TL;DR
The OpenAI Five report documents a distributed, continually trained self-play system for a long-horizon, imperfect-information team game.
Why it matters
It remains a useful systems case study: scaling RL required not only an algorithm, but sustained rollout generation, distributed optimization, monitoring, and curriculum management.
Key findings
- 01
Self-play can generate a continuously adapting task distribution.
- 02
Long-running RL systems need operational tools for stability and iteration.
Scaling dimensions
Models, methods & benchmarks
- Models
- OpenAI Five
- Algorithms
- PPO, Self-play
- Benchmarks
- Dota 2
Topics