TL;DR
A technical report on scaling multimodal language-model reinforcement learning with long-context training, policy optimization, and data-selection strategies.
Why it matters
It broadens reasoning RL beyond text-only math settings and highlights how context length, rollout generation, and modality interact at scale.
Key findings
- 01
Long-context RL introduces distinct rollout and optimization constraints.
- 02
Data and sampling strategy remain first-class scaling variables alongside compute.
Scaling dimensions
Models, methods & benchmarks
- Models
- Kimi k1.5
- Algorithms
- Policy optimization
Topics