TL;DR

A technical report on scaling multimodal language-model reinforcement learning with long-context training, policy optimization, and data-selection strategies.

Why it matters

It broadens reasoning RL beyond text-only math settings and highlights how context length, rollout generation, and modality interact at scale.

Key findings

  1. 01

    Long-context RL introduces distinct rollout and optimization constraints.

  2. 02

    Data and sampling strategy remain first-class scaling variables alongside compute.

Scaling dimensions

Models, methods & benchmarks

Models
Kimi k1.5
Algorithms
Policy optimization

Topics

Read the original sourcearXiv