Model techniques map
Techniquespost-trainingagentic post-training

general family · filed under post-training

Agentic reinforcement learning

Reinforcement learning applied to agentic models, distinguished from the more general agentic post-training label.

Also called agentic RL, Large-scale agentic reinforcement learning.

sources
4
models
4
lab adopt it
1
strongest
core

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 3core 1

Documented in

Evidence

4 spans quoted from the sources, strongest treatment first.

a practical approach to advancing foundation models through large-scale agentic reinforcement learning.

corepost trainingin MiMo-V2.6

large-scale agentic RL

usedpost trainingin MiMo-V2.5-ProXiaomi

Post-training incorporates SFT, large-scale agentic RL, and Multi-Teacher On-Policy Distillation (MOPD)

usedpost trainingin MiMo-V2.5Xiaomi

Post-training incorporates SFT, large-scale agentic RL, and Multi-Teacher On-Policy Distillation (MOPD)

usedpost trainingin MiMo-V2.5Xiaomi

Filed alongside

Other methods under post-training :: agentic post-training.