general family · filed under post-training
Agentic reinforcement learning
Reinforcement learning applied to agentic models, distinguished from the more general agentic post-training label.
Also called agentic RL, Large-scale agentic reinforcement learning.
- sources
- 4
- models
- 4
- lab adopt it
- 1
- strongest
- core
How sources treat it
One count per evidence span, weakest treatment to strongest.
used 3core 1
Documented in
Evidence
4 spans quoted from the sources, strongest treatment first.
a practical approach to advancing foundation models through large-scale agentic reinforcement learning.
corepost trainingin MiMo-V2.6
large-scale agentic RL
usedpost trainingin MiMo-V2.5-ProXiaomi
Post-training incorporates SFT, large-scale agentic RL, and Multi-Teacher On-Policy Distillation (MOPD)
usedpost trainingin MiMo-V2.5Xiaomi
Post-training incorporates SFT, large-scale agentic RL, and Multi-Teacher On-Policy Distillation (MOPD)
usedpost trainingin MiMo-V2.5Xiaomi
Filed alongside
Other methods under post-training :: agentic post-training.
Multi-harness trainingAgentic tool-use trainingEnvironment hardeningReinforcement learning on synthetic agentic dataRepair-agent environment correction loopAgentic post-trainingAutonomous Execution Tasks (AET)Concurrent multi-environment post-trainingContainer-level network isolationEnvironment preparation to prevent solution leakageEnvironment scaling for realistic training tasksGenerate-verify-refine loopHarness-optimized trainingMock applications for personal-assistant reinforcement learningMulti-agent task decomposition and coordinationMulti-environment reinforcement learningMulti-environment reinforcement learning from verifiable rewardsMulti-harness trajectory training with native behavior preservationMulti-turn collaboration simulatorProduction-harness-matched reinforcement learningPython tool use in chain-of-thoughtRe-post-training for agentic capabilitiesReinforcement learning in an agent harnessReinforcement learning restricted to search and code environments