Model techniques map
Taxonomypost-trainingreinforcement learning algorithm

taxonomy node · level 2

reinforcement learning algorithm

62 methods filed at this node or below it, from the sources of 18 models.

post-training :: reinforcement learning algorithm

Matching aids for the classifier: GRPO; group relative policy optimization; MLAPO; IcePop; pivot RL; direct double-sided importance sampling; rollout routing replay.

In this branch 62

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 62

Group Relative Policy Optimization core · 15 sources · 17 quotes
Groupwise Advantage Redistribution core · 3 sources · 4 quotes
Chain-of-Thought Reinforcement Learning core · 2 sources · 2 quotes
Mixed Reinforcement Learning core · 2 sources · 2 quotes
Effort-Conditioned Reinforcement Learning core · 1 source · 1 quote
Keep Routing core · 1 source · 1 quote
Penalty Module core · 1 source · 1 quote
Dropping All-Zero-Advantage Groups default · 1 source · 1 quote
Reinforcement Learning used · 11 sources · 12 quotes
IcePop used · 2 sources · 3 quotes
Keep Sampling Mask used · 2 sources · 2 quotes
Off-Policy Sequence Masking used · 2 sources · 3 quotes
Reinforcement Learning Post-Training used · 2 sources · 2 quotes
Rollout Routing Replay used · 2 sources · 3 quotes
Unbiased KL Estimate used · 2 sources · 3 quotes
Abstention Training used · 1 source · 1 quote
Advantage Shaping used · 1 source · 1 quote
Agentic RL Task Mix used · 1 source · 1 quote
Concatenated Routing Replay used · 1 source · 1 quote
Derived-Latency Penalty used · 1 source · 1 quote
Direct Double-Sided Importance Sampling used · 1 source · 2 quotes
Domain-Specialized RL Experts used · 1 source · 1 quote
Domain-Specific GRPO Training used · 1 source · 1 quote
Dynamic Abstention-Reward Calibration used · 1 source · 1 quote
Dynamic Sampling used · 1 source · 1 quote
Effort-Dependent Length Penalty used · 1 source · 1 quote
Flagged-Token Masking and Penalty used · 1 source · 1 quote
Group-Relative Length Penalty used · 1 source · 1 quote
Group-Wise Policy Optimization used · 1 source · 1 quote
GRPO with Masked Importance Sampling used · 1 source · 1 quote
GSPO used · 1 source · 1 quote
Hierarchical Penalty Escalation used · 1 source · 1 quote
Incremental Reinforcement Learning used · 1 source · 1 quote
Interaction-Aligned Reinforcement Learning used · 1 source · 1 quote
Keep Candidate-Set Replay used · 1 source · 1 quote
Large-Scale Reinforcement Learning used · 1 source · 1 quote
Per-Token Tool-Error Step Penalty used · 1 source · 1 quote
Pivot Reinforcement Learning used · 1 source · 2 quotes
PPO-Style Policy-Ratio Clipping used · 1 source · 1 quote
Progressively Complex Task Distributions used · 1 source · 1 quote
Quality-Weighted Advantage Redistribution used · 1 source · 1 quote
Reinforcement Learning Training used · 1 source · 1 quote
RL with Rubric and Claims Graders used · 1 source · 1 quote
SAO with Compaction used · 1 source · 1 quote
Single Mixed Reinforcement-Learning Run used · 1 source · 1 quote
Single-Harness Reinforcement Learning used · 1 source · 1 quote
Moonlight Scaling optional · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modeltechniques
DeepSeek-V4.1-Flash coreEffort-Conditioned Reinforcement Learning coreConcatenated Routing Replay usedDerived-Latency Penalty usedEffort-Dependent Length Penalty usedExponentially Decaying Token-Penalty Coefficient usedFailure Replay and Targeted Reinforcement Learning usedGroup-Relative Advantage Normalization Within Effort-Level Subgroups usedProgressive Scaling of RL Data, Tasks, and Rollouts usedRL Reward with Collaboration Bonus and Derived-Latency Penalty usedReinforcement Learning Post-Training mentioned—
NVIDIA-Nemotron-3-Ultra-550B-A55B usedAbstention Training usedDynamic Abstention-Reward Calibration usedGroup Relative Policy Optimization usedIcePop usedNegative-Advantage Penalties for Malformed Reasoning and Tool Calls usedPivot Reinforcement Learning usedPPO-Style Policy-Ratio Clipping usedReinforcement Learning usedReinforcement Learning from Verifiable Rewards used—
MiMo-V2.6-Flash coreAsynchronous Group Relative Policy Optimization coreGroupwise Advantage Redistribution corePenalty Module coreDropping All-Zero-Advantage Groups defaultAdvantage Shaping usedDomain-Specific GRPO Training usedDynamic Sampling usedFlagged-Token Masking and Penalty usedFreezing the MoE Router During Reinforcement Learning usedGroup-Relative Length Penalty usedHierarchical Penalty Escalation usedKeep Candidate-Set Replay usedQuality-Weighted Advantage Redistribution usedRollout Routing Replay usedSingle-Harness Reinforcement Learning usedZero-Reward Correction for Leaked or External Answers used—
DeepSeek-V4-Flash usedGroup Relative Policy Optimization used—
MiMo-V2.5 usedGroup Relative Policy Optimization usedReinforcement Learning usedRollout Routing Replay used—
GLM-5.3 usedSAO with Compaction used—
Hy3 usedGroup Relative Policy Optimization usedReinforcement Learning usedReinforcement Learning Post-Training used—
GLM-5.2 usedDirect Double-Sided Importance Sampling usedGroup Relative Policy Optimization usedGroup-Wise Policy Optimization usedIcePop used—
DeepSeek-V3.2 coreGroup Relative Policy Optimization coreKeep Routing coreMixed Reinforcement Learning coreKeep Sampling Mask usedOff-Policy Sequence Masking usedReinforcement Learning Training usedUnbiased KL Estimate used—
DeepSeek-V4-Pro usedGroup Relative Policy Optimization usedReinforcement Learning used—
Inkling usedLarge-Scale Reinforcement Learning usedReinforcement Learning for Calibration with Proper Scoring Rules usedRL with Rubric and Claims Graders used—
Kimi K3 coreMulti-Domain, Multi-Effort Reinforcement Learning coreDomain-Specialized RL Experts used—
Laguna-S-2.1 coreCISPO with Length-Weighted Leave-One-Out Group-Relative Advantages coreAgentic RL Task Mix usedPer-Token Tool-Error Step Penalty usedReinforcement Learning from Code Execution Feedback usedMoonlight Scaling optional—
MiMo-V2.5-Pro usedReinforcement Learning used—
MiMo-V2.6-Pro corePenalty Module coreDropping All-Zero-Advantage Groups defaultAdvantage Shaping usedAsynchronous Group Relative Policy Optimization usedDomain-Specific GRPO Training usedDynamic Sampling usedFlagged-Token Masking and Penalty usedFreezing the MoE Router During Reinforcement Learning usedGroup-Relative Length Penalty usedGroupwise Advantage Redistribution usedHierarchical Penalty Escalation usedKeep Candidate-Set Replay usedQuality-Weighted Advantage Redistribution usedRollout Routing Replay usedSingle Mixed Reinforcement-Learning Run usedSingle-Harness Reinforcement Learning usedZero-Reward Correction for Leaked or External Answers used—
NVIDIA-Nemotron-3.5-Lightning-30B-A3B usedGroup Relative Policy Optimization usedGRPO with Masked Importance Sampling used—
Qwen3.5-397B-A17B usedGSPO usedInteraction-Aligned Reinforcement Learning usedProgressively Complex Task Distributions used—
gpt-oss-120b coreChain-of-Thought Reinforcement Learning coreHelpful-Only Adversarial Reinforcement Learning usedIncremental Reinforcement Learning used—