Model techniques map
Taxonomypost-trainingpolicy distillation

taxonomy node · level 2

policy distillation

19 methods filed at this node or below it, from the sources of 13 models.

post-training :: policy distillation

Matching aids for the classifier: on-policy distillation; multi-teacher on-policy distillation; MOPD; off-policy distillation; on-policy cross-stage distillation.

In this branch 19

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 19

Multi-Teacher On-Policy Distillation core · 12 sources · 17 quotes
On-Policy Distillation core · 7 sources · 9 quotes
Specialist Distillation used · 3 sources · 3 quotes
Prefix-Conditioned On-Policy Distillation used · 2 sources · 5 quotes
Autonomous Student Rollouts used · 1 source · 2 quotes
Behavior–Proximal Policy Decoupling used · 1 source · 1 quote
IcePop Token-Level Loss Masking used · 1 source · 1 quote
Large-Scale On-Policy Distillation used · 1 source · 2 quotes
Model Distillation used · 1 source · 1 quote
Multi-Objective Policy Distillation used · 1 source · 1 quote
On-Policy Cross-Stage Distillation used · 1 source · 2 quotes
Per-Token On-Policy Distillation Reward used · 1 source · 1 quote
SFT–RL–On-Policy Distillation Pipeline used · 1 source · 1 quote
Teacher-Trajectory and SFT-History Reuse used · 1 source · 1 quote
Off-Policy Distillation not used · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modeltechniques
DeepSeek-V4.1-Flash usedLarge-Scale On-Policy Distillation usedOn-Policy Distillation usedSFT–RL–On-Policy Distillation Pipeline used—
NVIDIA-Nemotron-3-Ultra-550B-A55B coreMulti-Teacher On-Policy Distillation coreAsynchronous Multi-Teacher On-Policy Distillation usedBehavior–Proximal Policy Decoupling usedIcePop Token-Level Loss Masking usedMulti-Objective Policy Distillation usedOff-Policy Distillation not used—
MiMo-V2.6-Flash usedAutonomous Student Rollouts usedDistillation Fine-Tuning on MiMo-Generated Data usedModel Distillation usedMulti-Prefix Multi-Teacher On-Policy Distillation usedPrefix-Conditioned On-Policy Distillation used—
DeepSeek-V4-Flash coreMulti-Teacher On-Policy Distillation coreOn-Policy Distillation used—
MiMo-V2.5 coreMulti-Teacher On-Policy Distillation coreOn-Policy Distillation used—
GLM-5.2 usedOn-Policy Cross-Stage Distillation used—
DeepSeek-V3.2 usedSpecialist Distillation used—
DeepSeek-V4-Pro coreMulti-Teacher On-Policy Distillation coreOn-Policy Distillation core—
Inkling usedDistillation for Post-Training Data Generation used—
Kimi K3 coreMulti-Teacher On-Policy Distillation corePer-Token On-Policy Distillation Reward used—
MiMo-V2.5-Pro coreMulti-Teacher On-Policy Distillation core—
MiMo-V2.6-Pro usedAutonomous Student Rollouts usedDistillation Fine-Tuning on MiMo-Generated Data usedModel Distillation usedMulti-Prefix Multi-Teacher On-Policy Distillation usedPrefix-Conditioned On-Policy Distillation usedTeacher-Trajectory and SFT-History Reuse used—
Qwen3.5-397B-A17B usedOn-Policy Distillation usedSpecialist Distillation used—