specific method · filed under post-training
On-Policy Cross-Stage Distillation
On-policy distillation used as a final refinement across training stages to mitigate capability regression.
- source
- 1
- model
- 1
- lab adopt it
- 1
- strongest
- used
How sources treat it
One count per evidence span, weakest treatment to strongest.
used 2
Documented in
Evidence
2 spans quoted from the sources, strongest treatment first.
By leveraging on-policy cross-stage distillation as the final refinement, GLM-5 effectively mitigates capability regression while harnessing the performance gains from each training stage.
usedtraining objectivein GLM-5Z.ai
we perform on-policy cross-stage distillation as the final stage
usedtraining objectivein GLM-5Z.ai
Filed alongside
Other methods under post-training :: policy distillation.
Multi-Teacher On-Policy DistillationOn-Policy DistillationPrefix-Conditioned On-Policy DistillationMulti-Prefix Multi-Teacher On-Policy DistillationSpecialist DistillationAutonomous Student RolloutsLarge-Scale On-Policy DistillationAsynchronous Multi-Teacher On-Policy DistillationBehavior–Proximal Policy DecouplingDistillation Fine-Tuning on MiMo-Generated DataDistillation for Post-Training Data GenerationIcePop Token-Level Loss MaskingModel DistillationMulti-Objective Policy DistillationOff-Policy DistillationPer-Token On-Policy Distillation RewardSFT–RL–On-Policy Distillation PipelineTeacher-Trajectory and SFT-History Reuse