Model techniques map
Taxonomydata curationdata mixture & curriculum

taxonomy node · level 2

data mixture & curriculum

26 methods filed at this node or below it, from the sources of 13 models.

data curation :: data mixture & curriculum

Matching aids for the classifier: three-stage data mixture; Gaussian mixture construction; two-phase curriculum; interleaved data; data scheduler.

In this branch 26

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 26

AutoMixer core · 1 source · 2 quotes
Sample Mixer core · 1 source · 1 quote
Vulnerability-discovery data inclusion used · 2 sources · 2 quotes
Agent-centric multimodal data mixture used · 1 source · 1 quote
Blind pairwise bucket-boundary calibration used · 1 source · 1 quote
Data Scheduler used · 1 source · 1 quote
Domain-specific multimodal datasets used · 1 source · 1 quote
Interleaved data used · 1 source · 1 quote
Interleaved multimodal training used · 1 source · 1 quote
KL-regularized data-mixture optimization used · 1 source · 1 quote
Long-context data upsampling used · 1 source · 1 quote
Pass-rate-based RL task sampling used · 1 source · 1 quote
Text-only pre-training corpus used · 1 source · 1 quote
Three-stage data mixture strategy used · 1 source · 1 quote
Three-stage pre-training curriculum used · 1 source · 1 quote
Two-phase curriculum used · 1 source · 1 quote
ProtocolQA-aligned RL training datasets evaluated · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modeltechniques
DeepSeek-V4.1-Flash coreFiltering, deduplication, and difficulty calibration coreDeterministic pre-splitting of ultra-long documents usedDomain-specific multimodal datasets usedScaling-ladder-guided data and model planning usedUnion-based integration of text-only and multimodal corpora used—
NVIDIA-Nemotron-3-Ultra-550B-A55B usedGaussian-based data mixture and curriculum construction usedTwo-phase curriculum used—
MiMo-V2.6-Flash coreSample Mixer coreAgent-centric multimodal data mixture usedData Scheduler usedDynamic sampling for mixed-task reinforcement learning usedSmooth weighted round-robin source scheduling used—
MiMo-V2.5 usedThree-stage data mixture strategy used—
GLM-5.3 usedVulnerability-discovery data inclusion used—
MiniMax-M3 usedInterleaved data usedInterleaved multimodal training used—
Gemma 4 31B usedAttribution, hedging, and refusal data subsets used—
Kimi K3 usedLong-context data upsampling used—
Laguna-S-2.1 coreAutoMixer coreBlind pairwise bucket-boundary calibration usedKL-regularized data-mixture optimization usedPass-rate-based RL task sampling usedPrior-constrained Dirichlet mixture exploration used—
MiMo-V2.5-Pro usedThree-stage data mixture strategy used—
MiMo-V2.6-Pro coreSample Mixer coreAgent-centric multimodal data mixture usedData Scheduler usedDynamic sampling for mixed-task reinforcement learning usedSmooth weighted round-robin source scheduling used—
Qwen3.5-397B-A17B usedThree-stage pre-training curriculum used—
gpt-oss-120b usedText-only pre-training corpus usedProtocolQA-aligned RL training datasets evaluated—