Model techniques map
Taxonomydata curation

taxonomy area · pipeline stage 01

data curation

160 methods filed at this node or below it, from the sources of 23 models.

data curation

Matching aids for the classifier: how the training corpus is built.

In this branch 160

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 5

Data curation used · 2 sources · 2 quotes
Training data deduplication and filtering used · 2 sources · 2 quotes
Multilingual corpus expansion used · 1 source · 1 quote
Nemotron-CC pipeline used · 1 source · 1 quote
Product co-design for training data used · 1 source · 1 quote

data sourcing 17

Expert co-created training data used · 2 sources · 2 quotes
GitHub Crawl used · 2 sources · 2 quotes
Agentic knowledge graph construction used · 1 source · 1 quote
Common Crawl used · 1 source · 1 quote
EssentialWeb used · 1 source · 1 quote
FinePDFs used · 1 source · 1 quote
High-recall web-data curation used · 1 source · 1 quote
Long-document curation used · 1 source · 1 quote
Nemotron-3-Ultra corpus used · 1 source · 1 quote
Nemotron-CC used · 1 source · 1 quote
Nemotron-Post-Training-v3 used · 1 source · 1 quote
Streaming training-data ingestion used · 1 source · 1 quote
Video frame extraction at 1 FPS used · 1 source · 1 quote
Video sampling parameters optional · 1 source · 1 quote

data filtering 37

Conservative model-based noise filtering core · 1 source · 1 quote
Continuous contribution-score ranking core · 1 source · 1 quote
Multi-dimensional document quality scoring core · 1 source · 1 quote
Quality-bucket sampling core · 1 source · 1 quote
CSAM filtering used · 3 sources · 3 quotes
Sensitive data filtering used · 3 sources · 3 quotes
CBRN pre-training data filtering used · 2 sources · 2 quotes
Heuristic filtering used · 2 sources · 2 quotes
Keyword- and regex-based filtering used · 2 sources · 2 quotes
Model-based refusal and inability filtering used · 2 sources · 2 quotes
Pass@100 filtering used · 2 sources · 2 quotes
Pathological repetition filtering used · 2 sources · 2 quotes
Unified data filtering pipeline used · 2 sources · 2 quotes
Automated verification used · 1 source · 1 quote
Content quality and safety filtering used · 1 source · 1 quote
Data cleaning used · 1 source · 1 quote
Data filtering pipeline used · 1 source · 1 quote
Image-text relevance filtering used · 1 source · 1 quote
Long-context data cleaning pipeline used · 1 source · 1 quote
Multi-dimensional data filtering used · 1 source · 1 quote
Permissive-license filtering used · 1 source · 1 quote
Propella used · 1 source · 1 quote
SmolVLM-based image-text quality scoring used · 1 source · 2 quotes
Structural checks for malformed examples used · 1 source · 1 quote
Three-stage question filtering used · 1 source · 1 quote
One-task-per-repository diversity filtering optional · 1 source · 1 quote

deduplication 5

Deduplication used · 2 sources · 2 quotes
In-pack deduplication used · 1 source · 1 quote
Semantic image deduplication used · 1 source · 1 quote
Snapshot-level fuzzy deduplication used · 1 source · 1 quote

synthetic data 56

Agentic data synthesis pipeline core · 4 sources · 4 quotes
Knowledge distillation for synthetic data used · 3 sources · 3 quotes
Heterogeneous answer-generation agents used · 1 source · 1 quote
Iterative task-difficulty escalation used · 1 source · 1 quote
Knowledge-graph-guided task synthesis used · 1 source · 1 quote
Metadata-conditioned synthetic generation used · 1 source · 1 quote
Mocked tools for agent environments used · 1 source · 1 quote
Multi-agent task-attempt validation used · 1 source · 1 quote
Programmatic multimodal data generation used · 1 source · 1 quote
Reward-driven task-construction training used · 1 source · 1 quote
Rubric-guided RL data used · 1 source · 1 quote
Search-based question construction used · 1 source · 1 quote
Search-capable answer verification agent used · 1 source · 1 quote
Synthetic data generation used · 1 source · 1 quote
Synthetic data generation and augmentation used · 1 source · 1 quote
Synthetic privacy-preserving personas used · 1 source · 1 quote
Synthetic system-message augmentation used · 1 source · 1 quote
Targeted synthetic data rephrasing used · 1 source · 1 quote
Tool-set and schema randomization used · 1 source · 1 quote
Counterfactual data augmentation mentioned · 2 sources · 2 quotes

data mixture & curriculum 26

AutoMixer core · 1 source · 2 quotes
Sample Mixer core · 1 source · 1 quote
Vulnerability-discovery data inclusion used · 2 sources · 2 quotes
Agent-centric multimodal data mixture used · 1 source · 1 quote
Blind pairwise bucket-boundary calibration used · 1 source · 1 quote
Data Scheduler used · 1 source · 1 quote
Domain-specific multimodal datasets used · 1 source · 1 quote
Interleaved data used · 1 source · 1 quote
Interleaved multimodal training used · 1 source · 1 quote
KL-regularized data-mixture optimization used · 1 source · 1 quote
Long-context data upsampling used · 1 source · 1 quote
Pass-rate-based RL task sampling used · 1 source · 1 quote
Text-only pre-training corpus used · 1 source · 1 quote
Three-stage data mixture strategy used · 1 source · 1 quote
Three-stage pre-training curriculum used · 1 source · 1 quote
Two-phase curriculum used · 1 source · 1 quote
ProtocolQA-aligned RL training datasets evaluated · 1 source · 1 quote

sequence packing 6

Length-aware best-fit packing used · 2 sources · 2 quotes
Best-fit packing used · 1 source · 2 quotes
Cross-source document packing used · 1 source · 1 quote
Group-local packing used · 1 source · 1 quote
Interleaved image-text sequences used · 1 source · 1 quote
Sequence packing used · 1 source · 1 quote

tokenization 8

XTML (eXtensible Token Markup Language) core · 1 source · 1 quote
o200k_harmony tokenizer used · 2 sources · 2 quotes
Quick Instruction tokens used · 2 sources · 2 quotes
Byte-level Byte Pair Encoding (BPE) used · 1 source · 1 quote
SentencePiece tokenizer used · 1 source · 1 quote
Separate PT and IT end tokens used · 1 source · 1 quote
Subtoken averaging used · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modelfiled heredata sourcingdata filteringdeduplicationsynthetic datadata mixture & curriculumsequence packingtokenization
GLM-5.3-Flash used———————Chat-template image/video placeholder expansion used—
DeepSeek-V4.1-Flash core—Image-code pairs and computer-use trajectories usedStar-threshold-filtered GitHub repositories used—Coding-agent session filtering and trajectory deduplication usedFiltering low-information model-generated content usedHeuristic and statistical filtering with deduplication and quality models usedImage-text relevance filtering usedSmolVLM-based image-text quality scoring used—Joint prefetching and assignment of training samples usedSemantic image deduplication used—Automated data synthesis and environment-construction pipelines coreProcedural construction and scaling of interactive agent environments coreProgressively scaled synthesis of agent tasks and environments coreSynthesis of verifiable tasks with solutions and reward signals coreAutomated batch synthesis of RL training data usedContainer buildability and verifiability check usedContainerized coding-environment construction with self-testing and trace removal usedFailure-case and negative-feedback-driven environment generation usedMocked tools for agent environments usedMulti-agent collaborative environment construction usedMulti-agent task-attempt validation usedRecycling filtered documents into image-text pairs usedReward-driven task-construction training usedTask formalization as a problem–environment–verification triplet used—Filtering, deduplication, and difficulty calibration coreDeterministic pre-splitting of ultra-long documents usedDomain-specific multimodal datasets usedScaling-ladder-guided data and model planning usedUnion-based integration of text-only and multimodal corpora used—Best-fit packing usedInterleaved image-text sequences used——
Hy4-preview usedProduct co-design for training data used—Expert co-created training data used———Training-data construction around expert work products used————
NVIDIA-Nemotron-3-Ultra-550B-A55B usedNemotron-CC pipeline used—Common Crawl usedEssentialWeb usedFinePDFs usedGitHub Crawl usedNemotron-3-Ultra corpus usedNemotron-CC usedNemotron-Post-Training-v3 used—Automated verification usedData filtering pipeline usedHeuristic filtering usedKeyword- and regex-based filtering usedPathological repetition filtering used—Deduplication usedIn-pack deduplication used—Knowledge distillation for synthetic data usedSynthetic data generation usedCounterfactual data augmentation mentioned—Gaussian-based data mixture and curriculum construction usedTwo-phase curriculum used—Length-aware best-fit packing used——
MiMo-V2.6-Flash core————Large-scale environment synthesis and curation usedMulti-agent synthesis of local software mocks usedSFT teachers trained on synthetic demonstrations used—Sample Mixer coreAgent-centric multimodal data mixture usedData Scheduler usedDynamic sampling for mixed-task reinforcement learning usedSmooth weighted round-robin source scheduling used—Group-local packing used——
DeepSeek-V4-Flash used——Filtering batched auto-generated and templated content used————Cross-source document packing used—Quick Instruction tokens used—
MiMo-V2.5 used——Multi-dimensional data filtering used———Three-stage data mixture strategy used———
GLM-5.3 used————End-to-end synthetic environment generation usedVerifier synthesis without reference solutions usedVulnerability-focused training data and environments used—Vulnerability-discovery data inclusion used———
Hy3 used——Data cleaning usedEvidence-based data cleaning and training constraints used——————
GLM-5.2 used—Web knowledge graph construction and question generation used—Three-stage question filtering used——Agentic data synthesis pipeline used————
MiniMax-M3 used—————Interleaved data usedInterleaved multimodal training used———
DeepSeek-V3.2 core——Model-based refusal and inability filtering usedPass@100 filtering used——Agentic data synthesis pipeline coreAutomatic synthesis of task-oriented RL environments coreCoding environments from GitHub issue–PR pairs usedEnvironment, toolset, task, and solution synthesis pipeline usedHeterogeneous answer-generation agents usedIterative task-difficulty escalation usedMulti-agent search-agent training-data generation usedSearch-based question construction usedSearch-capable answer verification agent used————
DeepSeek-V4-Pro usedMultilingual corpus expansion used—Long-document curation used—Filtering batched auto-generated and templated content used——Rubric-guided RL data usedTask-specific data injection during mid-training used——Cross-source document packing used—Quick Instruction tokens used—
Gemma 4 31B used—Video frame extraction at 1 FPS used—Content quality and safety filtering usedCSAM filtering usedPost-training data filtering for safety and factuality usedPre-training data filtering for decontamination and safety usedSensitive data filtering used———Attribution, hedging, and refusal data subsets used——SentencePiece tokenizer usedSeparate PT and IT end tokens used—
Inkling usedData curation usedTraining data deduplication and filtering used————Synthetic data generation and augmentation usedTool-set and schema randomization used————
Kimi K3 core—Agentic knowledge graph construction used—Domain filtering with heuristics, classifier scoring, and deduplication usedLong-context data cleaning pipeline used——Corpus rephrasing with fidelity verification usedKnowledge-graph-guided task synthesis usedLong-context data synthesis by permutation and concatenation usedMulti-stage verification with human-in-the-loop annotation usedProgrammatic multimodal data generation usedSandboxed visual reasoning with a Python interpreter usedSynthetic trajectory generation with domain-specialized models used—Long-context data upsampling used——XTML (eXtensible Token Markup Language) core—
Laguna-S-2.1 core—High-recall web-data curation usedStreaming training-data ingestion used—Conservative model-based noise filtering coreContinuous contribution-score ranking coreMulti-dimensional document quality scoring coreQuality-bucket sampling coreDense annotation of ambiguous low-quality data usedPCA-based dimension selection for decorrelated quality signals usedPropella usedTwo-axis document-quality labeling by noise and information usedOne-task-per-repository diversity filtering optional—Snapshot-level fuzzy deduplication used—Dynamic multi-agent synthetic-data generation loop coreModular synthetic-data pipeline composition coreMatching synthesis-pipeline complexity to teacher capability usedMetadata-conditioned synthetic generation usedMulti-stage synthetic-data generation cascade usedSynthetic data augmentation of organic data usedSynthetic system-message augmentation usedTargeted synthetic data rephrasing usedTraining-task generation from real commit history usedTwo-sided test validation for synthetic coding tasks used—AutoMixer coreBlind pairwise bucket-boundary calibration usedKL-regularized data-mixture optimization usedPass-rate-based RL task sampling usedPrior-constrained Dirichlet mixture exploration used—Sequence packing used—Subtoken averaging used—
MiMo-V2.5-Pro used——Multi-dimensional data filtering used———Three-stage data mixture strategy used———
MiMo-V2.6-Pro core————Large-scale environment synthesis and curation usedMulti-agent synthesis of local software mocks usedSFT teachers trained on synthetic demonstrations used—Sample Mixer coreAgent-centric multimodal data mixture usedData Scheduler usedDynamic sampling for mixed-task reinforcement learning usedSmooth weighted round-robin source scheduling used—Group-local packing used——
NVIDIA-Nemotron-3.5-Lightning-30B-A3B used—GitHub Crawl used—Heuristic filtering usedKeyword- and regex-based filtering usedPathological repetition filtering usedPermissive-license filtering usedStructural checks for malformed examples usedUnified data filtering pipeline used—Deduplication used—Knowledge distillation for synthetic data usedSynthetic data generation, filtering, and curation usedSynthetic privacy-preserving personas usedCounterfactual data augmentation mentioned————
Qwen3.5-397B-A17B used—————Three-stage pre-training curriculum used——Byte-level Byte Pair Encoding (BPE) used—
Qwen3.6-35B-A3B optional—Video sampling parameters optional———————
gpt-oss-120b used——CBRN pre-training data filtering used———Text-only pre-training corpus usedProtocolQA-aligned RL training datasets evaluated——o200k_harmony tokenizer used—

Proposed children

Paths the corpus wanted and the taxonomy does not have. A human promotes them into the outline; the extraction cannot.

training data formatHarmony chat format, Harmony response format, message encoding