Model techniques map
Taxonomydata curationdata filtering

taxonomy node · level 2

data filtering

37 methods filed at this node or below it, from the sources of 14 models.

data curation :: data filtering

Matching aids for the classifier: heuristic filtering; quality filtering; n-gram repetition filtering; multi-dimensional filtering; keyword and regex filters.

In this branch 37

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 37

Conservative model-based noise filtering core · 1 source · 1 quote
Continuous contribution-score ranking core · 1 source · 1 quote
Multi-dimensional document quality scoring core · 1 source · 1 quote
Quality-bucket sampling core · 1 source · 1 quote
CSAM filtering used · 3 sources · 3 quotes
Sensitive data filtering used · 3 sources · 3 quotes
CBRN pre-training data filtering used · 2 sources · 2 quotes
Heuristic filtering used · 2 sources · 2 quotes
Keyword- and regex-based filtering used · 2 sources · 2 quotes
Model-based refusal and inability filtering used · 2 sources · 2 quotes
Pass@100 filtering used · 2 sources · 2 quotes
Pathological repetition filtering used · 2 sources · 2 quotes
Unified data filtering pipeline used · 2 sources · 2 quotes
Automated verification used · 1 source · 1 quote
Content quality and safety filtering used · 1 source · 1 quote
Data cleaning used · 1 source · 1 quote
Data filtering pipeline used · 1 source · 1 quote
Image-text relevance filtering used · 1 source · 1 quote
Long-context data cleaning pipeline used · 1 source · 1 quote
Multi-dimensional data filtering used · 1 source · 1 quote
Permissive-license filtering used · 1 source · 1 quote
Propella used · 1 source · 1 quote
SmolVLM-based image-text quality scoring used · 1 source · 2 quotes
Structural checks for malformed examples used · 1 source · 1 quote
Three-stage question filtering used · 1 source · 1 quote
One-task-per-repository diversity filtering optional · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modeltechniques
DeepSeek-V4.1-Flash usedCoding-agent session filtering and trajectory deduplication usedFiltering low-information model-generated content usedHeuristic and statistical filtering with deduplication and quality models usedImage-text relevance filtering usedSmolVLM-based image-text quality scoring used—
NVIDIA-Nemotron-3-Ultra-550B-A55B usedAutomated verification usedData filtering pipeline usedHeuristic filtering usedKeyword- and regex-based filtering usedPathological repetition filtering used—
DeepSeek-V4-Flash usedFiltering batched auto-generated and templated content used—
MiMo-V2.5 usedMulti-dimensional data filtering used—
Hy3 usedData cleaning usedEvidence-based data cleaning and training constraints used—
GLM-5.2 usedThree-stage question filtering used—
DeepSeek-V3.2 usedModel-based refusal and inability filtering usedPass@100 filtering used—
DeepSeek-V4-Pro usedFiltering batched auto-generated and templated content used—
Gemma 4 31B usedContent quality and safety filtering usedCSAM filtering usedPost-training data filtering for safety and factuality usedPre-training data filtering for decontamination and safety usedSensitive data filtering used—
Kimi K3 usedDomain filtering with heuristics, classifier scoring, and deduplication usedLong-context data cleaning pipeline used—
Laguna-S-2.1 coreConservative model-based noise filtering coreContinuous contribution-score ranking coreMulti-dimensional document quality scoring coreQuality-bucket sampling coreDense annotation of ambiguous low-quality data usedPCA-based dimension selection for decorrelated quality signals usedPropella usedTwo-axis document-quality labeling by noise and information usedOne-task-per-repository diversity filtering optional—
MiMo-V2.5-Pro usedMulti-dimensional data filtering used—
NVIDIA-Nemotron-3.5-Lightning-30B-A3B usedHeuristic filtering usedKeyword- and regex-based filtering usedPathological repetition filtering usedPermissive-license filtering usedStructural checks for malformed examples usedUnified data filtering pipeline used—
gpt-oss-120b usedCBRN pre-training data filtering used—