specific method · filed under data curation
Pre-training data filtering for decontamination and safety
Pre-training data is filtered to decontaminate benchmarks and reduce unsafe utterances and recitation risk.
Also called data filtering.
- source
- 1
- model
- 1
- lab adopt it
- 1
- strongest
- used
How sources treat it
One count per evidence span, weakest treatment to strongest.
used 1
Documented in
Evidence
1 span quoted from the sources, strongest treatment first.
We filter data to decontaminate benchmarks, and to reduce the risk of unwanted or unsafe utterances and the risk of recitation.
useddata curationin Gemma 4Google DeepMind
Filed alongside
Other methods under data curation :: data filtering.
CSAM filteringSensitive data filteringCBRN pre-training data filteringFiltering batched auto-generated and templated contentHeuristic filteringKeyword- and regex-based filteringModel-based refusal and inability filteringPass@100 filteringPathological repetition filteringSmolVLM-based image-text quality scoringUnified data filtering pipelineAutomated verificationCoding-agent session filtering and trajectory deduplicationConservative model-based noise filteringContent quality and safety filteringContinuous contribution-score rankingData cleaningData filtering pipelineDense annotation of ambiguous low-quality dataDomain filtering with heuristics, classifier scoring, and deduplicationEvidence-based data cleaning and training constraintsFiltering low-information model-generated contentHeuristic and statistical filtering with deduplication and quality modelsImage-text relevance filtering