Model techniques map
Taxonomyevaluation

taxonomy area

evaluation

109 methods filed at this node or below it, from the sources of 23 models.

evaluation

Matching aids for the classifier: measuring, not building.

In this branch 109

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 35

Prompt-based output standardization used · 5 sources · 5 quotes
Evaluation without safety filters used · 3 sources · 3 quotes
avg@k used · 2 sources · 2 quotes
Almost@1 used · 1 source · 1 quote
Behavior testing with stubs and edge cases used · 1 source · 1 quote
Deadline-bounded rollout evaluation used · 1 source · 1 quote
Documenting evaluation configuration used · 1 source · 1 quote
End-to-end exploit development evaluation used · 1 source · 1 quote
Evaluation equivalence threshold used · 1 source · 1 quote
Fixed MTP draft-token acceptance length used · 1 source · 1 quote
Four-run mean pass@1 used · 1 source · 1 quote
Full trajectory release used · 1 source · 1 quote
Joint validation protocol used · 1 source · 1 quote
Mean@5 used · 1 source · 1 quote
Prompt engineering to elicit answers used · 1 source · 1 quote
ProtocolQA robustness validation used · 1 source · 1 quote
Refusal behavior quantification used · 1 source · 1 quote
Rollout-based auditing used · 1 source · 1 quote
Standard function-calling format used · 1 source · 1 quote
Standardized agent evaluation protocol used · 1 source · 1 quote
Trajectory analysis used · 1 source · 1 quote
Two-dimensional coding-agent evaluation used · 1 source · 1 quote
Union-of-capabilities coverage scoring used · 1 source · 1 quote
Visual checking of generated renders used · 1 source · 1 quote
Zero-shot base-model baseline fallback used · 1 source · 1 quote
Model–harness co-design optional · 1 source · 1 quote
V-model iterative testing and validation mentioned · 1 source · 1 quote

benchmark 25

Living in-house benchmark suite core · 1 source · 1 quote
BrowseComp with Search used · 1 source · 1 quote
Capture-the-Flag (CTF) evaluation used · 1 source · 1 quote
Disabling tool search used · 1 source · 1 quote
Domain whitelist used · 1 source · 1 quote
Execution-grounded evaluation used · 1 source · 1 quote
F2P/P2F acceptance criterion used · 1 source · 1 quote
GPU kernel optimization task suite used · 1 source · 1 quote
High-confidence ProgramBench subset used · 1 source · 2 quotes
KernelBench used · 1 source · 1 quote
LongBench v2 used · 1 source · 1 quote
Multiple-rollout evaluation used · 1 source · 1 quote
PaperBench used · 1 source · 1 quote
PinchBench used · 1 source · 1 quote
ProfBench with Search used · 1 source · 1 quote
SQuAD used · 1 source · 1 quote
SWE-bench Verified used · 1 source · 1 quote
Three-configuration cyber range testing used · 1 source · 1 quote
Vals.ai used · 1 source · 1 quote
Verified CUDA kernels used · 1 source · 1 quote
CAD visual reproduction optional · 1 source · 1 quote
Computer use closed-loop evaluation optional · 1 source · 1 quote
Artificial Analysis Intelligence Index evaluated · 1 source · 1 quote

evaluation harness 14

DeepSeek Harness Minimal mode used · 2 sources · 2 quotes
Harbor used · 2 sources · 2 quotes
NeMo Evaluator SDK used · 2 sources · 2 quotes
Atomic binary rubric evaluation used · 1 source · 1 quote
Benchmark evaluation framework used · 1 source · 1 quote
Cross-scaffold evaluation used · 1 source · 1 quote
Isolated container per rollout used · 1 source · 1 quote
JSON-structured answer-format prompt used · 1 source · 1 quote
mini-swe-agent harness used · 1 source · 1 quote
NeMo Gym and NeMo Evaluator-based harness used · 1 source · 1 quote
NeMo Skills used · 1 source · 1 quote
Pool used · 1 source · 1 quote
Inline training evaluators optional · 1 source · 1 quote

judge 16

Agent-as-a-Judge used · 1 source · 2 quotes
Agent-as-a-Verifier used · 1 source · 1 quote
Deterministic tool-call verifier used · 1 source · 1 quote
GPT-5.5 (medium) judge model used · 1 source · 1 quote
Human-calibrated LLM-as-a-Judge used · 1 source · 1 quote
Independent quality-inspection agent used · 1 source · 2 quotes
LLM autograding with expert validation used · 1 source · 1 quote
LLM-as-a-Judge used · 1 source · 1 quote
LLM-based anti-cheating judgment used · 1 source · 1 quote
LLM-based correctness judging used · 1 source · 1 quote
LLM-based external API usage inspection used · 1 source · 1 quote
Mandatory agentic judge protocol used · 1 source · 1 quote
Official task verifier scoring used · 1 source · 1 quote
Reward-hack detection judge used · 1 source · 1 quote
Rule-based anti-cheat checks used · 1 source · 1 quote

human & real-world evaluation 19

Held-out evaluation default · 1 source · 1 quote
Blind side-by-side expert evaluation used · 4 sources · 4 quotes
Multi-turn open-ended external red-teaming used · 3 sources · 3 quotes
Automated red-teaming loop used · 1 source · 1 quote
Cyber range exercises used · 1 source · 1 quote
Dangerous-capability uplift assessment used · 1 source · 1 quote
Human evaluation used · 1 source · 1 quote
Internal engineering task evaluation used · 1 source · 2 quotes
Pairwise comparison for Chinese writing used · 1 source · 1 quote
Pre-release safety evaluation used · 1 source · 1 quote
Real-world codebase testing used · 1 source · 1 quote
Real-world feedback refinement used · 1 source · 1 quote
Reward hacking mitigation in evaluations used · 1 source · 1 quote
Same-prompt comparative DevOps testing used · 1 source · 1 quote
White-collar enterprise task evaluation used · 1 source · 1 quote
A/B testing on real tasks mentioned · 1 source · 1 quote
Continuous monitoring mentioned · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modelfiled herebenchmarkevaluation harnessjudgehuman & real-world evaluation
GLM-5.3-Flash optional—CAD visual reproduction optionalComputer use closed-loop evaluation optional————
DeepSeek-V4.1-Flash usedAlmost@1 usedDeadline-bounded rollout evaluation usedEvaluation equivalence threshold usedMean@5 usedStandardized agent evaluation protocol usedModel–harness co-design optionalSingle-agent and multi-agent evaluation configurations evaluated—Fail-to-pass and pass-to-pass evaluation points usedHigh-confidence ProgramBench subset usedMultiple-rollout evaluation used—Cross-scaffold evaluation usedDeepSeek Harness Minimal mode used—Independent quality-inspection agent used—Reward hacking mitigation in evaluations usedSystematic robustness-boundary characterization used—
Hy4-preview used————Blind side-by-side expert evaluation used—
DeepSeek-V4-Flash-0731 mentioned————A/B testing on real tasks mentioned—
NVIDIA-Nemotron-3-Ultra-550B-A55B default—BrowseComp with Search usedKernelBench usedLongBench v2 usedPinchBench usedProfBench with Search usedScaleAI Multi Challenge Multi Turn Instruction Following usedSQuAD usedVals.ai used—Harbor usedNeMo Evaluator SDK usedNeMo Skills used—Deterministic tool-call verifier usedLLM-based correctness judging used—Held-out evaluation defaultAutomated red-teaming loop used—
MiMo-V2.6-Flash usedBehavior testing with stubs and edge cases usedRollout-based auditing used——Atomic binary rubric evaluation used——Same-prompt comparative DevOps testing used—
GLM-5.3 usedavg@k usedTwo-dimensional coding-agent evaluation usedUnion-of-capabilities coverage scoring usedZero-shot base-model baseline fallback used—Disabling tool search usedDomain whitelist used—Isolated container per rollout usedmini-swe-agent harness used—LLM-based anti-cheating judgment usedLLM-based external API usage inspection usedOfficial task verifier scoring usedRule-based anti-cheat checks used—Real-world codebase testing used—
Hy3 used————Real-world feedback refinement used—
GLM-5.2 used———Agent-as-a-Judge usedGPT-5.5 (medium) judge model used——
MiniMax-M3 used———Agent-as-a-Verifier usedLLM-as-a-Judge used——
DeepSeek-V3.2 usedSample test and length-constraint filtering usedStandard function-calling format used—F2P/P2F acceptance criterion used————
DeepSeek-V4-Flash-Vision-Exp used——DeepSeek Harness Minimal mode used———
DeepSeek-V4-Pro used————Internal engineering task evaluation usedPairwise comparison for Chinese writing usedWhite-collar enterprise task evaluation used—
Gemma 4 31B usedEvaluation without safety filters used————Human evaluation usedContinuous monitoring mentioned—
Inkling usedDocumenting evaluation configuration usedRefusal-suppressed variants for capability estimation used——Benchmark evaluation framework usedInline training evaluators optional——Dangerous-capability uplift assessment usedMulti-turn open-ended external red-teaming usedPre-release safety evaluation used—
Kimi K3 coreEnd-to-end exploit development evaluation usedPrompt engineering to elicit answers usedSandboxed GPU kernel optimization evaluation usedTrajectory analysis usedTwo-tier cybersecurity capability evaluation usedVulnerability discovery with proof-of-concept evaluation used—Living in-house benchmark suite coreGPU kernel optimization task suite used——Mandatory agentic judge protocol used—Blind side-by-side expert evaluation used—
Laguna-S-2.1 usedavg@k usedDiverse benchmark validation for quantization usedFour-run mean pass@1 usedFull trajectory release usedOfficial-release-source baseline restriction used—Execution-grounded evaluation used—Automatic in-flight checkpoint evaluation scheduling usedHarbor usedPool used—Decompositional instruction-following judge usedHuman-calibrated LLM-as-a-Judge usedReward-hack detection judge used——
MiMo-V2.6-Pro usedBehavior testing with stubs and edge cases usedRollout-based auditing usedVisual checking of generated renders used——Atomic binary rubric evaluation used——Same-prompt comparative DevOps testing used—
NVIDIA-Nemotron-3.5-Lightning-30B-A3B usedV-model iterative testing and validation mentioned—Verified CUDA kernels usedArtificial Analysis Intelligence Index evaluated—NeMo Gym and NeMo Evaluator-based harness used———
Qwen3.5-397B-A17B usedPrompt-based output standardization used——JSON-structured answer-format prompt used———
Qwen3.6-35B-A3B usedPrompt-based output standardization used—————
Qwen3.8-Flash-Next usedFixed MTP draft-token acceptance length usedJoint validation protocol used—————
gpt-oss-120b usedProtocolQA robustness validation usedRefusal behavior quantification used—Capture-the-Flag (CTF) evaluation usedPaperBench usedSWE-bench Verified usedThree-configuration cyber range testing used——LLM autograding with expert validation used—Cyber range exercises usedExternal expert review of safety evaluation methodology used—