Model techniques map
Taxonomyinference & servingdecoding strategy

taxonomy node · level 2

decoding strategy

28 methods filed at this node or below it, from the sources of 25 models.

inference & serving :: decoding strategy

Matching aids for the classifier: speculative decoding; EAGLE; multi-layer EAGLE; speculative sampling; MTP draft; best-of-n selection.

In this branch 28

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 28

Speculative decoding core · 22 sources · 25 quotes
Multi-Token Prediction core · 20 sources · 20 quotes
DSpark core · 8 sources · 10 quotes
DFlash core · 6 sources · 8 quotes
Fused recurrent replay kernel core · 1 source · 1 quote
Recursive shared MTP-head drafting core · 1 source · 2 quotes
Standardized sampling configuration default · 3 sources · 3 quotes
Same-checkpoint target and draft weights default · 1 source · 1 quote
EAGLE used · 9 sources · 9 quotes
NEXTN speculative decoding used · 4 sources · 4 quotes
Presence Penalty used · 4 sources · 5 quotes
Best-of-N scaffolding used · 3 sources · 4 quotes
Multi-stage candidate filtering used · 2 sources · 2 quotes
EAGLE-3-style draft-model fine-tuning used · 1 source · 1 quote
Grammar-constrained decoding used · 1 source · 1 quote
Longest-trace selection used · 1 source · 1 quote
MTP-1 speculative decoding used · 1 source · 1 quote
Throughput-based draft-block sizing used · 1 source · 1 quote
Top-k over token clusters used · 1 source · 1 quote
Top-p and top-k sampling used · 1 source · 1 quote
Multi-layer EAGLE optional · 3 sources · 3 quotes
Speculative sampling optional · 3 sources · 3 quotes
Task-specific sampling parameters optional · 2 sources · 2 quotes
Chat Prefix Completion optional · 1 source · 1 quote
Concurrency-aware draft-length tuning evaluated · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modeltechniques
GLM-5.3-Flash usedMulti-Token Prediction used—
DeepSeek-V4.1-Flash coreDSpark coreThroughput-aware dynamic verification-length scheduling coreSpeculative decoding used—
Hy4-preview usedMulti-Token Prediction usedNEXTN speculative decoding usedSpeculative decoding used—
DeepSeek-V4-Flash-0731 usedDSpark usedChat Prefix Completion optionalSpeculative decoding mentioned—
NVIDIA-Nemotron-3-Ultra-550B-A55B coreRecursive shared MTP-head drafting coreSpeculative decoding defaultBest-of-N scaffolding usedEAGLE usedMulti-Token Prediction used—
MiMo-V2.6-Flash coreDFlash coreDistribution-matched draft-model fine-tuning usedThroughput-based draft-block sizing usedEAGLE optionalSpeculative decoding optional—
MiMo-V2.5 usedMulti-Token Prediction usedSpeculative decoding usedEAGLE optional—
GLM-5.3 usedMulti-Token Prediction used—
Hy3 coreSpeculative decoding coreEAGLE optionalSpeculative sampling optional—
GLM-5.2 usedMulti-Token Prediction usedSpeculative decoding used—
DeepSeek-V3.2 usedLongest-trace selection usedMulti-stage candidate filtering usedTop-p and top-k sampling used—
DeepSeek-V4-Flash-Vision-Exp defaultSame-checkpoint target and draft weights defaultChat Prefix Completion optionalDSpark optional—
DeepSeek-V4-Pro-0813 optionalChat Prefix Completion optionalDSpark optional—
Gemma 4 31B coreMulti-Token Prediction coreSpeculative decoding coreStandardized sampling configuration defaultKV-cache sharing between drafter and target usedTop-k over token clusters used—
Inkling coreMulti-Token Prediction core—
Kimi K3 coreFused recurrent replay kernel coreEAGLE-3-style draft-model fine-tuning used—
Laguna-S-2.1 optionalDFlash optional—
MiMo-V2.5-Pro usedMulti-Token Prediction usedSpeculative decoding usedEAGLE optionalMulti-layer EAGLE optional—
MiMo-V2.6-Pro coreDFlash coreDistribution-matched draft-model fine-tuning usedThroughput-based draft-block sizing used—
NVIDIA-Nemotron-3.5-Lightning-30B-A3B coreSpeculative decoding coreBest-of-N scaffolding usedMulti-Token Prediction usedDFlash optionalDSpark optionalConcurrency-aware draft-length tuning evaluated—
Qwen3.5-397B-A17B usedMTP-1 speculative decoding usedPresence Penalty usedMulti-Token Prediction optionalNEXTN speculative decoding optionalTask-specific sampling parameters optional—
Qwen3.6-35B-A3B optionalMulti-Token Prediction optionalPresence Penalty optionalTask-specific sampling parameters optional—
Qwen3.8-Flash-Next usedNEXTN speculative decoding usedMulti-Token Prediction optional—
Step-3.7-Flash optionalEAGLE optionalMulti-layer EAGLE optionalSpeculative decoding optional—
gpt-oss-120b usedGrammar-constrained decoding usedBest-of-N scaffolding evaluated—