Model techniques map
Taxonomyinference & servingreasoning control

taxonomy node · level 2

reasoning control

42 methods filed at this node or below it, from the sources of 25 models.

inference & serving :: reasoning control

Matching aids for the classifier: reasoning effort control; thinking mode; test-time scaling; turn budget capping; adaptive reasoning; selectable reasoning depths.

In this branch 42

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 42

Configurable reasoning effort core · 33 sources · 34 quotes
Chain-of-thought reasoning core · 8 sources · 8 quotes
Default thinking mode core · 8 sources · 8 quotes
Interleaved thinking between tool calls core · 3 sources · 4 quotes
Always-on thinking mode core · 2 sources · 2 quotes
Control-token-enabled thinking mode core · 2 sources · 2 quotes
Thinking mode selection default · 4 sources · 4 quotes
Maximum thinking effort default · 3 sources · 3 quotes
clear_thinking chat-template parameter default · 2 sources · 2 quotes
Deployment-time scalar effort control default · 1 source · 5 quotes
Cross-turn persistent reasoning history used · 3 sources · 3 quotes
Inference-time reasoning budget control used · 3 sources · 4 quotes
Reasoning parser used · 3 sources · 3 quotes
Generate-verify-refine loop used · 2 sources · 2 quotes
Medium-effort reasoning mode used · 2 sources · 2 quotes
Test-time compute scaling used · 2 sources · 2 quotes
Per-problem reasoning-budget control used · 1 source · 1 quote
Think-tag response formatting used · 1 source · 1 quote
Thinking modes (off and max) used · 1 source · 1 quote
Turn budget capping used · 1 source · 1 quote
Turn-aware prompting used · 1 source · 1 quote
Disabling reasoning via chat-template configuration optional · 5 sources · 5 quotes
Adaptive reasoning optional · 1 source · 1 quote
Configurable thinking or reasoning mode optional · 1 source · 1 quote
reasoning-enabled inference toggle optional · 1 source · 1 quote
Step-by-step thinking mode optional · 1 source · 1 quote
Task-appropriate maximum output length optional · 1 source · 1 quote
Parallel-fewest-step sampling evaluated · 2 sources · 2 quotes
Parallel test-time compute scaling evaluated · 1 source · 1 quote
Reward-optimized preferred reasoning length evaluated · 1 source · 1 quote
Qwen3 soft thinking switch not used · 2 sources · 2 quotes
User-configurable thinking-effort control not used · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modeltechniques
GLM-5.3-Flash coreAlways-on thinking mode coreConfigurable reasoning effort defaultReasoning-effort resolution and system-prompt injection defaultclear_thinking chat-template parameter optional—
DeepSeek-V4.1-Flash coreCapped linear reasoning-token length deduction coreConfigurable reasoning effort coreEffort-dependent exponential token-penalty schedule coreDeployment-time scalar effort control defaultReward-optimized preferred reasoning length evaluatedTest-time compute scaling evaluated—
Hy4-preview defaultChain-of-thought reasoning defaultConfigurable reasoning effort used—
DeepSeek-V4-Flash-0731 usedConfigurable reasoning effort used—
NVIDIA-Nemotron-3-Ultra-550B-A55B usedChain-of-thought reasoning usedConfigurable reasoning effort usedGenerate-verify-refine loop usedMedium-effort reasoning mode usedTurn budget capping usedTurn-aware prompting usedInference-time reasoning budget control optional—
DeepSeek-V4-Flash usedCross-turn persistent reasoning history usedThink-tag response formatting usedThinking mode selection optional—
GLM-5.3 defaultclear_thinking chat-template parameter defaultConfigurable reasoning effort default—
Hy3 defaultConfigurable reasoning effort defaultReasoning parser usedChain-of-thought reasoning optional—
GLM-5.2 defaultConfigurable reasoning effort defaultDefault thinking mode usedMaximum thinking effort optional—
MiniMax-M3 usedTest-time compute scaling usedAdaptive reasoning optionalConfigurable reasoning effort optionalThinking mode selection optional—
DeepSeek-V3.2 usedGenerate-verify-refine loop usedreasoning-enabled inference toggle optionalDefault thinking mode evaluatedParallel test-time compute scaling evaluatedParallel-fewest-step sampling evaluatedSerial test-time compute scaling through context management evaluated—
DeepSeek-V4-Flash-Vision-Exp optionalConfigurable reasoning effort optional—
DeepSeek-V4-Pro usedConfigurable reasoning effort usedCross-turn persistent reasoning history usedThink-tag response formatting usedThinking mode selection optional—
DeepSeek-V4-Pro-0813 optionalConfigurable reasoning effort optional—
Gemma 4 31B coreControl-token-enabled thinking mode coreDefault thinking mode coreConfigurable thinking or reasoning mode optionalStep-by-step thinking mode optional—
Inkling usedConfigurable reasoning effort usedControllable thinking effort via system message and per-token cost used—
Kimi K3 coreAlways-on thinking mode coreChain-of-thought reasoning defaultConfigurable reasoning effort defaultMaximum thinking effort defaultNatural-language reasoning-effort option message usedPer-problem reasoning-budget control usedstage-wise curriculum over reasoning-effort budget multiplier usedThinking mode selection via generation prefix used—
Laguna-S-2.1 coreInterleaved thinking between tool calls coreConfigurable reasoning effort defaultMaximum thinking effort defaultThinking mode with automatic test-time compute budget defaultCross-turn persistent reasoning history usedThinking modes (off and max) usedUser-configurable thinking-effort control not used—
MiMo-V2.6-Pro usedChain-of-thought reasoning used—
NVIDIA-Nemotron-3.5-Lightning-30B-A3B usedInference-time reasoning budget control used—
Qwen3.5-397B-A17B defaultDefault thinking mode defaultDisabling reasoning via chat-template configuration optionalTask- and mode-specific sampling parameter recommendations optionalTask-appropriate maximum output length optionalQwen3 soft thinking switch not used—
Qwen3.6-35B-A3B defaultDefault thinking mode defaultInterleaved thinking between tool calls defaultThinking mode selection defaultCross-turn persistent reasoning history usedDisabling reasoning via chat-template configuration optional—
Qwen3.8-Flash-Next defaultDefault thinking mode default—
Step-3.7-Flash usedReasoning parser usedConfigurable reasoning effort optional—
gpt-oss-120b coreChain-of-thought reasoning coreConfigurable reasoning effort used—