Model techniques map
Techniquesinference & servingreasoning control

specific method · filed under inference & serving

Reward-optimized preferred reasoning length

The preferred reasoning length is defined by maximizing a reward term minus an effort-dependent token cost.

Also called preferred reasoning length.

source
1
model
1
labs adopt it
0
strongest
evaluated

How sources treat it

One count per evidence span, weakest treatment to strongest.

evaluated 1

Documented in

Evidence

1 span quoted from the sources, strongest treatment first.

define the preferred reasoning length ℓ∗x(b) by ℓ∗x(b)∈arg maxℓ≥0 [px(ℓ)−k(b) ℓ/Lnorm]

evaluatedtraining objectivein DeepSeek-V4.1-FlashDeepSeek

Filed alongside

Other methods under inference & serving :: reasoning control.