Model techniques map
Techniquesinference & servingKV cache management

implementation detail · filed under inference & serving

Encoder SWA bounded replay

When encoder SWA KV is missing, replays the recent cached-prefix window together with the uncached suffix.

source
1
model
1
lab adopt it
1
strongest
used

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 1

Documented in

Evidence

1 span quoted from the sources, strongest treatment first.

When the encoder SWA KV is missing, we replay the last 𝑛win tokens of the cached prefix and process them together with the uncached suffix

usedunclearin DeepSeek-V4.1-FlashDeepSeek

Filed alongside

Other methods under inference & serving :: KV cache management.