Model techniques map
Techniquesinference & servingKV cache management

specific method · filed under inference & serving

RadixCache

A radix-based cache used for prefix sharing.

Also called radix cache.

sources
2
models
2
lab adopt it
1
strongest
used

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 1not used 1

Documented in

Evidence

2 spans quoted from the sources, strongest treatment first.

Context Management: Features like RadixCache (prefix sharing) and Prefix Cache

usedinference servingin GLM-5Z.ai

Unlike the commonly-used radix cache in current inference engines, our request-level prefix cache avoids re-prefilling or inter-request output cache sharing

not usedinference servingin MiMo-V2-FlashXiaomi

Filed alongside

Other methods under inference & serving :: KV cache management.