Model techniques map
Techniquesinference & servinginference quantization

implementation detail · filed under inference & serving

Block-wise E4M3 FP8 weight quantization

Stores native FP8 weights using block-wise E4M3 quantization.

Also called FP8 quantization with block-wise e4m3, native FP8 (block-wise e4m3) weights.

source
1
model
1
lab adopt it
1
strongest
used

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 1

Documented in

Evidence

1 span quoted from the sources, strongest treatment first.

ships with native FP8 (block-wise e4m3) weights

usedoptimizationin MiMo-V2.5Xiaomi

Filed alongside

Other methods under inference & serving :: inference quantization.