Model techniques map
Techniquesoptimizationtraining precision

implementation detail · filed under optimization

FP4+FP8 mixed precision

MoE expert parameters use FP4 while most other parameters use FP8.

Also called FP4 + FP8 Mixed.

sources
2
models
2
lab adopt it
1
strongest
used

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 2

Documented in

Evidence

2 spans quoted from the sources, strongest treatment first.

MoE expert parameters use FP4 precision; most other parameters use FP8.

usedinference servingin DeepSeek-V4-FlashDeepSeek

FP4 + FP8 Mixed: MoE expert parameters use FP4 precision; most other parameters use FP8.

usedinference servingin DeepSeek-V4DeepSeek

Filed alongside

Other methods under optimization :: training precision.