Model techniques map
Techniquesoptimizationtraining precision

specific method · filed under optimization

FP8 mixed-precision training

Training uses mixed precision with FP8, without further precision-specific details in the evidence.

Also called FP8 mixed precision.

sources
4
models
2
lab adopt it
1
strongest
used

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 4

Documented in

Further reading

Picked by hand, not extracted: where to read more, not evidence for anything on this page.

Evidence

4 spans quoted from the sources, strongest treatment first.

Trained on 27T tokens using FP8 mixed precision

usedoptimizationin MiMo-V2.5-ProXiaomi

Trained on a total of ~48T tokens using FP8 mixed precision.

usedoptimizationin MiMo-V2.5Xiaomi

Trained on a total of ~48T tokens using FP8 mixed precision.

usedtraining objectivein MiMo-V2.5Xiaomi

we adopt an FP8 mixed-precision framework similar to DeepSeek-V3

usedoptimizationin MiMo-V2-FlashXiaomi

Filed alongside

Other methods under optimization :: training precision.