PublishersXiaomi LLM-Core
Xiaomi LLM-Core
1 document read from this publisher.
MiMo-V2-Flash Technical Report
technical report · 2026-01-06 · 39 techniques
Mixture of ExpertsMulti-Token PredictionHybrid AttentionSpeculative decodingGroup Relative Policy OptimizationMulti-Teacher On-Policy DistillationSupervised fine-tuningGrouped-query attentionReinforcement LearningSliding Window AttentionOn-Policy DistillationCosine decayHybrid Sliding Window AttentionLearnable attention sink biasPartial rolloutRotary Position EmbeddingAdamWFP8 mixed-precision trainingGlobal attentionNo Shared ExpertsRollout Routing ReplayData SchedulerRadixCacheSeamless Rollout EngineTool ManagerToolboxBash commands for context retrievalDense feed-forward networkDiscarding tool-call historyExpert bias update factorGradient clippingLoad balancingMemory compressionMoE sequence auxiliary lossMoE with 256 experts and top-8 routingOutcome Reward ModelRequest-level prefix cacheReverse KL divergenceStaleness-aware truncated importance sampling