PublishersXiaomi MiMo
Xiaomi MiMo
10 documents read from this publisher.
XiaomiMiMo/MiMo-V2.6-Pro-RL · Hugging Face
first party release · model card · 2026-09-21 · 20 techniques
Mixture of ExpertsMulti-Token PredictionHybrid AttentionDFlashvLLMGroupwise Advantage RedistributionGroupwise Agentic GradingGroupwise Reward SynthesisSGLangMulti-Prefix Multi-Teacher On-Policy DistillationNo Shared ExpertsAdversarial screeningAsynchronous Group Relative Policy OptimizationEnvironment hardeningSelf-correction cold startVerifier cross-checkingGlobal attention with a dense feed-forward network in the first Transformer blockMixing tasks and harnesses in a single RL batchSingle Mixed Reinforcement-Learning RunTeacher-Trajectory and SFT-History Reuse
XiaomiMiMo/MiMo-V2.6-Flash-RL · Hugging Face
first party release · model card · 2026-09-21 · 16 techniques
Mixture of ExpertsMulti-Token PredictionSpeculative decodingEAGLEDFlashPrefix-Conditioned On-Policy DistillationGroupwise Advantage RedistributionGroupwise Agentic GradingGroupwise Reward SynthesisMulti-Prefix Multi-Teacher On-Policy DistillationNo Shared ExpertsAdversarial screeningAsynchronous Group Relative Policy OptimizationEnvironment hardeningSelf-correction cold startVerifier cross-checking
XiaomiMiMo/MiMo-V2.5-Pro · Hugging Face
first party release · model card · 2026-04-27 · 13 techniques
XiaomiMiMo/MiMo-V2.5-Base · Hugging Face
first party release · model card · 2026-04-27 · 19 techniques
Mixture of ExpertsMulti-Token PredictionHybrid AttentionSpeculative decodingMulti-Teacher On-Policy DistillationSupervised fine-tuningFP8Sliding Window AttentionChunked prefillHybrid Sliding Window AttentionLearnable attention sink biasAgentic reinforcement learningAttention data parallelismDeepEPFP8 mixed-precision trainingGlobal attentionFlashAttention 3Audio encoder initialized from MiMo-AudioRound-robin load balancing
XiaomiMiMo/MiMo-V2.5 · Hugging Face
first party release · model card · 2026-04-27 · 17 techniques
Mixture of ExpertsMulti-Token PredictionHybrid AttentionSpeculative decodingMulti-Teacher On-Policy DistillationSupervised fine-tuningFP8Sliding Window AttentionChunked prefillHybrid Sliding Window AttentionLearnable attention sink biasAgentic reinforcement learningDeepEPFP8 mixed-precision trainingGlobal attentionFlashAttention 3Vision Transformer (ViT)
Xiaomi MiMo-V2.5
first party release · official blog · 2026-04-22 · 11 techniques
Xiaomi MiMo-V2.6 Series: 3 New Models Officially Released
first party release · vendor docs · 2026-01-01 · 4 techniques
Xiaomi MiMo-V2.6 Series: 3 New Models Officially Released
first party release · vendor docs · 2026-01-01 · 5 techniques
MiMo V2 6 technical report
technical report · 107 techniques
Hybrid AttentionDFlashAsynchronous reinforcement learningPartial rolloutPrefix-Conditioned On-Policy DistillationAgentic reinforcement learningGroupwise Advantage RedistributionGroupwise Agentic GradingGroupwise Reward SynthesisFP4 Quantization-Aware TrainingFreezing the MoE Router During Reinforcement LearningMulti-harness trainingMulti-Prefix Multi-Teacher On-Policy DistillationRollout Routing ReplayAutonomous Student RolloutsDecoupled control plane and data planeDeficit-corrected schedulingPredictive Rollout DispatchAdaptive Rollout ConcurrencyAdaptive Rollout SchedulingAdvantage ShapingAgent LoopAgent-centric mid-trainingAgent-centric multimodal data mixtureAgent-centric rollout executionAlternating Row-Major and Column-Major Token SerializationAsynchronous cache offloading and restorationAsynchronous group-wise gradingAtomic binary rubric evaluationBehavior rubricsBehavioral regularizationComposite early-stop strategyContainer-level network isolationCPU-resident optimizer statesCross-entropy objectiveData SchedulerData-parallel-first multimodal encodingDialogue prefix matchingDistribution-matched draft-model fine-tuningDomain-Specific GRPO Training
Install the latest SGlang from main branch
first party release · code repo · 12 techniques
Speculative decodingMulti-Token PredictionEAGLEMulti-Token PredictionSeamless Rollout EngineCold-started SFT modelContinuous rollout with asynchronous reward computation and early terminationData re-sampling strategyMulti-dimensional data filteringRule-based verifierTest-difficulty-driven code rewardThree-stage data mixture strategy