PublishersMiniMax
MiniMax
5 documents read from this publisher.
MiniMax M3 - Coding & Agentic Frontier, 1M Context, Multimodal
first party release · vendor docs · 2026-07-25 · 3 techniques
MiniMax Sparse Attention
research paper · technical report · 2026-06-11 · 33 techniques
Mixture of ExpertsGrouped-query attentionSliding Window AttentionShared ExpertsMiniMax Sparse AttentionSparse attentionLearnable attention sink biasRotary Position EmbeddingKL alignment lossGradient detachmentIndex BranchIndexer WarmupKV-outer sparse attentionLinear attentionLocal BlockMain BranchTop-4 expert routingTop-k block selectionDynamic load balancingDynamic sparse selectionExp-free TopK kernelFixed Sliding Window AttentionFlashAttentionIndex Branch outputIndex Branch value headLanguage modeling loss plus KL lossLSE fusionPersistent load balancingPre-scheduled tile chunkingquery concatenationSparse softmax attentionTwo-phase forwardTwo-stage sparse attention
MiniMaxAI/MiniMax-M3 · Hugging Face
first party release · model card · 2026-06-11 · 5 techniques
MiniMax M3: Frontier Coding, 1M Context, Native Multimodality — All in One Model - MiniMax Research
first party release · official blog · 2026-05-31 · 29 techniques
DeepSeek Sparse AttentionMiniMax Sparse AttentionSparse attentionMixed-modality trainingOpenCodeThinking mode selectionClaude CodeCUDA GraphFull attentionKV-outer sparse attentionTerminus 2Test-time compute scalingAgent-as-a-VerifierarchipelagoAutotune configuration generationDynamic Workflowsflash-mobaFlash-Sparse-AttentionFP8 GEMMHost-side scheduling optimizationInterleaved multimodal trainingLLM-as-a-JudgeMini-SWE-AgentMixture of Block AttentionPersistent kernelPiProducer–Verifier adversarial harness loopRalph-Loop mechanismReAct Toolbelt
README
first party release · code repo · 10 techniques