Model techniques map
Taxonomymodel architecturechannel mixermixture of experts

taxonomy node · level 3

mixture of experts

61 methods filed at this node or below it, from the sources of 25 models.

model architecture :: channel mixer :: mixture of experts

Matching aids for the classifier: MoE; sparse MoE; sparse expert activation; DeepSeekMoE; MegaMoE.

In this branch 61

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 17

Mixture of Experts core · 88 sources · 101 quotes
Sparse expert activation core · 8 sources · 8 quotes
DeepSeekMoE core · 2 sources · 2 quotes
Mixture-of-Experts layers core · 2 sources · 2 quotes
MoE with routed and shared experts core · 2 sources · 2 quotes
Asymmetric input/output activation split core · 1 source · 1 quote
Dispatch recomputation core · 1 source · 1 quote
Gated DeltaNet MoE core · 1 source · 2 quotes
Hybrid Mixture of Experts core · 1 source · 1 quote
MegaMoE used · 1 source · 1 quote
MoE with 256 experts and top-8 routing used · 1 source · 1 quote
Routed expert output modulation used · 1 source · 1 quote

expert routing 15

Top-8 expert routing core · 5 sources · 5 quotes
Token-level expert routing core · 3 sources · 3 quotes
Keep Routing core · 1 source · 1 quote
Routed experts core · 1 source · 1 quote
Token-choice routing with softplus gating core · 1 source · 1 quote
Top-6 expert routing core · 1 source · 1 quote
Fixed Top-k routing with frozen bias default · 1 source · 1 quote
Anticipatory Routing used · 2 sources · 2 quotes
DP-aware routing used · 1 source · 1 quote
Hash routing used · 1 source · 1 quote
Latent-space routing used · 1 source · 1 quote
Token-choice routing used · 1 source · 1 quote
Top-4 expert routing used · 1 source · 2 quotes
Loss-spike-triggered Anticipatory Routing optional · 1 source · 1 quote

expert load balancing 15

Auxiliary-loss-free load balancing core · 3 sources · 5 quotes
Quantile Balancing core · 3 sources · 5 quotes
Auxiliary-loss load balancing used · 1 source · 1 quote
Exact coordinate minimization used · 1 source · 1 quote
Expert bias update factor used · 1 source · 1 quote
Expert Parallelism Load Balancing used · 1 source · 1 quote
formHC used · 1 source · 1 quote
Histogram-based quantile estimation used · 1 source · 2 quotes
Load balancing used · 1 source · 1 quote
Persistent load balancing used · 1 source · 1 quote
Pooled-global-batch quantile estimation used · 1 source · 1 quote
Round-robin load balancing optional · 1 source · 1 quote
MaxVio evaluated · 1 source · 1 quote

shared experts 7

Shared Experts core · 7 sources · 7 quotes
No Shared Experts core · 3 sources · 3 quotes
Shared Experts Active on Every Token core · 2 sources · 2 quotes
MoE with Expert Sinks core · 1 source · 1 quote

fine-grained experts 2

Granular Mixture of Experts not used · 2 sources · 2 quotes

latent mixture of experts 5

LatentMoE core · 7 sources · 9 quotes
Normalized LatentMoE core · 6 sources · 7 quotes
Hybrid Latent Mixture of Experts core · 1 source · 1 quote
Latent-dimension reduction used · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modelfiled hereexpert routingexpert load balancingshared expertsfine-grained expertslatent mixture of experts
GLM-5.3-Flash coreMixture of Experts core—Token-level expert routing core—————
DeepSeek-V4.1-Flash coreAsymmetric input/output activation split coreMixture of Experts coreMoE with 384 routed experts and a shared expert coreMixture-of-Experts layers used——Auxiliary-loss-free load balancing coreModality-specific auxiliary-loss-free load balancing coreformHC used—Shared Experts used—DeepSeekMoE shared and fine-grained routed experts core——
Hy4-preview coreMixture of Experts coreMoE with routed and shared experts core—Top-8 expert routing core——Shared Experts coreTop-8 Routed-Expert Selection with Shared-Expert Activation core———
NVIDIA-Nemotron-3-Ultra-550B-A55B coreMixture of Experts coreMixture-of-Experts layers core——Expert Parallelism Load Balancing usedMaxVio evaluated—Shared Experts used—Granular Mixture of Experts not used—Hybrid Latent Mixture of Experts coreLatentMoE core—
MiMo-V2.6-Flash coreMixture of Experts core———No Shared Experts core———
DeepSeek-V4-Flash coreDeepSeekMoE coreMixture of Experts coreMegaMoE used—Hash routing usedAnticipatory Routing optionalLoss-spike-triggered Anticipatory Routing optional—Auxiliary-loss-free load balancing used—Shared Experts core———
MiMo-V2.5 coreMixture of Experts coreMoE with 256 experts and top-8 routing used—Top-8 expert routing used—Expert bias update factor usedLoad balancing usedRound-robin load balancing optional—No Shared Experts not used———
Hy3 coreMixture of Experts core—Routed experts coreTop-8 expert routing core——Shared Experts core———
GLM-5.2 coreMixture of Experts core—DP-aware routing used—————
MiniMax-M3 coreMixture of Experts core—Top-4 expert routing used—Persistent load balancing used—Shared Experts used———
DeepSeek-V3.2 core—Keep Routing core—————
DeepSeek-V4-Flash-Vision-Exp coreMixture of Experts core——————
DeepSeek-V4-Pro coreDeepSeekMoE coreMixture of Experts coreMegaMoE used—Anticipatory Routing usedHash routing usedLoss-spike-triggered Anticipatory Routing optional—Auxiliary-loss-free load balancing used—Shared Experts core———
Gemma 4 31B coreMixture of Experts coreSparse expert activation core——————
Inkling coreMixture of Experts coreSigmoid-based MoE router with auxiliary-loss-free load balancing used—Token-level expert routing coreTop-6 expert routing core——MoE with Expert Sinks coreShared Experts Active on Every Token core———
Kimi K3 coreDispatch recomputation coreMixture of Experts coreOutput-independent MoE gradient reformulation coreSparse expert activation core—Fixed Top-k routing with frozen bias defaultLatent-space routing used—Auxiliary-loss-free load balancing coreQuantile Balancing coreExact coordinate minimization usedExponential moving average of estimated quantiles usedHistogram-based quantile estimation usedPooled-global-batch quantile estimation used———LatentMoE coreNormalized LatentMoE coreSharded latent weights with fused all-gather GEMM epilogue core—
Laguna-S-2.1 coreMixture of Experts coreSparse expert activation coreRouted expert output modulation used—Token-choice routing with softplus gating coreToken-choice routing used—Auxiliary-loss load balancing used—Shared Experts used———
MiMo-V2.5-Pro coreMixture of Experts core——————
MiMo-V2.6-Pro coreMixture of Experts coreSparse expert activation core———No Shared Experts core———
NVIDIA-Nemotron-3.5-Lightning-30B-A3B coreMixture of Experts coreMoE with 128 routed experts and a shared expert used—Token-level expert routing core————LatentMoE coreLatent-dimension reduction used—
Qwen3.5-397B-A17B coreHybrid Mixture of Experts coreMixture of Experts coreSparse expert activation core———10 Routed + 1 Shared Experts Activated per Token core8 Routed + 1 Shared Experts Activated per Token core———
Qwen3.6-35B-A3B coreGated DeltaNet MoE coreMixture of Experts core——————
Qwen3.8-Flash-Next coreMixture of Experts coreFrequency-based partitioning of N-gram embedding slots evaluated———10 Routed + 1 Shared Experts Activated per Token core———
Step-3.7-Flash coreMixture of Experts core——————
gpt-oss-120b coreMixture of Experts core—Top-k expert routing with softmax over selected experts core—————