Model techniques map
Taxonomyoptimizationtraining parallelism

taxonomy node · level 2

training parallelism

29 methods filed at this node or below it, from the sources of 15 models.

optimization :: training parallelism

Matching aids for the classifier: tensor parallelism; pipeline parallelism; context parallelism; data-weighted data parallelism; training-time expert parallelism.

In this branch 29

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 29

Communication-Computation Overlap core · 1 source · 2 quotes
MoonEP core · 1 source · 4 quotes
Redundant-Expert Capacity Reservation core · 1 source · 1 quote
Sequence Parallelism for Activations core · 1 source · 1 quote
Expert Parallelism used · 10 sources · 13 quotes
Tensor Parallelism used · 5 sources · 6 quotes
Pipeline Parallelism used · 2 sources · 2 quotes
Cache-Based Pipeline Communication used · 1 source · 1 quote
Context Parallelism used · 1 source · 1 quote
Fully Balanced Expert-Parallel Training used · 1 source · 1 quote
Hybrid ZeRO Bucket Assignment for Muon used · 1 source · 1 quote
KDA Context Parallelism used · 1 source · 1 quote
Load-Balanced Image Sharding used · 1 source · 1 quote
Pipeline Payload Extensions used · 1 source · 1 quote
SConv-Aware Tensor-Parallel Sharding used · 1 source · 1 quote
SM-Level Context Parallelism used · 1 source · 1 quote
ZeRO-3 Optimizer State Sharding used · 1 source · 1 quote
Data-Weighted Data Parallelism mentioned · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modeltechniques
DeepSeek-V4.1-Flash coreCommunication-Computation Overlap coreLoad-Balanced Image Sharding usedPipeline Payload Extensions used—
NVIDIA-Nemotron-3-Ultra-550B-A55B usedContext Parallelism usedExpert Parallelism usedPipeline Parallelism usedTensor Parallelism usedData-Weighted Data Parallelism mentioned—
MiMo-V2.6-Flash usedWindow-Bounded KV Exchange under Context Parallelism used—
DeepSeek-V4-Flash usedAll-to-all Gradient Exchange with Local FP32 Summation usedHybrid ZeRO Bucket Assignment for Muon usedKnapsack-Based Balanced Assignment of Dense Parameter Matrices usedModified DualPipe 1F1B Pipeline Overlap for mHC used—
GLM-5.3 usedExpert Parallelism used—
GLM-5.2 usedExpert Parallelism used—
DeepSeek-V4-Pro usedAll-to-all Gradient Exchange with Local FP32 Summation usedHybrid ZeRO Bucket Assignment for Muon usedKnapsack-Based Balanced Assignment of Dense Parameter Matrices usedModified DualPipe 1F1B Pipeline Overlap for mHC used—
Gemma 4 31B usedData Replica Reduction over the Data Center Network usedZeRO-3 Optimizer State Sharding used—
Inkling usedSConv-Aware Tensor-Parallel Sharding used—
Kimi K3 coreMoonEP coreRedundant-Expert Capacity Reservation coreSequence Parallelism for Activations coreCache-Based Pipeline Communication usedDynamic Context Parallelism for Large Multimodal Samples usedExpert Parallelism usedFully Balanced Expert-Parallel Training usedGPU Planning Kernel for Redundant Expert Migration usedKDA Context Parallelism usedPipeline ZeRO-2 Gradient Sharding with CPU Offloading usedpipeline-bubble scheduling of ViT computation usedSM-Level Context Parallelism used—
MiMo-V2.6-Pro usedWindow-Bounded KV Exchange under Context Parallelism used—
Qwen3.5-397B-A17B usedExpert Parallelism used—
Qwen3.6-35B-A3B usedTensor Parallelism used—
Qwen3.8-Flash-Next usedNS-FLOP-Balanced Static Parameter Partitioning usedTensor and Expert Parallelism with Degree Eight used—
Step-3.7-Flash usedExpert Parallelism usedTensor Parallelism used—