Model techniques map
Taxonomysoftware implementation

taxonomy area

software implementation

79 methods filed at this node or below it, from the sources of 25 models.

software implementation

Matching aids for the classifier: a named piece of software, not a technique.

In this branch 79

Everything filed at this node or below it, with one collapsible heading per child node.

filed here 7

Separate encoding and inference modules default · 1 source · 1 quote
Data Designer used · 2 sources · 2 quotes
CUDA used · 1 source · 1 quote
fastsafetensors used · 1 source · 1 quote
Nemotron Parse used · 1 source · 1 quote
Model routing and orchestration optional · 1 source · 1 quote

inference engine 15

vLLM used · 7 sources · 7 quotes
TensorRT-LLM used · 2 sources · 3 quotes
Atlas inference library used · 1 source · 1 quote
litert-lm serve used · 1 source · 1 quote
llama.cpp used · 1 source · 1 quote
vLLM or SGLang serving used · 1 source · 1 quote
vLLM tensor parallelism used · 1 source · 1 quote
SGLang optional · 4 sources · 4 quotes
KTransformers optional · 2 sources · 2 quotes
Unsloth optional · 2 sources · 2 quotes
Dedicated serving engines optional · 1 source · 1 quote
vLLM language-model-only mode optional · 1 source · 1 quote
vLLM-Ascend optional · 1 source · 1 quote
xLLM optional · 1 source · 1 quote

training framework 6

DAG-based asset lineage tracking core · 1 source · 1 quote
Experiments as Code core · 1 source · 1 quote
Hugging Face Transformers used · 4 sources · 4 quotes
Megatron-LM used · 3 sources · 3 quotes
NeMo Gym used · 2 sources · 2 quotes
NeMo used · 1 source · 1 quote

kernel & quantization library 18

FlashInfer used · 3 sources · 3 quotes
AngelSlim used · 2 sources · 2 quotes
FlashInfer NVLinkOneSided used · 2 sources · 2 quotes
FlashInfer TensorRT-LLM backend used · 2 sources · 2 quotes
MiniTriton used · 2 sources · 2 quotes
NVIDIA Model-Optimizer used · 2 sources · 2 quotes
AITER used · 1 source · 1 quote
Container-baked precompiled artifacts used · 1 source · 1 quote
FLASHMLA_SPARSE used · 1 source · 1 quote
FlashQLA used · 1 source · 1 quote
Marlin MoE backend used · 1 source · 1 quote
MiniTriton dual-mode tensor library used · 1 source · 1 quote
CUTEDSL optional · 1 source · 1 quote
CUTLASS optional · 1 source · 1 quote
deepseek-recipe optional · 1 source · 1 quote
flash-moba evaluated · 1 source · 1 quote
Flash-Sparse-Attention evaluated · 1 source · 1 quote
Triton mentioned · 1 source · 1 quote

agent product 11

OpenCode used · 4 sources · 4 quotes
Claude Code used · 3 sources · 3 quotes
OpenHands used · 2 sources · 2 quotes
Qwen-Agent used · 2 sources · 2 quotes
Droid used · 1 source · 1 quote
Mini-SWE-Agent used · 1 source · 1 quote
OpenClaw used · 1 source · 1 quote
Pi used · 1 source · 1 quote
Stirrup used · 1 source · 1 quote
Kilo optional · 1 source · 1 quote

infrastructure service 22

Automatic provider failover core · 6 sources · 6 quotes
DeepSeek Elastic Compute (DSec) core · 1 source · 1 quote
End-to-end lineage core · 1 source · 1 quote
Sandbox pause and resume core · 1 source · 1 quote
Custom placement engine used · 1 source · 1 quote
Dependency unification used · 1 source · 1 quote
Durable peer mailbox used · 1 source · 1 quote
Fresh-clone repository sanitization used · 1 source · 1 quote
HTTP/HTTPS sidecar proxy used · 1 source · 1 quote
In-house batch scheduler used · 1 source · 1 quote
Local container-image caching used · 1 source · 1 quote
Model Factory used · 1 source · 1 quote
Mooncake used · 1 source · 1 quote
NeMo Guardrails used · 1 source · 1 quote
NeMo Switchyard used · 1 source · 1 quote
Per-node pooling of initialization actors used · 1 source · 1 quote
Vendoring external dependencies used · 1 source · 1 quote
Write-ahead log used · 1 source · 1 quote
Z3 SMT solver integration used · 1 source · 1 quote
Ray optional · 1 source · 1 quote

By model

Which of this branch's techniques each model's own documents describe, and how strongly. Under each model: its strongest treatment anywhere in the branch.

Modelfiled hereinference enginetraining frameworkkernel & quantization libraryagent productinfrastructure service
GLM-5.3-Flash used—————Automatic provider failover used—
DeepSeek-V4.1-Flash core———deepseek-recipe optional—Claude Agent SDK with version-specific native tool interfaces used—DeepSeek Elastic Compute (DSec) coreCustom placement engine usedDurable peer mailbox used—
Hy4-preview used—vLLM or SGLang serving used——AngelSlim usedFLASHMLA_SPARSE used———
NVIDIA-Nemotron-3-Ultra-550B-A55B usedCUDA usedData Designer used—Environment variable propagation to subprocesses usedvLLM usedSGLang optionalTensorRT-LLM optional—Hugging Face Transformers usedMegatron-LM usedNeMo usedNeMo Gym used—Container-baked precompiled artifacts usedFlashInfer usedFlashInfer NVLinkOneSided usedNVIDIA Model-Optimizer usedCUTEDSL optionalCUTLASS optional—Droid usedOpenCode usedOpenHands usedStirrup used—Dependency unification usedFresh-clone repository sanitization usedLocal container-image caching usedPer-node pooling of initialization actors usedReplacing short-lived Ray actors with tasks usedRay optional—
MiMo-V2.6-Flash used—vLLM tensor parallelism used—————
DeepSeek-V4-Flash used—————Write-ahead log usedZ3 SMT solver integration used—
MiMo-V2.5 optional————Claude Code optionalKilo optionalOpenCode optional——
GLM-5.3 used———AITER used———
Hy3 mentioned———AngelSlim mentioned———
GLM-5.2 used—KTransformers optionalSGLang optionalUnsloth optionalvLLM optionalvLLM-Ascend optionalxLLM optional—Hugging Face Transformers optional——Claude Code usedOpenHands used——
MiniMax-M3 used—KTransformers optionalSGLang optionalUnsloth optionalvLLM optional—Hugging Face Transformers optional—flash-moba evaluatedFlash-Sparse-Attention evaluated—Claude Code usedMini-SWE-Agent usedOpenCode usedPi used——
DeepSeek-V4-Flash-Vision-Exp defaultSeparate encoding and inference modules default—vLLM optional—————
DeepSeek-V4-Pro used—————Write-ahead log usedZ3 SMT solver integration used—
DeepSeek-V4-Pro-0813 optional—————Automatic provider failover optional—
Gemma 4 31B core—litert-lm serve used————Automatic provider failover core—
Inkling used—————Automatic provider failover used—
Kimi K3 core———MiniTriton usedMiniTriton dual-mode tensor library usedTriton mentioned—OpenClaw used—Incremental sandbox checkpointing and resumption coreSandbox pause and resume coreMooncake used—
Laguna-S-2.1 coreShared composable codebase for research and production used—Atlas inference library used—DAG-based asset lineage tracking coreExperiments as Code core———End-to-end lineage coreHTTP/HTTPS sidecar proxy usedIn-house batch scheduler usedModel Factory usedVendoring external dependencies used—
MiMo-V2.5-Pro optional————Claude Code optionalKilo optionalOpenCode optional——
MiMo-V2.6-Pro used—vLLM tensor parallelism usedSGLang optionalvLLM optional—————
NVIDIA-Nemotron-3.5-Lightning-30B-A3B usedNemotron Parse usedModel routing and orchestration optional—TensorRT-LLM used————NeMo Guardrails usedNeMo Switchyard used—
Qwen3.5-397B-A17B used—vLLM language-model-only mode optional———Qwen-Agent used—Automatic provider failover used—
Qwen3.6-35B-A3B corefastsafetensors used—Dedicated serving engines optional——Marlin MoE backend used——Automatic provider failover core—
Qwen3.8-Flash-Next used———FlashQLA used———
Step-3.7-Flash used—llama.cpp used——FlashInfer TensorRT-LLM backend usedFlashInfer optional———