Model techniques map
PublishersvLLM

vLLM

10 documents read from this publisher.

Qwen3.8-Flash-Next on vLLM — Serve command for H200, H100, GB200 NVL4, GB300 NVL4, MI355X, RTX Pro 6000 4x, DGX Station (GB300)

software documentation · vendor docs · 2026-09-17 · 15 techniques

zai-org/GLM-5.3 — 743B / 39B active · MOE · 1024K ctx

software documentation · vendor docs · 2026-09-10 · 9 techniques

zai-org/GLM-5.3-Flash — 321B / 18B active · MOE · 1024K ctx

software documentation · vendor docs · 2026-09-05 · 16 techniques

tencent/Hy4-preview — 770B / 49B active · MOE · 1024K ctx

software documentation · vendor docs · 2026-08-28 · 14 techniques

thinkingmachines/Inkling — 975B / 41B active · MOE · 1024K ctx

software documentation · vendor docs · 2026-07-14 · 8 techniques

tencent/Hy3 — 295B / 21B active · MOE · 256K ctx

software documentation · vendor docs · 2026-07-06 · 15 techniques

Qwen/Qwen3.6-27B — 27B · DENSE · 256K ctx

software documentation · vendor docs · 2026-07-02 · 6 techniques

Qwen/Qwen3.6-35B-A3B — 35B / 3B active · MOE · 256K ctx

software documentation · vendor docs · 2026-06-03 · 18 techniques

XiaomiMiMo/MiMo-V2.5 — 311B / 15B active · MOE · 1024K ctx

software documentation · vendor docs · 2026-04-27 · 8 techniques

Qwen/Qwen3.5-397B-A17B — 397B / 17B active · MOE · 256K ctx

software documentation · vendor docs · 2026-04-16 · 12 techniques