Model techniques map
Techniquesmodel architecturechannel mixermixture of expertsshared experts

implementation detail · filed under model architecture

8 Routed + 1 Shared Experts Activated per Token

A reported MoE activation configuration with 8 routed experts and 1 shared expert activated per token.

sources
2
model
1
lab adopt it
1
strongest
core

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 1core 1

Documented in

Evidence

2 spans quoted from the sources, strongest treatment first.

Number of Activated Experts: 8 Routed + 1 Shared

coremodel architecturein Qwen3.5-35B-A3BQwen

Number of Activated Experts: 8 Routed + 1 Shared

usedmodel architecturein Qwen3.5-122B-A10BQwen

Filed alongside

Other methods under model architecture :: channel mixer :: mixture of experts :: shared experts.