Model techniques map
Techniquesmodel architecturemultimodal architecture

specific method · filed under model architecture

Early fusion multimodal training

Multimodal tokens are included in training from the start, rather than added through a separate vision adapter afterward.

Also called Early fusion training on multimodal tokens, Unified Vision-Language Foundation, Early fusion vision-language training.

sources
5
models
2
lab adopt it
1
strongest
core

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 1core 4

Documented in

Further reading

Picked by hand, not extracted: where to read more, not evidence for anything on this page.

Evidence

5 spans quoted from the sources, strongest treatment first.

Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks.

coremodel architecturein Qwen3.5-122B-A10BQwen

Early fusion training on multimodal tokens means the model doesn’t need a separate vision adapter.

coremodel architecturein Qwen3.5-397B-A17BAlibaba

Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks.

coremodel architecturein Qwen3.5-35B-A3BQwen

Early fusion training on trillions of multimodal tokens achieves cross-generational parity with Qwen3 and outperforms Qwen3-VL models across reasoning, coding, agents, and visual understanding benchmarks.

coremodel architecturein Qwen3.5Qwen

Early fusion training on multimodal tokens achieves cross-generational parity with Qwen3

usedtraining objectivein Qwen3.5-397B-A17BQwen

Filed alongside

Other methods under model architecture :: multimodal architecture.