Model techniques map
Techniquesmodel architecturemultimodal architecture

ambiguous · filed under model architecture

Language backbone

The language-model component paired with a vision encoder; the evidence does not specify a more particular architecture.

source
1
model
1
lab adopt it
1
strongest
core

How sources treat it

One count per evidence span, weakest treatment to strongest.

core 1

Documented in

Evidence

1 span quoted from the sources, strongest treatment first.

combines a 196B-parameter language backbone with a 1.8B-parameter vision encoder

coremodel architecturein Step 3.7 FlashStepFun

Filed alongside

Other methods under model architecture :: multimodal architecture.