Model techniques map
Techniquesmodel architecturemultimodal architecture

general family · filed under model architecture

Vision Transformer (ViT)

A transformer architecture used as a vision encoder.

Also called Vision Transformer, ViT vision encoder.

sources
2
models
2
labs adopt it
2
strongest
used

How sources treat it

One count per evidence span, weakest treatment to strongest.

used 2

Documented in

Evidence

2 spans quoted from the sources, strongest treatment first.

Equipped with a 729M-param Vision Transformer (ViT) featuring hybrid window attention

usedmodel architecturein MiMo-V2.5Xiaomi

paired with a 1.88-billion-parameter ViT vision encoder

usedmodel architecturein Step 3.7 FlashStepFun

Filed alongside

Other methods under model architecture :: multimodal architecture.