implementation detail · not yet filed
One global-attention layer per four-layer GDN hybrid block
- source
- 1
- model
- 1
- lab adopt it
- 1
- strongest
- default
How sources treat it
One count per evidence span, weakest treatment to strongest.
default 1
Documented in
Evidence
1 span quoted from the sources, strongest treatment first.
We place one such full-attention layer in every four layers, with the other three layers using GDN.
defaultunclearin Qwen3.8-Flash-NextQwen