Исследование: гетерогенные механизмы внимания в трансформерах дают выигрыш только при разных семействах
VIDRAFT AI Research (arXiv:2609.20269) проверила размещение семи механизмов внимания по латинскому квадрату в 49-слойной модели Aether-7B-5Attn (6,59 млрд параметров MoE, ~2,98 млрд активных). Оказалось, что порядок слоёв не важен, а выигрыш даёт лишь наличие механизма из другого семейства: удаление Mamba-2 ухудшает CE на 2,14%, тогда как скользящее окно, дифференциальное и полное внимание можно убрать без эффекта.
- Aether-7B-5Attn: 6,59 млрд параметров MoE, 49 слоёв, 144,2 млрд токенов, ~11 700 B200-часов
- Удаление Mamba-2 из четырёх механизмов даёт +2,14% CE, остальные три — в пределах шума
- Однородный стек проигрывает +1,68% при 700,9 млн и +2,63% при 1,514 млрд параметров
- Порог значимости |Δ| > 2·pooled SD зафиксирован до финальных запусков
Читать дальше
ИИ