Alibaba выпустила Qwen3.8-Flash-Next: 125B параметров, 6B активных
Alibaba представила открытую MoE-модель Qwen3.8-Flash-Next: 125 млрд параметров при 6 млрд активных на токен и таблица N-gram-эмбеддингов на 51 млрд. Контекст 262 144 токена с расширением до 1 млн, заявленный результат 62,5 на SWE-bench Pro и стоимость обучения около 1/9 от Qwen3.7-Plus.
- 125B всего / 6B активных параметров, плюс 51B таблица N-gram-эмбеддингов
- Нативный контекст 262 144 токена, расширяется до 1 млн через YaRN
- 62,5 на SWE-bench Pro против 61,7 у плотной Qwen3.8-27B (данные вендора)
- Заявленная стоимость обучения — около 1/9 от Qwen3.7-Plus
Читать дальше
ИИ