Открытые MoE-модели 2026 года активируют лишь 1–9% весов
В 2026 году открытые модели на разреженной архитектуре Mixture of Experts активируют от 1 до 9% весов на токен: DeepSeek V4.1-Flash — 552 млрд общих при ~8 млрд активных, Kimi K3 — 2,8 трлн при ~104 млрд, GLM-5.2 — 744 млрд при ~40 млрд. Вычисления зависят от активных параметров, а память и загрузка — от общих, и эти величины расходятся на один-два порядка.
- DeepSeek V4.1-Flash: 552 млрд общих весов, ~8 млрд активных (~1,4%)
- Kimi K3: 2,8 трлн общих, ~104 млрд активных (~3,7%), 16 из 896 экспертов
- GLM-5.2: 744 млрд общих, ~40 млрд активных (~5,4%)
- KV-кэш V4.1-Flash — ~890 байт на токен при контексте 1 млн токенов
Читать дальше
ИИ