NaiveAI выпустила открытую MoE-модель Naive-N0.5-Flash на 309 млрд параметров
NaiveAI опубликовала на Hugging Face открытую MoE-модель Naive-N0.5-Flash: около 309 млрд параметров при 15,5 млрд активных, лицензия MIT и контекст на 1 млн токенов. Архитектура сочетает скользящее окно внимания (SWA) и разреженное внимание DSA в пропорции примерно 5:1 без полных слоёв внимания.
- 309 млрд параметров всего, 15,5 млрд активных, лицензия MIT
- Контекст 1 млн токенов на гибриде SWA и DSA в пропорции 5:1
- Модель дообучена на базе MiMo-V2.5 без полного претрейна
- NaiveRT: до 2000 токенов/с в режиме Ultrafast по данным вендора
Читать дальше
Компании