35-миллиардная ИИ-модель запущена на iPhone со скоростью 11 токенов в секунду
Better Stack продемонстрировала запуск 35-миллиардной MoE-модели прямо на iPhone: активны лишь 3 млрд параметров, скорость — 11 токенов в секунду. Трёхуровневая квантизация сжала модель с 19 до 13 ГБ, активные компоненты занимают 1,4 ГБ RAM, неактивные эксперты (12 ГБ) стримятся с SSD.
- MoE-архитектура активирует 3 млрд из 35 млрд параметров через роутер
- Квантизация сжала модель с 19 до 13 ГБ: горячие эксперты 4 бита, холодные 2 бита
- Активные компоненты занимают 1,4 ГБ RAM, 12 ГБ экспертов хранятся на SSD
- Скорость генерации — 11 токенов в секунду на iPhone
Читать дальше
ИИ