Llama-Mobile сжала 11B VLM до 2,7 бита на CPU смартфонов
Graphcore Research и Arm представили Llama-Mobile: формат S3D8 сжимает веса Llama 3.2 Vision 11B с 21,3 ГБ до 3,7 ГБ (2,7 бита на параметр) и ускоряет генерацию токенов на Arm CPU. На Pixel 8a модель выдаёт 3,8 токена/с, сохраняя 66,1% против 74,4% у bfloat16.
- Веса Llama 3.2 Vision 11B сжаты с 21,3 ГБ до 3,7 ГБ — экономия более 80%
- Формат S3D8 хранит 3 веса в байте: 5-битный индекс центроида и знаки
- На Pixel 8a генерация токенов достигает 33,8 GMAC/s — на 28% выше INT8
- QAT-дистилляция даёт 66,1% в VQA против 74,4% у bfloat16
Читать дальше
ИИ