Кластер из четырёх Raspberry Pi 5 запустил Qwen3-30B-A3B на CPU со скоростью 15 токенов/с
Hellomatik опубликовала исследование и модификацию distributed-llama, запустившую Qwen3-30B-A3B на кластере из четырёх Raspberry Pi 5 только на CPU Cortex-A76 без GPU и разгона. Средняя скорость декодирования составила 15,143 токена/с — на 15,2% быстрее базовой реализации и на 16,1% выше прошлого результата.
- Кластер из 4 Raspberry Pi 5 по 16 ГБ LPDDR4X, NVMe и Gigabit Ethernet
- Скорость декодирования 15,143 токена/с, end-to-end — 14,449 токена/с
- 12 правок в distributed-llama дали прирост 15,2% без разгона CPU
- Пропускная способность памяти выросла с 8,3 до 12,5 ГБ/с на плату
Читать дальше
ИИ