Apple M3 Neural Engine ускорил генерацию токенов Llama 3.2 1B до 24,3 в секунду
Бенчмарки показали рост скорости генерации токенов с 10,0 до 24,3 токена в секунду при запуске модели Llama 3.2 1B на Neural Engine чипа Apple M3. Для крупных моделей вроде Qwen3-8B прирост слабее, а результаты зависят от поддержки Core ML и узких мест передачи данных.
- Llama 3.2 1B: рост с 10,0 до 24,3 токена в секунду
- Для Qwen3-8B прирост производительности менее заметен
- Многие приложения по умолчанию используют CPU или GPU вместо Neural Engine
- Результаты не подтверждены независимо, Apple их не комментировала
Читать дальше
Железо