vllm-mlx на Apple Silicon: батчинг ускоряет до 3,39x, но упирается в память
Обзор vllm-mlx 0.4.1 — сервера инференса на MLX для Apple Silicon с OpenAI- и Anthropic-совместимыми API, непрерывным батчингом, paged KV-кэшем и префикс-кэшированием. На M4 Max с 128 ГБ при 5 параллельных запросах рост совокупной пропускной способности составил от 1,64x до 3,39x в зависимости от модели, но объём унифицированной памяти остаётся жёстким ограничением.
- Qwen3-0.6B-8bit: рост с 328,1 до 1111,8 токенов/с (3,39x) при 5 запросах
- Qwen3-30B-A3B-4bit: с 98,1 до 233,3 токенов/с (2,38x)
- Qwen2.5-1.5B-Instruct-4bit: с 196,9 до 322,2 токенов/с (1,64x)
- Ускорение зависит от модели, архитектуры и пропускной способности памяти, а не фиксировано
Читать дальше
ИИ