tehno24.ru
← ИИ
ИИ10 октября 2026, 07:36

vllm-mlx на Apple Silicon: батчинг ускоряет до 3,39x, но упирается в память

Обзор vllm-mlx 0.4.1 — сервера инференса на MLX для Apple Silicon с OpenAI- и Anthropic-совместимыми API, непрерывным батчингом, paged KV-кэшем и префикс-кэшированием. На M4 Max с 128 ГБ при 5 параллельных запросах рост совокупной пропускной способности составил от 1,64x до 3,39x в зависимости от модели, но объём унифицированной памяти остаётся жёстким ограничением.

vllm-mlx на Apple Silicon: батчинг ускоряет до 3,39x, но упирается в память
#Apple#Vllm-mlx#MLX
Читать дальше
ИИ

ИИ-агенты упираются в недоверие: лишь 13% готовы дать доступ к почте

Софт

rke2-silicon запускает Kubernetes на macOS через Apple Containers

Софт

Gravity Linux — дистрибутив для Apple Silicon с планом самоустранения

Софт

Fedora Asahi Remix 45 добавила поддержку Apple Silicon M3