Scality представила AI Inference Factory с KV-кэшем в объектном хранилище
Scality выпустила открытый стек AI Inference Factory для запуска открытых моделей на собственной инфраструктуре. KV-кэш хранится в объектном хранилище ADI и передаётся в GPU по RDMA: восстановление контекста в 14 раз быстрее пересчёта, до 8 ТБ кэша и 1000 возобновляемых сессий.
- Восстановление контекста из ADI в 14 раз быстрее пересчёта: 166 мс против 2,3 с
- На контексте 438 764 токена разрыв 72x: 7,3 с против 529 с
- ADI удерживает до 8 ТБ KV-кэша — в 10 раз больше памяти сервера
- Веса Gemma-3 27B (54,86 ГБ) загружаются в GPU за 1,9 с
Читать дальше
ИИ