Lightbits представила движок Inferra для кэша KV в инференсе ИИ
Lightbits Labs анонсировала Inferra — движок оркестрации KV-кэша, который виртуализирует память GPU между DRAM и NVMe. Заявлено до 16x больше одновременных сессий, ускорение задержки более чем в 100x и контекст до 10 млн токенов; бета-тестирование уже прошло с OVH.
- Заявлено до 16x больше параллельных сессий инференса на существующих GPU
- Ускорение задержки более чем в 100x за счёт префетчинга вместо пересчёта
- Поддержка контекстных окон до 10 млн токенов
- Поддерживаются фреймворки vLLM, TensorRT и SGLang, бета-клиент — OVH
Читать дальше
ИИ