Vast предложила многоуровневое хранилище для памяти ИИ-агентов
Vast представила подход с многоуровневой памятью для ИИ-агентов: KV-кэш выгружается из памяти GPU на CPU и постоянные носители, что позволяет хранить петабайты контекста и избегать повторных вычислений. Оркестрацию обеспечивает ПО Nvidia Dynamo, также запущен сервис конфиденциальных вычислений.
- Сессия на 500 000 токенов занимает 1/10–1/20 памяти GPU
- KV-кэш выгружается на CPU и постоянные носители до петабайт
- Оркестрацией выгрузки занимается ПО Nvidia Dynamo
- Запущен сервис конфиденциальных вычислений для чувствительных задач
Читать дальше
ИИ