Google TurboQuant сжимает KV-кэш до 3 бит без потери точности
Google Research опубликовала алгоритм TurboQuant, сжимающий KV-кэш LLM до 3 бит на значение без потери качества. Кэш модели Llama-3.1-8B при контексте 128K сокращается с 16 ГБ до ~2,6 ГБ, на H100 достигнуто 8-кратное ускорение внимания.
- KV-кэш Llama-3.1-8B на 128K токенов: 16 ГБ VRAM сжимаются до ~2,6 ГБ
- На NVIDIA H100 4-битный TurboQuant ускорил вычисление внимания в 8 раз
- Метод сочетает PolarQuant с 1-битным преобразованием Джонсона-Линденштрауса
- Алгоритм портирован в llama.cpp, MLX, vLLM и SGLang в течение суток
Читать дальше
ИИ