tehno24.ru
← ИИ
ИИ4 октября 2026, 16:08

Google TurboQuant сжимает KV-кэш до 3 бит без потери точности

Google Research опубликовала алгоритм TurboQuant, сжимающий KV-кэш LLM до 3 бит на значение без потери качества. Кэш модели Llama-3.1-8B при контексте 128K сокращается с 16 ГБ до ~2,6 ГБ, на H100 достигнуто 8-кратное ускорение внимания.

Google TurboQuant сжимает KV-кэш до 3 бит без потери точности
#Google#Nvidia#Llama.cpp#VLLM
Читать дальше
ИИ

QAT-версия Gemma 4 26B-A4B на одном TPU v6e: KV-кэш больше в 15,6 раза, пропускная способность — в 1,9 раза

ИИ

Intel сжала 1,58-битную модель до 1,485 бита без изменения весов

ИИ

Llama-Mobile сжала 11B VLM до 2,7 бита на CPU смартфонов

ИИ

Moonshot AI выпустила Kimi Linear: гибридное внимание с 75% экономии KV-кэша