tehno24.ru
← ИИ
ИИ20 сентября 2026, 12:00

HyQuant: гибридная квантизация внимания LLM ускоряет декодирование до 3,58×

Метод HyQuant квантует большую часть тензоров query, key и value в низкую разрядность, сохраняя в полной точности лишь критичные токены и локальное скользящее окно. Это даёт ускорение декодирующего ядра в 1,32–3,58 раза и сквозного декодирования в 1,04–1,17 раза при потере точности менее 1%.

HyQuant: гибридная квантизация внимания LLM ускоряет декодирование до 3,58×
#HyQuant
Читать дальше
ИИ

OpenAI выпустила GPT-5.6 Sol с задержкой ответа менее 100 мс

ИИ

McKinsey: у 30% компаний упала продуктивность после внедрения агентного ИИ

ИИ

Nvidia: локальный ИИ придёт в дома через DGX Spark и RTX Spark

ИИ

Spirit AI: «мозг» роботов достигнет уровня GPT-3 к середине 2027 года