HyQuant: гибридная квантизация внимания LLM ускоряет декодирование до 3,58×
Метод HyQuant квантует большую часть тензоров query, key и value в низкую разрядность, сохраняя в полной точности лишь критичные токены и локальное скользящее окно. Это даёт ускорение декодирующего ядра в 1,32–3,58 раза и сквозного декодирования в 1,04–1,17 раза при потере точности менее 1%.
- Ускорение декодирующего ядра 1,32–3,58×, сквозного декодирования 1,04–1,17×
- Потеря точности менее 1% на бенчмарках длинного контекста и рассуждений
- Накладные расходы на детектор критичных токенов — 3–5% времени работы
- Готов патч Triton-ядра, подключаемый одним импортом
Читать дальше
ИИ