BeaconKV сокращает пиковую память KV-кэша на 40%
Метод BeaconKV использует «маячковые» запросы, предсказывающие повторное обращение к удалённым фрагментам контекста, и снижает пиковое потребление памяти KV-кэша до 40% без потери качества ответов. На Qwen3-14B с лимитом кэша 1024 токена точность на AIME24 выросла на 31,7 п.п. Метод не требует обучения, но нуждается в ручной настройке целевого коэффициента сжатия.
- Снижение пиковой памяти KV-кэша до 40% на четырёх открытых моделях рассуждения
- Прирост точности на Qwen3-14B для AIME24 — 31,7 п.п. при кэше 1024 токена
- Метод training-free, коэффициент сжатия задаётся флагом --decode-max-budget
- Экономия меньше на задачах без повторного обращения к дальнему контексту
Читать дальше
ИИ