Учёные предложили сжимать вывод инструментов, а не действия ИИ-агентов
Исследование Пекинского университета (arXiv:2609.31430) показало, что сжатие всего транскрипта агента ломает работу: теряются точные пути к файлам и синтаксис вызовов. Метод LOHA сохраняет действия агента и последние K наблюдений в сыром виде, а старые выводы инструментов сжимает в латентные токены; обучение ACD удерживает качество на обычном тексте.
- Сокращение контекста на 43% (Qwen3-4B) и 57% (SWE-Master-4B-RL) при K=3
- Решение задач: 12,1% против 14,5% у Qwen3-4B без сжатия
- При лимите 32K токенов Qwen3 с K=3 решила 21,1% задач против 11,1%
- Пропускная способность на одной GPU выросла в 1,9 раза
Читать дальше
ИИ