Headroom: сжатие контекста ИИ-агентов экономит 60–95% токенов
Проект Headroom представил слой сжатия контекста между агентом и LLM: модель kompress-v2-base сокращает вывод инструментов, логи, RAG-чанки и файлы. Заявлена экономия 20% токенов для кодинг-агентов и 60–95% для JSON-нагрузок без изменения ответов. Доступны библиотека Python, FastAPI-прокси и MCP-сервер.
- Экономия 20% токенов для кодинг-агентов и 60–95% для JSON-нагрузок
- Промпт на 55 957 токенов сжат до 24 340 с сохранением строки FATAL
- Три режима: библиотека (50–200 мс), прокси (100–300 мс), MCP (150–400 мс)
- Модель сохраняет сигнатуры функций, стектрейсы и строки ERROR/FATAL
Читать дальше
ИИ