Открытый прокси с дообученной моделью сжимает контекст Codex на 29,6%
Проект на Show HN предлагает локальный прокси, который перехватывает результаты вызовов инструментов Codex и сжимает их дообученной моделью Qwen, сокращая расход токенов на 29,6% без сброса KV-кэша. Авторы экономили до $700 в день на API-вызовах из-за раздутого контекста.
- Прокси сжимает вывод инструментов до попадания в контекст, KV-кэш не сбрасывается
- Экономия токенов — 29,6%, дообучение на траекториях кодинг-агентов
- Установка одной командой, отключается флагом codex --uncompress
- Риски: потеря нужных данных, задержка и необходимость доверять бинарнику
Читать дальше
ИИ