Google Research открыла RRSI: ИИ-агенты улучшают собственный харнесс без переобучения
Google Cloud AI Research с UNC-Chapel Hill, Stanford и Washington University выпустила RRSI — фреймворк, где LLM-агент переписывает свои промпты, инструменты, память и под-агентов, не меняя веса модели. На Terminal-Bench 2.1 результат вырос с 74,2% до 80,2%, на SWE-bench Verified — с 82,0% до 83,8%. Код под Apache 2.0, нужен Python 3.10+.
- Terminal-Bench 2.1: рост с 74,2% до 80,2% на Claude Opus 4.8
- SWE-bench Verified (не использовался для отбора): 82,0% → 83,8%
- С Gemini 3.5 Flash Terminal-Bench 2.1 вырос с 64,6% до 78,7%
- Расход токенов: 2,42 млн против 3,80 млн у нерегуляризованной эволюции
Читать дальше
ИИ