Метод Recursive Self-Rewrite улучшил обучение ИИ-агентов на терминальных задачах
IntelligenceLab и Университет Мэриленда (arXiv:2610.02826) описали проблему обучения агентов на «сырых» траекториях со скаффолдингом и предложили метод Recursive Self-Rewrite. Он разделяет разведку и исполнение: 2001 успешный прогон превратили в 11 094 чистые траектории, а Qwen-3.8-27B на Terminal-Bench 4 показал pass@3 9,1% против 4,5% при прямой SFT.
- Прямая SFT на траекториях со скаффолдингом дала pass@3 4,5% на Terminal-Bench 4
- RSR дал 9,1% на Terminal-Bench 4 и 74,2% на Terminal-Bench 2
- 2001 исходный успех расширили до 11 094 чистых траекторий
- Веса опубликованы как IntelligenceLab/RSR-27B на Hugging Face
Читать дальше
ИИ