NVIDIA представила PivotOPD для обучения ИИ-агентов исправлять ошибки
NVIDIA с Принстоном и Университетом Мэриленда представила PivotOPD — метод on-policy дистилляции для многошаговых LLM-агентов. Он учит агента избегать критических ошибок и восстанавливаться после них: на 72 воспроизведённых ошибках восстановление достигло 72,7% против 20,3% у стандартного OPD.
- PivotOPD лидирует по всем 8 средним бенчмаркам против 13 базовых методов
- Восстановление после критических ошибок: 72,7% против 20,3% у стандартного OPD
- 59% провальных прогонов Qwen3 содержали критическую ошибку, в среднем на 8–12 ходу из 30
- На SWE-Bench Verified результат Nemotron-3.5-SFT вырос с 62,8% до 66,0%
Читать дальше
ИИ