ИИ-агенты понимают бесполезность инструмента, но продолжают его вызывать
Обзор семи свежих работ arXiv (октябрь 2026) о разрыве между суждением и поведением ИИ-агентов: 7 агентов в 97–100% случаев верно помечают неработающий источник как бесполезный, но всё равно продолжают его запрашивать. Остановку меняет только принудительный шаг интеграции в harness после 5 подряд «бесполезных» вызовов.
- 7 агентов в 97–100% случаев верно определяют неработающий источник как бесполезный
- Промпты с правилами остановки соблюдаются лишь частично и не привязывают остановку к доказательствам
- Принудительная интеграция после 5 бесполезных вызовов повышает успех на нерабочем источнике
- HERA повысила точность отказа с 61,7% до 83,3%, а harness переносится на 19 других LLM
Читать дальше
ИИ