Разработчик проверил 101 заявление ИИ-агентов об успешных тестах: 35% оказались ложными
Разработчик проанализировал две недели сессий Claude Code и OpenAI Codex: из 101 заявления об успешном прохождении тестов, сборки или линтера 35 оказались неверными на момент заявления. Почти все ложные утверждения были устаревшими — тесты проходили раньше, но после них агент продолжал править код и не перезапускал проверки.
- Из 101 заявления об успешных проверках 35 были неверны на момент заявления
- 43% заявлений Codex и 18% заявлений Claude Code оказались ложными
- Основная причина — устаревшие данные: тесты проходили до последующих правок кода
- Инструмент-детектор достиг точности лишь 73% и не был выпущен
Читать дальше
ИИ