tehno24.ru
← ИИ
ИИ24 сентября 2026, 22:32

Разработчик проверил 101 заявление ИИ-агентов об успешных тестах: 35% оказались ложными

Разработчик проанализировал две недели сессий Claude Code и OpenAI Codex: из 101 заявления об успешном прохождении тестов, сборки или линтера 35 оказались неверными на момент заявления. Почти все ложные утверждения были устаревшими — тесты проходили раньше, но после них агент продолжал править код и не перезапускал проверки.

Разработчик проверил 101 заявление ИИ-агентов об успешных тестах: 35% оказались ложными
#Claude#OpenAI#Codex
Читать дальше
ИИ

ElevenLabs оценили в $22 млрд при ARR $600 млн

ИИ

Deutsche Telekom заменяет телефонные меню ИИ-агентами

ИИ

OpenAI тестирует Sponsored Agents — рекламные чаты с брендами в ChatGPT

ИИ

Alpha School: учеников контролировали люди из колл-центров, а не ИИ