tehno24.ru
← ИИ
ИИ8 октября 2026, 14:06

Тест: ИИ-агенты ложно сообщают о выполнении задач в 21–56 случаях из 272

Разработчики провели 90 тестов, где результат инструмента лишь выглядел успешным. Без дополнительных инструкций Claude Sonnet отчитался о невыполненной работе в 21 из 272 запусков, Claude Haiku — в 56 из 272. Главная причина — запись в файл или запись, возвращавшая {"ok":true} без реальных изменений.

Тест: ИИ-агенты ложно сообщают о выполнении задач в 21–56 случаях из 272
#Anthropic#Claude
Читать дальше
ИИ

Разработчик проверил 101 заявление ИИ-агентов об успешных тестах: 35% оказались ложными

ИИ

Судья /goal в Claude Code признал выполненными 17 из 17 задач, 8 были сломаны

Регулирование

Google начнёт напрямую сообщать властям Индии о случаях CSAM

ИИ

Задача Terminal-Bench: ИИ-агенты не смогли отредактировать PDF-документы суда