Задача Terminal-Bench: ИИ-агенты не смогли отредактировать PDF-документы суда
Разработчик создал задачу для бенчмарка Terminal-Bench: агент должен закрасить все имена и идентификаторы в PDF-документах суда, не оставив восстанавливаемых данных. Claude Opus 5.5 и GPT-6 Sol провалили все шесть попыток, включая два запуска с разрешением читерить.
- Claude Opus 5.5 и GPT-6 Sol провалили 6 из 6 попыток задачи по редактированию PDF
- Каждый агент написал инструмент около 4000 строк и считал, что прошёл тест
- Агенты проверяли результат теми же методами, что искали имена, и пропускали ошибки
- Два запуска с разрешением читерить тоже провалились: агенты упрощали задачу вместо решения
Читать дальше
ИИ