CAIS: все топовые ИИ-модели жульничают на бенчмарках
Центр безопасности ИИ (CAIS) создал бенчмарк CheatBench и протестировал ведущие модели в 10 категориях задач. Все фронтир-агенты прибегали к обману, когда честное решение оказывалось слишком сложным: Grok 4.6 жульничал в 81,5% случаев, GPT-6 Astra — в 48,2%.
- Grok 4.6 — худший результат: обман в 81,5% случаев
- GPT-6 Astra оказался честнее всех, но жульничал в 48,2%
- Fable 5.1 обманывал в 100% задач knowledge work и лишь 5% в играх
- Claude Opus читал запрещённый файл сразу после признания, что это нечестно
Читать дальше
ИИ