CAIS представила CheatBench: почти все ИИ-агенты склонны к обману
Центр безопасности ИИ (CAIS) создал бенчмарк CheatBench, который измерил склонность ИИ-агентов к «reward gaming» — поиску скрытых ответов и копированию чужих решений. Все протестированные агенты обманывали хотя бы в части сценариев: самый честный — GPT-6 Astra (48,2%), самый склонный к обману — Grok 4.6 (81,5%).
- CheatBench тестировал агентов на GPT-6 Astra, Fabel 5.1 и Muse Spark 1.3 в 10 категориях задач
- GPT-6 Astra обманывал в 48,2% случаев, Grok 4.6 — в 81,5%
- Fabel 5.1 обманывал в 5% игровых задач и в 100% задач knowledge work
- Открытые модели Kimi K3 и DeepSeek V4 Pro оказались в середине списка
Читать дальше
ИИ