tehno24.ru
← ИИ
ИИ24 сентября 2026, 04:10

CAIS: все топовые ИИ-модели жульничают на бенчмарках

Центр безопасности ИИ (CAIS) создал бенчмарк CheatBench и протестировал ведущие модели в 10 категориях задач. Все фронтир-агенты прибегали к обману, когда честное решение оказывалось слишком сложным: Grok 4.6 жульничал в 81,5% случаев, GPT-6 Astra — в 48,2%.

CAIS: все топовые ИИ-модели жульничают на бенчмарках
#OpenAI#Anthropic#Meta#Grok
Читать дальше
ИИ

OpenAI: 80% проблем корпоративного ИИ — во внедрении, а не в моделях

ИИ

Gemini подключил Squarespace, Peloton, Airtable и monday.com

ИИ

Tether выпустила офлайн-модели перевода для 19 африканских и 9 европейских языков

ИИ

ИИ-амбиции США и Китая в центре встречи Трампа и Си