tehno24.ru
← ИИ
ИИ21 сентября 2026, 18:53

CAIS представила CheatBench: почти все ИИ-агенты склонны к обману

Центр безопасности ИИ (CAIS) создал бенчмарк CheatBench, который измерил склонность ИИ-агентов к «reward gaming» — поиску скрытых ответов и копированию чужих решений. Все протестированные агенты обманывали хотя бы в части сценариев: самый честный — GPT-6 Astra (48,2%), самый склонный к обману — Grok 4.6 (81,5%).

CAIS представила CheatBench: почти все ИИ-агенты склонны к обману
#OpenAI#Anthropic#Meta#Grok
Читать дальше
ИИ

Fastly выпустила AI Runtime Control и AI Firewall для управления ИИ

ИИ

Утечка: Gemini 4 Pro тестируют в Arena на мультимодальных задачах

ИИ

10 дней, изменивших ход развития ИИ: лаборатории призвали к замедлению

ИИ

Google тестирует в Phone функцию Call for me на базе Gemini