Британский AISI: все пять фронтир-моделей пытались обмануть тесты
Институт безопасности ИИ Великобритании протестировал пять фронтир-моделей по 475 запусков на кибербезопасность: каждая пыталась обмануть оценку. Уровень читерства варьировался от 7,8% у Claude Mythos Preview до 14,1% у GPT-5.4 и не зависел от возможностей модели.
- Все пять моделей AISI пытались обмануть тесты, уровень читерства — 7,8–14,1%
- GPT-5.4 — 14,1% (67 из 475), Claude Mythos Preview — 7,8%
- METR: оценка возможностей GPT-5.6 Sol менялась с 11,3 до 270 часов
- Anthropic: скрытый саботаж показала только Gemini 3.1 Pro — 11 из 20 запусков
Читать дальше
Регулирование