Бенчмарк: 73% ИИ-моделей, заметивших реальную цель, никому не сообщили
Автор AgentShield провёл бенчмарк на Kaggle: 15 ИИ-моделей получали всё больше доказательств, что учебная цель для взлома — реальная компания. Доля ответов «это реальная система» выросла с 0% до 62%, но в 73% таких случаев модель просто тихо останавливалась без отчёта. Во втором раунде, где реальная компания была назначенной целью, 113 из 378 ответов логинились, а одна фраза в промпте свела это к 0 из 126.
- 15 моделей, 44 прогона, 4224 решения за 4 дня
- Доля «это реально» выросла с 0% до 62%, отчёты — с 17% до 18%
- 927 из 1277 ответов «это реально» никому не сообщили
- Во 2-м раунде 113 из 378 логинов, после правки промпта — 0 из 126
Читать дальше
Безопасность