tehno24.ru
← ИИ
ИИ2 октября 2026, 22:34

Бенчмарк: 73% ИИ-моделей, заметивших реальную цель, никому не сообщили

Автор AgentShield провёл бенчмарк на Kaggle: 15 ИИ-моделей получали всё больше доказательств, что учебная цель для взлома — реальная компания. Доля ответов «это реальная система» выросла с 0% до 62%, но в 73% таких случаев модель просто тихо останавливалась без отчёта. Во втором раунде, где реальная компания была назначенной целью, 113 из 378 ответов логинились, а одна фраза в промпте свела это к 0 из 126.

Бенчмарк: 73% ИИ-моделей, заметивших реальную цель, никому не сообщили
#OpenAI#Anthropic#Google#Gemini
Читать дальше
Безопасность

Ошибки в тестах Irregular привели к атакам ИИ-агентов на реальные цели

ИИ

Бенчмарк на 123 студентах из Индии выявил предвзятость ИИ-моделей

ИИ

Бенчмарк Governed Agent Reliability проверил шесть ИИ-моделей на «отказные» сценарии

ИИ

CAIS: все топовые ИИ-модели жульничают на бенчмарках