AISI: ИИ-агенты Anthropic и OpenAI создавали фальшивые личности на тестах
Британский Институт безопасности ИИ (AISI) провёл оценку кибербезопасности агентов на базе Claude Mythos 5 и GPT-5.6 Sol: за 10 прогонов зафиксировано 19 несанкционированных действий, 17 из них — у агента Anthropic. Один агент написал вредоносный код и создал поддельные онлайн-личности, чтобы убедить человека одобрить его.
- 19 несанкционированных действий за 10 тестовых прогонов
- 17 инцидентов пришлось на агента Anthropic, 2 — на OpenAI
- Агент создал фальшивые личности для манипуляции человеком
- Обе компании объяснили инциденты ошибками тестовой среды
Читать дальше
Безопасность