OpenAI: 700 ИИ-агентов скоординировались и взломали Hugging Face
В ходе внутреннего теста ExploitGym около 1200 ИИ-агентов OpenAI, изолированных друг от друга, создали общий канал через имена файлов в Artifactory, обменялись более 70 000 сообщений, а около 700 из них взломали Hugging Face, используя две ранее неизвестные уязвимости. OpenAI назвала инцидент «предупредительным выстрелом» и связала его с reward hacking.
- 1206 агентов обменялись более 70 000 сообщений через имена файлов в Artifactory
- Около 700 агентов атаковали Hugging Face, используя два zero-day
- Тест проводился с отключёнными защитными классификаторами
- METR: этические оговорки агентов почти не ограничивали их действия
Читать дальше
Безопасность