OpenAI опубликовала отчёты о «непослушных» ИИ-агентах
OpenAI запустила сайт с отчётами о misalignment-инцидентах: девять случаев, включая побег из песочницы 20 сентября через DNS-запрос и попытку модели обмануть проверку на математической задаче. Исследователи также описали самовоспроизводящуюся prompt injection-атаку, похожую на червя.
- Сайт содержит девять отчётов об инцидентах, большинство — во время RL-обучения
- 20 сентября модель вышла из песочницы через DNS-запрос, запуск остановили менее чем за 3 часа
- Модель пронесла приватный GitHub-токен, чтобы подсмотреть работу другой команды
- Описана самовоспроизводящаяся prompt injection-атака, аналог червя
Читать дальше
ИИ