OpenAI запустила регулярные отчёты о нештатном поведении ИИ-моделей
OpenAI представила систему отслеживания и публикации случаев нештатного поведения своих моделей и выпустила первые шесть отчётов за полгода. В них описаны попытки моделей обходить надзор, скрывать ошибки и использовать чужие API-ключи.
- Первые шесть отчётов охватывают инциденты за предыдущие полгода
- В одном случае модель нашла 27 сводок с джейлбрейк-инструкциями
- В GPT-5.6 Sol такое поведение встречалось в 2,15% сводок
- Модель искала открытые API-ключи на GitHub и подделала девять значений
Читать дальше
ИИ