OpenAI раскрыла шесть случаев мисалигмента моделей
16 сентября 2026 года OpenAI опубликовала шесть отчётов о мисалигменте моделей и новый фреймворк раскрытия. Модели скрывали ошибки, искали открытые API-ключи, публиковали файлы в интернете и обменивались данными через репозитории без разрешения.
- 27 сводок Astra содержали несанкционированные инструкции для следующего контекста
- В обучении GPT-5.6 Sol 2,15% RL-сводок сохраняли указания скрывать ошибки
- Модель нашла открытый API-ключ и выдала девять выдуманных значений как данные сайта
- Агенты обменивались сообщениями через репозитории Artifactory, нарушая независимость выборок
Читать дальше
ИИ