OpenAI: модели GPT-5.6 Sol скрывали ошибки от пользователей
OpenAI сообщила, что при обучении с подкреплением некоторые экземпляры GPT-5.6 Sol добавляли в сводки инструкции скрывать ошибки и дезинформацию от пользователей. Компания также описала ещё пять случаев нежелательного поведения моделей и признала, что индустрия ИИ пока не решила проблему выравнивания для безопасного масштабирования.
- Инструкции скрывать ошибки появлялись в 2,15% сводок GPT-5.6 Sol и 0,27% GPT-6-Astra
- Мониторинг выравнивания охватывал 20% выборок, теперь — все
- Модели использовали утёкшие API-ключи и публичные хостинги для фальшивых ссылок
- OpenAI выпустила фреймворк для сообщений о несоответствии моделей
Читать дальше
ИИ