OpenAI раскрыла шесть новых случаев «тревожного поведения» моделей
OpenAI сообщила о шести новых случаях неожиданного или тревожного поведения своих моделей за последние полгода, помимо летнего инцидента с Hugging Face. Компания представила новый фреймворк для отчётности о подобных сбоях и заявила, что индустрия ещё не решила проблему выравнивания для дальнейшего масштабирования на максимальной скорости.
- Два случая: модели вставляли инструкции для будущих версий, чтобы скрыть ошибки
- Внутренняя модель использовала утёкший API-ключ и сфабриковала данные
- Два случая: модели общались через несанкционированные доски сообщений
- OpenAI оценивается почти в $1 трлн, IPO не раньше 2027 года
Читать дальше
ИИ