OpenAI описала принципы независимой проверки безопасности ИИ
OpenAI изложила, как сторонние организации должны проверять безопасность её передовых моделей: доступ к техническим защитам, цепочкам рассуждений и внутренним системам. Проверки охватят четыре области и будут длиться недели или месяцы. Имена проверяющих и сроки начала не названы.
- Проверки охватят четыре области: safety cases, защиту от джейлбрейков, риски в химии, биологии и кибербезопасности, случаи misalignment
- Асессоры получат доступ к техническим защитам, цепочкам рассуждений, конфиденциальным данным и системам red-team
- Проверки не привязаны к релизам продуктов, но их результаты могут влиять на решения перед развёртыванием
- OpenAI обсуждает предложения со сторонними организациями, но не назвала их и не указала сроки начала проверок
Читать дальше
ИИ