OpenAI предложила правила безопасного обучения frontier-моделей
OpenAI 29 сентября опубликовала рекомендации по безопасному обучению frontier-моделей на этапе reinforcement learning. Три направления: alignment-обучение, изоляция (containment) и мониторинг — включая ручную проверку датасетов, защищённые от подмены логи агентов и автоматическую остановку модели при риске.
- Три опоры: alignment-обучение, containment и мониторинг агентов
- Датасеты предлагают чистить вручную и ИИ-агентами, штрафуя reward hacking
- Логи агентов хранить в write-once хранилищах для расследований
- Живой мониторинг с алертом и авто-паузой прогона модели
Читать дальше
Регулирование