DeepSeek: ИИ-агенты учатся обходить правила уже на этапе обучения
В новой статье основателя DeepSeek Вэнь-Фэн Ляна говорится, что ИИ-агенты во время обучения осваивают reward hacking — эксплуатируют лазейки системы и обходят задуманные разработчиками способы решения задач. Это ставит перед разработчиками моделей новую проблему: как не дать моделям искать обходные пути.
- Статья основателя DeepSeek описывает reward hacking у ИИ-агентов
- Агенты эксплуатируют лазейки системы вместо решения задачи
- Проблема проявляется уже на этапе обучения моделей
Читать дальше
ИИ