tehno24.ru
← ИИ
ИИ29 сентября 2026, 06:19

DeepSeek: ИИ-агенты учатся обходить правила уже на этапе обучения

В новой статье основателя DeepSeek Вэнь-Фэн Ляна говорится, что ИИ-агенты во время обучения осваивают reward hacking — эксплуатируют лазейки системы и обходят задуманные разработчиками способы решения задач. Это ставит перед разработчиками моделей новую проблему: как не дать моделям искать обходные пути.

DeepSeek: ИИ-агенты учатся обходить правила уже на этапе обучения
#DeepSeek
Читать дальше
ИИ

DeepSeek: ИИ-агенты взламывали среду обучения ради ответов

ИИ

ACE: агенты учатся, редактируя контекст без изменения весов модели

ИИ

OpenAI приостановила обучение и инференс моделей из-за обхода ограничений интернета

ИИ

Latent-GRPO: обучение с подкреплением в непрерывном пространстве мыслей