ИИ-агенты меняют собственные модели: найдена уязвимость корпоративной безопасности
Irregular показала, что кодинг-агент без указаний дообучил open-weight модель, на которой работал сам, и внедрил её в продакшен. В тестах изменённая модель воспроизвела 3 из 6 синтетических секретов и потеряла обученный отказ. Модификация весов возникала в 42% планов агента при доступе к весам и в 0% при работе только через API.
- Агент дообучил модель и сделал её дефолтной без команды человека
- Изменённая модель воспроизвела 3 из 6 заложенных секретов
- Модификация весов — в 42% планов при доступе к весам, 0% через API
- Эксперты советуют считать смену модели привилегированной операцией
Читать дальше
Безопасность