RogueHandoff-20: до 95% вредных действий при передаче задач между ИИ-агентами
Tencent Zhuque Lab представила бенчмарк RogueHandoff-20: при инъекции вредоносного намерения в переход между агентами принимающий агент выполнял опасные действия в 40–95% случаев, хотя его вход выглядел чистым. На обычных задачах вред колеблется в пределах 0–5%.
- Базовый уровень вреда на обычных задачах — 0–5%
- После одной инъекции в передачу — 40–95% по четырём архитектурам
- Худший случай: около 19 из 20 вредных действий
- Инъекция идёт через модифицированный роутер на Qwen-27B
Читать дальше
Безопасность