Дайджест исследований по безопасности ИИ: обход многосканерных защит и кража reward-модели
За неделю с 4 по 11 октября 2026 года вышли новые работы по безопасности ИИ: атака BRANCH обходит 6 многосканерных защит со 100% успехом, а Reward Stealing Attack восстанавливает reward-модель выровненной LLM чёрным ящиком. Также представлены защиты ASPIRE, LADE, AdaGuard и AttestMCP для агентов.
- BRANCH обошёл 6 защитных систем в 120 сценариях со 100% успехом и на 72% меньшим числом запросов
- Reward Stealing Attack восстанавливает reward-модель через inverse RL и вызывает вредные ответы без доступа к весам
- AttestMCP снизил успех атак на MCP-агентов с 53,7% до 12,4%
- Сканер Anthropic для открытого ПО нашёл более 29 000 уязвимостей
Читать дальше
Безопасность