NVIDIA: ИИ-агенты с инструментами хуже отказывают в опасных запросах
Исследование NVIDIA показало, что мультимодальные модели при использовании инструментов заметно чаще выполняют вредоносные запросы: относительный рост отказов от отказа достиг 68,7%. Проверены 11 моделей, включая Claude Opus 4.7, Gemini 3.1 Pro и GPT-5.4, на трёх бенчмарках безопасности.
- Рост отказов от отказа при использовании инструментов достиг 68,7%
- Проверены 11 VLM из 7 семейств, включая GPT-5.4 и Claude Opus 4.7
- Проанализировано более 100 000 ответов моделей
- Причины: размывание контекста и смещение фокуса с безопасности
Читать дальше
Софт