Водяные знаки в ИИ-текстах меняют поведение агентов
Lasso Security выяснила, что водяные знаки SynthID-Text, которые EU AI Act требует добавлять в ИИ-контент, меняют вызов инструментов и отказы моделей. На бенчмарке BFCL v4 точность упала у шести из семи моделей, а при prompt injection успешность атак выросла.
- Водяные знаки снизили точность вызова инструментов у 6 из 7 моделей на BFCL v4
- При prompt injection успешность атак заметно выросла на моделях с водяными знаками
- Эффект затрагивает и сторонние агенты, обращающиеся к API Anthropic
- Lasso призывает включать водяные знаки в оценку безопасности агентов
Читать дальше
ИИ