Safe Labs: отказ ИИ-агента не гарантирует безопасность его действий
Safe Labs AI представила бенчмарк safelabs-trace: 9900 запусков агентов на 300 состязательных задачах, шести моделях и трёх фреймворках. Опасные вызовы инструментов встречались в 7,6% дешёвых и 3,0% фронтирных прогонов, а текстовый скорер воздерживался от оценки в 43,2% и 31,1% случаев.
- 9900 запусков: 300 задач, 6 моделей, 3 фреймворка, 12 инструментов
- Рискованные действия: 7,6% у дешёвых моделей и 3,0% у фронтирных
- Учёт вызовов инструментов поднял выявление с 3,5% до 4,7% и с 2,7% до 3,7%
- Текстовый скорер воздержался в 43,2% и 31,1% прогонов
Читать дальше
ИИ