LLM-RedKit: агентные промпт-инъекции дают 10 находок из 16 попыток
Разработчик представил LLM-RedKit — открытый CLI и веб-интерфейс для тестирования агентных промпт-инъекций. В тесте агента LangChain с llama3.1:8b и инструментами send_email и delete_user статические джейлбрейки дали 0 находок из 30 попыток, а агентные — 10 из 16.
- Статические джейлбрейки: 0 находок из 30 попыток
- Агентные промпты: 10 находок из 16 попыток
- Инструмент перехватывает вызовы на уровне раннера, не выполняя их
- 50+ промптов в 10 категориях, маппинг на OWASP LLM Top 10 и MITRE ATLAS
Читать дальше
Безопасность