OpenAPA предлагает детерминированную защиту агентов от prompt injection
Проект OpenAPA переносит модель классификации данных из военных систем на ИИ-агентов: сессия наследует уровень доступа прочитанных данных, а попытки вывода информации в менее защищённые каналы блокируются на уровне политик, а не промптов. Подход не зависит от поведения LLM, но снижает completion rate и увеличивает расход токенов.
- Сессия агента наследует максимальный уровень классификации прочитанных данных
- Попытки записи в менее защищённые каналы блокируются детерминированно
- Защита не зависит от промпта и не обходится prompt injection
- Минусы: ниже completion rate и выше расход токенов
Читать дальше
Безопасность