KaliBench: бенчмарк показал, что ИИ-агенты не умеют строить команды для инструментов Kali Linux
Представлен KaliBench — бенчмарк из 8504 пар «запрос-команда» по 1642 инструментам Kali Linux, охватывающий 23 направления и 5 фаз безопасности. Ни одна открытая модель не превысила 42% точности команд без подсказок; проверка идёт без запуска опасных утилит.
- 8504 пар «запрос-команда» по 1642 инструментам Kali Linux
- Лучший результат открытых моделей — 42% точных команд без подсказок
- С подсказкой инструмента точность растёт до 68%, с примерами — до 71%
- Проверка без запуска: канонизация, LLM-валидация, песочница, ручная проверка
Читать дальше
ИИ