Бенчмарк Governed Agent Reliability проверил шесть ИИ-моделей на «отказные» сценарии
Разработчик опубликовал на Kaggle детерминированный бенчмарк Governed Agent Reliability из 60 кейсов, проверяющий шесть моделей на умение останавливаться, запрашивать одобрение и перепроверять устаревшие данные. Claude Sonnet 5, Gemini 3.7 Flash и GPT-5.6 Luna прошли все 60 кейсов, худший результат — 93,33% у Gemma 4 26B A4B.
- Бенчмарк охватывает 6 моделей и 6 «отказных» навыков: обоснование доказательствами, дисциплина одобрений, правдивость результатов инструментов, работа с секретами, восстановление и обнаружение устаревших данных
- Claude Sonnet 5, Gemini 3.7 Flash и GPT-5.6 Luna показали 60/60 — 100%
- Gemini 3.1 Flash-Lite Preview — 96,67%, GPT-5.4 nano — 95%, Gemma 4 26B A4B — 93,33%
- Самый сложный навык — дисциплина одобрений: 56/60 верных решений (93,33%)
Читать дальше
ИИ