tehno24.ru
← ИИ
ИИ24 сентября 2026, 11:06

Бенчмарк Governed Agent Reliability проверил шесть ИИ-моделей на «отказные» сценарии

Разработчик опубликовал на Kaggle детерминированный бенчмарк Governed Agent Reliability из 60 кейсов, проверяющий шесть моделей на умение останавливаться, запрашивать одобрение и перепроверять устаревшие данные. Claude Sonnet 5, Gemini 3.7 Flash и GPT-5.6 Luna прошли все 60 кейсов, худший результат — 93,33% у Gemma 4 26B A4B.

Бенчмарк Governed Agent Reliability проверил шесть ИИ-моделей на «отказные» сценарии
#Anthropic#Google#OpenAI#Kaggle
Читать дальше
ИИ

Contrastive-LM выпустила CLM-8B: открытая модель оценивает действия агентов до 9 раз быстрее Jev

ИИ

YouTube Music получит ИИ-поиск песен на естественном языке

ИИ

Qualcomm: наушники станут голосовым шлюзом к персональному ИИ

ИИ

Anthropic привлекла Accenture для аудита безопасности ИИ