Microsoft и Hugging Face представили бенчмарк ThinkingBox для проверки ИИ-агентов
Microsoft и Hugging Face выпустили фреймворк ThinkingBox, оценивающий ИИ-агентов по фактическому состоянию базы данных, а не по финальному ответу. Бенчмарк ThinkingBox-Bench охватывает 507 бизнес-сценариев и 18 моделей: Claude Opus 5.5 лидирует с pass@1 67,16%, Kimi-K3 — лучшая открытая модель с 57,37%.
- ThinkingBox-Bench: 507 сценариев в 5 доменах, 20 попыток на модель, 18 LLM
- 79 853 из 121 680 попыток провалили проверки, хотя 67,24% завершились без ошибок
- 77,61% провалов — неверные значения полей, 43,30% — лишние эффекты
- Claude Opus 5.5: pass@1 67,16%, но 20/20 только в 241 из 507 задач
Читать дальше
Безопасность