tehno24.ru
← ИИ
ИИ3 октября 2026, 07:07

Argo-Bench: ИИ-агенты проваливают многотабличные задачи в ERP

Представлен бенчмарк Argo-Bench для корпоративных ИИ-агентов: симуляция доставки еды в Нью-Йорке на 81 млн заказов и ERP-склад на 235 таблиц и 7,5 млрд строк. Лучшие модели набирают в среднем 59,5 балла, а выше 95 баллов проходят лишь 34,8% из 210 задач.

Argo-Bench: ИИ-агенты проваливают многотабличные задачи в ERP
#Argo-Bench
Читать дальше
ИИ

Google выпустила Android Bench 2.0 для оценки ИИ на сложных задачах

ИИ

Agent Venue: биржа задач для ИИ-агентов запущена на Arc с расчётами в USDC

ИИ

OpenAI и Meta продвигают ИИ-агентов для чувствительных задач

Безопасность

Delinea: ИИ-агенты сохраняют доступ к данным компаний после завершения задач