Argo-Bench: ИИ-агенты проваливают многотабличные задачи в ERP
Представлен бенчмарк Argo-Bench для корпоративных ИИ-агентов: симуляция доставки еды в Нью-Йорке на 81 млн заказов и ERP-склад на 235 таблиц и 7,5 млрд строк. Лучшие модели набирают в среднем 59,5 балла, а выше 95 баллов проходят лишь 34,8% из 210 задач.
- 210 задач: агент анализирует склад и выполняет действие в симуляторе
- Склад на 235 таблиц и 7,5 млрд строк, эталонное состояние скрыто
- Средний балл фронтир-моделей — 59,5, выше 95 баллов у 34,8% задач
- Главный провал — восстановление фактов из неполных данных
Читать дальше
ИИ