VA-Bench: лучшие мультимодальные модели выполняют лишь половину задач робота
Команда Даляньского технологического университета выпустила VA-Bench — бенчмарк для проверки, могут ли мультимодальные LLM превращать увиденное в действия роборуки. Лучший результат показала Qwen3.8-max от Alibaba — 53,93% выполненных задач из 280 сцен и 14 типов манипуляций.
- Qwen3.8-max выполнила 53,93% задач, Opus-5 — 52,86%, GPT-5.6-sol — 51,55%
- Модели находят цели в 100% случаев, но полная задача удаётся лишь в половине
- Однорукие задачи — 65,61% успеха, двурукие — только 11,11%
- Свободный выбор ракурса дал 57,50% против 27,86% при пяти фиксированных камерах
Читать дальше
ИИ