tehno24.ru
← ИИ
ИИ5 октября 2026, 14:14

VA-Bench: лучшие мультимодальные модели выполняют лишь половину задач робота

Команда Даляньского технологического университета выпустила VA-Bench — бенчмарк для проверки, могут ли мультимодальные LLM превращать увиденное в действия роборуки. Лучший результат показала Qwen3.8-max от Alibaba — 53,93% выполненных задач из 280 сцен и 14 типов манипуляций.

VA-Bench: лучшие мультимодальные модели выполняют лишь половину задач робота
#Alibaba#Qwen#OpenAI#Anthropic
Читать дальше
ИИ

Утечка: Gemini 4 Pro тестируют в Arena на мультимодальных задачах

ИИ

Бенчмарк: лучшие LLM знают лишь 24% фактов после даты обучения

Безопасность

Утечка email-адреса GitLab позволяет выполнять код и CI-задачи от вашего имени

ИИ

Эксперты: обещания ИИ-лабораторий о надзоре не выполняются