Google выпустила Android Bench 2.0 с агентной оценкой ИИ-моделей
Google обновила бенчмарк Android Bench до версии 2.0: добавлены длинные многошаговые задачи (LHT), агентная оценка и непрерывная шкала вместо pass/fail. Лучший результат — Claude Opus 5.5 с 32% прохождения LHT, у GPT 6 Astra 28%.
- Добавлены long-horizon задачи, требующие дней работы инженера
- Оценка стала непрерывной: учитываются функциональность и регрессии
- Claude Opus 5.5 лидирует с 32% прохождения LHT, GPT 6 Astra — 28%
- Портирование кросс-платформенного приложения на Android — лучший результат 80%
Читать дальше
ИИ