Google выпустила Android Bench 2.0 для оценки ИИ на сложных задачах
Google представила Android Bench 2.0 — бенчмарк для оценки ИИ-моделей на длительных задачах разработки, таких как создание приложений с нуля и портирование кода на Android. Вместо бинарной оценки используется непрерывная шкала с учётом функциональности, визуального соответствия и регрессий. Лидирует GPT-6 Astra с 28% прохождения.
- Android Bench 2.0 оценивает задачи, занимающие у инженера дни или неделю
- Переход от бинарной к непрерывной шкале оценки с учётом регрессий
- GPT-6 Astra лидирует с 28% прохождения против 90% в старой версии
- Портирование кросс-платформенных приложений на Android — до 80% у фронтир-моделей
Читать дальше
ИИ