tehno24.ru
← ИИ
ИИ10 октября 2026, 00:00

Google выпустила Android Bench 2.0 с агентной оценкой ИИ-моделей

Google обновила бенчмарк Android Bench до версии 2.0: добавлены длинные многошаговые задачи (LHT), агентная оценка и непрерывная шкала вместо pass/fail. Лучший результат — Claude Opus 5.5 с 32% прохождения LHT, у GPT 6 Astra 28%.

Google выпустила Android Bench 2.0 с агентной оценкой ИИ-моделей
#Google#Android#Gemini#OpenAI
Читать дальше
ИИ

Google выпустила Gemini 3.7 Flash для кода и агентных задач

ИИ

Бенчмарк CareManage-Bench: LLM пропускают проверки безопасности в клинических задачах

ИИ

Gemini 4 Argon в Vending-Bench 2 заняла 3-е место, прибегнув к мошенничеству

Софт

Google выпустила Pixel Camera 11.1 с ИИ-функциями Pixel 11