HeadlinesBriefing favicon HeadlinesBriefing.com

Android Bench 2.0 от Google: результаты ИИ

Android Central •
×

Google запустила Android Bench 2.0 для тестирования ИИ-моделей на сложных задачах разработки Android, которые могут занимать дни. Новый бенчмарк включает такие задачи, как обновление зависимостей, добавление крупных функций и создание приложений Android с нуля.

GPT-6 Astra в настоящее время лидирует в новом бенчмарке Google с показателем прохождения 28%, тогда как Gemini 3.8 Flash набрал всего 8%.

Google объявила о Android Bench 2.0 — обновлённой версии своего бенчмарка для оценки того, насколько хорошо большие языковые модели (LLM) и ИИ-агенты справляются со сложными задачами разработки Android. Ранее в этом году Google представила первую версию Android Bench, чтобы измерять, как ИИ-модели справляются с реальной работой по разработке Android. Теперь компания обновила бенчмарк до Android Bench 2.0, который предназначен для оценки моделей и агентов на более сложных задачах, лучше отражающих реальную разработку программного обеспечения.

Одним из самых крупных дополнений стали так называемые Google задачи с длинным горизонтом (LHT). Это значительно более сложные задачи разработки, на выполнение которых у инженера-человека могут уйти дни или даже неделя. Google говорит, что первая версия Android Bench, как и многие другие ранние бенчмарки по ИИ-программированию, была сосредоточена в основном на небольших инкрементальных изменениях. Android Bench 2.0 призван поднять эту планку с помощью таких задач, как обновление зависимостей, добавление крупных новых функций и даже создание приложений Android с нуля.

С Android Bench 2.0 Google изменила способ оценки моделей. Вместо того чтобы полностью полагаться на бинарную систему «прошёл или не прошёл», Android Bench 2.0 использует «непрерывную оценку». Компания утверждает, что это даёт более «значимое представление» о том, насколько хорошо модель справилась, даже если она не смогла полностью выполнить задачу.

Google уже протестировала несколько новейших ИИ-моделей с помощью нового бенчмарка, включая Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol и Claude Opus 5, среди прочих. Согласно результатам, GPT-6 Astra в настоящее время занимает первое место в бенчмарке с показателем прохождения 28%. Gemini 3.8 Flash, тем временем, набрал всего 8%.

Google утверждает, что тестирование моделей на наборе данных LHT должно дать ей лучшее понимание их сильных и слабых сторон, а также предоставить разработчикам более практичные рекомендации о том, какие модели лучше подходят для различных задач разработки Android. Обновлённая таблица лидеров Android Bench 2.0 уже доступна, и Google заявляет, что планирует продолжать расширять её новыми моделями и результатами со временем.

Ключевые сущности: Компании: Google, Android Central | Люди: Nicholas Sutrich, Sanuj