HeadlinesBriefing favicon HeadlinesBriefing.com

Android Bench 2.0 de Google: resultados de IA

Android Central •
×

Google ha lanzado Android Bench 2.0 para probar modelos de IA en tareas complejas de desarrollo Android que pueden llevar días. El nuevo benchmark incluye tareas como actualizar dependencias, añadir funciones importantes y crear aplicaciones Android desde cero.

GPT-6 Astra actualmente lidera el nuevo benchmark de Google con una tasa de aprobación del 28%, mientras que Gemini 3.8 Flash obtuvo solo un 8%.

Google ha anunciado Android Bench 2.0, una versión actualizada de su benchmark para evaluar qué tan bien los modelos de lenguaje grandes (LLM) y los agentes de IA manejan tareas complejas de desarrollo Android. A principios de este año, Google presentó la primera versión de Android Bench para medir cómo se desempeñan los modelos de IA en trabajo real de desarrollo Android. La compañía ahora ha actualizado el benchmark con Android Bench 2.0, que está diseñado para evaluar modelos y agentes frente a tareas más complejas que reflejan mejor el desarrollo de software real.

Una de las mayores incorporaciones es lo que Google llama tareas de largo horizonte (LHT). Estos son trabajos de desarrollo significativamente más complejos que a un ingeniero humano podrían llevarle varios días o incluso una semana completar. Google dice que la primera versión de Android Bench, junto con muchos otros benchmarks tempranos de codificación con IA, se centraba principalmente en cambios más pequeños e incrementales. Android Bench 2.0 está diseñado para elevar ese listón con tareas como actualizar dependencias, añadir nuevas funciones importantes e incluso crear aplicaciones Android desde cero.

Con Android Bench 2.0, Google ha cambiado cómo se califica a los modelos. En lugar de depender enteramente de un sistema binario de aprobado o reprobado, Android Bench 2.0 utiliza una "puntuación continua". La compañía dice que esto proporciona una "indicación más significativa" de qué tan bien se desempeñó un modelo, incluso cuando no pudo completar totalmente una tarea.

Google ya ha probado varios de los últimos modelos de IA con el nuevo benchmark, incluidos Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol y Claude Opus 5, entre otros. Según los resultados, GPT-6 Astra actualmente se sitúa en la cima del benchmark con una tasa de aprobación del 28%. Gemini 3.8 Flash, mientras tanto, obtuvo solo un 8%.

Google dice que probar modelos con el conjunto de datos LHT debería darle una mejor comprensión de sus fortalezas y debilidades, al tiempo que proporciona a los desarrolladores una guía más práctica sobre qué modelos son más adecuados para diferentes tareas de desarrollo Android. La tabla de clasificación actualizada de Android Bench 2.0 ya está disponible, y Google dice que planea seguir ampliándola con más modelos y resultados con el tiempo.

Entidades clave: Empresas: Google, Android Central | Personas: Nicholas Sutrich, Sanuj