HeadlinesBriefing favicon HeadlinesBriefing.com

Android Bench 2.0 do Google: resultados de IA

Android Central •
×

O Google lançou o Android Bench 2.0 para testar modelos de IA em tarefas complexas de desenvolvimento Android que podem levar dias. O novo benchmark inclui tarefas como atualizar dependências, adicionar recursos importantes e criar aplicativos Android do zero.

O GPT-6 Astra atualmente lidera o novo benchmark do Google com uma taxa de aprovação de 28%, enquanto o Gemini 3.8 Flash obteve apenas 8%.

O Google anunciou o Android Bench 2.0, uma versão atualizada de seu benchmark para avaliar quão bem os grandes modelos de linguagem (LLMs) e agentes de IA lidam com tarefas complexas de desenvolvimento Android. No início deste ano, o Google introduziu a primeira versão do Android Bench para medir o desempenho dos modelos de IA em trabalho real de desenvolvimento Android. A empresa agora atualizou o benchmark com o Android Bench 2.0, projetado para avaliar modelos e agentes em tarefas mais complexas que refletem melhor o desenvolvimento de software real.

Uma das maiores adições é o que o Google chama de tarefas de longo horizonte (LHTs). São trabalhos de desenvolvimento significativamente mais complexos que um engenheiro humano poderia levar vários dias ou até uma semana para concluir. O Google afirma que a primeira versão do Android Bench, junto com muitos outros benchmarks iniciais de codificação com IA, concentrava-se principalmente em mudanças menores e incrementais. O Android Bench 2.0 foi projetado para elevar esse padrão com tarefas como atualizar dependências, adicionar novos recursos importantes e até criar aplicativos Android do zero.

Com o Android Bench 2.0, o Google mudou a forma como os modelos são avaliados. Em vez de depender inteiramente de um sistema binário de aprovação ou reprovação, o Android Bench 2.0 usa "pontuação contínua". A empresa afirma que isso fornece uma "indicação mais significativa" de quão bem um modelo se saiu, mesmo quando não conseguiu concluir totalmente uma tarefa.

O Google já testou vários dos modelos de IA mais recentes usando o novo benchmark, incluindo Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol e Claude Opus 5, entre outros. De acordo com os resultados, o GPT-6 Astra atualmente está no topo do benchmark com uma taxa de aprovação de 28%. O Gemini 3.8 Flash, por sua vez, obteve apenas 8%.

O Google afirma que testar modelos com o conjunto de dados LHT deve lhe dar uma melhor compreensão de seus pontos fortes e fracos, ao mesmo tempo que fornece aos desenvolvedores orientações mais práticas sobre quais modelos são mais adequados para diferentes tarefas de desenvolvimento Android. O ranking atualizado do Android Bench 2.0 já está disponível, e o Google afirma que planeja continuar expandindo-o com mais modelos e resultados ao longo do tempo.

Entidades principais: Empresas: Google, Android Central | Pessoas: Nicholas Sutrich, Sanuj