HeadlinesBriefing favicon HeadlinesBriefing.com

Android Bench 2.0 de Google : résultats IA

Android Central •
×

Google a lancé Android Bench 2.0 pour tester les modèles d'IA sur des tâches complexes de développement Android qui peuvent prendre des jours. Le nouveau benchmark comprend des tâches comme la mise à niveau des dépendances, l'ajout de fonctionnalités majeures et la création d'applications Android à partir de zéro.

GPT-6 Astra est actuellement en tête du nouveau benchmark de Google avec un taux de réussite de 28 %, tandis que Gemini 3.8 Flash n'a obtenu que 8 %.

Google a annoncé Android Bench 2.0, une version mise à jour de son benchmark destiné à évaluer dans quelle mesure les grands modèles de langage (LLM) et les agents d'IA gèrent des tâches complexes de développement Android. Plus tôt cette année, Google a introduit la première version d'Android Bench pour mesurer les performances des modèles d'IA sur des travaux réels de développement Android. L'entreprise a désormais mis à jour le benchmark avec Android Bench 2.0, conçu pour évaluer les modèles et les agents face à des tâches plus complexes qui reflètent mieux le développement logiciel réel.

L'un des ajouts les plus importants est ce que Google appelle les tâches à long horizon (LHT). Il s'agit de travaux de développement nettement plus complexes qu'un ingénieur humain pourrait mettre plusieurs jours, voire une semaine, à accomplir. Google indique que la première version d'Android Bench, ainsi que de nombreux autres premiers benchmarks de codage par IA, se concentraient principalement sur des changements plus petits et incrémentaux. Android Bench 2.0 est conçu pour élever ce niveau avec des tâches telles que la mise à niveau des dépendances, l'ajout de nouvelles fonctionnalités majeures et même la création d'applications Android à partir de zéro.

Avec Android Bench 2.0, Google a changé la façon dont les modèles sont notés. Plutôt que de s'appuyer entièrement sur un système binaire de réussite ou d'échec, Android Bench 2.0 utilise une « notation continue ». L'entreprise affirme que cela fournit une « indication plus significative » de la performance d'un modèle, même lorsqu'il n'a pas pu accomplir entièrement une tâche.

Google a déjà testé plusieurs des derniers modèles d'IA avec le nouveau benchmark, notamment Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol et Claude Opus 5, entre autres. Selon les résultats, GPT-6 Astra occupe actuellement la première place du benchmark avec un taux de réussite de 28 %. Gemini 3.8 Flash, quant à lui, n'a obtenu que 8 %.

Google affirme que tester les modèles sur l'ensemble de données LHT devrait lui permettre de mieux comprendre leurs forces et leurs faiblesses, tout en fournissant aux développeurs des conseils plus pratiques sur les modèles les plus adaptés aux différentes tâches de développement Android. Le classement mis à jour d'Android Bench 2.0 est disponible dès maintenant, et Google indique qu'il prévoit de continuer à l'enrichir avec davantage de modèles et de résultats au fil du temps.

Entités clés : Entreprises : Google, Android Central | Personnes : Nicholas Sutrich, Sanuj

FAQ : Qu'est-ce qu'Android Bench 2.0 ?

Android Bench 2.0 est le benchmark mis à jour de Google pour évaluer dans quelle mesure les modèles d'IA gèrent des tâches complexes de développement Android, y compris des tâches à long horizon qu'un ingénieur humain pourrait mettre des jours à accomplir.

Question FAQ : Qu'est-ce qu'Android Bench 2.0 ?

Réponse FAQ : Android Bench 2.0 est le benchmark mis à jour de Google pour évaluer dans quelle mesure les modèles d'IA gèrent des tâches complexes de développement Android, y compris des tâches à long horizon qu'un ingénieur humain pourrait mettre des jours à accomplir.