HeadlinesBriefing favicon HeadlinesBriefing.com

Google Android Bench 2.0:AIコーディング結果

Android Central •
×

Googleは、数日かかることもある複雑なAndroid開発タスクでAIモデルをテストするため、Android Bench 2.0を開始しました。新しいベンチマークには、依存関係のアップグレード、主要機能の追加、Androidアプリをゼロから構築するなどのタスクが含まれます。

GPT-6 Astraは現在、Googleの新しいベンチマークで28%の合格率で首位に立っており、Gemini 3.8 Flashはわずか8%でした。

Googleは、大規模言語モデル(LLM)やAIエージェントが複雑なAndroid開発タスクをどれだけうまく処理できるかを評価するためのベンチマークの更新版であるAndroid Bench 2.0を発表しました。今年初め、GoogleはAIモデルが実世界のAndroid開発作業でどのように性能を発揮するかを測定するため、Android Benchの最初のバージョンを導入しました。同社は今回、ベンチマークをAndroid Bench 2.0に更新しました。これは、実際のソフトウェア開発をよりよく反映する、より複雑なタスクに対してモデルやエージェントを評価するように設計されています。

最大の追加点の一つは、Googleがロングホライズンタスク(LHT)と呼ぶものです。これらは、人間のエンジニアが完了するのに数日、あるいは1週間かかる可能性がある、著しく複雑な開発作業です。Googleによると、Android Benchの最初のバージョンや、他の多くの初期のAIコーディングベンチマークは、主に小規模で漸進的な変更に焦点を当てていました。Android Bench 2.0は、依存関係のアップグレード、主要な新機能の追加、さらにはAndroidアプリをゼロから構築するといったタスクで、その基準を引き上げるように設計されています。

Android Bench 2.0では、Googleはモデルの採点方法を変更しました。完全に合否の二値システムに頼るのではなく、Android Bench 2.0は「連続スコアリング」を使用します。同社によると、これにより、モデルがタスクを完全に完了できなかった場合でも、どれだけうまく性能を発揮したかについて、より「意味のある指標」が得られます。

Googleはすでに、新しいベンチマークを使用して、Gemini 3.8 Flash、GPT-6 Astra、Claude Fable 5.1、GPT-5.6 Sol、Claude Opus 5など、最新のAIモデルをいくつかテストしています。結果によると、GPT-6 Astraは現在28%の合格率でベンチマークの首位にあります。一方、Gemini 3.8 Flashはわずか8%でした。

Googleによると、LHTデータセットに対してモデルをテストすることで、モデルの強みと弱みをよりよく理解できるようになり、また、さまざまなAndroid開発タスクにどのモデルがより適しているかについて、開発者により実用的な指針を提供できるようになります。更新されたAndroid Bench 2.0のリーダーボードは現在利用可能で、Googleは時間の経過とともにさらに多くのモデルと結果で拡張し続ける予定だと述べています。

主要エンティティ:企業:Google、Android Central | 人物:Nicholas Sutrich、Sanuj

FAQ:Android Bench 2.0とは何ですか?

Android Bench 2.0は、AIモデルが複雑なAndroid開発タスクをどれだけうまく処理できるかを評価するためのGoogleの更新されたベンチマークで、人間のエンジニアが完了するのに数日かかる可能性があるロングホライズンタスクも含まれます。

FAQ質問:Android Bench 2.0とは何ですか?

FAQ回答:Android Bench 2.0は、AIモデルが複雑なAndroid開発タスクをどれだけうまく処理できるかを評価するためのGoogleの更新されたベンチマークで、人間のエンジニアが完了するのに数日かかる可能性があるロングホライズンタスクも含まれます。