HeadlinesBriefing favicon HeadlinesBriefing.com

Android Bench 2.0 Google: Hasil Tes Coding AI

Android Central •
×

Google telah meluncurkan Android Bench 2.0 untuk menguji model AI pada tugas pengembangan Android kompleks yang bisa memakan waktu berhari-hari. Benchmark baru ini mencakup tugas seperti meningkatkan dependensi, menambahkan fitur utama, dan membangun aplikasi Android dari awal.

GPT-6 Astra saat ini memimpin benchmark baru Google dengan tingkat kelulusan 28%, sementara Gemini 3.8 Flash hanya mencetak 8%.

Google telah mengumumkan Android Bench 2.0, versi terbaru dari benchmark mereka untuk mengevaluasi seberapa baik model bahasa besar (LLM) dan agen AI menangani tugas pengembangan Android yang kompleks. Awal tahun ini, Google memperkenalkan versi pertama Android Bench untuk mengukur bagaimana model AI berkinerja pada pekerjaan pengembangan Android di dunia nyata. Perusahaan kini telah memperbarui benchmark tersebut dengan Android Bench 2.0, yang dirancang untuk mengevaluasi model dan agen terhadap tugas-tugas yang lebih kompleks yang lebih mencerminkan pengembangan perangkat lunak sebenarnya.

Salah satu tambahan terbesar adalah apa yang disebut Google sebagai tugas horizon panjang (LHT). Ini adalah pekerjaan pengembangan yang jauh lebih kompleks yang bisa memakan waktu beberapa hari atau bahkan seminggu bagi seorang insinyur manusia untuk menyelesaikannya. Google mengatakan versi pertama Android Bench, bersama dengan banyak benchmark coding AI awal lainnya, terutama berfokus pada perubahan yang lebih kecil dan bertahap. Android Bench 2.0 dirancang untuk menaikkan standar tersebut dengan tugas-tugas seperti meningkatkan dependensi, menambahkan fitur baru utama, dan bahkan membangun aplikasi Android dari awal.

Dengan Android Bench 2.0, Google telah mengubah cara model dinilai. Alih-alih sepenuhnya mengandalkan sistem biner lulus-atau-gagal, Android Bench 2.0 menggunakan "penilaian berkelanjutan". Perusahaan mengatakan ini memberikan "indikasi yang lebih bermakna" tentang seberapa baik kinerja sebuah model, bahkan ketika model tersebut tidak dapat menyelesaikan tugas sepenuhnya.

Google telah menguji beberapa model AI terbaru menggunakan benchmark baru tersebut, termasuk Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol, dan Claude Opus 5, di antara yang lain. Menurut hasilnya, GPT-6 Astra saat ini berada di puncak benchmark dengan tingkat kelulusan 28%. Sementara itu, Gemini 3.8 Flash hanya mencetak 8%.

Google mengatakan bahwa menguji model terhadap kumpulan data LHT akan memberinya pemahaman yang lebih baik tentang kekuatan dan kelemahan mereka, sekaligus memberikan panduan yang lebih praktis kepada pengembang tentang model mana yang lebih cocok untuk berbagai tugas pengembangan Android. Papan peringkat Android Bench 2.0 yang diperbarui kini tersedia, dan Google mengatakan pihaknya berencana untuk terus memperluasnya dengan lebih banyak model dan hasil seiring waktu.

Entitas Utama: Perusahaan: Google, Android Central | Orang: Nicholas Sutrich, Sanuj