HeadlinesBriefing favicon HeadlinesBriefing.com

Googles Android Bench 2.0: KI-Testergebnisse

Android Central •
×

Google hat Android Bench 2.0 gestartet, um KI-Modelle bei komplexen Android-Entwicklungsaufgaben zu testen, die Tage dauern können. Der neue Benchmark umfasst Aufgaben wie das Aktualisieren von Abhängigkeiten, das Hinzufügen großer Funktionen und das Erstellen von Android-Apps von Grund auf.

GPT-6 Astra führt derzeit Googles neuen Benchmark mit einer Erfolgsquote von 28 % an, während Gemini 3.8 Flash nur 8 % erreichte.

Google hat Android Bench 2.0 angekündigt, eine aktualisierte Version seines Benchmarks zur Bewertung, wie gut große Sprachmodelle (LLMs) und KI-Agenten komplexe Android-Entwicklungsaufgaben bewältigen. Anfang dieses Jahres führte Google die erste Version von Android Bench ein, um zu messen, wie KI-Modelle bei realen Android-Entwicklungsarbeiten abschneiden. Das Unternehmen hat den Benchmark nun mit Android Bench 2.0 aktualisiert, der darauf ausgelegt ist, Modelle und Agenten anhand komplexerer Aufgaben zu bewerten, die die tatsächliche Softwareentwicklung besser widerspiegeln.

Eine der größten Neuerungen sind die sogenannten Long-Horizon-Aufgaben (LHTs). Dabei handelt es sich um deutlich komplexere Entwicklungsarbeiten, deren Fertigstellung einen menschlichen Entwickler mehrere Tage oder sogar eine Woche kosten könnte. Google erklärt, dass sich die erste Version von Android Bench sowie viele andere frühe KI-Coding-Benchmarks hauptsächlich auf kleinere, inkrementelle Änderungen konzentrierten. Android Bench 2.0 soll diese Messlatte mit Aufgaben wie dem Aktualisieren von Abhängigkeiten, dem Hinzufügen großer neuer Funktionen und sogar dem Erstellen von Android-Apps von Grund auf höher legen.

Mit Android Bench 2.0 hat Google die Art und Weise geändert, wie Modelle bewertet werden. Anstatt sich vollständig auf ein binäres Bestanden-oder-Durchgefallen-System zu verlassen, verwendet Android Bench 2.0 eine „kontinuierliche Bewertung“. Das Unternehmen erklärt, dass dies einen „aussagekräftigeren Hinweis“ darauf gibt, wie gut ein Modell abgeschnitten hat, selbst wenn es eine Aufgabe nicht vollständig abschließen konnte.

Google hat bereits mehrere der neuesten KI-Modelle mit dem neuen Benchmark getestet, darunter Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol und Claude Opus 5. Den Ergebnissen zufolge steht GPT-6 Astra derzeit mit einer Erfolgsquote von 28 % an der Spitze des Benchmarks. Gemini 3.8 Flash erreichte hingegen nur 8 %.

Google erklärt, dass das Testen von Modellen anhand des LHT-Datensatzes ein besseres Verständnis ihrer Stärken und Schwächen ermöglichen und Entwicklern zugleich praktischere Hinweise dazu geben soll, welche Modelle für verschiedene Android-Entwicklungsaufgaben besser geeignet sind. Die aktualisierte Rangliste von Android Bench 2.0 ist jetzt verfügbar, und Google erklärt, dass es sie im Laufe der Zeit mit weiteren Modellen und Ergebnissen erweitern will.

Wichtige Entitäten: Unternehmen: Google, Android Central | Personen: Nicholas Sutrich, Sanuj