HeadlinesBriefing favicon HeadlinesBriefing.com

Google Android Bench 2.0: AI कोडिंग परिणाम

Android Central •
×

Google ने जटिल Android विकास कार्यों पर AI मॉडल का परीक्षण करने के लिए Android Bench 2.0 लॉन्च किया है, जिन्हें पूरा करने में कई दिन लग सकते हैं। नए बेंचमार्क में निर्भरताओं को अपग्रेड करना, बड़ी सुविधाएँ जोड़ना और शुरू से Android ऐप्स बनाना जैसे कार्य शामिल हैं।

GPT-6 Astra वर्तमान में Google के नए बेंचमार्क में 28% पास दर के साथ आगे है, जबकि Gemini 3.8 Flash ने केवल 8% स्कोर किया।

Google ने Android Bench 2.0 की घोषणा की है, जो इसके बेंचमार्क का एक अद्यतन संस्करण है, जो यह मूल्यांकन करता है कि बड़े भाषा मॉडल (LLM) और AI एजेंट जटिल Android विकास कार्यों को कितनी अच्छी तरह संभालते हैं। इस वर्ष की शुरुआत में, Google ने Android Bench का पहला संस्करण पेश किया था, ताकि यह मापा जा सके कि AI मॉडल वास्तविक दुनिया के Android विकास कार्यों पर कैसा प्रदर्शन करते हैं। कंपनी ने अब बेंचमार्क को Android Bench 2.0 के साथ अद्यतन किया है, जिसे अधिक जटिल कार्यों के विरुद्ध मॉडल और एजेंट का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो वास्तविक सॉफ़्टवेयर विकास को बेहतर ढंग से दर्शाते हैं।

सबसे बड़े जोड़ों में से एक है जिसे Google लॉन्ग-हॉरिज़न टास्क (LHT) कहता है। ये काफी अधिक जटिल विकास कार्य हैं, जिन्हें पूरा करने में एक मानव इंजीनियर को कई दिन या एक सप्ताह तक लग सकता है। Google का कहना है कि Android Bench का पहला संस्करण, साथ ही कई अन्य शुरुआती AI कोडिंग बेंचमार्क, मुख्य रूप से छोटे, क्रमिक परिवर्तनों पर केंद्रित थे। Android Bench 2.0 को निर्भरताओं को अपग्रेड करना, बड़ी नई सुविधाएँ जोड़ना और यहाँ तक कि शुरू से Android ऐप्स बनाना जैसे कार्यों के साथ उस स्तर को ऊपर उठाने के लिए डिज़ाइन किया गया है।

Android Bench 2.0 के साथ, Google ने मॉडलों को ग्रेड करने का तरीका बदल दिया है। पूरी तरह से बाइनरी पास-या-फेल सिस्टम पर निर्भर रहने के बजाय, Android Bench 2.0 "सतत स्कोरिंग" का उपयोग करता है। कंपनी का कहना है कि यह इस बात का अधिक "सार्थक संकेत" देता है कि किसी मॉडल ने कितना अच्छा प्रदर्शन किया, भले ही वह किसी कार्य को पूरी तरह पूरा न कर सका हो।

Google ने पहले ही नए बेंचमार्क का उपयोग करके कई नवीनतम AI मॉडलों का परीक्षण किया है, जिनमें Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol और Claude Opus 5 आदि शामिल हैं। परिणामों के अनुसार, GPT-6 Astra वर्तमान में 28% पास दर के साथ बेंचमार्क में शीर्ष पर है। इस बीच, Gemini 3.8 Flash ने केवल 8% स्कोर किया।

Google का कहना है कि LHT डेटासेट के विरुद्ध मॉडलों का परीक्षण करने से उसे उनकी ताकत और कमजोरियों की बेहतर समझ मिलेगी, साथ ही डेवलपर्स को इस बारे में अधिक व्यावहारिक मार्गदर्शन भी मिलेगा कि कौन से मॉडल विभिन्न Android विकास कार्यों के लिए अधिक उपयुक्त हैं। अद्यतन Android Bench 2.0 लीडरबोर्ड अब उपलब्ध है, और Google का कहना है कि वह समय के साथ इसे और अधिक मॉडलों और परिणामों के साथ विस्तारित करना जारी रखने की योजना बना रहा है।

मुख्य संस्थाएँ: कंपनियाँ: Google, Android Central | व्यक्ति: Nicholas Sutrich, Sanuj