HeadlinesBriefing favicon HeadlinesBriefing.com

Android Bench 2.0 من Google: نتائج الذكاء الاصطناعي

Android Central •
×

أطلقت Google Android Bench 2.0 لاختبار نماذج الذكاء الاصطناعي في مهام تطوير Android المعقدة التي قد تستغرق أيامًا. يتضمن المعيار الجديد مهام مثل ترقية التبعيات وإضافة ميزات رئيسية وبناء تطبيقات Android من الصفر.

يتصدر GPT-6 Astra حاليًا معيار Google الجديد بنسبة نجاح 28%، بينما سجل Gemini 3.8 Flash 8% فقط.

أعلنت Google عن Android Bench 2.0، وهي نسخة محدثة من معيارها لتقييم مدى جودة تعامل النماذج اللغوية الكبيرة (LLMs) ووكلاء الذكاء الاصطناعي مع مهام تطوير Android المعقدة. في وقت سابق من هذا العام، قدمت Google الإصدار الأول من Android Bench لقياس أداء نماذج الذكاء الاصطناعي في أعمال تطوير Android الواقعية. وقد حدّثت الشركة الآن المعيار إلى Android Bench 2.0، المصمم لتقييم النماذج والوكلاء مقابل مهام أكثر تعقيدًا تعكس تطوير البرمجيات الفعلي بشكل أفضل.

من أكبر الإضافات ما تسميه Google المهام طويلة الأفق (LHTs). هذه مهام تطوير أكثر تعقيدًا بكثير وقد يستغرق إكمالها من مهندس بشري عدة أيام أو حتى أسبوعًا. تقول Google إن الإصدار الأول من Android Bench، إلى جانب العديد من معايير البرمجة بالذكاء الاصطناعي المبكرة الأخرى، ركّز بشكل أساسي على تغييرات أصغر وتدريجية. صُمم Android Bench 2.0 لرفع هذا المستوى بمهام مثل ترقية التبعيات وإضافة ميزات جديدة رئيسية وحتى بناء تطبيقات Android من الصفر.

مع Android Bench 2.0، غيّرت Google طريقة تقييم النماذج. فبدلًا من الاعتماد بالكامل على نظام ثنائي للنجاح أو الفشل، يستخدم Android Bench 2.0 "التقييم المستمر". وتقول الشركة إن هذا يوفر "مؤشرًا أكثر معنى" لمدى أداء النموذج، حتى عندما لم يتمكن من إكمال المهمة بالكامل.

اختبرت Google بالفعل عدة نماذج ذكاء اصطناعي حديثة باستخدام المعيار الجديد، بما في ذلك Gemini 3.8 Flash وGPT-6 Astra وClaude Fable 5.1 وGPT-5.6 Sol وClaude Opus 5 وغيرها. وفقًا للنتائج، يحتل GPT-6 Astra حاليًا صدارة المعيار بنسبة نجاح 28%. أما Gemini 3.8 Flash فقد سجل 8% فقط.

تقول Google إن اختبار النماذج مقابل مجموعة بيانات LHT ينبغي أن يمنحها فهمًا أفضل لنقاط قوتها وضعفها، مع تزويد المطورين بإرشادات أكثر عملية حول النماذج الأنسب لمهام تطوير Android المختلفة. لوحة صدارة Android Bench 2.0 المحدثة متاحة الآن، وتقول Google إنها تخطط لمواصلة توسيعها بمزيد من النماذج والنتائج بمرور الوقت.

الكيانات الرئيسية: الشركات: Google، Android Central | الأشخاص: Nicholas Sutrich، Sanuj

الأسئلة الشائعة: ما هو Android Bench 2.0؟

Android Bench 2.0 هو المعيار المحدث من Google لتقييم مدى جودة تعامل نماذج الذكاء الاصطناعي مع مهام تطوير Android المعقدة، بما في ذلك المهام طويلة الأفق التي قد يستغرق إكمالها من مهندس بشري أيامًا.

سؤال الأسئلة الشائعة: ما هو Android Bench 2.0؟

إجابة الأسئلة الشائعة: Android Bench 2.0 هو المعيار المحدث من Google لتقييم مدى جودة تعامل نماذج الذكاء الاصطناعي مع مهام تطوير Android المعقدة، بما في ذلك المهام طويلة الأفق التي قد يستغرق إكمالها من مهندس بشري أيامًا.