HeadlinesBriefing favicon HeadlinesBriefing.com

Google Android Bench 2.0: AI কোডিং ফলাফল

Android Central •
×

Google Android Bench 2.0 চালু করেছে, যা জটিল Android ডেভেলপমেন্ট কাজে AI মডেল পরীক্ষা করে, যেগুলো সম্পন্ন করতে দিন লেগে যেতে পারে। নতুন বেঞ্চমার্কে নির্ভরতা আপগ্রেড করা, বড় ফিচার যোগ করা এবং শূন্য থেকে Android অ্যাপ তৈরি করার মতো কাজ অন্তর্ভুক্ত রয়েছে।

GPT-6 Astra বর্তমানে Google-এর নতুন বেঞ্চমার্কে 28% পাস রেট নিয়ে শীর্ষে রয়েছে, অন্যদিকে Gemini 3.8 Flash মাত্র 8% স্কোর করেছে।

Google Android Bench 2.0 ঘোষণা করেছে, যা বড় ভাষা মডেল (LLM) এবং AI এজেন্টরা জটিল Android ডেভেলপমেন্ট কাজ কতটা ভালোভাবে সামলায় তা মূল্যায়নের জন্য তাদের বেঞ্চমার্কের একটি হালনাগাদ সংস্করণ। এ বছরের শুরুতে, Google Android Bench-এর প্রথম সংস্করণ চালু করেছিল, যাতে বাস্তব-জগতের Android ডেভেলপমেন্ট কাজে AI মডেলগুলোর পারফরম্যান্স মাপা যায়। কোম্পানি এখন বেঞ্চমার্কটি Android Bench 2.0 দিয়ে হালনাগাদ করেছে, যা আরও জটিল কাজের বিপরীতে মডেল ও এজেন্ট মূল্যায়নের জন্য ডিজাইন করা হয়েছে, যা প্রকৃত সফটওয়্যার ডেভেলপমেন্টকে আরও ভালোভাবে প্রতিফলিত করে।

সবচেয়ে বড় সংযোজনগুলোর একটি হলো যা Google লং-হরাইজন টাস্ক (LHT) বলে। এগুলো উল্লেখযোগ্যভাবে আরও জটিল ডেভেলপমেন্ট কাজ, যা একজন মানব ইঞ্জিনিয়ারকে সম্পন্ন করতে কয়েক দিন বা এমনকি এক সপ্তাহও লাগতে পারে। Google বলেছে, Android Bench-এর প্রথম সংস্করণ, পাশাপাশি আরও অনেক প্রাথমিক AI কোডিং বেঞ্চমার্ক, মূলত ছোট, ক্রমবর্ধমান পরিবর্তনের উপর মনোযোগ দিয়েছিল। Android Bench 2.0 নির্ভরতা আপগ্রেড করা, বড় নতুন ফিচার যোগ করা এবং এমনকি শূন্য থেকে Android অ্যাপ তৈরি করার মতো কাজ দিয়ে সেই মান বাড়ানোর জন্য ডিজাইন করা হয়েছে।

Android Bench 2.0-এর সাথে, Google মডেলগুলো কীভাবে গ্রেড করা হয় তা পরিবর্তন করেছে। সম্পূর্ণভাবে বাইনারি পাস-বা-ফেল সিস্টেমের উপর নির্ভর করার বদলে, Android Bench 2.0 "ধারাবাহিক স্কোরিং" ব্যবহার করে। কোম্পানি বলেছে, এটি একটি মডেল কতটা ভালো পারফর্ম করেছে তার আরও "অর্থবহ ইঙ্গিত" দেয়, এমনকি যখন এটি একটি কাজ সম্পূর্ণভাবে সম্পন্ন করতে পারেনি।

Google ইতিমধ্যে নতুন বেঞ্চমার্ক ব্যবহার করে কয়েকটি সাম্প্রতিক AI মডেল পরীক্ষা করেছে, যার মধ্যে Gemini 3.8 Flash, GPT-6 Astra, Claude Fable 5.1, GPT-5.6 Sol এবং Claude Opus 5 ইত্যাদি রয়েছে। ফলাফল অনুযায়ী, GPT-6 Astra বর্তমানে 28% পাস রেট নিয়ে বেঞ্চমার্কের শীর্ষে রয়েছে। অন্যদিকে, Gemini 3.8 Flash মাত্র 8% স্কোর করেছে।

Google বলেছে, LHT ডেটাসেটের বিপরীতে মডেল পরীক্ষা করলে তাদের শক্তি ও দুর্বলতা সম্পর্কে আরও ভালো ধারণা পাওয়া যাবে, পাশাপাশি ডেভেলপারদের জন্য কোন মডেলগুলো বিভিন্ন Android ডেভেলপমেন্ট কাজের জন্য বেশি উপযুক্ত সে সম্পর্কে আরও ব্যবহারিক নির্দেশনা পাওয়া যাবে। হালনাগাদ Android Bench 2.0 লিডারবোর্ড এখন উপলব্ধ, এবং Google বলেছে তারা সময়ের সাথে আরও মডেল ও ফলাফল দিয়ে এটি প্রসারিত করার পরিকল্পনা করছে।

মূল সত্তা: কোম্পানি: Google, Android Central | ব্যক্তি: Nicholas Sutrich, Sanuj