HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE: বেসরকারি Codebase-তে AI-এর কার্যক্ষমতা

Hacker News •
×

২০২৬ সালের সেপ্টেম্বরে Real-SWE Benchmarking বেসরকারি, বাস্তব-জগতের Enterprise Codebase-তে Frontier AI Model-এর মূল্যায়ন করে। প্রতিটি Task একটি বাস্তব Company থেকে লাইসেন্সপ্রাপ্ত বেসরকারি Production Codebase থেকে উদ্ভূত হয়, যা Engineers-এর সামনে Proprietary Systems ও Business-critical Problems তুলে ধরে। ফলাফল প্রমুখ Model-গুলোর মধ্যে উল্লেখযোগ্য Performance Gap প্রকাশ করে; Claude Code ৩৮.৮% সর্বোচ্চ Resolution Rate অর্জন করে, এর পরে GPT-6 Astra Codex CLI ৩৩.৮% এবং Gemini 3.8 Flash ৩১.২% অর্জন করে। মূল্যায়নটি Model-and-harness Combination পরিমাপ করে এবং Agents-কে Proprietary Conventions-এর মধ্যে নেভিগেট করে একাধিক Services-এর Business Operations-কে প্রভাবিত করে এমন Changes বাস্তবায়ন করতে হয়। Real Company Tasks-এ নির্দিষ্ট Context-এর প্রয়োজন হয়, যেমন সহী Billing Business Rules ও বাহ্যিক Tax Services-এর ওপর নির্ভরশীল। Tasks-এ Invoice Billing ঠিক করা জড়িত, যাতে প্রতিটি Business সহী Tax চার্জ করে, অন্যদিকে Exempt Customers Tax-মুক্ত থাকে। Benchmarkটি তুলে ধরে যে Expert-generated বা Synthetic Tasks প্রকৃত Engineer Work থেকে আলাদা, কারণ Underlying Coding Artifact ও Instruction Specificity—উভয়ই এমন জটিলতা যোগ করে যা আজকের Frontier Models-এর জন্য চ্যালেঞ্জিং।