HeadlinesBriefing favicon HeadlinesBriefing.com

Real-SWE: أداء الذكاء الاصطناعي في قواعد شفرات خاصة

Hacker News •
×

يقيّم معيار Real-SWE في سبتمبر 2026 نماذج الذكاء الاصطناعي الرائدة في قواعد شفرات مؤسسية خاصة من العالم الحقيقي. ينشأ كل مهمة من قاعدة شفرات إنتاج خاصة مرخّصة من شركة حقيقية، ويقدم للمهندسين أنظمة خاصة ومشكلات حاسمة للأعمال. تكشف النتائج عن فجوات أداء كبيرة بين النماذج الرائدة، إذ حقّق Claude Code أعلى معدل حل بلغ 38.8%، يليه GPT-6 Astra Codex CLI بنسبة 33.8% وGemini 3.8 Flash بنسبة 31.2%. يقيس التقييم تركيبات النموذج والإطار، ويتطلب من الوكلاء التنقل في الاتفاقيات الخاصة وتنفيذ تغييرات تؤثر في العمليات التجارية عبر خدمات متعددة. تتطلب مهام الشركات الحقيقية سياقًا محددًا، مثل أن يعتمد الفوترة الصحيحة على قواعد الأعمال وخدمات الضرائب الخارجية. تتضمن المهام إصلاح فوترة الفواتير بحيث تفرض كل شركة الضريبة الصحيحة بينما يظل العملاء المعفون غير خاضعين للضريبة. يبرز المعيار أن المهام التي يولدها الخبراء أو المهام التركيبية تختلف عن عمل المهندسين الفعلي، لأن كلًا من الأثر البرمجي الأساسي وخصوصية التعليمات يضيفان تعقيدًا يتحدى نماذج اليوم الرائدة.