HeadlinesBriefing favicon HeadlinesBriefing.com

تم إصدار Intelligence Index v4.2

Hacker News •
×

أصدرت Artificial Analysis الإصدار v4.2 من Intelligence Index، وهو تحديث مؤقت يسرّع عناصر الإصدار v5 المخطط له للحفاظ على الوتيرة مع التطورات السريعة لنماذج الحدود. يقدّم التحديث مهامًا أكثر تعقيدًا وواقعية، ويزيد نسبة مجموعات الاختبار المغلقة والخاصة إلى 40% من وزن الفهرس — الضعف المضاعف مقارنةً بـ v4.1 — لمنع التلاعب. تمت إضافة تقييمان رئيسيان: AA-Briefcase، اختبار معايير عمل معرفة قائم على وكلاء داخلي، مع مجموعات اختبار خاصة تختبر مشاريع متعددة الأسابيع عبر آلاف الملفات المصدرية، وGDP.pdf من Surge AI، الذي يقيّم التفكير على المستندات بسياق طويل عبر 4,592 صفحة PDF بـ 1,275 معيارًا ذريًا كتبه خبراء. تشمل ترقيات بنية التقييم تحسينات في دقة التقييم في AA-LCR v1.1، وتقييمات Elo المستقرة لـ GDPval-AA v2 وAA-Briefcase، وبيئات تقييم أكثر بروزًا لـ Sci Code. تُظهر النتائج الرئيسية أن Claude Fable 5.1 من Anthropic يتصدر الفهرس، يليه GPT-6 Astra من Open AI، بزيادة 4 نقاط على GPT-5.6 Sol. تحتل Meta المرتبة الثالثة، تليها Space XAI، Moonshot/Kimi، Z.AI، وGoogle. تُشارك حدود بارييتو التكلفة لكل مهمة بين Anthropic وOpen AI وMeta وZ.AI، بينما يهيمن GPT-6 Astra على حدود كفاءة رموز الإخراج بالقرب من حدود الذكاء.