HeadlinesBriefing favicon HeadlinesBriefing.com

تحليل Claude Opus 5.5: الذكاء والأداء والسعر

Hacker News •
×

يتضمن مؤشر الذكاء v4.3.2 من Artificial Analysis 10 تقييمات: AA-Briefcase v1.1، GDPval-AA v2.1، Automation Bench-AA، Terminal-Bench 4.0، Sci Code، Humanity's Last Exam، GDP.pdf، Crit Pt، AA-Omniscience، AA-LCR v1.1. راجع منهجية مؤشر الذكاء لمزيد من التفاصيل، بما في ذلك تفصيل لكل تقييم وكيفية تشغيلها.

AA-Briefcase v1.1 هو معيار عمل معرفي وكيلي طورته Artificial Analysis. AA-Briefcase Elo هو مقياس مركب يجمع معدل اجتياز المعايير وجودة التحليل Elo والعرض التقديمي Elo · الأعلى أفضل. يقيس مؤشر AA-Omniscience موثوقية المعرفة والهلوسة. يكافئ الإجابات الصحيحة، ويعاقب الهلوسة، وليس هناك عقوبة على رفض الإجابة. تتراوح الدرجات من -100 إلى 100، حيث يعني 0 وجود عدد متساوٍ من الإجابات الصحيحة والخاطئة.

مقارنات مؤشر الذكاء: مؤشر الذكاء مقابل التكلفة لكل مهمة في مؤشر الذكاء. متوسط التكلفة المرجح لكل مهمة في مؤشر الذكاء. تُحسب تكلفة كل تقييم من أسعار رموز الإدخال وإصابة الذاكرة المؤقتة وكتابة الذاكرة المؤقتة والاستدلال والإجابة، مقسومة على عدد المهام، ومرجحة بوزنها في مؤشر الذكاء.

الكيانات الرئيسية: الشركات: Artificial Analysis

الأسئلة الشائعة: ما هو مؤشر الذكاء من Artificial Analysis؟

يتضمن مؤشر الذكاء v4.3.2 من Artificial Analysis 10 تقييمات: AA-Briefcase v1.1، GDPval-AA v2.1، Automation Bench-AA، Terminal-Bench 4.0، Sci Code، Humanity's Last Exam، GDP.pdf، Crit Pt، AA-Omniscience، AA-LCR v1.1.

سؤال الأسئلة الشائعة: ما هو مؤشر الذكاء من Artificial Analysis؟

إجابة الأسئلة الشائعة: يتضمن مؤشر الذكاء v4.3.2 من Artificial Analysis 10 تقييمات: AA-Briefcase v1.1، GDPval-AA v2.1، Automation Bench-AA، Terminal-Bench 4.0، Sci Code، Humanity's Last Exam، GDP.pdf، Crit Pt، AA-Omniscience، AA-LCR v1.1.