HeadlinesBriefing favicon HeadlinesBriefing.com

تحليل مؤشر ذكاء الصوت v4.3

Hacker News •
×

يحتوي مؤشر ذكاء الصوت v4.3 من Artificial Analysis على 10 تقييمات: AA-Briefcase، GDPval-AA v2، Automation Bench-AA، Terminal-Bench 4.0، Sci Code، Humanity's Last Exam، GDP.pdf، Crit Pt، AA-Omniscience، AA-LCR v1.1. راجع منهجية مؤشر الذكاء لمزيد من التفاصيل، بما في ذلك تفكيك كل تقييم وكيفية تنفيذه.

يشير إلى ما إذا كانت أوزان النموذج متاحة. يُصنف النماذج على أنها "مقيدة للاستخدام التجاري" إذا كان الاستخدام التجاري محدود بظروف، و على أنها "غير تجارية" إذا كان الترخيص يمنع الاستخدام التجاري.

مؤشرات القدرة تقيس أداء النماذج على قدرات وصناعات محددة.

تُقاس التقييمات الذكية بشكل مستقل من قبل Artificial Analysis · كلما كان القيمة أعلى، كان الأمر أفضل.

الترميز الوكيل واستخدام الطرفية استنتاج المستندات المهنية جميعها الطبي استنتاج السياق الطويل في الطب على الرغم من أن الذكاء عمومًا للنموذج يترجم عبر الحالات، قد تكون التقييمات المحددة أكثر صلة لبعض الحالات.

AA-Briefcase Elo هو مقياس مدمج يجمع معدل مرور الرُّبِيك، جودة التحليل Elo، و Elo العرض. وتُقيد قيم Elo وحدود الفترة المثالية للـ 95% عند 0.

مؤشر AA-Omniscience (كلما كان أعلى، كان الأمر أفضل) يقيس موثوقية المعرفة والوهميات. يكافح الإجابات الصحيحة، يعاقب الوهميات، ولا يفرض عقابًا على رفض الإجابة. تتراوح النقاط من -100 إلى 100.

الكيانات الرئيسية: الشركات: Artificial Analysis