HeadlinesBriefing favicon HeadlinesBriefing.com

GLM-5.3-Flash تحليل الذكاء والأداء والسعر

Hacker News •
×

تقدم Artificial Analysis تحليل نموذج GLM-5.3-Flash. يتضمن مؤشر الذكاء الاصطناعي v4.1.1 من Artificial Analysis 9 تقييمات: GDPval-AA v2، 𝜏³-Banking، Terminal-Bench v2.1، Sci Code، Humanity's Last Exam، GPQA Diamond، Crit Pt، AA-Omniscience، AA-LCR. يتم الإشارة إلى نماذج الاستدلال بأيقونة مصباح كهربائي.

يتضمن مؤشر الذكاء هذه التقييمات، مع توفر تفاصيل المنهجية. يتم تصنيف النماذج على أنها 'مقيدة الاستخدام التجاري' إذا كان الاستخدام التجاري محدودًا، أو 'غير تجاري' إذا كان الترخيص يحظر الاستخدام التجاري. يتم قياس تقييمات الذكاء بشكل مستقل بواسطة Artificial Analysis، والدرجات الأعلى أفضل.

يقيس مؤشر AA-Omniscience موثوقية المعرفة والهلوسة. يكافئ الإجابات الصحيحة، ويعاقب الهلوسة، ولا توجد عقوبة لرفض الإجابة. تتراوح الدرجات من -100 إلى 100، حيث يعني 0 أن عدد الإجابات الصحيحة يساوي عدد الإجابات الخاطئة، والدرجات السالبة تعني أن الإجابات الخاطئة أكثر من الصحيحة.

تتضمن المقارنات مؤشر الذكاء مقابل التكلفة لكل مهمة، باستخدام متوسط التكلفة المرجح من أسعار رموز الإدخال، وضرب ذاكرة التخزين المؤقت، وكتابة ذاكرة التخزين المؤقت، والاستدلال، والإجابة. يتم قياس استخدام الرموز كرموز إخراج لكل مهمة من مهام مؤشر الذكاء، ويتم حسابها بضرب رموز الإخراج لكل تقييم في أوزان المعيار.

الكيانات الرئيسية: الشركات: Artificial Analysis