HeadlinesBriefing favicon HeadlinesBriefing.com

أنظمة الاستدلال للمستهلكين: معايير الذكاء الاصطناعي المحمول

Hacker News •
×

تنشر Artificial Analysis معايير أنظمة الاستدلال للمستهلكين لتقييم أداء نماذج الذكاء الاصطناعي على الأجهزة المحمولة، وتحديدًا iPhone 17 Pro. تستخدم الدراسة متوسطًا بسيطًا لخمس تقييمات — — BFCL (جزء فرعي)، IFBench، AA-Omniscience، GPQA Diamond و MATH-500 — — تم اختيارها لتمثيل استخدام الأجهزة المحمولة في العالم الحقيقي. يقتصر السياق على أقصى 16K توكن.

تقيس درجات الذكاء قدرة النموذج على استدعاء الأدوات، اتباع التعليمات، دقة المعرفة، معدل عدم الهلوسة، الاستدلال العلمي والاستدلال الكمي. تشير الدرجات الأعلى إلى أداء أفضل.

يتبع وقت الجيل من النهاية إلى النهاية إجمالي ثوانٍ جدار الساعة لمعالجة مُحفِّز من 1,024 توكن وإنشاء رد من 256 توكن. كلما قل الوقت كان ذلك أفضل. تعكس النتائج القيود الأساسية للأجهزة والبنية، باستثناء آثار التفصيل.

يتتبع كفاءة التوكن تجاوزات ميزانية السياق — — الأجيال التي تتوقف عند حد 16K توكن بدلاً من الإكمال. يتم استبعاد النماذج الكبيرة جدًا للجهاز أو التي تتجاوز حدود الوقت من قياسات الأداء.

الكيانات الرئيسية: الشركات: Artificial Analysis