HeadlinesBriefing favicon HeadlinesBriefing.com

سبب ضعف أداء النماذج المحلية

Hacker News •
×

نحمّل جميعاً نموذج “AMAZEBALLZ” متوقعين أداءً عالياً، لنكتشف أن إعدادنا المحلي يعمل بشكل سيء. ينشأ هذا الفجوة من مخاطر خاصة بالتنفيذ أثناء الاستدلال. يختلف عتاد وبرمجيات مختبرات المرجع اختلافاً كبيراً عن أجهزة المنزل. تحسب كل جيل من بطاقات الرسوميات الرموز التالية بطريقة فريدة، مما يؤدي إلى انحراف طبيعي عن الادعاءات المنشورة.

لقياس أداء إعدادك الحقيقي، شغّل معايير قياسية مثل terminal bench, hle, SWEthis, HELLAthat أو MMLU-whatever. تجنب اختبارات الصفرية؛ تحتاج المهام الوكيلية استدعاء أدوات بسياق طويل. طابق إعدادات المجمع بدقة. كما لاحظ @wendell، الرياضيات ثابتة. استخدم القيم الافتراضية لبطاقة النموذج: عادةً temp 1.0 و top-p 0.95. تسبب درجات الحرارة الخاطئة حلقات لا نهائية، بينما تشوّه المجمعات غير المتطابقة احتمالات التوزيع، مما يجعل المخرجات تبدو غريبة.

رياضياً، تتبع KLD (انحراف كلي-ليبنر). حوّل اللوغيتات إلى توزيعات احتمالية وقيس الانحراف عن الأساس. يشير انخفاض KLD إلى تطابق أقرب، وليس ذكاءً أعلى. احذر من النتائج المنخفضة بشكل مستحيل على نماذج HF الكمومية دون نقاط مرجعية مكشوفة. لا تنخدع بالنتائج المنخفضة دون بيئات تشغيل كاملة. شغّل اختبارات تمثيلية، طابق قوالب الدردشة، واقتنع بأن كل مثيل يشغل LLM اليوم يعمل بتباينات طفيفة.