HeadlinesBriefing favicon HeadlinesBriefing.com

Jeeves: تحسين نماذج القرار Jev-like بواسطة الاستدلال

Hacker News •
×

Jeeves هو مصنف-style Jev مع مدرب انتشار، تم تدريبه بواسطة SFT و CISPO. يتميز بنموذج Jev-like بحجم 9B (Qwen3.5-9B, LoRA, head pointer) يفكر قبل اتخاذ القرار، باستخدام مدرب انتشار من النوع block-4. يتفوق النموذج على Kev-9B وJev في بيانات الاختبار خارج النطاق (0.889 مقابل 0.822 و 0.857) والمستويات العامة لـ Jev Bench (0.935 مقابل 0.866). يدعم أسئلة نعم/لا، خيار متعدد، وأسئلة rating عبر واجهة API متوافقة مع Jev. تستغرق الاستنتاج ~0.3s بدون تفكير و 3.3smedian مع التفكير على GPU H100 واحد. Jeeves يحقق دقة أعلى في عناصر Jev Bench الصعبة (0.865 مقابل 0.730) وعدم يقين أقل في الإجابات غير المعروفة (0.055 مقابل 0.090). يعمل النموذج على CUDA (Hopper ل Kernel FP8) ويشمل كود تدريبي كامل وبيانات. يتطلب Python 3.12 وبطاقة GPU CUDA للبدء السريع. يمكن تنزيل الأوزان وتقديمها عبر Hugging Face أو نقاط التحقق المدمجة. تظهر طلبات المثال مخرجات منظمة لقطاع، تصعيد، وتقييم الإحباط مع ثقة واحتمالات.