HeadlinesBriefing favicon HeadlinesBriefing.com

Jev مقابل LLMs: اختبار اتخاذ القرار

Towards Data Science •
×

اختبرت Jev من TypeSafe AI على 3,080 مهام التصنيف لمقارنة الدقة، وال latency، وال calibration، وال confiance مع LLMs. Jev هو نموذ System One مصمم لاتخاذ قرارات سريعة و منظمة مثل التصنيف، والتوجيه، وال Checksamen—على عكس LLMs التي تنتج نصوصاً مفتوحة. في اختبار Prior Bench المكون من 400 عنصر، حصل Jev على دقة 95.9% مقارنة بـ 77.2% لقواعد الكلمات المفتاحية. ت processed المهام في وسط 0.35 ثانية مقارنة بـ 8.83 ثانية للتصنيفات التقليدية. في calibration confiance، أظهر Jev أخطاء 0.002–0.047 مقارنة بـ 0.078–0.163 لاربعة نماذج دردشة في معيار Supa Journal. تقييم الاختبار ما إذا كانت confiance scores Jev قابلة لل confiance لـ workflows اتخاذ القرار مثل توجيه tickets الدعم أو calls tools agents. أظهرت النتائج أن Jev كان أكثر دقة بشكل عام، confiance ثبت أنه غير موثوق في بعض السيناريوهات. نموذج fallback في الحقيقة degraded الأداء. Jev يتفوق عندما تكون مخرجات محددة مطلوبة، بينما LLMs تناسب التفكير المفتوح.