HeadlinesBriefing favicon HeadlinesBriefing.com

Jev vs LLMs: AI निर्णय परीक्षण

Towards Data Science •
×

मैंने 3,080 वर्गीकरण कार्यों पर TypeSafe AI के Jev का परीक्षण किया ताकि LLMs के साथ accuracy, latency, calibration, और confidence की तुलना की जाए। Jev एक System One मॉडल है जिसे तेज, संरचित निर्णय जैसे कि वर्गीकरण, रूटिंग, और सुरक्षा जाँच के लिए डिज़ाइन किया गया है—जबकि LLMs खुले-सिर्फ़ टेक्स्ट जनरेट करते हैं। 400-आइटम Prior Bench परीक्षण में, Jev ने 95.9% की सटिकता हासिल की जबकि कीवर्ड नियमों ने 77.2% की। इसने कार्यों को मीडियन 0.35 सेकंड में प्रोसेस किया जबकि पारंपरिक क्लासीफायर्स ने 8.83 सेकंड लिए। कॉन्फिडेंस कैलिब्रेशन में, Jev ने 0.002–0.047 के त्रुटि दिखाई दीं जबकि Supa Journal के बेंचमार्क में चैट मॉडल्स ने 0.078–0.163 की। इस परीक्षण ने यह जाँचा कि क्या Jev के कॉन्फिडेंस स्कोर सपोर्ट टिकट रूटिंग यजेंट टूल कॉल्स जैसे निर्णय वर्कफ्लो में भरोसा करने योग्य हैं। परिणामों ने दिखाया कि Jev समग्र में अधिक सटीक था, हालाँकि कॉन्फिडेंस कुछ परिस्थितियों में अविश्वसनीय साबित हुआ। एक फॉलबैक मॉडल वास्तव में प्रदर्शन को कम कर दिया। Jev तब उत्कृष्ट प्रदर्शन करता है जब पूर्व-परिभाषित आउटपुट की आवश्यकता होती है, जबकि LLMs खुले तर्क के लिए उपयुक्त हैं।