HeadlinesBriefing favicon HeadlinesBriefing.com

Jev vs LLMs: AI সিদ্ধান্ত পরীক্ষার

Towards Data Science •
×

আমি 3,080 টি বিভাগীকরণ কাজে TypeSafe AI-র Jev পরীক্ষা করেছি LLM-এর সাথে accuracy, latency, calibration, এবং confidence তুলনা করার জন্য। Jev একটি System One মডেল যা দ্রুত, সংরচিত সিদ্ধান্ত যেমন বিভাগীকরণ, রাউটিং, এবং নিরাপত্তা পরীক্ষার জন্য ডিজাইন করা হয়েছে—LLM-এর থেকে ভিন্ন যা খোলা টেক্স্ট তৈরি করে। 400-আইটেম Prior Bench পরীক্ষায়, Jev 95.9% সঠিকতা পেয়েছে অপেক্ষে কিওয়ার্ড নিযমের 77.2%। এটি কাজগুলো মেডিয়ান 0.35 সেকেন্ডে প্রক্রিয়া করেছে অপেক্ষে প্রতিষ্ঠিত বিভাগীকরকের 8.83 সেকেন্ড। confidence calibration-এ, Jev 0.002–0.047 ত্রুটি দেখিয়েছে অপেক্ষে Supa Journal-র বেঞ্চমার্কে চারটি চ্যাট মডেলের 0.078–0.163। এই পরীক্ষাটি মূল্যায়ন করেছে যে Jev-র confidence scores সপোর্ট টিকেট রাউটিং বা এজেন্ট টুল কল জন্য সিদ্ধান্ত ওয়র্কফ্লোতে বিশ্বাসযোগ্য কি না। ফলাফলে দেখা গেছে যে Jev সাধারণতে বেশি সঠিক, তবে confidence কিছু পরিস্থিতিতে অবিশ্বাসযোগ্য প্রমাণিত হয়েছে। একটি ফলব্যাক মডেল প্রকৃতপক্ষে কর্মক্ষমতা হ্রাস করেছে। Jev যখন পূর্বনির্ধারিত আউটপুট প্রয়োজন হয় তখন উত্কৃষ্ট প্রদর্শন করে, অপেক্ষে LLM-এর খোলা যুক্তির উপযুক্ত।