সেপ্টেম্বর 2026। এখানে প্রতিটি সংখ্যা বেঞ্চমার্ক থেকে, এবং bash experiments/bench.sh --no-record API কী ছাড়াই সেগুলি পুনরায় চালায়। আপনি যদি Jev দিয়ে টেক্সট শ্রেণীবদ্ধ করেন, প্রতিটি উত্তর একটি বিক্রেতার কাছে নেটওয়ার্ক কল এবং যে কোনো লোডে প্রায় 300 ms এ ফিরে আসে। একটি এজেন্ট লুপের জন্য যা সিদ্ধান্ত নেয়, কাজ করে এবং আবার সিদ্ধান্ত নেয়, 300 ms প্রতি ধাপ সম্পূর্ণ বাজেট। Jevstiller সেই কলের সামনে বসে, Jev এর নিজস্ব উত্তর থেকে একটি ছোট স্থানীয় মডেল শেখে এবং CPU তে প্রায় 15 ms এ এটি নিশ্চিত উত্তর দিতে দেয়।
আকর্ষণীয় অংশটি ছোট মডেল নয়। এটি চুক্তি: একটি সংখ্যা সেট করুন, ধরুন 98%। Jevstiller সেই লেবেল ফেরত দেয় যা Jev কমপক্ষে সেই অনুপাতের অনুরোধে ফেরত দিত। এই পোস্টটি সেই বাক্যটি সত্য করতে কী প্রয়োজন, কেন আত্মবিশ্বাসের থ্রেশহোল্ড বেছে নেওয়ার সুস্পষ্ট উপায় এটি সত্য করে না এবং এর খরচ কী তা নিয়ে।
পাঁচটি পাবলিক টাস্কে, প্রতিটিতে বিশটি এলোমেলো প্রশিক্ষণ/ক্যালিব্রেশন/পরীক্ষা বিভাজন, পয়েন্ট-এস্টিমেট নিয়মটি প্রতি টাস্কে 20টি বিভাজনের মধ্যে 6 থেকে 12টিতে 2% বাজেট অতিক্রম করেছে, পুরো এক শতাংশ পয়েন্ট পর্যন্ত। Banking77-এর জন্য, পয়েন্ট-এস্টিমেট নিয়মের কভারেজ 79.8% এবং অসম্মতি 1.90% ছিল, 20টির মধ্যে 9 বার বাজেট ভেঙেছে, যেখানে সীমা সংস্করণের কভারেজ 74.9% এবং অসম্মতি 1.15% ছিল, 20টির মধ্যে 0 বার ভেঙেছে।
রাউটারের কাজ হল c·e কে β এর নিচে রেখে যতটা সম্ভব উত্তর দেওয়া। দুটি জিনিস ইচ্ছাকৃতভাবে অনুপস্থিত: এটি সত্যের বিরুদ্ধে মডেলের নির্ভুলতা সম্পর্কে কিছু বলে না, এবং এটি সমস্ত অনুরোধের উপর সম্মতি সম্পর্কে একটি বিবৃতি, স্থানীয় মডেলের নির্ভুলতা সম্পর্কে নয় যে অনুরোধগুলি এটি উত্তর দেওয়ার জন্য বেছে নিয়েছে।