सितंबर 2026। यहां प्रत्येक संख्या बेंचमार्क से है, और bash experiments/bench.sh --no-record बिना API कुंजी के उन्हें फिर से चलाता है। यदि आप Jev के साथ टेक्स्ट वर्गीकृत करते हैं, तो प्रत्येक उत्तर एक विक्रेता को नेटवर्क कॉल है और किसी भी लोड पर लगभग 300 ms में वापस आता है। एक एजेंट लूप के लिए जो निर्णय लेता है, कार्य करता है, और फिर से निर्णय लेता है, 300 ms प्रति चरण पूरा बजट है। Jevstiller उस कॉल के सामने बैठता है, Jev के अपने उत्तरों से एक छोटा स्थानीय मॉडल सीखता है, और इसे CPU पर लगभग 15 ms में वह उत्तर देने देता है जिसके बारे में यह निश्चित है।
दिलचस्प हिस्सा छोटा मॉडल नहीं है। यह अनुबंध है: एक संख्या सेट करें, मान लें 98%। Jevstiller वह लेबल लौटाता है जो Jev कम से कम उस अनुपात के अनुरोधों पर लौटाता। यह पोस्ट इस बारे में है कि उस वाक्य को सच बनाने के लिए क्या आवश्यक है, क्यों आत्मविश्वास सीमा चुनने का स्पष्ट तरीका इसे सच नहीं बनाता, और इसकी लागत क्या है।
पांच सार्वजनिक कार्यों पर, प्रत्येक में बीस यादृच्छिक प्रशिक्षण/अंशांकन/परीक्षण विभाजन, बिंदु-अनुमान नियम ने प्रति कार्य 20 में से 6 से 12 विभाजनों में 2% बजट को पार कर लिया, पूरे एक प्रतिशत अंक तक। Banking77 के लिए, बिंदु-अनुमान नियम का कवरेज 79.8% और असहमति 1.90% था, 20 में से 9 बार बजट तोड़ा, जबकि सीमा संस्करण का कवरेज 74.9% और असहमति 1.15% था, 20 में से 0 बार तोड़ा।
राउटर का काम c·e को β से कम रखते हुए जितना संभव हो उत्तर देना है। दो चीजें जानबूझकर अनुपस्थित हैं: यह सत्य के विरुद्ध मॉडल की सटीकता के बारे में कुछ नहीं कहता, और यह सभी अनुरोधों पर सहमति के बारे में एक कथन है, न कि उन अनुरोधों पर स्थानीय मॉडल की सटीकता के बारे में जिन्हें उसने उत्तर देने के लिए चुना।