سبتمبر 2026. كل رقم هنا من المعايير، و bash experiments/bench.sh --no-record يعيد تشغيلها بدون مفتاح API. إذا قمت بتصنيف النص باستخدام Jev، فإن كل إجابة هي استدعاء شبكة إلى بائع واحد وتعود في حوالي 300 مللي ثانية، تحت أي حمل. بالنسبة لحلقة وكيل تقرر وتفعل وتقرر مرة أخرى، 300 مللي ثانية لكل خطوة هي الميزانية بأكملها. يجلس Jevstiller أمام هذا الاستدعاء، ويتعلم نموذجًا محليًا صغيرًا من إجابات Jev الخاصة، ويتركه يجيب على ما هو متأكد منه في حوالي 15 مللي ثانية على وحدة المعالجة المركزية.
الجزء المثير للاهتمام ليس النموذج الصغير. إنه العقد: حدد رقمًا، مثل 98%. يُرجع Jevstiller التسمية التي كان سيعيدها Jev على الأقل على تلك النسبة من الطلبات. هذه المقالة تدور حول ما يلزم لجعل هذه الجملة صحيحة، ولماذا الطريقة الواضحة لاختيار عتبة الثقة لا تجعلها صحيحة، وما تكلفته.
في خمس مهام عامة، عشرون تقسيمًا عشوائيًا للتدريب/المعايرة/الاختبار لكل منها، تجاوزت قاعدة التقدير النقطي ميزانية 2% في 6 إلى 12 من 20 تقسيمًا لكل مهمة، بما يصل إلى نقطة مئوية كاملة. بالنسبة لـ Banking77، كان لقاعدة التقدير النقطي تغطية 79.8% وخلاف 1.90%، مما كسر الميزانية 9 مرات من 20، بينما كان للإصدار المحدود تغطية 74.9% وخلاف 1.15%، مما كسرها 0 مرة من 20.
وظيفة جهاز التوجيه هي الإجابة بقدر ما يستطيع مع الحفاظ على c·e تحت β. هناك شيئان غائبان عن عمد: لا يقول شيئًا عن دقة النموذج مقابل الحقيقة، وهو بيان حول الاتفاق على جميع الطلبات، وليس حول دقة النموذج المحلي على الطلبات التي اختار الإجابة عليها.
الأسئلة الشائعة: كيف يضمن Jevstiller أن نموذجه المحلي يتفق مع Jev ضمن ميزانية محددة؟
يدرب Jevstiller نموذجًا محليًا صغيرًا (رأس انحدار لوجستي متعدد الحدود على تضمينات الجمل المجمدة) من إجابات Jev، ويستخدم سياسة توجيه مع عتبة ثقة وحد OOD معايرين على البيانات المحتجزة. يحدد معدل اتفاق مستهدف (مثل 98%) ويضمن أن حصة جميع الطلبات ذات التسمية المختلفة تبقى تحت الميزانية β = 1 − A*، من خلال التحكم في التغطية c والخلاف e بحيث c·e < β.