September 2026. Setiap angka di sini berasal dari tolok ukur, dan bash experiments/bench.sh --no-record menjalankannya kembali tanpa kunci API. Jika Anda mengklasifikasikan teks dengan Jev, setiap jawaban adalah panggilan jaringan ke satu vendor dan kembali dalam waktu sekitar 300 ms, pada beban apa pun. Untuk loop agen yang memutuskan, bertindak, dan memutuskan lagi, 300 ms per langkah adalah seluruh anggaran. Jevstiller duduk di depan panggilan itu, mempelajari model lokal kecil dari jawaban Jev sendiri, dan membiarkannya menjawab apa yang yakin dalam waktu sekitar 15 ms di CPU.
Bagian yang menarik bukanlah model kecilnya. Ini adalah kontrak: Tetapkan satu angka, katakanlah 98%. Jevstiller mengembalikan label yang akan dikembalikan Jev pada setidaknya bagian permintaan tersebut. Posting ini tentang apa yang diperlukan untuk membuat kalimat itu benar, mengapa cara yang jelas untuk memilih ambang kepercayaan tidak membuatnya benar, dan berapa biayanya.
Pada lima tugas publik, masing-masing dua puluh pemisahan pelatihan/kalibrasi/tes acak, aturan estimasi titik melampaui anggaran 2% pada 6 hingga 12 dari 20 pemisahan per tugas, hingga satu poin persentase penuh. Untuk Banking77, aturan estimasi titik memiliki cakupan 79,8% dan ketidaksepakatan 1,90%, melanggar anggaran 9 dari 20 kali, sementara versi terikat memiliki cakupan 74,9% dan ketidaksepakatan 1,15%, melanggarnya 0 dari 20 kali.
Tugas router adalah menjawab sebanyak mungkin sambil menjaga c·e di bawah β. Dua hal sengaja tidak ada: tidak mengatakan apa pun tentang akurasi model terhadap kebenaran, dan ini adalah pernyataan tentang kesepakatan atas semua permintaan, bukan tentang akurasi model lokal pada permintaan yang dipilih untuk dijawab.