September 2026. Jede Zahl hier stammt aus den Benchmarks, und bash experiments/bench.sh --no-record führt sie ohne API-Schlüssel erneut aus. Wenn Sie Text mit Jev klassifizieren, ist jede Antwort ein Netzwerkaufruf an einen Anbieter und kommt bei jeder Last in etwa 300 ms zurück. Für eine Agentenschleife, die entscheidet, handelt und wieder entscheidet, sind 300 ms pro Schritt das gesamte Budget. Jevstiller sitzt vor diesem Aufruf, lernt ein kleines lokales Modell aus Jevs eigenen Antworten und lässt es das, worüber es sicher ist, in etwa 15 ms auf einer CPU beantworten.
Der interessante Teil ist nicht das kleine Modell. Es ist der Vertrag: Setzen Sie eine Zahl, sagen wir 98%. Jevstiller gibt das Label zurück, das Jev bei mindestens diesem Anteil der Anfragen zurückgegeben hätte. Dieser Beitrag handelt davon, was nötig ist, um diesen Satz wahr zu machen, warum der offensichtliche Weg, einen Konfidenzschwellenwert zu wählen, ihn nicht wahr macht, und was es kostet.
Bei fünf öffentlichen Aufgaben, jeweils zwanzig zufällige Trainings-/Kalibrierungs-/Testaufteilungen, überschritt die Punktschätzregel das Budget von 2% in 6 bis 12 der 20 Aufteilungen pro Aufgabe, um bis zu einem ganzen Prozentpunkt. Für Banking77 hatte die Punktschätzregel eine Abdeckung von 79,8% und eine Abweichung von 1,90%, wobei sie das Budget 9 von 20 Mal überschritt, während die Version mit Grenze eine Abdeckung von 74,9% und eine Abweichung von 1,15% hatte, wobei sie es 0 von 20 Mal überschritt.
Die Aufgabe des Routers ist es, so viel wie möglich zu antworten, während c·e unter β gehalten wird. Zwei Dinge fehlen bewusst: Es sagt nichts über die Genauigkeit des Modells gegenüber der Wahrheit aus, und es ist eine Aussage über die Übereinstimmung über alle Anfragen hinweg, nicht über die Genauigkeit des lokalen Modells bei den Anfragen, die es zu beantworten wählte.