Septembre 2026. Chaque nombre ici provient des benchmarks, et bash experiments/bench.sh --no-record les réexécute sans clé API. Si vous classifiez du texte avec Jev, chaque réponse est un appel réseau à un fournisseur et revient en environ 300 ms, sous n'importe quelle charge. Pour une boucle d'agent qui décide, agit, et décide à nouveau, 300 ms par étape est tout le budget. Jevstiller se place devant cet appel, apprend un petit modèle local à partir des propres réponses de Jev, et le laisse répondre à ce dont il est sûr en environ 15 ms sur un CPU.
La partie intéressante n'est pas le petit modèle. C'est le contrat : Fixez un nombre, disons 98%. Jevstiller renvoie l'étiquette que Jev aurait renvoyée sur au moins cette part des requêtes. Cet article traite de ce qu'il faut pour rendre cette phrase vraie, pourquoi la manière évidente de choisir un seuil de confiance ne la rend pas vraie, et ce que cela coûte.
Sur cinq tâches publiques, vingt divisions aléatoires entraînement/calibration/test chacune, la règle d'estimation ponctuelle a dépassé le budget de 2% dans 6 à 12 des 20 divisions par tâche, jusqu'à un point de pourcentage complet. Pour Banking77, la règle d'estimation ponctuelle avait une couverture de 79,8% et un désaccord de 1,90%, brisant le budget 9 fois sur 20, tandis que la version avec limite avait une couverture de 74,9% et un désaccord de 1,15%, le brisant 0 fois sur 20.
Le travail du routeur est de répondre autant que possible tout en maintenant c·e sous β. Deux choses sont délibérément absentes : il ne dit rien sur la précision du modèle par rapport à la vérité, et c'est une déclaration sur l'accord sur toutes les requêtes, pas sur la précision du modèle local sur les requêtes qu'il a choisi de répondre.
FAQ : Comment Jevstiller assure-t-il que son modèle local est d'accord avec Jev dans un budget spécifié ?
Jevstiller entraîne un petit modèle local (une tête de régression logistique multinomiale sur des embeddings de phrases gelés) à partir des réponses de Jev, et utilise une politique de routage avec un seuil de confiance et une limite OOD calibrés sur des données réservées. Il fixe un taux d'accord cible (par exemple 98%) et garantit que la part de toutes les requêtes avec une étiquette différente reste sous le budget β = 1 − A*, en contrôlant la couverture c et le désaccord e de sorte que c·e < β.