HeadlinesBriefing favicon HeadlinesBriefing.com

Jevstiller: destilar Jev modelo local límite desacuerdo

Hacker News •
×

Septiembre de 2026. Cada número aquí proviene de los benchmarks, y bash experiments/bench.sh --no-record los vuelve a ejecutar sin una clave API. Si clasificas texto con Jev, cada respuesta es una llamada de red a un proveedor y regresa en unos 300 ms, bajo cualquier carga. Para un bucle de agente que decide, actúa y decide de nuevo, 300 ms por paso es todo el presupuesto. Jevstiller se sitúa frente a esa llamada, aprende un pequeño modelo local a partir de las propias respuestas de Jev, y deja que responda lo que está seguro en unos 15 ms en una CPU.

La parte interesante no es el modelo pequeño. Es el contrato: Establece un número, digamos 98%. Jevstiller devuelve la etiqueta que Jev habría devuelto en al menos esa proporción de solicitudes. Este artículo trata sobre lo que se necesita para hacer verdadera esa frase, por qué la forma obvia de elegir un umbral de confianza no la hace verdadera, y cuánto cuesta.

En cinco tareas públicas, veinte divisiones aleatorias de entrenamiento/calibración/prueba cada una, la regla de estimación puntual superó el presupuesto del 2% en 6 a 12 de 20 divisiones por tarea, hasta en un punto porcentual completo. Para Banking77, la regla de estimación puntual tuvo una cobertura del 79.8% y un desacuerdo del 1.90%, rompiendo el presupuesto 9 de 20 veces, mientras que la versión con límite tuvo una cobertura del 74.9% y un desacuerdo del 1.15%, rompiéndolo 0 de 20 veces.

El trabajo del enrutador es responder tanto como pueda mientras mantiene c·e por debajo de β. Dos cosas están deliberadamente ausentes: no dice nada sobre la precisión del modelo contra la verdad, y es una declaración sobre el acuerdo sobre todas las solicitudes, no sobre la precisión del modelo local en las solicitudes que eligió responder.