HeadlinesBriefing favicon HeadlinesBriefing.com

Jevstiller: destilar Jev modelo local limite discordância

Hacker News •
×

Setembro de 2026. Cada número aqui vem dos benchmarks, e bash experiments/bench.sh --no-record os reexecuta sem uma chave de API. Se você classificar texto com Jev, cada resposta é uma chamada de rede para um fornecedor e retorna em cerca de 300 ms, sob qualquer carga. Para um loop de agente que decide, age e decide novamente, 300 ms por etapa é todo o orçamento. Jevstiller fica na frente dessa chamada, aprende um pequeno modelo local a partir das próprias respostas de Jev, e deixa-o responder o que tem certeza em cerca de 15 ms em uma CPU.

A parte interessante não é o modelo pequeno. É o contrato: Defina um número, digamos 98%. Jevstiller retorna o rótulo que Jev teria retornado em pelo menos essa parcela de solicitações. Este post é sobre o que é necessário para tornar essa frase verdadeira, por que a maneira óbvia de escolher um limite de confiança não a torna verdadeira, e quanto custa.

Em cinco tarefas públicas, vinte divisões aleatórias de treinamento/calibração/teste cada, a regra de estimativa pontual excedeu o orçamento de 2% em 6 a 12 das 20 divisões por tarefa, em até um ponto percentual inteiro. Para Banking77, a regra de estimativa pontual teve cobertura de 79,8% e discordância de 1,90%, quebrando o orçamento 9 vezes em 20, enquanto a versão com limite teve cobertura de 74,9% e discordância de 1,15%, quebrando 0 vezes em 20.

O trabalho do roteador é responder o máximo possível enquanto mantém c·e abaixo de β. Duas coisas estão deliberadamente ausentes: não diz nada sobre a precisão do modelo contra a verdade, e é uma declaração sobre concordância em todas as solicitações, não sobre a precisão do modelo local nas solicitações que escolheu responder.