HeadlinesBriefing favicon HeadlinesBriefing.com

Jevstiller:Jev蒸馏本地模型分歧界限

Hacker News •
×

2026年9月。这里的每个数字都来自基准测试,bash experiments/bench.sh --no-record 无需API密钥即可重新运行。如果你用Jev对文本进行分类,每个答案都是对一个供应商的网络调用,在任何负载下大约需要300毫秒。对于决定、行动、再决定的代理循环,300毫秒每步就是整个预算。Jevstiller位于该调用之前,从Jev自己的答案中学习一个小的本地模型,并在CPU上大约15毫秒内回答它确信的内容。

有趣的部分不是小模型。而是契约:设置一个数字,比如98%。Jevstiller返回Jev在至少该比例请求中会返回的标签。这篇文章探讨了使这句话成立需要什么,为什么选择置信度阈值的明显方法不能使其成立,以及其代价。

在五个公开任务上,每个任务有20个随机训练/校准/测试分割,点估计规则在6到12个分割中超出了2%的预算,最多超出整整一个百分点。对于Banking77,点估计规则覆盖率为79.8%,分歧为1.90%,20次中有9次打破预算,而带界限的版本覆盖率为74.9%,分歧为1.15%,20次中0次打破预算。

路由器的工作是在保持c·e低于β的情况下尽可能多地回答。有两件事被刻意忽略:它没有说明模型相对于真实情况的准确性,并且它是关于所有请求一致性的陈述,而不是关于本地模型在其选择回答的请求上的准确性。

FAQ:Jevstiller如何确保其本地模型在指定预算内与Jev一致?

Jevstiller从Jev的答案中训练一个小型本地模型(在冻结的句子嵌入上的多项逻辑回归头),并使用基于保留数据校准的置信度阈值和OOD截断的路由策略。它设定一个目标一致率(例如98%),并通过控制覆盖率c和分歧e使得c·e < β,确保所有请求中标签不同的比例保持在预算β = 1 − A*之下。