HeadlinesBriefing favicon HeadlinesBriefing.com

Jevstiller: дистилляция Jev локальная модель граница разногласий

Hacker News •
×

Сентябрь 2026. Каждое число здесь взято из бенчмарков, и bash experiments/bench.sh --no-record запускает их повторно без ключа API. Если вы классифицируете текст с помощью Jev, каждый ответ — это сетевой вызов одному поставщику, который возвращается примерно за 300 мс при любой нагрузке. Для цикла агента, который принимает решения, действует и снова принимает решения, 300 мс на шаг — это весь бюджет. Jevstiller находится перед этим вызовом, обучает небольшую локальную модель на основе собственных ответов Jev и позволяет ей отвечать на то, в чем она уверена, примерно за 15 мс на CPU.

Интересная часть — не маленькая модель. Это контракт: установите одно число, скажем, 98%. Jevstiller возвращает метку, которую Jev вернул бы по крайней мере на такой доле запросов. Этот пост о том, что нужно, чтобы сделать это утверждение истинным, почему очевидный способ выбора порога уверенности не делает его истинным, и какова цена.

На пяти публичных задачах, по двадцать случайных разбиений на обучение/калибровку/тест в каждой, правило точечной оценки превысило бюджет в 2% в 6–12 из 20 разбиений на задачу, вплоть до целого процентного пункта. Для Banking77 правило точечной оценки имело покрытие 79,8% и разногласие 1,90%, нарушая бюджет 9 раз из 20, в то время как версия с границей имела покрытие 74,9% и разногласие 1,15%, нарушая его 0 раз из 20.

Задача маршрутизатора — отвечать как можно больше, удерживая c·e ниже β. Две вещи намеренно отсутствуют: он ничего не говорит о точности модели относительно истины, и это утверждение о согласии по всем запросам, а не о точности локальной модели на запросах, которые она решила ответить.