HeadlinesBriefing favicon HeadlinesBriefing.com

Jevstiller:Jev蒸留ローカルモデル不一致限界

Hacker News •
×

2026年9月。ここにあるすべての数字はベンチマークからのものであり、bash experiments/bench.sh --no-record はAPIキーなしでそれらを再実行します。Jevでテキストを分類する場合、各回答は1つのベンダーへのネットワークコールであり、どの負荷でも約300ミリ秒で返ってきます。決定、行動、再決定を行うエージェントループでは、1ステップあたり300ミリ秒が予算全体です。Jevstillerはそのコールの前に位置し、Jev自身の回答から小さなローカルモデルを学習し、CPU上で約15ミリ秒で確信のある回答を返します。

興味深い部分は小さなモデルではありません。契約です:1つの数値を設定します。たとえば98%。Jevstillerは、少なくともその割合のリクエストでJevが返したであろうラベルを返します。この投稿は、その文を真にするために何が必要か、信頼度しきい値を選ぶ明白な方法がなぜそれを真にしないのか、そしてそのコストについてです。

5つの公開タスクで、それぞれ20のランダムなトレーニング/キャリブレーション/テスト分割において、点推定ルールはタスクごとに20分割中6~12で2%の予算を超え、最大で1パーセントポイント超えました。Banking77では、点推定ルールのカバレッジは79.8%、不一致は1.90%で、20回中9回予算を破りましたが、限界付きバージョンはカバレッジ74.9%、不一致1.15%で、20回中0回破りました。

ルーターの仕事は、c·eをβ未満に保ちながら、できるだけ多く回答することです。2つのことが意図的に欠けています:真実に対するモデルの精度については何も述べておらず、これはすべてのリクエストに対する一致に関する声明であり、ローカルモデルが回答を選択したリクエストに対する精度ではありません。

FAQ:Jevstillerは、指定された予算内でローカルモデルがJevと一致することをどのように保証しますか?

Jevstillerは、Jevの回答から小さなローカルモデル(凍結された文埋め込み上の多項ロジスティック回帰ヘッド)をトレーニングし、保持データでキャリブレーションされた信頼度しきい値とOODカットオフを使用したルーティングポリシーを使用します。目標一致率(例:98%)を設定し、カバレッジcと不一致eを制御してc·e < βとすることで、異なるラベルを持つすべてのリクエストの割合が予算β = 1 − A*未満に保たれるようにします。