HeadlinesBriefing favicon HeadlinesBriefing.com

Jevのキャリブレーション主張が議論される

Hacker News •
×

Type Safeの最初のSystem One ModelであるJevは、訓練データなしで分類タスクに対してキャリブレーションされた確率を約束する。記事は、Jevは有用なスコアを生成できるものの、そのキャリブレーションの主張には欠陥があると主張している。キャリブレーションはモデルとデータ分布の両方に依存する。あるデータセットでキャリブレーションされたモデルは、別のデータセットではキャリブレーションがずれる可能性がある。著者はコイン投げの例を強調し、Jevが表の確率を0.92と予測し、深刻なキャリブレーションのずれを示している。著者はJevの出力を信頼できる確率ではなくランキングスコアとして扱うことを推奨し、正確な確率が必要な場合は数百のラベル付き例を使用した安価な再キャリブレーションを提案している。記事は、Jevの価値はデータなしで分類できる能力にあるが、数値のしきい値やコスト計算に依存する前に、ユーザーは自分のデータでキャリブレーションを検証する必要があることを強調している。