この記事では、出力をAからEなどの固定された選択肢のセットに制限することで、大規模言語モデル(LLM)を使用して意思決定モデルを構築する方法を説明します。標準的な言語モデルがトークンを順次生成するのに対し、Jevなどの意思決定モデルは固定された選択肢を仮定し、1パスで予測を行います。著者は、Qwen/Qwen3-1.7Bモデルを使用してこの技術を実演し、制約デコードを適用して出力を事前に定義されたトークンに制限します。語彙の他のすべての項目をマスクすることで、モデルは有効なオプションのみを出力でき、最高確率のトークンが回答として選択されます。
このアプローチはCommonsenseQAデータセットでテストされ、ファインチューニングなしで59.38%の精度を達成しました。クイックファインチューニング後、精度は62.41%に向上しました。この記事ではまた、出力トークンの確率が必ずしも正解への真の信頼を反映しないという制限点も指摘しています。特にあいまいな質問ではそうなります。著者は、Hugging Face TransformersとPyTorchを使用した完全なPython実装を提供し、プロンプトのフォーマット方法、モデルのロード方法、各オプションの確率の計算方法を示します。この方法は、LLMを多肢選択型推論タスクに軽量に再利用する方法を提供します。
主要エンティティ: 企業: Hugging Face, Qwen
よくある質問: 制約デコードはLLMの意思決定をどのように改善しますか?
制約デコードは、モデルの出力を事前に定義されたトークンのセット(例えばA–E)に制限し、1パス予測を可能にします。これはJevのような意思決定モデルを模倣し、反復トークン生成の必要性をなくすことで計算オーバーヘッドを削減します。
出典: Hacker News · 要約:HeadlinesBriefing