HeadlinesBriefing favicon HeadlinesBriefing.com

Retrieve-for-Train:AI検索のスピードブースト

Google AI Blog •
×

現代の検索アプリは、1つのマッチのバリエーションではなく、一貫性のある結果セットを返す必要があります。「キャンプ用品」の場合、ユーザーはテント、寝袋、ストーブ、ヘッドランプを求めています。システムはクエリファンアウトを使用して、広範なプロンプトをサブクエリに分割します。しかし、LLMにデータベースを意識したクエリ分解を教えることは、膨大な思考予算を消費します。ゼロショットLLMは汎用テキスト予測器であり、対象コーパスに最適化されていないため、多様性やカバレッジといったセットレベルの特性を最適化しながらグラウンディングを保つには、拡張されたテスト時計算が必要です。

ICML 2026論文「Efficient, Property-Aligned Fan-Out Retrieval via RL-Compiled Diffusion」では、報酬からデータへのコンパイルフレームワークを通じてこの問題に対処しています。大規模な推論思考予算の代わりに、私たちのRetrieve-for-Trainフレームワークはオフライン強化学習を用いて報酬に沿ったファンアウトを発見し、それらを教師信号にコンパイルします。これらの振る舞いを軽量な拡散レトリーバーに蒸留することで、推論時に効率的な単一パスクエリファンアウトを可能にします。

既製のLLMは2つの課題に直面しています。1つは言い換え崩壊で、「ボヘミアンフェスティバルファッション」や「ボヘミアンフェスティバル服」といった冗長なクエリを生成し、フリンジジャケットやかぎ針編みのドレスを出しません。もう1つは自己回帰のレイテンシボトルネックで、数百の思考連鎖トークンを必要とします。これはサブ秒検索と相反するレイテンシの下限を生み出します。Retrieve-for-Trainはトレーニングをオフラインの練習セッションとして扱います。

主要エンティティ:企業:Google AI Blog

FAQ:Retrieve-for-Trainフレームワークとは何ですか?

Retrieve-for-Trainは、オフライン強化学習を用いて報酬に沿ったファンアウトを発見し、それらを教師信号にコンパイルし、その後、軽量な拡散レトリーバーに蒸留して推論時に効率的な単一パスクエリファンアウトを実現する、報酬からデータへのコンパイルフレームワークです。

FAQ Q:Retrieve-for-Trainフレームワークとは何ですか?

FAQ A:Retrieve-for-Trainは、オフライン強化学習を用いて報酬に沿ったファンアウトを発見し、それらを教師信号にコンパイルし、その後、軽量な拡散レトリーバーに蒸留して推論時に効率的な単一パスクエリファンアウトを実現する、報酬からデータへのコンパイルフレームワークです。