HeadlinesBriefing favicon HeadlinesBriefing.com

Diffusion Controller:AI画像生成

Google AI Blog •
×

Nano Banana、Stable Diffusion、Fluxなどのテキストから画像へのAIモデルの急速な進歩はクリエイティブデザインを変革しましたが、正確なユーザーの意図を満たすようにこれらのモデルを導くことは依然としてバランスを取る行為です。例えば、「サングラスをかけたトカゲ」というプロンプトは、サングラスなしの現実的なトカゲを生成するかもしれません。または、強制するとトカゲの顔が歪むかもしれません。既存の方法論は断片的です:開発者は、分類器なしガイダンスなどの推論時技術、またはLoRAなどのパラメータ効率的アダプター、報酬加重回帰、ポリシー勾配を用いた重いファインチューニングを使用します。これらのツールは別々の修正として扱われるため、この分野には制御のための統一された数学的言語が欠けています。

Diffusion Controllerフレームワークは、ノイズ除去プロセスを滑らかな制御問題として再構成することでこれを解決します。その軽量なアドオンネットワークは、人間の好みに一致する点で業界標準を上回り、完全にロック解除されたバージョンはベースラインに対して90%の勝率を達成しました。このフレームワークは、生成を制御された旅として扱い、ベースモデルは凍結され、ステアリングダンパーが軌道を調整します。

このアプローチはモデルの動作を動的に再調整し、画像品質を維持しながらユーザー定義の目標により重みを与えます。トカゲの例では、ダンパーがサングラスが含まれることを保証しますが、ペナルティガードレールが歪みを防ぎます。このフレームワークは、最終報酬スコアに基づく2つのファインチューニング方法(ポリシー勾配とPPOを含む)で理論と実践を橋渡しし、組み込みのクリッピングルールでモデルを反復的に導きます。