HeadlinesBriefing favicon HeadlinesBriefing.com

拡散言語モデル

Hacker News •
×

今日、連続データ(画像)用の拡散モデルと離散データ(テキスト)用のオートレグレスイブモデルという、2つの主要な生成AIアルゴリズムファミリーが支配しています。拡散モデルは、粗雑な下書きから始め、複数のラウンドで並列に各位置を順次改良して、1回にすべてのシーケンスを生成します。このアプローチでは、速度と品質のトレードオフ、組み込みエラー補正、双方向コンテキストが可能になります。オートレグレスイブモデルは、トークンを1つずつ、左から右に生成し、トークン数と同じステップ数を取ります。拡散LLMは、全長の下書きから始め、各ステップでシーケンス全体を再書き換えます。2024年までに拡散モデルは品質面でオートレグレスイブモデルと競争できるようになり、2026年には拡散LLMは現実のものとなり、Inception LabsのMercury 2、GoogleのGemma Diffusion、NVIDIAのNemotron Diffusionなどの主要企業のリリースが行われました。拡散モデルの核心概念はデノイジングです:純粋なランダムノイズから始め、各ステップで少しずつノイズを除去して、明確な画像が現れるまでに至るまで、画像を徐々に作り上げます。前方プロセスは、クリーンなトレーニング画像をよりノイズの多い画像に変換します。逆プロセスは、この変換を逆転させるよう学習し、ノイズを画像に戻します。

拡散モデルは、ノイズが徐々に画像に変換される例を学習します。前方プロセスは、クリーンな画像にノイズを1ステップずつ追加し、逆プロセスはこの変換を逆転させるよう学習します。この2段階のアプローチにより、拡散モデルは生成に非常に効果的です。

現代の拡散言語モデルは、これらの基本原理を離散データ(テキスト)に適応したものです。

主要な実体:企業:Inception Labs, Google, NVIDIA