HeadlinesBriefing favicon HeadlinesBriefing.com

無限パラメータLLM:ライブデータからの重み

Hacker News •
×

スケーリング則は、言語モデルがより多くのパラメータと訓練データによってより能力が高まると主張する。Mixture-of-Experts(MoE)アーキテクチャはこれらの法則に従い、トークンごとに巨大な保存パラメータバンクのごく一部のみを活性化することで目覚ましい成果を上げてきた。

その成功は静的な事前訓練データに基づいている。展開されたモデルは異なる世界に直面し、それをより有用にするデータの多くは訓練セットにはなく、現在処理しているライブインタラクション、たとえばユーザーが提供する事実や与える修正の中にある。従来のモデルはこのデータから学習できない。訓練後に重みが凍結されているからだ。代わりに、実行時に提供された知識と振る舞いはプロンプトに置かれ、リクエストが終わると破棄される。

私たちは、アーキテクチャがライブインタラクションを重みに書き込むことでそこから学習する方法を問う。MoEに着想を得て、無限パラメータLLMを提案する。コンパクトなハイパーネットワークが実行時データを共有ベースネットワークの低ランク変調に変換するため、フィードフォワード重みは固定バンクに保存されるのではなく、ライブデータから生成される。従来の重み生成器がコンテキストを一度読み取って凍結するのに対し、私たちは生成器の潜在コードに対するベイズ信念を保持し、オンラインで更新する。

保存フットプリントは固定のままだが、モデルがコンパイルできる重みは事実上無限である。実行時知識をプロンプトではなく重みに保持することは計算上償却され、コンテキストウィンドウを解放し、ターンをまたいで持続し、よりよく一般化できる。私たちはこれをインコンテキスト学習と検索に対してテストする評価プロトコルを指定する。

主要エンティティ:人物:Jinli Hu

FAQ:無限パラメータLLMとは何か?

それは、コンパクトなハイパーネットワークがライブ実行時データを共有ベースネットワークの低ランク変調に変換し、固定バンクに保存するのではなくライブデータからフィードフォワード重みを生成する、提案されたアーキテクチャである。

FAQ 質問:無限パラメータLLMとは何か?

FAQ 回答:それは、コンパクトなハイパーネットワークがライブ実行時データを共有ベースネットワークの低ランク変調に変換し、固定バンクに保存するのではなくライブデータからフィードフォワード重みを生成する、提案されたアーキテクチャである。