2026年10月 s@qlabs.sh への書簡·コード·TL;DR 我々は、Transformer言語モデルの事前学習においてバックプロップと競合する最初のゼロ次法を提示します。Dustは各トークンで独立に活性化を摂動(ノード摂動)するため、各トークンは仮想的な集団メンバーとなり、1回の順伝搬でそれらすべてを並列に評価します。Dustは大集団(すなわち実質的に多くの計算)においてバックプロップを密に近似し、複数の設定ではそれを上回ることさえあります。これは、計算豊富な体制においてバックプロップを凌駕できる可能性を示唆しています。Dustは重み空間ESよりも桁違いに効率的です。1Mトークン以上では、我々の外挿に基づき、Dustは最先端のES手法であるEGGROLLのTransformer実装よりも$10^3$から$10^4$倍効率的です。
ゼロ次法は大規模ネットワークにスケールしないと広く信じられています。驚くべきことに、より大きなモデルの方が集団効率が高く、低くはないことがわかります:243Mパラメータのモデルは、ほとんどの集団サイズにおいて120倍小さいモデルを上回ります。集団が成長するにつれてDustの勾配推定はバックプロップのものとより良く一致し、我々がテストするすべてのスケール(最大1Bトークン)で良好な一致を維持します。これはスケーリングにとって励みになります。
深層学習はバックプロパゲーションを中心に構築されてきました。バックプロパゲーションは、現代のニューラルネットを訓練できる唯一のクレジット割り当てアルゴリズムです。しかし、計算量が増加するにつれて、より汎用的なアルゴリズムを好むかもしれません。苦い教訓(Sutton、2019)は、計算量とともにスケールする汎用的な方法が最終的に勝利するということです。同様に、微分可能性は低計算体制では良い帰納的バイアスかもしれませんが、高計算体制ではアーキテクチャ空間を制限します。探索に基づくより柔軟なクレジット割り当てアルゴリズムは、はるかに優れた汎化への重要なステップとなるでしょう。我々はそれをDustと呼びます。活性化を摂動するゼロ次最適化アルゴリズムです。
出典: Hacker News · 要約:HeadlinesBriefing