HeadlinesBriefing favicon HeadlinesBriefing.com

置換対称性がニューラルネットワーク平均化を壊す

Towards Data Science •
×

同じデータで同じアーキテクチャを2回トレーニングし、ランダムシードだけを変えてニューラルネットワークの重み平均を試したことがあるなら、おそらく2つの結果は基本的に交換可能だと思っていたでしょう。両方の実行は収束します。両方とも同じ損失に達します。そこで2つの重みベクトルを平均し、少なくともどちらか単独と同じくらい良いものを期待します。平均は悪化します。しばしばはるかに悪化します。トレーニングプロセス中に問題はありませんでした。これはニューラルネットワークの構造的特徴であり、置換対称性として知られる特性から直接導き出すことができます。

同じ原理は、モデルマージが成功するときと失敗するときの理由も説明します。これは2026年において、モデルスープやフェデレーテッドアベレージングを扱うかどうかにかかわらず、実用的なLLMエンジニアリングの中心にある問題です。2つのトレーニング済みネットワークを、同じレポートを説明する2つのスプレッドシートと考えてください。ただし、列の順序が異なります。モデルAの「列3」には、モデルBが「列7」と呼ぶものが含まれているかもしれません。両方のスプレッドシートは正しいです。しかし、最初に列を整列せずにセルごとに平均すると、収益と従業員数を平均していることになります。

ニューラルネットワークの入門書のほとんどは関数空間に留まります。この記事はパラメータ空間に留まります:良い解の集合が実際にどのように見えるか、そしてその幾何学があなたに何をもたらすか。多項式回帰のような古典的なモデルは、固定基底関数と凸損失を持ちます。ニューラルネットワークは基底関数自体を学習し、損失を非凸にします。この非凸性は適応性の代償です。基底を固定すれば凸性が得られます。基底を学習すれば凸性を失います。第三の選択肢はありません。