HeadlinesBriefing favicon HeadlinesBriefing.com

小さなネットワークがデータを圧縮、ペンタゴンを惹きつける

Towards Data Science •
×

幾何学が現れるとは思っていませんでした。私はAnthropicの2022年の解釈可能性に関する論文「Toy Models of Superposition」[1]の小さな部分を再現していました。主に、中心的な主張が信じがたいほどに思えたので、それを盲信するのではなく自分で確認したかったからです。その主張とは、ニューラルネットワークは、特徴を互いに角度をつけて詰め込み、少しの干渉を許容することで、作業に使える次元よりも多くの特徴を表現できるというものです。適切な条件下で5つのものを2次元に圧縮するよう求めると、2つの勝者を選んで残りを諦めることはありません。5つすべてを完璧な五角形に配置します。PyTorchやオートグラッドライブラリは利用できず、インストールするためのインターネットアクセスもなかったので、以下はすべてプレーンなNumPyで、逆伝播を手で導出しました。それは正しい種類の厄介さであることが判明しました。自分で勾配を導出することで、モデルがデータに何をしているのかを実際に理解することを強いられます。考えたこともない.backward()呼び出しを信頼するのではなく。数学のバックグラウンドがあり、小さなネットワークでも手でバックプロップを導出したことがないなら、本当に演習としてお勧めします。10分の連鎖律で、その後のすべてが理解できるようになります。この投稿のすべてのデータは合成です。コードで自分で生成しており、外部データセットは関与していません。これは元の論文も同じ方法です。特に断りのない限り、すべての画像は著者によるものです。これが説明しようとしている問題:ここに動機付けとなるパズルがあります。これは解釈可能性研究において現実のものです。訓練されたニューラルネットワークの中を覗いて、個々の概念をきれいに表現する個々のニューロンを見つけたいと期待すると、「これは犬か」のためのニューロン、「これは赤か」のためのニューロン、そういうものはほとんど見つかりません。代わりに、一度にいくつかの無関係なものに反応するように見えるニューロンが見つかります。たとえば、猫の顔と車の前端の両方に発火するニューロンです。これは多義性と呼ばれ、解釈可能性をはるかに困難にします。個々のユニットを検査するだけでネットワークが「何を信じているか」を読み取ることができないからです。論文の提案は、多義性はノイズや失敗ではないということです。それはネットワークが意図的に使用する実際の戦略であり、表現すべき概念がニューロンよりも多く、それらの概念のほとんどが同時にアクティブになることはめったにないからです。2つの特徴がほぼ同時に「オン」になることがない場合、ネットワークはそれらが活性化空間で方向を共有することを許容できます。干渉は、両方が一緒に発火するまれな機会にのみコストがかかるからです。このパッキング戦略が、論文が重ね合わせと呼ぶものであり、そのトイモデルは、それが起こるのを見て実際に測定できる最も単純な設定になるように設計されています。モデル、そしてそれを訓練するために私が解決しなければならなかった数学:設定は意図的に小さいです。n個の合成特徴があり、それぞれ0から1の間の数値で、ほとんどの場合ゼロ(それがスパース性)で、残りの時間は非ゼロです。m個の隠れ次元のボトルネックを通してそれらを圧縮します。ここでmはnより小さく、その後ReLUを通して外に出るときに元の特徴を再構築しようとします。具体的には、圧縮と再構築の両方に使用される形状(m, n)の単一の重み行列Wを使用します:h=W⋅x、x̂=ReLU(W⊤⋅h+b)。トレーニングはxとx̂の間の重み付き二乗誤差を最小化し、各特徴iは重要度の重みIiを取得するため、ネットワークは一部の特徴が他よりも正しく取得することが重要であると指示されます:L=∑i Ii⋅(xi−x̂i)²\m...