HeadlinesBriefing favicon HeadlinesBriefing.com

Winziges Netzwerk komprimiert Daten, zieht Pentagon an

Towards Data Science •
×

Ich hatte nicht erwartet, dass Geometrie auftauchen würde. Ich reproduzierte einen kleinen Teil des Interpretierbarkeitspapiers von Anthropic aus dem Jahr 2022, "Toy Models of Superposition" [1], hauptsächlich weil die zentrale Behauptung so unplausibel klang, dass ich sie selbst überprüfen wollte, anstatt sie blind zu glauben. Die Behauptung: Ein neuronales Netz kann mehr Merkmale darstellen, als es Dimensionen zur Verfügung hat, indem es sie in Winkeln zueinander packt und ein wenig Interferenz toleriert.

Bitten Sie es, unter den richtigen Bedingungen fünf Dinge in zwei Dimensionen zu komprimieren, und es wählt nicht zwei Gewinner aus und gibt den Rest auf. Es ordnet alle fünf zu einem perfekten Fünfeck an. Ich hatte weder PyTorch noch eine Autograd-Bibliothek zur Verfügung, noch Internetzugang, um eine zu installieren, also ist alles unten reines NumPy, und ich habe den Rückwärtsdurchlauf von Hand abgeleitet.

Das erwies sich als die richtige Art von nervig. Das Ableiten der Gradienten selbst zwingt einen, tatsächlich zu verstehen, was das Modell mit den Daten macht, anstatt einem .backward()-Aufruf zu vertrauen, über den man nie nachdenken musste. Wenn Sie einen mathematischen Hintergrund haben und noch nie Backprop durch ein winziges Netzwerk von Hand abgeleitet haben, empfehle ich es aufrichtig als Übung.

Es sind zehn Minuten Kettenregel, die alles Nachfolgende zum Klicken bringen. Alle Daten in diesem Beitrag sind synthetisch. Ich generiere sie selbst im Code, es ist kein externer Datensatz beteiligt, was auch das ursprüngliche Papier so macht.

Alle Bilder, sofern nicht anders angegeben, stammen vom Autor. Das Problem, das dies zu erklären versucht: Hier ist das motivierende Rätsel, und es ist real in der Interpretierbarkeitsforschung. Wenn Sie in ein trainiertes neuronales Netz schauen und hoffen, einzelne Neuronen zu finden, die einzelne Konzepte sauber repräsentieren, ein Neuron für "ist das ein Hund", eines für "ist das rot", finden Sie das meistens nicht.

Stattdessen finden Sie Neuronen, die auf mehrere unzusammenhängende Dinge gleichzeitig zu reagieren scheinen, ein Neuron, das sowohl für Katzengesichter als auch für Autofronten feuert, sagen wir. Dies wird Polysemantik genannt und macht Interpretierbarkeit viel schwieriger, weil man nicht einfach ablesen kann, was ein Netz "glaubt", indem man einzelne Einheiten inspiziert. Der Vorschlag des Papiers ist, dass Polysemantik kein Rauschen oder Versagen ist.

Es ist eine echte Strategie, die das Netz absichtlich verwendet, weil es mehr Konzepte zu repräsentieren hat als Neuronen, um sie zu repräsentieren, und die meisten dieser Konzepte selten gleichzeitig aktiv sind. Wenn zwei Merkmale fast nie gleichzeitig "an" sind, kann sich das Netz leisten, sie eine Richtung im Aktivierungsraum teilen zu lassen, da die Interferenz nur in den seltenen Fällen kostet, in denen beide zusammen feuern. Diese Packstrategie ist das, was das Papier Superposition nennt, und sein Spielzeugmodell ist so konzipiert, dass es die einfachste mögliche Umgebung ist, in der man es geschehen sehen und tatsächlich messen kann.

Das Modell und die Mathematik, die ich lösen musste, um es zu trainieren: Das Setup ist absichtlich klein. Sie haben n synthetische Merkmale, jedes eine Zahl zwischen 0 und 1, die die meiste Zeit Null ist (das ist die Sparsity) und den Rest der Zeit ungleich Null. Sie komprimieren sie durch einen Engpass von m verborgenen Dimensionen, wobei m kleiner als n ist, und versuchen dann, die ursprünglichen Merkmale auf dem Weg nach draußen durch eine ReLU zu rekonstruieren.

Konkret mit einer einzelnen Gewichtsmatrix W der Form (m, n), die sowohl für die Kompression als auch für die Rekonstruktion verwendet wird: h=W⋅x, x̂=ReLU(W⊤⋅h+b). Das Training minimiert einen gewichteten quadratischen Fehler zwischen x und x̂, wobei jedes Merkmal i ein Wichtigkeitsgewicht Ii erhält, sodass dem Netz mitgeteilt wird, dass einige Merkmale wichtiger sind, richtig zu sein als andere: L=∑i Ii⋅(xi−x̂i)²\m...