Oktober 2026 Korrespondenz an s@qlabs.sh·Code·TL;DR Wir stellen die erste Methode nullter Ordnung vor, die mit Rückpropagation beim Vortraining von Transformer-Sprachmodellen konkurriert. Dust stört Aktivierungen (Knotenstörung) unabhängig an jedem Token, sodass jedes Token ein virtuelles Populationsmitglied ist und ein Vorwärtsdurchlauf sie alle parallel bewertet. Dust nähert sich der Rückpropagation bei großer Population (d.h. erheblich mehr Rechenleistung) eng an und übertrifft sie in mehreren Einstellungen sogar. Dies deutet darauf hin, dass wir in einem rechenreichen Regime die Rückpropagation übertreffen könnten. Dust ist um Größenordnungen effizienter als Gewichtsraum-ES. Ab 1M Token ist Dust basierend auf unseren Extrapolationen um den Faktor $10^3$ bis $10^4$ effizienter als eine Transformer-Implementierung von EGGROLL, einer hochmodernen ES-Methode.
Methoden nullter Ordnung gelten allgemein als nicht skalierbar auf große Netzwerke. Auffallend ist, dass wir feststellen, dass größere Modelle populationseffizienter sind, nicht weniger: Ein 243M-Parametermodell übertrifft ein 120-mal kleineres Modell bei den meisten Populationsgrößen. Die Gradientenschätzungen von Dust stimmen mit denen der Rückpropagation besser überein, wenn die Population wächst, und bleiben bei jeder von uns getesteten Skala bis zu 1B Token gut ausgerichtet, was für die Skalierung ermutigend ist.
Deep Learning wurde um die Rückpropagation herum aufgebaut, den einzigen Kreditzuweisungsalgorithmus, der moderne neuronale Netze trainieren kann. Mit zunehmender Rechenleistung könnten wir jedoch allgemeinere Algorithmen bevorzugen. Die bittere Lektion (Sutton, 2019) besagt, dass allgemeine Methoden, die mit der Rechenleistung skalieren, letztendlich gewinnen. Ähnlich könnte Differenzierbarkeit eine gute induktive Verzerrung im rechenarmen Regime sein, aber im rechenreichen Regime schränkt sie den Architekturraum ein. Ein flexiblerer, auf Suche basierender Kreditzuweisungsalgorithmus ist wahrscheinlich ein wichtiger Schritt zu einer viel besseren Generalisierung. Wir nennen ihn Dust, einen Optimierungsalgorithmus nullter Ordnung, der Aktivierungen stört.
Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing