HeadlinesBriefing HeadlinesBriefing.com

Dust : Pré-entraînement des Transformers Sans Rétropropagation

Hacker News •
×

Octobre 2026 Correspondance à s@qlabs.sh·Code·TL;DR Nous présentons la première méthode d'ordre zéro qui soit compétitive avec la rétropropagation pour le pré-entraînement de modèles de langage Transformer. Dust perturbe les activations (perturbation de nœud) indépendamment à chaque token, de sorte que chaque token est un membre virtuel de la population et qu'une seule passe avant les évalue tous en parallèle. Dust s'approche étroitement de la rétropropagation pour une grande population (c'est-à-dire significativement plus de calcul) et dans plusieurs configurations la dépasse même. Cela suggère que dans un régime riche en calcul, nous pourrions surpasser la rétropropagation. Dust est des ordres de grandeur plus efficace que l'ES dans l'espace des poids. À partir de 1M tokens, Dust est de l'ordre de $10^3$ à $10^4$ fois plus efficace qu'une implémentation Transformer d'EGGROLL, une méthode ES de pointe, selon nos extrapolations.

On croit largement que les méthodes d'ordre zéro ne passent pas à l'échelle sur les grands réseaux. De manière frappante, nous constatons que les grands modèles sont plus efficaces en population, pas moins : un modèle de 243M paramètres surpasse un modèle 120 fois plus petit pour la plupart des tailles de population. Les estimations de gradient de Dust s'alignent mieux avec celles de la rétropropagation à mesure que la population croît, et restent bien alignées à chaque échelle que nous testons, jusqu'à 1B tokens, ce qui est encourageant pour le passage à l'échelle.

L'apprentissage profond a été construit autour de la rétropropagation, le seul algorithme d'attribution de crédit capable d'entraîner les réseaux de neurones modernes. Cependant, à mesure que le calcul augmente, nous pourrions préférer des algorithmes plus génériques. La leçon amère (Sutton, 2019) est que les méthodes générales qui passent à l'échelle avec le calcul finissent par gagner. De même, la différentiabilité pourrait être un bon biais inductif dans le régime de faible calcul, mais dans le régime de calcul élevé, elle limite l'espace des architectures. Un algorithme d'attribution de crédit plus flexible basé sur la recherche est probablement une étape importante vers une bien meilleure généralisation. Nous l'appelons Dust, un algorithme d'optimisation d'ordre zéro qui perturbe les activations.

Source: Hacker News · Résumé par HeadlinesBriefing