Octubre 2026 Correspondencia a s@qlabs.sh·Código·TL;DR Presentamos el primer método de orden cero que es competitivo con retropropagación en el preentrenamiento de modelos de lenguaje Transformer. Dust perturba activaciones (perturbación de nodo) independientemente en cada token, por lo que cada token es un miembro virtual de la población y una pasada hacia adelante los evalúa a todos en paralelo. Dust se aproxima estrechamente a retropropagación en poblaciones grandes (es decir, sustancialmente más cómputo) y en múltiples configuraciones incluso la supera. Esto sugiere que en un régimen rico en cómputo podríamos superar retropropagación. Dust es órdenes de magnitud más eficiente que ES en el espacio de pesos. Desde 1M tokens, Dust es del orden de $10^3$ a $10^4$ veces más eficiente que una implementación Transformer de EGGROLL, un método ES de última generación, basado en nuestras extrapolaciones.
Se cree ampliamente que los métodos de orden cero no escalan a redes grandes. Sorprendentemente, encontramos que los modelos más grandes son más eficientes en población, no menos: un modelo de 243M parámetros supera a un modelo 120 veces más pequeño en la mayoría de los tamaños de población. Las estimaciones de gradiente de Dust se alinean mejor con las de retropropagación a medida que la población crece, y se mantienen bien alineadas en cada escala que probamos, hasta 1B tokens, lo cual es alentador para el escalado.
El aprendizaje profundo se ha construido alrededor de retropropagación, el único algoritmo de asignación de crédito capaz de entrenar redes neuronales modernas. Sin embargo, a medida que aumenta el cómputo, podríamos preferir algoritmos más genéricos. La lección amarga (Sutton, 2019) es que los métodos generales que escalan con el cómputo eventualmente ganan. Similarmente, la diferenciabilidad podría ser un buen sesgo inductivo en el régimen de bajo cómputo, pero en el régimen de alto cómputo limita el espacio de arquitecturas. Un algoritmo de asignación de crédito más flexible basado en búsqueda es probablemente un paso importante hacia una mejor generalización. Lo llamamos Dust, un algoritmo de optimización de orden cero que perturba activaciones.
Fuente: Hacker News · Resumido por HeadlinesBriefing