Outubro de 2026 Correspondência para s@qlabs.sh·Código·TL;DR Apresentamos o primeiro método de ordem zero que é competitivo com a retropropagação no pré-treinamento de modelos de linguagem Transformer. Dust perturba ativações (perturbação de nó) independentemente em cada token, então cada token é um membro virtual da população e uma passagem direta os avalia a todos em paralelo. Dust aproxima-se da retropropagação em grande população (ou seja, substancialmente mais computação) e em múltiplas configurações até a supera. Isso sugere que em um regime rico em computação podemos superar a retropropagação. Dust é ordens de magnitude mais eficiente que ES no espaço de pesos. A partir de 1M tokens, Dust é da ordem de $10^3$ a $10^4$ vezes mais eficiente que uma implementação Transformer de EGGROLL, um método ES de última geração, com base em nossas extrapolações.
Métodos de ordem zero são amplamente considerados como não escaláveis para redes grandes. Surpreendentemente, descobrimos que modelos maiores são mais eficientes em população, não menos: um modelo de 243M parâmetros supera um modelo 120 vezes menor na maioria dos tamanhos de população. As estimativas de gradiente do Dust alinham-se melhor com as da retropropagação à medida que a população cresce, e permanecem bem alinhadas em todas as escalas que testamos, até 1B tokens, o que é encorajador para escalonamento.
O aprendizado profundo foi construído em torno da retropropagação, o único algoritmo de atribuição de crédito capaz de treinar redes neurais modernas. No entanto, à medida que a computação aumenta, podemos preferir algoritmos mais genéricos. A lição amarga (Sutton, 2019) é que métodos gerais que escalam com a computação eventualmente vencem. Similarmente, a diferenciabilidade pode ser um bom viés indutivo no regime de baixa computação, mas no regime de alta computação limita o espaço de arquiteturas. Um algoritmo de atribuição de crédito mais flexível baseado em busca é provavelmente um passo importante para uma generalização muito melhor. Nós o chamamos de Dust, um algoritmo de otimização de ordem zero que perturba ativações.
Fonte: Hacker News · Resumido por HeadlinesBriefing