2026年10月致s@qlabs.sh·代码·TL;DR我们提出了第一个与反向传播竞争的零阶方法,用于预训练Transformer语言模型。Dust独立地在每个token处扰动激活(节点扰动),因此每个token是一个虚拟种群成员,一次前向传播并行评估所有token。在大种群(即显著更多的计算)下,Dust紧密近似反向传播,并在多种设置下甚至超越它。这暗示在计算丰富的体制中,我们可能能够超越反向传播。Dust比权重空间ES高效数个数量级。从1M token起,根据我们的外推,Dust比最先进的ES方法EGGROLL的Transformer实现高效约10^3到10^4倍。
零阶方法被广泛认为无法扩展到大型网络。引人注目的是,我们发现更大的模型更具种群效率,而非更差:一个243M参数的模型在大多数种群大小下优于一个小120倍的模型。随着种群增长,Dust的梯度估计与反向传播的对齐更好,并且在我们测试的每个规模(高达1B token)下保持良好对齐,这对扩展是令人鼓舞的。
深度学习围绕反向传播构建,反向传播是唯一能够训练现代神经网络的信用分配算法。然而,随着计算量的增加,我们可能更喜欢更通用的算法。苦涩的教训(Sutton,2019)是,随计算扩展的通用方法最终获胜。类似地,可微性在低计算体制中可能是一个好的归纳偏置,但在高计算体制中它限制了架构空间。基于搜索的更灵活的信用分配算法很可能是迈向更好泛化的重要一步。我们称之为Dust,一种扰动激活的零阶优化算法。
来源: Hacker News · 由HeadlinesBriefing整理摘要