HeadlinesBriefing favicon HeadlinesBriefing.com

置换对称性打破神经网络平均化

Towards Data Science •
×

如果你曾经尝试过通过在同一数据上训练两次相同架构的神经网络来进行权重平均化,除了随机种子不同外,其他都不变,你可能假设这两个结果基本上是可以互换的。两次运行都收敛了。两者都达到相同的损失。所以你平均这两个权重向量,期望至少比单独一个更好。但平均结果更差,通常差得多。训练过程中没有问题;这是神经网络的结构特征,可以直接从称为置换对称性的属性推导出来。

同样的原理也解释了模型合并何时成功、何时失败,这个问题在2026年处于实际LLM工程的核心,无论是处理模型汤还是联邦平均。将两个训练好的网络想象成描述同一报告的两张电子表格,只是列的顺序不同。模型A的“第3列”可能包含模型B所称的“第7列”。两个电子表格都是正确的。但如果不先对齐列,就逐单元格平均它们,你就是在平均收入与员工人数。

大多数神经网络入门停留在函数空间。本文停留在参数空间:好的解集合实际上是什么样子,以及这种几何形状让你付出什么代价。经典模型如多项式回归具有固定的基函数和凸损失。神经网络学习基函数本身,使损失非凸。这种非凸性是适应性的代价。固定基函数,我们得到凸性。学习基函数,我们失去凸性。没有第三种选择。