HeadlinesBriefing favicon HeadlinesBriefing.com

Перестановочная симметрия нарушает усреднение нейросетей

Towards Data Science •
×

Если вы когда-либо пытались усреднять веса нейронных сетей, обучая одну и ту же архитектуру дважды на одних и тех же данных, меняя только случайное зерно, вы, вероятно, предполагали, что два результата в основном взаимозаменяемы. Оба запуска сходятся. Оба достигают одинаковых потерь. Поэтому вы усредняете два вектора весов, ожидая что-то по крайней мере не хуже, чем каждый по отдельности. Среднее хуже. Часто намного хуже. Во время процесса обучения не было проблем; это структурная особенность нейронных сетей, которую можно напрямую вывести из свойства, известного как перестановочная симметрия.

Тот же принцип также объясняет, почему слияние моделей успешно, когда оно успешно, и терпит неудачу, когда терпит неудачу, вопрос, который в 2026 году находится в центре практической инженерии LLM, будь то супы моделей или федеративное усреднение. Представьте две обученные сети как две электронные таблицы, описывающие один и тот же отчет, за исключением того, что столбцы расположены в разном порядке. «Столбец 3» модели A может содержать то, что модель B называет «столбцом 7». Обе таблицы верны. Но усреднять их по ячейкам, не выровняв сначала столбцы, — это усреднять выручку с численностью сотрудников.

Большинство введений в нейронные сети остаются в пространстве функций. Эта статья остается в пространстве параметров: как на самом деле выглядит множество хороших решений и во что вам обходится эта геометрия. Классические модели, такие как полиномиальная регрессия, имеют фиксированные базисные функции и выпуклые потери. Нейронная сеть изучает сами базисные функции, делая потери невыпуклыми. Эта невыпуклость — цена адаптивности. Зафиксируйте базис — и мы получим выпуклость. Изучите базис — и мы ее теряем. Третьего варианта нет.