HeadlinesBriefing favicon HeadlinesBriefing.com

Symétrie de permutation brise la moyenne des réseaux de neurones

Towards Data Science •
×

Si vous avez déjà essayé de faire la moyenne des poids de réseaux de neurones en entraînant la même architecture deux fois sur les mêmes données, en ne changeant que la graine aléatoire, vous avez probablement supposé que les deux résultats étaient essentiellement interchangeables. Les deux exécutions convergent. Les deux atteignent la même perte. Vous faites donc la moyenne des deux vecteurs de poids, en vous attendant à quelque chose d'au moins aussi bon que l'un ou l'autre seul. La moyenne est pire. Souvent bien pire. Il n'y a eu aucun problème pendant le processus d'entraînement ; c'est une caractéristique structurelle des réseaux de neurones et peut être déduite directement d'une propriété connue sous le nom de symétrie de permutation.

Le même principe explique également pourquoi la fusion de modèles réussit quand elle réussit et échoue quand elle échoue, une question qui, en 2026, est au cœur de l'ingénierie pratique des LLM, qu'il s'agisse de soupes de modèles ou de moyenne fédérée. Pensez à deux réseaux entraînés comme deux feuilles de calcul décrivant le même rapport, sauf que les colonnes sont dans un ordre différent. La "colonne 3" du modèle A pourrait contenir ce que le modèle B appelle "colonne 7". Les deux feuilles de calcul sont correctes. Mais les moyenner cellule par cellule sans d'abord aligner les colonnes, c'est moyenner les revenus avec le nombre d'employés.

La plupart des introductions aux réseaux de neurones restent dans l'espace des fonctions. Cet article reste dans l'espace des paramètres : à quoi ressemble réellement l'ensemble des bonnes solutions, et ce que cette géométrie vous coûte. Les modèles classiques comme la régression polynomiale ont des fonctions de base fixes et une perte convexe. Un réseau de neurones apprend les fonctions de base elles-mêmes, rendant la perte non convexe. Cette non-convexité est le prix de l'adaptativité. Fixez la base, et nous obtenons la convexité. Apprenez la base, et nous la perdons. Il n'y a pas de troisième option.