HeadlinesBriefing favicon HeadlinesBriefing.com

Simetria de permutação quebra média de redes neurais

Towards Data Science •
×

Se você já tentou fazer a média de pesos de redes neurais treinando a mesma arquitetura duas vezes nos mesmos dados, mudando apenas a semente aleatória, provavelmente assumiu que os dois resultados eram basicamente intercambiáveis. Ambas as execuções convergem. Ambas atingem a mesma perda. Então você calcula a média dos dois vetores de pesos, esperando algo pelo menos tão bom quanto qualquer um deles sozinho. A média é pior. Frequentemente muito pior. Não houve problemas durante o processo de treinamento; isso é uma característica estrutural das redes neurais e pode ser deduzida diretamente de uma propriedade conhecida como simetria de permutação.

O mesmo princípio também explica por que a fusão de modelos tem sucesso quando tem e falha quando falha, uma questão que, em 2026, está no centro da engenharia prática de LLM, seja lidando com sopas de modelos ou média federada. Pense em duas redes treinadas como duas planilhas descrevendo o mesmo relatório, exceto que as colunas estão em uma ordem diferente. A "coluna 3" do Modelo A pode conter o que o Modelo B chama de "coluna 7". Ambas as planilhas estão corretas. Mas calcular a média célula por célula sem primeiro alinhar as colunas é calcular a média de receita com número de funcionários.

A maioria das introduções a redes neurais permanece no espaço de funções. Este artigo permanece no espaço de parâmetros: como o conjunto de boas soluções realmente se parece e o que essa geometria custa a você. Modelos clássicos como regressão polinomial têm funções de base fixas e perda convexa. Uma rede neural aprende as próprias funções de base, tornando a perda não convexa. Essa não convexidade é o preço da adaptabilidade. Fixe a base, e obtemos convexidade. Aprenda a base, e a perdemos. Não há terceira opção.