HeadlinesBriefing favicon HeadlinesBriefing.com

Simetría de permutación rompe promedio de redes neuronales

Towards Data Science •
×

Si alguna vez has intentado promediar pesos de redes neuronales entrenando la misma arquitectura dos veces con los mismos datos, cambiando solo la semilla aleatoria, probablemente has asumido que los dos resultados eran básicamente intercambiables. Ambas ejecuciones convergen. Ambas alcanzan la misma pérdida. Así que promedias los dos vectores de pesos, esperando algo al menos tan bueno como cualquiera de los dos por separado. El promedio es peor. A menudo mucho peor. No hubo problemas durante el proceso de entrenamiento; esto es una característica estructural de las redes neuronales y se puede deducir directamente de una propiedad conocida como simetría de permutación.

El mismo principio también explica por qué la fusión de modelos tiene éxito cuando lo tiene y falla cuando falla, una cuestión que, en 2026, está en el corazón de la ingeniería práctica de LLM, ya sea que se trate de sopas de modelos o promedio federado. Piensa en dos redes entrenadas como dos hojas de cálculo que describen el mismo informe, excepto que las columnas están en un orden diferente. La "columna 3" del modelo A podría contener lo que el modelo B llama "columna 7". Ambas hojas de cálculo son correctas. Pero promediarlas celda por celda sin alinear primero las columnas, es promediar ingresos con número de empleados.

La mayoría de las introducciones a las redes neuronales se mantienen en el espacio de funciones. Este artículo se mantiene en el espacio de parámetros: cómo se ve realmente el conjunto de buenas soluciones y qué te cuesta esa geometría. Modelos clásicos como la regresión polinómica tienen funciones base fijas y pérdida convexa. Una red neuronal aprende las funciones base mismas, haciendo que la pérdida sea no convexa. Esta no convexidad es el precio de la adaptabilidad. Fija la base, y obtenemos convexidad. Aprende la base, y la perdemos. No hay tercera opción.