HeadlinesBriefing favicon HeadlinesBriefing.com

Trucos de reparametrización: varianza reducida

Towards Data Science •
×

El truco de reparametrización es lo que hace que los Autoencoders Variacionales (VAEs) sean entrenables con descenso de gradiente estocástico estándar. Funciona moviendo la aleatoriedad fuera del grafo de computación y convierte un gradiente incómodo de una expectativa en una derivada ordinaria de la regla de la cadena. Una VAE es un modelo generativo.

Un encoder mapea los datos de entrada x a una distribución sobre una variable latente z, mientras que un decoder mapea una z muestreada de vuelta a una reconstrucción de x. Lo que la hace entrenable es su objetivo, el ELBO (Evidence Lower Bound), es decir, un sustituto manejable de la verdadera verosimilitud de los datos, compuesto por un término de reconstrucción y un término que regulariza la distribución latente hacia un prior simple. Entrenar una VAE implica maximizar este ELBO usando descenso de gradiente, y para hacerlo se debe calcular el gradiente de una expectativa; más precisamente, se debe calcular el gradiente de la calidad de reconstrucción esperada con respecto a las variables latentes z muestreadas aleatoriamente.

Este artículo recorre ese problema, las dos familias principales de estimadores de gradiente usadas para resolverlo, y por qué los gradientes pathwise obtenidos mediante reparametrización tienden a tener una varianza dramáticamente menor que la alternativa. Un estimador de gradiente de baja varianza no es solo una agradable teoría. En la práctica, se traduce directamente en curvas de entrenamiento más estables, menos oscilaciones salvajes en la pérdida, convergencia más rápida y mejores modelos finales.

Esto es especialmente crítico para modelos complejos como VAEs, redes neuronales bayesianas y agentes de Aprendizaje por Refuerzo de control continuo, donde la señal de entrenamiento puede ser demasiado ruidosa para ser útil de otra manera. El problema: Gradientes de expectativas — por qué la ruptura de la retropropagación por muestreo. Si queremos optimizar con respecto a θ.

Si θ solo apareciera dentro de f, esto sería un problema estándar de backprop. La complicación es que θ parametriza la distribución de la que se extrae z — el proceso de muestreo en sí depende de θ — así que no podemos simplemente empujar el gradiente a través de un grafo de computación fijo. Las estimaciones de Monte Carlo de L(θ) son fáciles (dibujar muestras, promediar f(z)), pero las estimaciones de Monte Carlo de θ L(θ) no son automáticas, porque diferenciar a través de una operación de muestreo no está bien definido.

Hay dos formas generales de salir de esto: el estimador de función de puntuación (REINFORCE) y el estimador pathwise / reparametrización. Ambos son insesgados. Difieren enormemente en varianza.

El estimador de función de puntuación (REINFORCE): flexible pero alta varianza. El truco clásico aquí es la identidad de derivada logarítmica: Sustituyendo esto en el gradiente de la expectativa se obtiene que ahora es una expectativa de nuevo, así que puede estimarse muestreando z ~ p_θ y promediando f(z)·∂log p_θ(z)/∂θ. Este es el estimador detrás de REINFORCE en el aprendizaje por refuerzo de gradiente de política, y es genuinamente versátil.

Funciona para z discreto y no requiere reparametrizar la distribución. Entidades clave: Empresas: Towards Data Science. FAQ Q: ¿Qué es el truco de reparametrización y por qué reduce la varianza del gradiente? FAQ A: El truco de reparametrización mueve la aleatoriedad fuera del grafo de computación, convirtiendo el gradiente de una expectativa en una derivada estándar de la regla de la cadena.

Esto permite gradientes pathwise que tienen una varianza dramáticamente menor en comparación con los estimadores de función de puntuación como REINFORCE, lo que lleva a un entrenamiento más estable y convergencia más rápida para modelos como VAEs y agentes de Aprendizaje por Refuerzo de control continuo.