HeadlinesBriefing favicon HeadlinesBriefing.com

Astuces de reparamétrisation : variance réduite

Towards Data Science •
×

L'astuce de reparamétrisation est ce qui rend les Auto-encodeurs Variationnels (VAEs) entraînables avec la descente de gradient stochastique standard. Elle fonctionne en déplaçant l'aléatoire hors du graphe de calcul et transforme un gradient maladroit d'une espérance en une dérivée ordinaire de la règle de la chaîne. Un VAE est un modèle génératif.

Un encodeur associe les données d'entrée x à une distribution sur une variable latente z, tandis qu'un décodeur associe un z échantillonné à une reconstruction de x. Ce qui le rend entraînable est son objectif, l'ELBO (Evidence Lower Bound), c'est-à-dire un substitut traitable à la vraisemblance réelle des données, composé d'un terme de reconstruction et d'un terme qui régularise la distribution latente vers un prior simple. Entraîner un VAE implique de maximiser cet ELBO en utilisant la descente de gradient, et pour cela le gradient d'une espérance doit être calculé ; plus précisément, le gradient de la qualité de reconstruction attendue par rapport aux variables latentes z échantillonnées aléatoirement doit être calculé.

Cet article parcourt ce problème, les deux familles principales d'estimateurs de gradient utilisées pour le résoudre, et pourquoi les gradients pathwise obtenus par reparamétrisation tendent à avoir une variance dramatiquement plus faible que l'alternative. Un estimateur de gradient à faible variance n'est pas juste une commodité théorique. En pratique, il se traduit directement par des courbes d'entraînement plus stables, moins de fluctuations brutales de la perte, une convergence plus rapide et de meilleurs modèles finaux.

C'est particulièrement critique pour des modèles complexes comme les VAEs, les réseaux de neurones bayésiens et les agents d'Apprentissage par Renforcement à contrôle continu, où le signal d'entraînement peut être trop bruité pour être utile autrement. Le problème : Gradients d'espérances — pourquoi l'échantillonnage casse la rétropropagation. Si nous voulons optimiser par rapport à θ.

Si θ n'apparaissait que dans f, ce serait un problème de rétropropagation standard. La complication est que θ paramétrise la distribution à partir de laquelle z est tiré — le processus d'échantillonnage lui-même dépend de θ — donc nous ne pouvons pas simplement faire passer le gradient à travers un graphe de calcul fixe. Les estimations de Monte Carlo de L(θ) sont faciles (tirer des échantillons, faire la moyenne de f(z)), mais les estimations de Monte Carlo de θ L(θ) ne sont pas automatiques, car différencier à travers une opération d'échantillonnage n'est pas bien défini.

Il y a deux façons générales de s'en sortir : l'estimateur de fonction de score (REINFORCE) et l'estimateur pathwise / reparamétrisation. Les deux sont sans biais. Ils diffèrent énormément en variance.

L'estimateur de fonction de score (REINFORCE) : flexible mais haute variance. L'astuce classique ici est l'identité de dérivation logarithmique : En substituant ceci dans le gradient de l'espérance on obtient qui est maintenant une espérance à nouveau, donc il peut être estimé en échantillonnant z ~ p_θ et en faisant la moyenne de f(z)·∂log p_θ(z)/∂θ. C'est l'estimateur derrière REINFORCE dans l'apprentissage par renforcement de gradient de politique, et il est véritablement polyvalent.

Il fonctionne pour z discret et ne nécessite pas de reparamétrer la distribution. Entités clés : Entreprises : Towards Data Science. FAQ Q : Qu'est-ce que l'astuce de reparamétrisation et pourquoi réduit-elle la variance du gradient ? FAQ A : L'astuce de reparamétrisation déplace l'aléatoire hors du graphe de calcul, transformant le gradient d'une espérance en une dérivée ordinaire de la règle de la chaîne.

Cela permet des gradients pathwise qui ont une variance dramatiquement plus faible comparée aux estimateurs de fonction de score comme REINFORCE, conduisant à un entraînement plus stable et une convergence plus rapide pour des modèles comme les VAEs et les agents d'Apprentissage par Renforcement à contrôle continu.