HeadlinesBriefing favicon HeadlinesBriefing.com

重参数化技巧降低梯度方差

Towards Data Science •
×

重参数化技巧是使变分自编码器(VAEs)能够使用标准随机梯度下降进行训练的关键。它通过将随机性移出计算图,将期望的复杂梯度转化为普通的链式法则导数。VAE是一种生成模型。编码器将输入数据x映射到潜在变量z的分布上,而解码器将采样得到的z映射回x的重构。使其可训练的是其目标函数——ELBO(证据下界),即真实数据似然的一个可处理替代,由重构项和将潜在分布正则化为简单先验的项组成。训练VAE需要使用梯度下降最大化这个ELBO,为此必须计算期望的梯度;更准确地说,必须计算期望重构质量关于随机采样潜在变量z的梯度。本文将深入探讨这个问题、用于解决它的两大主要梯度估计器族,以及为什么通过重参数化获得的路径梯度往往比替代方法具有显著更低的方差。低方差梯度估计器不仅仅是理论上的优点。在实践中,它直接转化为更稳定的训练曲线、更少的损失剧烈波动、更快的收敛以及更好的最终模型。这对于VAE、贝叶斯神经网络和连续控制强化学习智能体等复杂模型尤其关键,因为在这些模型中,训练信号否则可能过于嘈杂而毫无用处。问题:期望的梯度——为什么采样会破坏反向传播。如果我们想关于θ优化。如果θ仅出现在f中,这将是一个标准的反向传播问题。复杂之处在于θ参数化了z所抽取的分布——采样过程本身依赖于θ——因此我们不能简单地将梯度通过固定的计算图传播。L(θ)的蒙特卡洛估计很容易(抽取样本,对f(z)求平均),但L(θ)关于θ的蒙特卡洛估计并非自动完成,因为对采样操作进行求导没有明确定义。有两种通用方法:得分函数估计器(REINFORCE)和路径/重参数化估计器。两者都是无偏的,但在方差上差异巨大。得分函数估计器(REINFORCE):灵活但高方差。这里经典的技巧是对数导数恒等式:将其代入期望的梯度得到现在又是一个期望,因此可以通过采样z ~ p_θ并对f(z)·∂log p_θ(z)/∂θ求平均来估计。这就是策略梯度强化学习中REINFORCE背后的估计器,它确实非常通用。它适用于离散的z,并且不需要对分布进行重参数化。主要实体:公司:Towards Data Science。FAQ Q:什么是重参数化技巧,它为什么能降低梯度方差?FAQ A:重参数化技巧将随机性移出计算图,将期望的梯度转化为标准的链式法则导数。这使得路径梯度具有比REINFORCE等得分函数估计器显著更低的方差,从而为VAE和连续控制强化学习智能体等模型带来更稳定的训练和更快的收敛。