HeadlinesBriefing favicon HeadlinesBriefing.com

再パラメータ化: 分散を削減するグラディエント

Towards Data Science •
×

再パラメータ化テクニックは、変分オートエンコーダ(VAE)を標準的な確率的勾配降下法で学習可能にするものです。計算グラフの外にランダム性を移動させ、期待値の不格好な勾配を通常の連鎖律の微分に変換することで機能します。VAEは生成モデルです。エンコーダは入力データxを潜在変数zの分布にマッピングし、デコーダはサンプリングされたzをxの再構成にマッピングします。学習可能にするのはその目的関数であるELBO(Evidence Lower Bound)、つまり真のデータ尤度の扱いやすい代替であり、再構成項と潜在分布を単純な事前分布に正則化する項で構成されています。VAEを学習させることは、このELBOを勾配降下法で最大化することであり、そのためには期待値の勾配を計算する必要があります。より正確には、ランダムにサンプリングされた潜在変数zに関する期待再構成品質の勾配を計算する必要があります。この記事は、その問題、それを解決するために使用される2つの主要な勾配推定量のファミリー、そして再パラメータ化を通じて得られるパスワイズ勾配がなぜ代替手法よりも劇的に低い分散を持つ傾向があるかについて解説します。低分散の勾配推定量は単なる理論的な利点ではありません。実践的には、より安定した学習曲線、損失のより少ない激しい変動、より速い収束、より良い最終モデルに直接つながります。これはVAE、ベイジアンニューラルネットワーク、連続制御強化学習エージェントのような複雑なモデルにとって特に重要です。これらのモデルでは、学習信号が強すぎて有用にならない可能性があります。問題:期待値の勾配 — サンプリングが逆伝播を壊す理由。θに関して最適化したい場合、θがfの中にのみ現れるなら、これは標準的な逆伝播の問題です。複雑な点は、θがzをサンプリングする分布をパラメータ化していること — サンプリングプロセス自体がθに依存していること — ので、単に勾配を固定された計算グラフに通すことはできません。L(θ)のモンテカルロ推定は簡単(サンプルを引き、f(z)を平均する)ですが、θ L(θ)のモンテカルロ推定は自動的ではありません。サンプリング操作を通じて微分することはよく定義されていないからです。これを回避する一般的な方法は2つあります:スコア関数推定量(REINFORCE)とパスワイズ/再パラメータ化推定量です。両方とも不偏です。分散において大きく異なります。スコア関数推定量(REINFORCE):柔軟だが高分散。ここでの古典的なトリックは対数微分恒等式です:これを期待値の勾配に代入すると、今度は再び期待値になるので、z ~ p_θをサンプリングしてf(z)·∂log p_θ(z)/∂θを平均することで推定できます。これは方策勾配強化学習におけるREINFORCEの背後の推定量であり、確かに多用途です。離散的なzに対して機能し、分布の再パラメータ化を必要としません。主要エンティティ:企業:Towards Data Science。FAQ Q: 再パラメータ化テクニックとは何か、なぜ勾配の分散を削減するのか?FAQ A: 再パラメータ化テクニックは、ランダム性を計算グラフの外に移動させ、期待値の勾配を標準的な連鎖律の微分に変換します。これにより、REINFORCEのようなスコア関数推定量と比較して劇的に低い分散を持つパスワイズ勾配が可能になり、VAEや連続制御強化学習エージェントなどのモデルでより安定した学習とより速い収束を実現します。