HeadlinesBriefing favicon HeadlinesBriefing.com

ログ-サム-エクスプの分散爆発:最小二乗法による解

Hacker News •
×

機械学習における一般的なタスクは、(潜在的に連続的に)多くの項を持つ「ログ-サム-エクスプ」関数を推定または最適化することです。例えば $$ log Big( int_{\mathcal{X}} e^{v(x)} dq(x) Big)$$ ここで \(v: \mathcal{X} \to \mathbb{R}\) は何らかのポテンシャル関数であり、\(q\) は集合 \(\mathcal{X}\) 上の確率分布です。これはデータサイエンスにおいて広範な応用があり、しばしば確率モデルの正規化を通じて行われますが、最大値の滑らかな近似としても機能し、トランスフォーマーではその導関数を通じて、またはエントロピー正則化を用いた強化学習において [19] 重要な役割を果たします。時折、集合 \(\mathcal{X}\) は有限(潜在的に大きい)であり、積分は明示的な和によって計算できますが、しばしば正確な計算は不可能であり、代わりに確率分布 \(q\) からのサンプリングが使用されます。このような推定の主な困難は、特に \(v\) が大きな値を取るときのその分散にあります。最も単純な例として、独立かつ平均 \(\mu\)、分散 \(\sigma^2\) の正規分布に従う \(z_1,\dots,z_n \in \mathbb{R}\) を考えると、\(\mathbb{E}[e^z]\) を推定する際の相対二乗誤差は $$\frac{ {\rm var}\big( \frac{1}{n} \sum_{i=1}^n e^{z_i} \big) }{( \mathbb{E}[ e^{z} ])^2} = \frac{1}{n} \frac{ {\rm var}(e^z) }{( \mathbb{E}[ e^{z} ])^2} = \frac{ e^{\sigma^2}-1}{n}.$$ \(n\) が増加すると、この値はゼロに収束します(大数の法則から期待される通り)ですが、\(\sigma\) が増加すると指数関数的に爆発します。さらに、対数を取っても分散の爆発は変わりません。すなわち、${\rm var}\big( \log \big( \frac{1}{n} \sum_{i=1}^n e^{z_i} \big)\big)$ も、\(n\) が大きいとき(デルタ法により得られる通り)、\frac{ e^{\sigma^2}-1}{n} と同様の漸近的増加を示すことができます。ログ-サム-エクスプ関数は推定が難しいものの、多くの良い性質を持っています(それが人気の理由です)。私が特に気に入っている点は、(1) それは最大値の滑らかな近似であること(例えば、この以前の投稿を参照)、および(2) それは尤度最大推定に適した確率モデルの正規化方法であり、特に階層的確率モデルにおいて、(条件付き)独立性の仮定が関連する損失関数の分離をもたらすこと(これは確率グラフィカルモデルで広く使用されています)。この投稿で私が答えようとしている主な質問は:ログ-サム-エクスプ関数の最適化の利点を維持しながら、その計算的・統計的な不利益への曝露を減らすことはできるでしょうか?スペクトルのもう一方の端には、基本的に相反する特性を持つ最小二乗回帰があります:肯定的な側面では、線形代数を通じて線形モデルの閉形式推定を得たり、固定で制御された分散でのモーメントの計算に基づいたり、加速、確率的勾配降下などのさまざまな設定で鋭い分析を得たりします。例えば、この投稿の加速に関する部分や、この投稿の平均に関する部分を参照してください。否定的な側面では、すべての予測問題に最小二乗回帰を使用すること(特に離散出力の場合)は、いくつかの人工物を生じます。伝統的な例は、同じ共分散行列を持つガウスクラス条件データでの分類であり、ワンホットエンコードされた出力に対する最小二乗回帰は「マスキング」([13, セクション 2.4]および以下の例参照)や、多項ロジスティック回帰(すなわちソフトマックス回帰)と比較した高い近似誤差を引き起こします。なぜなら、そのときの対数条件確率はアフィン関数になるからです。これらを調和させることはできるでしょうか?言い換えれば、最小二乗回帰は本当に私が必要とするすべてなのでしょうか?(私の同僚は時々、私が最小二乗回帰を愛していることをからかいます)。なお、世界を最小二乗回帰で見ようとするもう一つの(古典的な)試みがあります:ニュートン法による逐次的アプローチで、この文脈ではイテラティブに重み付けされた最小二乗法に導きますが、これは計算のためだけであり、統計的な改善はありません。私たちが目指しているのはより強力な......