HeadlinesBriefing favicon HeadlinesBriefing.com

MSEの嘘:パートII

Towards Data Science •
×

前回の記事では、MSEを使用したトレーニングがなぜモデルに条件付き平均のみを報告させるのか、そしてガウスNLLがどのようにしてモデルに誠実なステップごとの不確実性σを学習させるのかを見ました。それは1ステップの話でした。この投稿は、前回の続きから始まります。パートIで構築したすべてのもの — ガウスNLL、2項損失、モデルが条件付き平均と条件付き分散の両方を学習するという証明 — は、1ステップ先の予測に関するものでした:T個の観測値のコンテキストウィンドウが与えられたとき、次の値x_{T+1}の分布を予測します。

推論時には、実際のアプリケーションでは、これで十分なことはほとんどありません。次の10、100、または1000ステップで何が起こるかを知りたいのです。単一の予測ではなく、予測が必要です。そして、モデルが確率的である場合、その予測が地平線の終わりまで誠実な不確実性を運ぶことを望みます。この投稿は、これを正しく行う方法についてです。

単純なアプローチ、つまりモデルを繰り返し適用し、その予測を入力としてフィードバックすることは、モデルが学習に多大な労力を費やした不確実性を捨てる、密かに決定論的な操作であるとすぐに考えるかもしれません。これを修正するには、将来の値に対する結合分布が実際に何であるか、そしてモンテカルロサンプリングでそれをどのように近似するかを注意深く考える必要があります。修正は単純なバージョンよりもほとんどコードが増えませんが、根本的に異なり、根本的に優れた予測を提供します。

ここにあるすべては、コンパニオンノートブックで構築およびチェックされています:2つのロールアウトアプローチが、同じ訓練済みモデルに、同じ信号に適用され、カバレッジとPIT診断(この投稿ですべて説明)が行われています。