HeadlinesBriefing favicon HeadlinesBriefing.com

MSE lügt: Teil II

Towards Data Science •
×

In einem vorherigen Artikel haben wir gesehen, warum das Training mit MSE ein Modell dazu zwingt, nur den bedingten Mittelwert zu melden, und wie die Gaußsche NLL es ihm ermöglicht, auch eine ehrliche schrittweise Unsicherheit σ zu lernen. Das war die Ein-Schritt-Geschichte. Dieser Beitrag knüpft dort an, wo wir aufgehört haben. Alles, was wir in Teil I aufgebaut haben — die Gaußsche NLL, der Zwei-Term-Verlust, der Beweis, dass das Modell sowohl den bedingten Mittelwert als auch die bedingte Varianz lernt — handelte von der Ein-Schritt-voraus-Vorhersage: Gegeben ein Kontextfenster von T beobachteten Werten, sagen Sie die Verteilung des nächsten Werts x_{T+1} voraus.

Zum Zeitpunkt der Inferenz ist dies in jeder realen Anwendung selten genug. Sie möchten wissen, was in den nächsten 10, 100 oder 1000 Schritten passiert. Sie möchten eine Vorhersage, keine einzelne Prognose. Und wenn Ihr Modell probabilistisch ist, möchten Sie, dass diese Vorhersage bis zum Ende des Horizonts eine ehrliche Unsicherheit trägt. In diesem Beitrag geht es darum, wie man dies richtig macht.

Man könnte sofort an den naiven Ansatz denken, d.h. das Modell wiederholt anzuwenden und seine Vorhersagen als Eingaben zurückzuführen, ist heimlich eine deterministische Operation, die die Unsicherheit verwirft, deren Erlernen das Modell so viel Mühe gekostet hat. Dies zu beheben erfordert sorgfältiges Nachdenken darüber, was eine gemeinsame Verteilung über zukünftige Werte tatsächlich ist und wie man sie mit Monte-Carlo-Stichproben approximiert. Die Korrektur ist kaum mehr Code als die naive Version, liefert aber eine grundlegend andere und grundlegend bessere Vorhersage.

Alles hier ist im Begleitnotizbuch erstellt und überprüft: die beiden Rollout-Ansätze, angewendet auf dasselbe trainierte Modell, auf dasselbe Signal, mit Coverage- und PIT-Diagnosen (alle in diesem Beitrag erklärt).