HeadlinesBriefing favicon HeadlinesBriefing.com

MSE ment : Partie II

Towards Data Science •
×

Dans un article précédent, nous avons vu pourquoi l'entraînement avec MSE force un modèle à ne rapporter que la moyenne conditionnelle, et comment la NLL gaussienne lui permet également d'apprendre une incertitude honnête par étape σ. C'était l'histoire en une étape. Cet article reprend là où nous nous sommes arrêtés. Tout ce que nous avons construit dans la Partie I — la NLL gaussienne, la perte à deux termes, la preuve que le modèle apprend à la fois la moyenne conditionnelle et la variance conditionnelle — concernait la prédiction à une étape : étant donné une fenêtre de contexte de T valeurs observées, prédire la distribution de la valeur suivante x_{T+1}.

Au moment de l'inférence, dans toute application réelle, cela est rarement suffisant. Vous voulez savoir ce qui se passe au cours des 10, 100 ou 1000 prochaines étapes. Vous voulez une prévision, pas une seule prédiction. Et si votre modèle est probabiliste, vous voulez que cette prévision porte une incertitude honnête jusqu'à la fin de l'horizon. Cet article explique comment faire cela correctement.

On pourrait immédiatement penser à l'approche naïve, c'est-à-dire appliquer le modèle de manière répétée, en renvoyant ses prédictions comme entrées, est secrètement une opération déterministe qui jette l'incertitude que le modèle a passé tant d'efforts à apprendre. Résoudre cela nécessite de réfléchir attentivement à ce qu'est réellement une distribution conjointe sur les valeurs futures, et comment l'approximer avec un échantillonnage de Monte Carlo. La correction est à peine plus de code que la version naïve, mais elle donne une prévision fondamentalement différente et fondamentalement meilleure.

Tout ici est construit et vérifié dans le cahier compagnon : les deux approches de rollout, appliquées au même modèle entraîné, sur le même signal, avec des diagnostics de couverture et PIT (tout expliqué dans cet article).