HeadlinesBriefing favicon HeadlinesBriefing.com

MSE miente: Parte II

Towards Data Science •
×

En un artículo anterior, vimos por qué entrenar con MSE obliga a un modelo a reportar solo la media condicional, y cómo la NLL Gaussiana le permite aprender también una incertidumbre honesta por paso σ. Esa era la historia de un solo paso. Este post retoma donde lo dejamos. Todo lo que construimos en la Parte I — la NLL Gaussiana, la pérdida de dos términos, la prueba de que el modelo aprende tanto la media condicional como la varianza condicional — trataba sobre la predicción de un paso adelante: dado una ventana de contexto de T valores observados, predecir la distribución del siguiente valor x_{T+1}.

En el momento de la inferencia, en cualquier aplicación real, esto rara vez es suficiente. Quieres saber qué sucede en los próximos 10, 100 o 1000 pasos. Quieres un pronóstico, no una sola predicción. Y si tu modelo es probabilístico, quieres que ese pronóstico lleve una incertidumbre honesta hasta el final del horizonte. Este post trata sobre cómo hacer esto correctamente.

Uno podría pensar inmediatamente en el enfoque ingenuo, es decir, aplicar el modelo repetidamente, alimentando sus predicciones como entradas, es secretamente una operación determinista que descarta la incertidumbre que el modelo pasó tanto esfuerzo aprendiendo. Solucionar esto requiere pensar cuidadosamente sobre qué es realmente una distribución conjunta sobre valores futuros y cómo aproximarla con muestreo de Monte Carlo. La solución es apenas más código que la versión ingenua, pero da un pronóstico fundamentalmente diferente y fundamentalmente mejor.

Todo aquí está construido y verificado en el cuaderno complementario: los dos enfoques de rollout, aplicados al mismo modelo entrenado, en la misma señal, con diagnósticos de cobertura y PIT (todo explicado en este post).