HeadlinesBriefing favicon HeadlinesBriefing.com

MSE mente: Parte II

Towards Data Science •
×

Em um artigo anterior, vimos por que treinar com MSE força um modelo a relatar apenas a média condicional, e como a NLL Gaussiana permite que ele aprenda também uma incerteza honesta por passo σ. Essa era a história de um passo. Este post retoma de onde paramos. Tudo o que construímos na Parte I — a NLL Gaussiana, a perda de dois termos, a prova de que o modelo aprende tanto a média condicional quanto a variância condicional — era sobre previsão de um passo à frente: dada uma janela de contexto de T valores observados, prever a distribuição do próximo valor x_{T+1}.

No momento da inferência, em qualquer aplicação real, isso raramente é suficiente. Você quer saber o que acontece nos próximos 10, 100 ou 1000 passos. Você quer uma previsão, não uma única predição. E se seu modelo é probabilístico, você quer que essa previsão carregue incerteza honesta até o final do horizonte. Este post é sobre como fazer isso corretamente.

Pode-se pensar imediatamente na abordagem ingênua, ou seja, aplicar o modelo repetidamente, alimentando suas previsões de volta como entradas é secretamente uma operação determinística que descarta a incerteza que o modelo gastou tanto esforço aprendendo. Corrigir isso requer pensar cuidadosamente sobre o que realmente é uma distribuição conjunta sobre valores futuros e como aproximá-la com amostragem de Monte Carlo. A correção é apenas um pouco mais de código do que a versão ingênua, mas dá uma previsão fundamentalmente diferente e fundamentalmente melhor.

Tudo aqui é construído e verificado no caderno complementar: as duas abordagens de rollout, aplicadas ao mesmo modelo treinado, no mesmo sinal, com diagnósticos de cobertura e PIT (tudo explicado neste post).