HeadlinesBriefing HeadlinesBriefing 3 languages

Your Model's MSE Is Lying to You III: Time Series Diffusion

Towards Data Science ·

🇬🇧 English

Earlier parts of this series showed that a model can match another on MSE while carrying very different risk, and that a mean and variance head, once rolled out over time, still assume a single symmetric bell curve. This part focuses on the shape of uncertainty. For signals that drift and jitter, a bell curve is a reasonable description. For signals that can jump, switch regimes, or sit on a threshold and move either way, it is not. A model can have exactly the right mean and variance and still describe a future that never happens.

The article moves from one bell curve to a mixture of several, then to infinitely many, which can express any shape but is hard to train. Diffusion models offer a way out. Noise is gradually added to the signal and then removed by a network, which learns what to subtract at each step. The resulting training loss turns out to be MSE, and the article explains why that is acceptable here. A forecast value is then drawn by sampling through this learned denoising process.

The diffusion head is plugged into the sampled rollout from Part II without changing anything else. The author stresses that the explanation is deliberately thorough, that no prior knowledge of diffusion models is required, and that a companion notebook reproduces every figure. A roadmap of nine stops guides the reader through the theory before the data and experiments appear.

View original article →


🇪🇸 Español

El MSE de tu modelo te miente III: difusión para series temporales

Las partes anteriores de esta serie mostraron que un modelo puede igualar a otro en MSE mientras asume riesgos muy diferentes, y que una cabeza de media y varianza, una vez desplegada en el tiempo, sigue suponiendo una única campana simétrica. Esta parte se centra en la forma de la incertidumbre. Para señales que derivan y oscilan, una campana es una descripción razonable. Para señales que pueden saltar, cambiar de régimen o quedarse sobre un umbral y moverse en cualquier dirección, no lo es. Un modelo puede tener exactamente la media y la varianza correctas y, aun así, describir un futuro que nunca ocurre.

El artículo pasa de una campana a una mezcla de varias y, después, a infinitas, que pueden expresar cualquier forma pero son difíciles de entrenar. Los modelos de difusión ofrecen una salida: se añade ruido gradualmente a la señal y luego una red lo elimina, aprendiendo qué restar en cada paso. La pérdida de entrenamiento resultante resulta ser MSE, y el artículo explica por qué eso es aceptable aquí. Un valor de pronóstico se obtiene entonces muestreando a través de este proceso de eliminación de ruido aprendido.

La cabeza de difusión se conecta a la simulación muestreada de la Parte II sin cambiar nada más. El autor subraya que la explicación es deliberadamente exhaustiva, que no se requiere conocimiento previo de modelos de difusión y que un cuaderno complementario reproduce todas las figuras. Un mapa de nueve paradas guía al lector por la teoría antes de presentar los datos y los experimentos.

Entidades clave: Empresas: Towards Data Science

Pregunta: ¿Por qué un pronóstico con la media y la varianza correctas puede seguir siendo engañoso?

Respuesta: La media y la varianza describen una única campana simétrica. Para señales que pueden saltar, cambiar de régimen o dividirse entre resultados, esa forma puede producir pronósticos que parecen estadísticamente sólidos pero describen futuros que nunca llegan a ocurrir. Los modelos de difusión abordan esto aprendiendo la forma completa de la distribución.

¿Por qué un pronóstico con la media y la varianza correctas puede seguir siendo engañoso?

La media y la varianza describen una única campana simétrica. Para señales que pueden saltar, cambiar de régimen o dividirse entre resultados, esa forma puede producir pronósticos que parecen estadísticamente sólidos pero describen futuros que nunca llegan a ocurrir. Los modelos de difusión abordan esto aprendiendo la forma completa de la distribución.

Español version →


🇨🇳 简体中文

你的模型MSE在误导你 III:时间序列扩散模型

本系列前文表明,一个模型与另一个模型的MSE可能相当,但承担的风险却截然不同;均值与方差输出头在随时间滚动展开后,仍然假设单一的对称钟形曲线。本部分聚焦于不确定性的形状。对于漂移和抖动的信号,钟形曲线是合理的描述。而对于可能跳跃、切换状态,或停留在阈值附近并向任一方向移动的信号,它就不再适用。模型完全可以拥有正确的均值和方差,却仍然描述了一个永远不会发生的未来。

本文从单一钟形曲线出发,转向若干钟形曲线的混合,再到无穷多条钟形曲线,后者能够表达任意形状,但训练难度很高。扩散模型提供了一条出路:噪声被逐步加入信号,再由网络逐步去除,网络学习每一步需要减去什么。最终的训练损失恰好是MSE,文章解释了为何这在此处是可以接受的。预测值则通过这一已学习的去噪过程采样得出。

扩散输出头被接入第二部分中的采样滚动预测,其他部分保持不变。作者强调,这一解释有意做得十分详尽,读者无需预先了解扩散模型,并且配套的笔记本可以复现所有图表。文章提供了一幅包含九个站点的路线图,在呈现数据与实验之前引导读者理解理论。

关键实体:公司:Towards Data Science

问:为何均值和方差都正确的预测仍可能具有误导性?

答:均值和方差描述的是单一的对称钟形曲线。对于可能跳跃、切换状态或在多种结果之间分裂的信号而言,这种形状可能产生看似统计上合理、实则描述了从未真正出现的未来的预测。扩散模型通过学习分布的完整形状来解决这一问题。

为何均值和方差都正确的预测仍可能具有误导性?

均值和方差描述的是单一的对称钟形曲线。对于可能跳跃、切换状态或在多种结果之间分裂的信号而言,这种形状可能产生看似统计上合理、实则描述了从未真正出现的未来的预测。扩散模型通过学习分布的完整形状来解决这一问题。

简体中文 version →