En finanzas cuantitativas, los modelos generativos son menos comunes que los predictivos, pero un proyecto de verano exploró el uso de difusión autoregresiva para sintetizar datos de mercado. El pasante de investigación, Kavish, construyó un modelo para generar no solo predicciones de precio, sino también eventos completos de libro de órdenes—incluyendo tiempo, tipo de orden y precio—tratando los datos de mercado como una señal secuencial y multimodal. Los datos de mercado exhiben tanto características discretas como continuas: las actualizaciones del libro de órdenes son acciones discretas, pero el precio y el tiempo tienen alta cardinalidad o son inherente Continuo, con distribuciones espicuas como 'pennying' y llegadas agrupadas alrededor de horas enteras.
Kavish modeló cuatro años de datos de acciones de EE. UU., usando una arquitectura codificador-difusor con un codificador Transformer con enmascaramiento causal para producir embeddings latentes. Durante el entrenamiento, una cabeza de tipo de evento predijo intercambio vs. actualización BBO, mientras que una cabeza de difusión generó características continuas como precio y tiempo transcurrido.
El modelo descubrió que la DDPM estándar divergió, pero el flujo matching funcionó mejor. La difusión continua falló al capturar la naturaleza dentada de los datos de mercado reales, y los intentos de manejar masas puntuales mediante suavizado o discretización aclararon el camino hacia adelante para un modelo generativo viable de datos de mercado.
Fuente: Hacker News · Resumido por HeadlinesBriefing