HeadlinesBriefing favicon HeadlinesBriefing.com

Entrenamiento texto-a-imagen 3.6× más rápido

Hacker News •
×

TL;DR Linum v2 estaba limitado por su ventana de contexto de atención: un clip de 720p y 5 segundos costaba 110K tokens. La mayoría de los sistemas generativos son Modelos de Difusión Latente (LDMs) con VAE y DiT separados. Los modelos en espacio de píxeles como JiT los combinan pero tienen dificultades con detalles finos. Proponemos JiT-DDT, una novedosa arquitectura encoder-decoder que recupera detalles y entrena eficientemente. Frente a Linum v2, JiT-DDT entrena un modelo texto-a-imagen con 3.6× menos horas de GPU, incluso generando imágenes con 4× más píxeles. Linum v2 (256×256, DiT en espacio latente de 2.0B + VAE, 256 tokens latentes) vs. JiT-DDT (512×512, DiT en espacio de píxeles activo de 2.5B, 320 tokens de píxeles = 64 encoder + 256 decoder). El código y los pesos están disponibles bajo Apache 2.0. Este es un artefacto de investigación, no un lanzamiento completo del modelo. Estén atentos a Linum v3.

Casi todos los modelos generativos de imagen y video son LDMs, usando un VAE para compresión y un DiT para generación. Los VAE se entrenan por separado y se congelan, limitando la reducción de tokens a 16×16 para modelos como FLUX, Ideogram y Z-Image. El otoño pasado, Tianhong Li y Kaiming He publicaron JiT, logrando una reducción de tokens de 32×32 al descartar el VAE.

Entidades clave: Empresas: Linum, FLUX, Ideogram, Z-Image | Personas: Tianhong Li, Kaiming He