HeadlinesBriefing favicon HeadlinesBriefing.com

Treinamento texto-para-imagem 3,6× mais rápido

Hacker News •
×

TL;DR Linum v2 estava limitado por sua janela de contexto de atenção: um clipe de 720p e 5 segundos custava 110K tokens. A maioria dos sistemas generativos são Modelos de Difusão Latente (LDMs) com VAE e DiT separados. Modelos em espaço de pixels como JiT os combinam, mas têm dificuldades com detalhes finos. Propomos JiT-DDT, uma nova arquitetura codificador-decodificador que recupera detalhes e treina eficientemente. Contra Linum v2, JiT-DDT treina um modelo texto-para-imagem com 3,6× menos horas de GPU, até gerando imagens com 4× mais pixels. Linum v2 (256×256, DiT em espaço latente de 2,0B + VAE, 256 tokens latentes) vs. JiT-DDT (512×512, DiT em espaço de pixels ativo de 2,5B, 320 tokens de pixels = 64 codificador + 256 decodificador). Código e pesos estão disponíveis sob Apache 2.0. Este é um artefato de pesquisa, não um lançamento completo de modelo. Fique atento ao Linum v3.

Quase todos os modelos generativos de imagem e vídeo são LDMs, usando um VAE para compressão e um DiT para geração. VAEs são treinados separadamente e congelados, limitando a redução de tokens a 16×16 para modelos como FLUX, Ideogram e Z-Image. No outono passado, Tianhong Li e Kaiming He publicaram JiT, alcançando redução de tokens de 32×32 ao descartar o VAE.

Entidades-chave: Empresas: Linum, FLUX, Ideogram, Z-Image | Pessoas: Tianhong Li, Kaiming He