HeadlinesBriefing favicon HeadlinesBriefing.com

Pelatihan Text-to-Image 3,6× Lebih Cepat

Hacker News •
×

TL;DR Linum v2 terhambat oleh jendela konteks attention-nya: klip 720p 5 detik memakan 110K token. Sebagian besar sistem generatif adalah Latent Diffusion Model (LDM) dengan VAE dan DiT terpisah. Model ruang piksel seperti JiT menggabungkannya tetapi kesulitan dengan detail halus. Kami mengusulkan JiT-DDT, arsitektur encoder-decoder baru yang memulihkan detail dan melatih secara efisien. Dibandingkan Linum v2, JiT-DDT melatih model text-to-image dengan 3,6× lebih sedikit jam GPU, bahkan menghasilkan gambar dengan 4× piksel. Linum v2 (256×256, DiT ruang laten 2,0B + VAE, 256 token laten) vs. JiT-DDT (512×512, DiT ruang piksel aktif 2,5B, 320 token piksel = 64 encoder + 256 decoder). Kode dan bobot tersedia di bawah Apache 2.0. Ini adalah artefak penelitian, bukan rilis model lengkap. Nantikan Linum v3.

Hampir semua model gambar dan video generatif adalah LDM, menggunakan VAE untuk kompresi dan DiT untuk generasi. VAE dilatih secara terpisah dan dibekukan, membatasi pengurangan token hingga 16×16 untuk model seperti FLUX, Ideogram, dan Z-Image. Musim gugur lalu, Tianhong Li dan Kaiming He menerbitkan JiT, mencapai pengurangan token 32×32 dengan membuang VAE.

Entitas Kunci: Perusahaan: Linum, FLUX, Ideogram, Z-Image | Orang: Tianhong Li, Kaiming He