HeadlinesBriefing favicon HeadlinesBriefing.com

Entraînement texte-image 3,6× plus rapide

Hacker News •
×

TL;DR Linum v2 était limité par sa fenêtre de contexte d'attention : un clip 720p de 5 secondes coûtait 110K tokens. La plupart des systèmes génératifs sont des modèles de diffusion latente (LDMs) avec VAE et DiT séparés. Les modèles en espace pixel comme JiT les combinent mais peinent sur les détails fins. Nous proposons JiT-DDT, une nouvelle architecture encodeur-décodeur qui récupère les détails et s'entraîne efficacement. Face à Linum v2, JiT-DDT entraîne un modèle texte-image avec 3,6× moins d'heures GPU, générant même des images avec 4× plus de pixels. Linum v2 (256×256, DiT en espace latent 2,0B + VAE, 256 tokens latents) vs. JiT-DDT (512×512, DiT en espace pixel actif 2,5B, 320 tokens pixel = 64 encodeur + 256 décodeur). Le code et les poids sont disponibles sous Apache 2.0. C'est un artefact de recherche, pas une sortie de modèle complète. Restez à l'écoute pour Linum v3.

Presque tous les modèles génératifs d'images et de vidéos sont des LDMs, utilisant un VAE pour la compression et un DiT pour la génération. Les VAE sont entraînés séparément et gelés, plafonnant la réduction de tokens à 16×16 pour des modèles comme FLUX, Ideogram et Z-Image. L'automne dernier, Tianhong Li et Kaiming He ont publié JiT, atteignant une réduction de tokens de 32×32 en abandonnant le VAE.

Entités clés : Entreprises : Linum, FLUX, Ideogram, Z-Image | Personnes : Tianhong Li, Kaiming He

FAQ : Qu'est-ce que JiT-DDT ?

JiT-DDT est une nouvelle architecture encodeur-décodeur qui entraîne les modèles texte-image 3,6× plus vite que Linum v2 tout en générant 4× plus de pixels.

FAQ Q : Qu'est-ce que JiT-DDT ?

FAQ R : JiT-DDT est une nouvelle architecture encodeur-décodeur qui entraîne les modèles texte-image 3,6× plus vite que Linum v2 tout en générant 4× plus de pixels.