HeadlinesBriefing favicon HeadlinesBriefing.com

टेक्स्ट-टू-इमेज मॉडल 3.6× तेज़ प्रशिक्षण

Hacker News •
×

TL;DR Linum v2 अपनी अटेंशन कॉन्टेक्स्ट विंडो से बाधित था: एक 720p, 5-सेकंड क्लिप में 110K टोकन लगते थे। अधिकांश जनरेटिव सिस्टम लेटेंट डिफ्यूजन मॉडल (LDMs) हैं जिनमें अलग VAE और DiT होते हैं। JiT जैसे पिक्सेल-स्पेस मॉडल उन्हें जोड़ते हैं लेकिन बारीक विवरणों में संघर्ष करते हैं। हम JiT-DDT प्रस्तावित करते हैं, एक नई एनकोडर-डिकोडर आर्किटेक्चर जो विवरण को पुनः प्राप्त करती है और कुशलता से प्रशिक्षण देती है। Linum v2 की तुलना में, JiT-DDT एक टेक्स्ट-टू-इमेज मॉडल को 3.6× कम GPU-घंटों में प्रशिक्षित करता है, यहां तक कि 4× अधिक पिक्सेल वाली छवियां भी उत्पन्न करता है। Linum v2 (256×256, 2.0B लेटेंट-स्पेस DiT + VAE, 256 लेटेंट टोकन) बनाम JiT-DDT (512×512, 2.5B सक्रिय पिक्सेल-स्पेस DiT, 320 पिक्सेल टोकन = 64 एनकोडर + 256 डिकोडर)। कोड और वेट Apache 2.0 के अंतर्गत उपलब्ध हैं। यह एक शोध आर्टिफैक्ट है, पूर्ण मॉडल रिलीज़ नहीं। Linum v3 के लिए बने रहें।

लगभग सभी जनरेटिव इमेज और वीडियो मॉडल LDMs हैं, जो संपीड़न के लिए VAE और जनरेशन के लिए DiT का उपयोग करते हैं। VAE अलग से प्रशिक्षित और फ्रोज़न होते हैं, जिससे FLUX, Ideogram और Z-Image जैसे मॉडलों के लिए टोकन कमी 16×16 तक सीमित हो जाती है। पिछले पतझड़ में, Tianhong Li और Kaiming He ने JiT प्रकाशित किया, जिसमें VAE को हटाकर 32×32 टोकन कमी प्राप्त की गई।

मुख्य संस्थाएं: कंपनियां: Linum, FLUX, Ideogram, Z-Image | लोग: Tianhong Li, Kaiming He