HeadlinesBriefing favicon HeadlinesBriefing.com

تدريب نماذج النص إلى الصورة أسرع 3.6×

Hacker News •
×

TL;DR كان Linum v2 محدودًا بنافذة سياق الانتباه: مقطع 720p لمدة 5 ثوانٍ يستهلك 110K رمزًا. معظم الأنظمة التوليدية هي نماذج انتشار كامن (LDMs) مع VAE و DiT منفصلين. نماذج فضاء البكسل مثل JiT تدمجهما لكنها تواجه صعوبة في التفاصيل الدقيقة. نقترح JiT-DDT، بنية ترميز-فك ترميز جديدة تستعيد التفاصيل وتتدرب بكفاءة. مقابل Linum v2، يدرب JiT-DDT نموذج نص إلى صورة بـ 3.6× ساعات GPU أقل، حتى مع توليد صور بـ 4× بكسلات. Linum v2 (256×256، DiT فضاء كامن 2.0B + VAE، 256 رمزًا كامنًا) مقابل JiT-DDT (512×512، DiT فضاء بكسل نشط 2.5B، 320 رمز بكسل = 64 ترميز + 256 فك ترميز). الكود والأوزان متاحة تحت Apache 2.0. هذا منتج بحثي، وليس إصدار نموذج كامل. ترقبوا Linum v3.

جميع نماذج الصور والفيديو التوليدية تقريبًا هي LDMs، تستخدم VAE للضغط و DiT للتوليد. يتم تدريب VAE بشكل منفصل وتجميده، مما يحد من تقليل الرموز إلى 16×16 لنماذج مثل FLUX و Ideogram و Z-Image. في الخريف الماضي، نشر Tianhong Li و Kaiming He ورقة JiT، محققين تقليل رموز 32×32 عبر التخلص من VAE.

الكيانات الرئيسية: الشركات: Linum، FLUX، Ideogram، Z-Image | الأشخاص: Tianhong Li، Kaiming He