HeadlinesBriefing favicon HeadlinesBriefing.com

টেক্সট-টু-ইমেজ মডেল ৩.৬× দ্রুত প্রশিক্ষণ

Hacker News •
×

TL;DR Linum v2 এর অ্যাটেনশন কনটেক্সট উইন্ডো দ্বারা সীমাবদ্ধ ছিল: একটি 720p, ৫-সেকেন্ড ক্লিপে 110K টোকেন খরচ হত। বেশিরভাগ জেনারেটিভ সিস্টেম লেটেন্ট ডিফিউশন মডেল (LDMs) যা আলাদা VAE এবং DiT ধারণ করে। JiT এর মতো পিক্সেল-স্পেস মডেলগুলি তাদের একত্রিত করে কিন্তু সূক্ষ্ম বিবরণে সমস্যা হয়। আমরা JiT-DDT প্রস্তাব করি, একটি নতুন এনকোডার-ডিকোডার আর্কিটেকচার যা বিবরণ পুনরুদ্ধার করে এবং দক্ষতার সাথে প্রশিক্ষণ দেয়। Linum v2 এর বিরুদ্ধে, JiT-DDT একটি টেক্সট-টু-ইমেজ মডেল ৩.৬× কম GPU-ঘণ্টায় প্রশিক্ষণ দেয়, এমনকি ৪× পিক্সেল সহ ছবি তৈরি করে। Linum v2 (256×256, 2.0B লেটেন্ট-স্পেস DiT + VAE, 256 লেটেন্ট টোকেন) বনাম JiT-DDT (512×512, 2.5B সক্রিয় পিক্সেল-স্পেস DiT, 320 পিক্সেল টোকেন = 64 এনকোডার + 256 ডিকোডার)। কোড এবং ওয়েট Apache 2.0 এর অধীনে উপলব্ধ। এটি একটি গবেষণা আর্টিফ্যাক্ট, সম্পূর্ণ মডেল রিলিজ নয়। Linum v3 এর জন্য অপেক্ষা করুন।

প্রায় সমস্ত জেনারেটিভ ইমেজ এবং ভিডিও মডেল LDMs, যা কম্প্রেশনের জন্য VAE এবং জেনারেশনের জন্য DiT ব্যবহার করে। VAE আলাদাভাবে প্রশিক্ষিত এবং ফ্রোজেন, FLUX, Ideogram এবং Z-Image এর মতো মডেলের জন্য টোকেন হ্রাস 16×16 এ সীমাবদ্ধ করে। গত শরতে, Tianhong Li এবং Kaiming He JiT প্রকাশ করেন, VAE বাদ দিয়ে 32×32 টোকেন হ্রাস অর্জন করেন।

মূল সত্তা: কোম্পানি: Linum, FLUX, Ideogram, Z-Image | ব্যক্তি: Tianhong Li, Kaiming He