HeadlinesBriefing favicon HeadlinesBriefing.com

تصفية البيانات للتدريب المسبق للفيديو التوليدي

Hacker News •
×

لقد تحسن صور وفيديو النماذج بشكل كبير خلال السنوات القليلة الماضية، رغم أن الداخل الداخلي لهذه النماذج لم يتغير كثيرًا منذ Stable Diffusion 3.当然,有一些小型变体,如GPT-Image流行的自回归扩散。但从高层来看,基本上全是带有v-prediction目标的Transformer骨干网络的流匹配。

في خبرتنا، معظم المكاسب مستحقة لثلاثة أنواع من تحسينات البيانات: تصفية البيانات وإعادة توازنها، وتسمية البيانات، وإنشاء بيانات Synthetic. وقد أدى RL إلى بعض التحسينات، لكنه بدأ في العمل حقًا للصور والفيديو فقط في الأشهر القليلة الماضية.

قبل بضع سنوات، كان الإجماع السائد بين جميع نماذج التوليد هو تجميع أكبر قدر ممكن من البيانات للتدريب المسبق. لحسن الحظ، أصبح المجال أكثر ذكاءً بشأن هذا الموضوع. إذا قمت بإلقاء كمية كبيرة من بيانات الجودة المنخفضة في التدريب المسبق، سيهدر نموذجك طاقته في تعلم تقليد تلك الشريحة من البيانات. إذا قمت بتصفية مجموعة بياناتك جيدًا، سيكون من الأسهل على نموذجك تعلم ما تريد أن يتعلمه.

نأخذك في رحلة عبر كيفية تطور نهجنا في تصفية البيانات منذ عام 2024، ونأمل أن نوفر عليك couple of headaches إذا انتهى بك الأمر إلى تدريبه نموذجك الخاص للفيديو التوليدي.