HeadlinesBriefing favicon HeadlinesBriefing.com

जनरेटिव वीडियो प्री-ट्रेनिंग के लिए डेटा फ़िल्टरिंग

Hacker News •
×

छवियों और वीडियो मॉडल पिछले कुछ वर्षों में बहुत बेहतर हुए हैं, हालांकि इन मॉडल के अंदरूनी हिस्से Stable Diffusion 3 के बाद से बहुत बदले नहीं हैं। निश्चित रूप से, GPT-Image द्वारा लोकप्रिय बनाया गया ऑटो-रिग्रेसिव डिफ्यूजन जैसे छोटे विविधताएं थीं। लेकिन उच्च स्तर पर, यह लगभग सभी प्रवाह मिलान है जिसमें एक ट्रांसफॉर्मर बैकबोन और एक v-prediction उद्देश्य है।

हमारे अनुभव में, अधिकांश लाभ सीधे 3 प्रकार के डेटा सुधारों के लिए जिम्मेदार हैं: डेटा फ़िल्टरिंग एंड रिबैलेंसिंग, डेटा एनोटेशन, और सिंथेटिक डेटा जनरेशन। RL ने कुछ सुधार किए हैं, लेकिन यह केवल पिछले कुछ महीनों में ही छवि और वीडियो के लिए वास्तव में काम करना शुरू किया है।

कुछ साल पहले, सभी जनरेटिव मॉडल में prevailing wisdom यह थी कि प्री-ट्रेनिंग के लिए मानवly संभव के रूप में अधिक से अधिक डेटा इकट्ठा किया जाए। सौभाग्य से, क्षेत्र बहुत स्मार्ट हो गया है। अगर आप प्री-ट्रेनिंग में बहुत सारी low-quality डेटा फेंक देंगे, तो आपका मॉडल उस slice of data की नकल करने के लिए क्षमता बर्बाद कर देगा। अगर आप अपने डेटासेट को अच्छी तरह से फ़िल्टर करेंगे, तो आपका मॉडल को सीखना आसान होगा जो आप चाहते हैं कि वह सीखे।

हम आपको 2024 के बाद से हमारे डेटा फ़िल्टरिंग दृष्टिकोण के विकास के माध्यम से चलते हैं, और आशा है कि अगर आप अंत में अपने स्वयं के जनरेटिव मॉडल प्रशिक्षित करने के अंत में हैं तो आपको कुछ सिरदर्द से बचाएंगे।