HeadlinesBriefing favicon HeadlinesBriefing.com

Filtering Data untuk Pre-training Video Generatif

Hacker News •
×

Gambar dan video model telah banyak meningkat dalam beberapa tahun terakhir, meskipun dalam model ini dalam tidak banyak berubah sejak Stable Diffusion 3. Tentu saja, ada varian kecil seperti auto-regressive diffusion yang populerisasi GPT-Image. Tapi pada level tinggi, basically semua flow matching dengan transformer backbone dan v-prediction objective.

Dalam pengalaman kami, mayoritas keuntungan langsung dapat diatur ke 3 rasa perbaikan data: Data Filtering & Rebalancing, Data Annotation, dan Synthetic Data Generation. RL telah membawa beberapa perbaikan, tetapi baru beberapa bulan lalu benar-benar bekerja untuk gambar dan video.

Sebelum beberapa tahun, kebijakan prevailing di semua model generatif adalah mengumpulkan sebesar mungkin data untuk pre-training. Untungnya, bidang ini menjadi lebih cerdas tentang ini. Jika Anda membuang sekumpulan data kualitas rendah ke dalam pre-training, model Anda akan membuang kapasitas untuk belajar meniru potongan data tersebut. Jika Anda well memfilter dataset Anda, model Anda akan lebih mudah belajar apa yang Anda inginkan untuk dipelajari.

Kami akan membawa Anda melalui cara pendekatan kami data filtering telah berkembang sejak 2024, dan harap Anda bisa menghindari beberapa kepala pusing jika Anda akhirnya melatih model generatif sendiri di kemudian hari.