HeadlinesBriefing favicon HeadlinesBriefing.com

Filtre de données pour le pré-entraînement vidéo génératif

Hacker News •
×

Les images et les modèles vidéo ont beaucoup progressé ces dernières années, même si l'intérieur de ces modèles n'a pas beaucoup changé depuis Stable Diffusion 3. Bien sûr, il y a eu de petites variantes comme la diffusion auto-régressive popularisée par GPT-Image. Mais à un niveau élevé, c'est essentiellement du flux matching avec un backbone de transformers et un objectif v-prediction.

Dans notre expérience, la plupart des gains sont directement attribuables à 3 saveurs d'améliorations de données : Filtre & Rebalancement des données, Annotation de données, et Génération de données synthétiques. Le RL a entraîné quelques améliorations, mais il ne fonctionne vraiment que pour l'image et la vidéo depuis quelques mois seulement.

Il y a quelques années, la sagesse répandue parmi tous les modèles génératifs était d'agréger autant de données que possible pour le pré-entraînement. Heureusement, le domaine est devenu beaucoup plus intelligent à ce sujet. Si vous jetez beaucoup de données de mauvaise qualité dans le pré-entraînement, votre modèle gaspillera sa capacité à apprendre à imiter cette tranche de données. Si vous filtrez bien votre ensemble de données, votre modèle aura plus facile à apprendre ce que vous voulez qu'il apprenne.

Nous vous guidons à travers l'évolution de notre approche de filtrage de données depuis 2024, et espérons vous éviter quelques maux de tête si vous finissez par entraîner vos propres modèles génératifs plus tard.