HeadlinesBriefing favicon HeadlinesBriefing.com

Datenfiltering für generatives Video-Pre-Training

Hacker News •
×

Bilder und Video-Modelle sind in den letzten Jahren besser geworden, obwohl die internen dieser Modelle seit Stable Diffusion 3 kaum verändert wurden. Natürlich gab es kleine Varianten wie die auto-regressive Diffusion, die GPT-Image populär gemacht hat. Aber auf hoher Ebene ist es basically alles Flow Matching mit einem Transformer-Backbone und einem v-Prediction-Ziel.

In unserer Erfahrung sind die meisten Gewinne direkt drei Sorten von Datenverbesserungen zuzuschreiben: Datenfiltering & Rebalancing, Datenannotation und Synthetische DatenGenerierung. RL hat einige Verbesserungen angestoßen, aber es hat erst in den letzten Monaten wirklich für Bild und Video angefangen zu funktionieren.

Vor ein paar Jahren war die herrschende Weisheit bei allen generativen Modellen, so viel Daten wie nur menschlich möglich für das Pre-Training zu aggregieren. Glücklicherweise ist das Feld viel schlauer darüber geworden. Wenn Sie eine Menge niedrigqualitativer Daten in das Pre-Training werfen, wird Ihr Modell Kapazität verschwenden, um einen Ausschnitt dieser Daten nachzuahmen. Wenn Sie Ihre Datenmenge gut filtern, wird Ihr Modell leichter haben, das zu lernen, was Sie es lernen lassen wollen.

Wir führen Sie durch die Entwicklung unseres Datenfiltering-Ansatzes seit 2024 und hoffen, Sie vor ein paar Kopfschmerzen zu bewahren, wenn Sie später Ihre eigenen generativen Modelle trainieren.