HeadlinesBriefing favicon HeadlinesBriefing.com

Фильтрация данных для претренирования генеративного видео

Hacker News •
×

Изображения и видео-модели сильно улучшились за последние годы, хотя внутренняя структура этих моделей практически не менялась с момента выхода Stable Diffusion 3. Конечно, были небольшие вариации, такие как авторегрессивная диффузия, популяризированная GPT-Image. Но на высоком уровне это basically все flow matching с бэкбоном трансформера и объектом v-prediction.

На наш опыт, большая частьGain'ов напрямую причитается трем видам улучшений данных: Фильтрация и перебалансировка данных, Аннотация данных и Синтетическая генерация данных. RL принес некоторые улучшения, но только начал реально работать для изображений и видео в последние месяцы.

Несколько лет назад, prevailing wisdom во всех генеративных моделях заключался в том, чтобы собрать как можно больше данных для претренирования. К счастью, область стала намного умнее в этом вопросе. Если вы бросите кучу низкокачественных данных в претренирование, ваша модель потратит Capacity на обучение имитации этой части данных. Если вы хорошо отфильтруете набор данных, ваша модель будет легче научиться тому, что вы хотите, чтобы она научилась.

Мы przeprowadzimy вас через то, как наш подход к фильтрации данных evolved с 2024 года, и, надеемся, сэкономим вам couple of headaches, если вы в итоге будете тренировать свои собственные генеративные модели.