HeadlinesBriefing favicon HeadlinesBriefing.com

Filtragem de Dados para Pré-treinamento de Vídeo Gerativo

Hacker News •
×

Imagens e modelos de vídeo melhoraram muito nos últimos anos, embora o interior desses modelos não tenha mudado muito desde Stable Diffusion 3. Claro, houve variantes pequenas como a difusão auto-regressiva que o GPT-Image popularizou. Mas ao nível alto, é basicamente flux matching com um backbone de transformer e um objetivo v-prediction.

Em nossa experiência, a maioria dos ganhos é diretamente atribuível a 3 sabores de melhorias de dados: Filtragem e Rebalanceamento de Dados, Anotação de Dados e Geração de Dados Sintéticos. RL tem impulsionado alguma melhora, mas só começou a funcionar realmente para imagem e vídeo nos últimos meses.

Há alguns anos, a sabedoria prevalente em todos os modelos generativos era agregar a maior quantidade de dados possível para o pré-treinamento. Felizmente, o campo ficou muito mais inteligente sobre isso. Se você jogar um monte de dados de baixa qualidade no pré-treinamento, seu modelo desperdiçará capacidade aprendendo a imitar esse pedaço de dados. Se você filtrar bem seu conjunto de dados, seu modelo terá mais facilidade em aprender o que você quer que ele aprenda.

Levamos você através de como nossa abordagem de filtragem de dados evoluiu desde 2024, e esperamos poupar você de alguns dores de cabeça se acabar treinando seus próprios modelos gerativos no futuro.