HeadlinesBriefing favicon HeadlinesBriefing.com

Filtrado de datos para preentrenamiento de video generativo

Hacker News •
×

Las imágenes y los modelos de video han mejorado mucho en los últimos años, aunque el interior de estos modelos no ha cambiado mucho desde Stable Diffusion 3. Por supuesto, han habido variantes pequeñas como la difusión auto-regresiva que popularizó GPT-Image. Pero a un nivel alto, básicamente todo es flujo de coincidencia con un backbone de transformer y un objetivo v-prediction.

En nuestra experiencia, la mayoría de los ganancias son directamente atribuibles a 3 sabores de mejoras de datos: Filtrado y reequilibrio de datos, anotación de datos y generación de datos sintéticos. RL ha impulsado alguna mejora, pero solo ha comenzado a funcionar realmente para imágenes y video en los últimos meses.

Hace un par de años, la sabiduría prevalente en todos los modelos generativos era agregar la mayor cantidad de datos posible para el preentrenamiento. Afortunadamente, el campo se ha puesto mucho más inteligente al respecto. Si lanzas mucha datos de baja calidad al preentrenamiento, tu modelo desperdiará capacidad aprendiendo a imitar esa porción de datos. Si filtras bien tu conjunto de datos, tu modelo tendrá más facilidad para aprender lo que quieres que aprenda.

Te llevamos a través de cómo nuestro enfoque de filtrado de datos ha evolucionado desde 2024, y espero que te ahorremos algunos dolores de cabeza si terminas entrenando tus propios modelos generativos en el futuro.