HeadlinesBriefing favicon HeadlinesBriefing.com

Los modelos de lenguaje de difusión continua están regresando

Hacker News •
×

La reciente actividad en los modelos de difusión continua para el lenguaje sugiere que este enfoque está resurgiendo después de años de inactividad. Los métodos de difusión completamente discretos habían suplantado en gran medida a los primeros intentos de difusión continua, pero la marea está empezando a cambiar. Los modelos de lenguaje modernos son predominantemente autorregresivos, generando secuencias un token a la vez, lo que ha demostrado ser extremadamente escalable a través del entrenamiento paralelo mediante el forceo del profesor.

Sin embargo, la autorregresión no es el único enfoque generativo iterativo: los investigadores exploraron la difusión para la generación de lenguaje invirtiendo un proceso de corrupción que destruye gradualmente la información. Los primeros modelos de difusión discretos surgieron en 2021, reemplazando la corrupción continua con métodos discretos para manejar datos categóricos. En 2022, la difusión continua para datos discretos ganó impulso con enfoques como Diffusion-LM, que representaba categorías discretas con vectores de incrustación continuos susceptibles a la corrupción por ruido gaussiano, permitiendo la aplicación de mecanismos de difusión gaussiana bien establecidos sin modificar el algoritmo central.