HeadlinesBriefing favicon HeadlinesBriefing.com

Modelos de linguagem por difusão contínua estão voltando

Hacker News •
×

A recente atividade em modelos de difusão contínua para linguagem sugere que esta abordagem está ressurgindo após anos de inatividade. Os métodos de difusão totalmente discretos haviam substituído em grande parte as primeiras tentativas de difusão contínua, mas a maré está começando a mudar. Os modelos de linguagem modernos são predominantemente autorregressivos, gerando sequências um token de cada vez, o que se mostrou extremamente escalável através do treinamento paralelo via teacher forcing.

No entanto, a autorregressão não é a única abordagem generativa iterativa — os pesquisadores exploraram a difusão para a geração de linguagem invertendo um processo de corrupção que gradualmente destrói a informação. Os primeiros modelos de difusão discretos surgiram em 2021, substituindo a corrupção contínua por métodos discretos para lidar com dados categóricos. Em 2022, a difusão contínua para dados discretos ganhou impulso com abordagens como Diffusion-LM, que representava categorias discretas com vetores de embedding contínuos suscetíveis à corrupção por ruído gaussiano, permitindo a aplicação de mecanismos de difusão gaussiana bem estabelecidos sem modificação do algoritmo central.