HeadlinesBriefing favicon HeadlinesBriefing.com

Les modèles de langage par diffusion continue font leur retour

Hacker News •
×

Une activité récente dans les modèles de diffusion continue pour le langage suggère que cette approche est en train de réapparaître après des années de dormance. Les méthodes de diffusion entièrement discrètes avaient largement remplacé les premières tentatives de diffusion continue, mais la tendance commence à s'inverser. Les modèles de langage modernes sont principalement autorégressifs, générant des séquences un jeton à la fois, ce qui s'est avéré extrêmement évolutif grâce à l'entraînement parallèle via le forcement de l'enseignant.

Cependant, l'autorégression n'est pas la seule approche générative itérative : les chercheurs ont exploré la diffusion pour la génération de langage en inversant un processus de corruption qui détruit progressivement l'information. Les premiers modèles de diffusion discrets sont apparus en 2021, remplaçant la corruption continue par des méthodes discrètes pour gérer les données catégorielles. En 2022, la diffusion continue pour les données discrètes a gagné en popularité avec des approches comme Diffusion-LM, qui représentait des catégories discrètes avec des vecteurs d'embedding continus sensibles à la corruption par le bruit gaussien, permettant l'application de mécanismes de diffusion gaussienne bien établis sans modification de l'algorithme de base.