HeadlinesBriefing favicon HeadlinesBriefing.com

Modèles de Langage par Diffusion

Hacker News •
×

Deux familles d'algorithmes de génération d'IA dominent aujourd'hui : les modèles de diffusion pour les données continues comme les images, et les modèles autogressifs pour les données discrètes comme le texte. Les modèles de diffusion génèrent l'ensemble de la séquence d'un coup, en partant d'un brouillon grossier et en raffinant chaque position en parallèle sur plusieurs tours. Cette approche permet des compromis entre vitesse et qualité, une correction d'erreur intégrée et un contexte bidirectionnel. Les modèles autogressifs génèrent un token à la fois, de gauche à droite, en autant d'étapes que de tokens. Les modèles de diffusion linguistique, en revanche, commencent par un brouillon complet et réécrivent toute la séquence à chaque étape. Appliquer la diffusion au langage était un problème ouvert jusqu'en 2024, mais les modèles de diffusion sont devenus compétitifs en qualité avec les modèles autogressifs. En 2026, les modèles de diffusion linguistique sont une réalité, avec des sorties des principaux laboratoires industriels, dont Mercury 2 (Inception Labs), Gemma Diffusion (Google) et Nemotron Diffusion (NVIDIA). Le concept central sous-tendant les modèles de diffusion est le dénoisement : produire des images pas à pas, en partant du bruit pur et en retirant une petite quantité à chaque étape jusqu'à ce qu'une image cohérente émerge. Le processus vers l'avant prend une image propre de formation et produit des images de plus en plus bruyantes. Le processus inverse apprend à inverser cette transformation, transformant le bruit en une image.

Les modèles de diffusion apprennent à dénoiser en s'entraînant sur des exemples de bruit qui se transforment progressivement en images. Le processus vers l'avant ajoute du bruit à une image propre étape par étape, tandis que le processus inverse apprend à inverser cette transformation. Cette approche à deux étapes rend les modèles de diffusion très efficaces pour la génération.

Les modèles modernes de langage par diffusion sont basés sur ces principes fondamentaux, adaptés aux données discrètes comme le texte.

Entités clés : Entreprises : Inception Labs, Google, NVIDIA

FAQ : Comment les modèles de langage par diffusion diffèrent-ils des modèles autogressifs ?

Diffusion LLMs generate entire sequences at once from a rough draft and refine every position in parallel, enabling error correction and bidirectional context, while autoregressive models generate one token at a time left to right without revision.