HeadlinesBriefing favicon HeadlinesBriefing.com

Kontinuierliche Diffusions-Sprachmodelle erleben ein Comeback

Hacker News •
×

Eine Reihe jüngster Aktivitäten im Bereich kontinuierlicher Diffusionsmodelle für Sprache deutet darauf hin, dass dieser Ansatz nach Jahren der Stagnation wiederbelebt wird. Vollständig diskrete Diffusionsmethoden hatten frühere Versuche der kontinuierlichen Diffusion weitgehend ersetzt, aber der Trend beginnt sich zu wenden. Moderne Sprachmodelle sind überwiegend autoregressiv und generieren Sequenzen Token für Token, was sich als äußerst skalierbar erwiesen hat, da es durch paralleles Training mittels Teacher-Forcing ermöglicht wird.

Autoregression ist jedoch nicht der einzige iterative generative Ansatz – Forscher haben Diffusion für die Spracherzeugung erforscht, indem sie einen Korruptionsprozess umkehren, der Informationen allmählich zerstört. Frühe diskrete Diffusionsmodelle entstanden 2021 und ersetzten kontinuierliche Korruption durch diskrete Methoden, um kategorische Daten zu verarbeiten. Im Jahr 2022 gewann die kontinuierliche Diffusion für diskrete Daten an Bedeutung, mit Ansätzen wie Diffusion-LM, der diskrete Kategorien mit kontinuierlichen Einbettungsvektoren darstellte, die anfällig für Gaussianische Rauschkorruption sind, wodurch die Anwendung etablierter Gaussianischer Diffusionsmechanismen ohne Modifikation des Kernalgorithmus ermöglicht wurde.