HeadlinesBriefing favicon HeadlinesBriefing.com

Модели языка на основе непрерывной диффузии возвращаются

Hacker News •
×

Недавняя активность в области непрерывных диффузионных моделей для языка указывает на то, что этот подход возвращается после многолетнего затишья. Полностью дискретные методы диффузии в значительной степени заменили более ранние попытки непрерывной диффузии, но ситуация начинает меняться. Современные языковые модели в основном являются автрегрессивными, генерируя последовательности по одному токену за раз, что оказалось чрезвычайно масштабируемым благодаря параллельному обучению с использованием teacher forcing. Однако автрегрессия — не единственный итеративный генеративный подход: исследователи изучали диффузию для генерации языка, обращая вспять процесс коррупции, который постепенно уничтожает информацию. Первые дискретные модели диффузии появились в 2021 году, заменив непрерывную коррупцию дискретными методами для обработки категориальных данных. В 2022 году непрерывная диффузия для дискретных данных получила распространение благодаря таким подходам, как Diffusion-LM, который представлял дискретные категории с помощью непрерывных векторов-embedding, подверженных воздействию гауссового шума, что позволяло применять хорошо зарекомендовавшие себя механизмы гауссовой диффузии без изменений в базовом алгоритме.