HeadlinesBriefing favicon HeadlinesBriefing.com

扩散语言模型详解

Hacker News •
×

两大生成式人工智能算法家族主导当今:用于连续数据(如图像)的扩散模型和用于离散数据(如文本)的自回归模型。扩散模型一次性生成整个序列,从粗略草稿开始,通过多轮并行逐步优化每个位置。这种方法使得速度与质量的权衡、内置错误校正以及双向上下文成为可能。自回归大语言模型(LLM)按顺序逐个生成token,从左到右,步数等于token数量。扩散LLM则从完整草稿开始,每一步重写整个序列。将扩散应用于语言长期是个难题,但到2024年扩散模型在质量上已与自回归模型竞争。2026年,扩散LLM成为现实,包括行业领先实验室的Inception Labs的Mercury 2、Google的Gemma Diffusion以及NVIDIA的Nemotron Diffusion。扩散模型的核心概念是去噪:从纯随机噪声逐步去除噪声,逐步构建出连贯图像。前向过程将干净训练图像生成 increasingly noisy(更噪音)的图像,而反向过程学习逆转此变换,将噪声转回图像。

扩散模型通过训练噪声逐渐转化为图像的示例来学习去噪。前向过程逐步向干净图像添加噪声,而反向过程学习逆转此变换。这种两步法使扩散模型在生成任务中极具效力。

现代扩散语言模型的基础源自这些核心原则,并适配于离散数据(如文本)。

关键实体:公司:Inception Labs, Google, NVIDIA