HeadlinesBriefing favicon HeadlinesBriefing.com

Модели языков по диффузии

Hacker News •
×

Сегодня доминируют две семейства генеративных алгоритмов ИИ: модели диффузии для непрерывных данных, таких как изображения, и автрорегрессивные модели для дискретных данных, таких как текст. Модели диффузии генерируют всю последовательность сразу, начиная с грубого черновика и постепенно улучшая каждую позицию параллельно в несколько раундов. Этот подход позволяет балансировать скорость и качество, встроенную коррекцию ошибок и двунаправленный контекст. Автрорегрессивные модели генерируют один токен за раз, слева направо, требуя столько шагов, сколько токенов. Модели диффузии для языка, в отличие, начинают с полной черновика и переписывают всю последовательность на каждом шаге. Применение диффузии к языку было открытой задачей до 2024 года, но к 2026 году модели диффузии стали конкурентоспособными по качеству с автрорегрессивными. В 2026 году модели диффузионных языков стали реальностью, с релизами ведущих промышленных лабораторий, включая Mercury 2 (Inception Labs), Gemma Diffusion (Google) и Nemotron Diffusion (NVIDIA). Центральная идея моделей диффузии — это денойзинг: создание изображений шаг за шагом, начиная с чистого шума и постепенно убирая его, пока не появится ясная картина. Прямой процесс преобразует чистую обучающую картинку в всё более шумные изображения. Обратный процесс обучается инвертировать это преобразование, превращая шум обратно в изображение.

Модели диффузии учатся денойзингу, обучаясь на примерах, где шум постепенно превращается в изображения. Прямой процесс добавляет шум к чистой картинке пошагово, а обратный процесс учится инвертировать это преобразование. Такой двухэтапный подход делает модели диффузии очень эффективными для генерации.

Современные модели языков по диффузии основаны на этих фундаментальных принципах, адаптированных для дискретных данных, таких как текст.

Ключевые сущности: Компании: Inception Labs, Google, NVIDIA