HeadlinesBriefing favicon HeadlinesBriefing.com

Modelos de Linguagem por Difusão

Hacker News •
×

Duas famílias de algoritmos de IA generativa dominam hoje: modelos de difusão para dados contínuos como imagens, e modelos autogressivos para dados discretos como texto. Modelos de difusão geram toda a sequência de uma vez, começando de um rascunho e refinando cada posição em paralelo em várias rodadas. Isso permite equilíbrios entre velocidade e qualidade, correção automática de erros e contexto bidirecional. Modelos autogressivos geram um token por vez, da esquerda para a direita, levando tantos passos quanto tokens há. Modelos de difusão linguística, por outro lado, começam com um rascunho completo e reescrevem toda a sequência a cada passo. Aplicar difusão à linguagem foi um problema aberto até 2024, mas os modelos de difusão tornaram-se competitivos em qualidade com os modelos autogressivos. Em 2026, os modelos de difusão linguística são uma realidade, com lançamentos de principais laboratórios industriais, incluindo Mercury 2 (Inception Labs), Gemma Diffusion (Google) e Nemotron Diffusion (NVIDIA). O conceito central dos modelos de difusão é o desnoising: gerar imagens passo a passo, começando com ruído puro e removendo uma pequena quantidade a cada passo até que uma imagem coerente surja. O processo à frente transforma uma imagem limpa de treinamento em imagens cada vez mais ruidosas. O processo inverso aprende a inverter essa transformação, convertendo o ruído de volta em imagem.

Modelos de difusão aprendem a desnoise treinando em exemplos de ruído que se transformam gradualmente em imagens. O processo à frente adiciona ruído a uma imagem limpa passo a passo, enquanto o processo inverso aprende a inverter essa transformação. Essa abordagem de duas etapas torna os modelos de difusão altamente eficazes para geração.

Modelos modernos de linguagem por difusão baseiam-se nesses princípios fundamentais, adaptados para dados discretos como texto.

Entidades-chave: Empresas: Inception Labs, Google, NVIDIA