HeadlinesBriefing favicon HeadlinesBriefing.com

Diffusion Controller: Unificando IA

Google AI Blog •
×

O rápido avanço dos modelos de IA de texto para imagem, como Nano Banana, Stable Diffusion e Flux, transformou o design criativo, mas orientar esses modelos para atender à intenção precisa do usuário continua sendo um ato de equilíbrio. Por exemplo, pedir "um lagarto usando óculos de sol" pode gerar um lagarto realista sem óculos, ou distorcer o rosto do lagarto se forçado. As metodologias existentes são desconectadas: os desenvolvedores usam técnicas de inferência como orientação sem classificador, ou ajuste fino pesado com adaptadores eficientes como LoRA, regressões ponderadas por recompensa ou gradientes de política. Como essas ferramentas são tratadas como correções distintas, o campo carece de uma linguagem matemática unificada para controle.

O framework Diffusion Controller resolve isso reformulando o processo de denoising como um problema de controle suave. Sua rede adicional leve superou o padrão da indústria para corresponder às preferências humanas, e sua versão totalmente desbloqueada alcançou uma taxa de vitória de 90% sobre a linha de base. O framework trata a geração como uma jornada controlada, com o modelo base congelado e um amortecedor de direção ajustando a trajetória.

Essa abordagem recalibra dinamicamente o comportamento do modelo, dando mais peso aos objetivos definidos pelo usuário enquanto preserva a qualidade da imagem. No exemplo do lagarto, o amortecedor garante que os óculos sejam incluídos, mas uma barreira de penalidade impede a distorção. O framework une teoria e prática com dois métodos de ajuste fino baseados em uma pontuação de recompensa final, incluindo gradiente de política e PPO, que orientam iterativamente o modelo com uma regra de recorte embutida.