HeadlinesBriefing favicon HeadlinesBriefing.com

Diffusion Controller: Unificando IA

Google AI Blog •
×

El rápido avance de los modelos de IA de texto a imagen, como Nano Banana, Stable Diffusion y Flux, ha transformado el diseño creativo, pero guiar estos modelos para satisfacer la intención precisa del usuario sigue siendo un acto de equilibrio. Por ejemplo, pedir "una lagartija con gafas de sol" podría generar una lagartija realista sin gafas, o distorsionar la cara de la lagartija si se fuerza. Las metodologías existentes están desconectadas: los desarrolladores usan técnicas de inferencia como la guía sin clasificador, o ajuste fino pesado con adaptadores eficientes como LoRA, regresiones ponderadas por recompensa o gradientes de política. Debido a que estas herramientas se tratan como arreglos distintos, el campo carece de un lenguaje matemático unificado para el control.

El marco Diffusion Controller resuelve esto reformulando el proceso de denoising como un problema de control suave. Su red adicional ligera superó el estándar de la industria para igualar preferencias humanas, y su versión completamente desbloqueada logró una tasa de victoria del 90% sobre la línea base. El marco trata la generación como un viaje controlado, con el modelo base congelado y un amortiguador de dirección ajustando la trayectoria.

Este enfoque recalibra dinámicamente el comportamiento del modelo, dando más peso a los objetivos definidos por el usuario mientras preserva la calidad de imagen. En el ejemplo de la lagartija, el amortiguador asegura que se incluyan las gafas, pero una barrera de penalización evita la distorsión. El marco une teoría y práctica con dos métodos de ajuste fino basados en una puntuación de recompensa final, incluyendo gradiente de política y PPO, que guían iterativamente el modelo con una regla de recorte incorporada.