L'avancement rapide des modèles d'IA texte-image, tels que Nano Banana, Stable Diffusion et Flux, a transformé la conception créative, mais guider ces modèles pour répondre à l'intention précise de l'utilisateur reste un exercice d'équilibre. Par exemple, demander "un lézard portant des lunettes de soleil" pourrait générer un lézard réaliste sans lunettes, ou déformer le visage du lézard si forcé. Les méthodologies existantes sont déconnectées : les développeurs utilisent des techniques d'inférence comme le guidage sans classificateur, ou un fine-tuning lourd avec des adaptateurs efficaces comme LoRA, des régressions pondérées par récompense ou des gradients de politique. Parce que ces outils sont traités comme des correctifs distincts, le domaine manque d'un langage mathématique unifié pour le contrôle.
Le framework Diffusion Controller résout cela en reformulant le processus de débruitage comme un problème de contrôle lisse. Son réseau additionnel léger a surpassé la norme industrielle pour correspondre aux préférences humaines, et sa version entièrement déverrouillée a atteint un taux de victoire de 90% par rapport à la ligne de base. Le framework traite la génération comme un voyage contrôlé, avec le modèle de base gelé et un amortisseur de direction ajustant la trajectoire.
Cette approche recalibre dynamiquement le comportement du modèle, donnant plus de poids aux objectifs définis par l'utilisateur tout en préservant la qualité de l'image. Dans l'exemple du lézard, l'amortisseur garantit que les lunettes sont incluses, mais une barrière de pénalité empêche la distorsion. Le framework relie la théorie et la pratique avec deux méthodes de fine-tuning basées sur un score de récompense final, y compris le gradient de politique et PPO, qui guident itérativement le modèle avec une règle de clipping intégrée.