HeadlinesBriefing favicon HeadlinesBriefing.com

Diffusion Controller: KI-Bild

Google AI Blog •
×

Der schnelle Fortschritt von Text-zu-Bild-KI-Modellen wie Nano Banana, Stable Diffusion und Flux hat das kreative Design verändert, aber die Steuerung dieser Modelle zur Erfüllung präziser Benutzerabsichten bleibt ein Balanceakt. Zum Beispiel könnte die Aufforderung "eine Eidechse mit Sonnenbrille" eine realistische Eidechse ohne Brille erzeugen oder das Gesicht der Eidechse verzerren, wenn erzwungen. Bestehende Methoden sind getrennt: Entwickler verwenden Inferenzzeit-Techniken wie klassifikatorfreie Führung oder schweres Feintuning mit parameter-effizienten Adaptern wie LoRA, belohnungsgewichtete Regressionen oder Policy-Gradienten. Da diese Werkzeuge als separate Korrekturen behandelt werden, fehlt dem Feld eine einheitliche mathematische Sprache für die Steuerung.

Das Diffusion-Controller-Framework löst dies, indem es den Denoising-Prozess als ein glattes Steuerungsproblem neu definiert. Sein leichtes Add-on-Netzwerk übertraf den Industriestandard beim Abgleich menschlicher Präferenzen, und seine vollständig entsperrte Version erreichte eine 90%-Gewinnrate gegenüber der Basislinie. Das Framework behandelt die Generierung als kontrollierte Reise, wobei das Basismodell eingefroren ist und ein Lenkdämpfer die Flugbahn anpasst.

Dieser Ansatz kalibriert das Verhalten des Modells dynamisch neu, gibt benutzerdefinierten Zielen mehr Gewicht und bewahrt gleichzeitig die Bildqualität. Im Eidechsen-Beispiel stellt der Dämpfer sicher, dass die Brille enthalten ist, aber eine Strafbarriere verhindert Verzerrungen. Das Framework verbindet Theorie und Praxis mit zwei Feintuning-Methoden, die auf einer endgültigen Belohnungsbewertung basieren, einschließlich Policy-Gradient und PPO, die das Modell iterativ mit einer eingebauten Clipping-Regel steuern.