Kemajuan pesat model AI teks-ke-gambar, seperti Nano Banana, Stable Diffusion, dan Flux, telah mengubah desain kreatif, tetapi mengarahkan model ini untuk memenuhi niat pengguna yang tepat tetap menjadi tindakan penyeimbang. Misalnya, meminta "kadal memakai kacamata hitam" mungkin menghasilkan kadal realistis tanpa kacamata, atau mendistorsi wajah kadal jika dipaksakan. Metodologi yang ada terputus: pengembang menggunakan teknik waktu inferensi seperti panduan tanpa pengklasifikasi, atau fine-tuning berat dengan adaptor efisien seperti LoRA, regresi berbobot hadiah, atau gradien kebijakan. Karena alat-alat ini diperlakukan sebagai perbaikan yang berbeda, bidang ini tidak memiliki bahasa matematika terpadu untuk kontrol.
Kerangka Diffusion Controller memecahkan ini dengan membingkai ulang proses denoising sebagai masalah kontrol yang mulus. Jaringan tambahan ringannya mengungguli standar industri untuk mencocokkan preferensi manusia, dan versi yang sepenuhnya tidak terkunci mencapai tingkat kemenangan 90% atas garis dasar. Kerangka ini memperlakukan generasi sebagai perjalanan yang terkontrol, dengan model dasar dibekukan dan peredam kemudi menyesuaikan lintasan.
Pendekatan ini mengkalibrasi ulang perilaku model secara dinamis, memberi bobot lebih pada tujuan yang ditentukan pengguna sambil mempertahankan kualitas gambar. Dalam contoh kadal, peredam memastikan kacamata disertakan, tetapi pagar penalti mencegah distorsi. Kerangka ini menjembatani teori dan praktik dengan dua metode fine-tuning berdasarkan skor hadiah akhir, termasuk gradien kebijakan dan PPO, yang secara iteratif mengarahkan model dengan aturan kliping bawaan.