HeadlinesBriefing favicon HeadlinesBriefing.com

Diffusion Controller: Объединение ИИ

Google AI Blog •
×

Быстрое развитие моделей ИИ для преобразования текста в изображение, таких как Nano Banana, Stable Diffusion и Flux, изменило творческий дизайн, но управление этими моделями для удовлетворения точных намерений пользователя остается балансирующим актом. Например, запрос «ящерица в солнцезащитных очках» может создать реалистичную ящерицу без очков или исказить лицо ящерицы, если заставить. Существующие методологии разрознены: разработчики используют методы времени вывода, такие как бесклассовое руководство, или тяжелую тонкую настройку с эффективными адаптерами, такими как LoRA, регрессии с взвешиванием по вознаграждению или градиенты политики. Поскольку эти инструменты рассматриваются как отдельные исправления, в этой области отсутствует единый математический язык для управления.

Фреймворк Diffusion Controller решает эту проблему, переосмысливая процесс денойзинга как плавную задачу управления. Его легкая дополнительная сеть превзошла отраслевой стандарт по соответствию человеческим предпочтениям, а его полностью разблокированная версия достигла 90% победы над базовым уровнем. Фреймворк рассматривает генерацию как контролируемое путешествие, с замороженной базовой моделью и демпфером рулевого управления, регулирующим траекторию.

Этот подход динамически перекалибрует поведение модели, придавая больше веса целям, определенным пользователем, сохраняя при этом качество изображения. В примере с ящерицей демпфер гарантирует включение очков, но штрафной барьер предотвращает искажение. Фреймворк соединяет теорию и практику с помощью двух методов тонкой настройки, основанных на финальной оценке вознаграждения, включая градиент политики и PPO, которые итеративно управляют моделью со встроенным правилом отсечения.