HeadlinesBriefing favicon HeadlinesBriefing.com

扩散控制器:统一AI图像生成

Google AI Blog •
×

文本到图像AI模型(如Nano Banana、Stable Diffusion和Flux)的快速发展已经改变了创意设计,但引导这些模型以满足精确的用户意图仍然是一个平衡行为。例如,提示“一只戴太阳镜的蜥蜴”可能会生成一只不戴太阳镜的逼真蜥蜴,或者如果强制包含太阳镜,则会扭曲蜥蜴的脸。现有方法是不连贯的:开发者使用推理时技术(如无分类器引导),或使用参数高效适配器(如LoRA)、奖励加权回归或策略梯度进行繁重的微调。由于这些工具被视为不同的修复,该领域缺乏统一的数学语言来控制。

扩散控制器框架通过将去噪过程重新定义为平滑控制问题来解决这个问题。其轻量级附加网络在匹配人类偏好方面优于行业标准,其完全解锁版本实现了90%的基线胜率。该框架将生成视为一个受控的旅程,基础模型冻结,转向阻尼器调整轨迹。

这种方法动态重新校准模型的行为,在保持图像质量的同时,更重视用户定义的目标。在蜥蜴示例中,阻尼器确保包含太阳镜,但惩罚护栏防止扭曲。该框架通过两种基于最终奖励分数的微调方法(包括策略梯度和PPO)弥合了理论与实践,这些方法通过内置裁剪规则迭代地引导模型。