Google Research 于 2026 年 9 月 29 日公布了图像生成控制框架 Diffusion Controller,将反向扩散采样过程重新表述为线性可解马尔可夫决策过程(LS-MDPs)中的纯状态随机控制问题。根据官方披露的基准测试,在保持基础模型权重冻结的“灰盒”配置下,该框架在人类偏好分数(HPS-v2)指标上的表现超过了参数高效微调方法 LoRA。
该技术的底层论文《Diffusion Controller: Framework, Algorithms and Parameterization》已于 2026 年 3 月提交至 arXiv,并被学术会议 ICML 2026 接收。Google Research 表示,现有的图像生成控制手段此前处于割裂状态,推论阶段采用的无分类器引导(Classifier-Free Guidance)与训练阶段采用的参数高效适配器(如 LoRA)之间缺乏统一的数学分析语言,而 Diffusion Controller 提供了一个将推论引导与参数高效适配整合至同一理论体系的控制层。
在具体控制机制上,框架设计了一个被称为“转向阻尼器”的轻量级附加网络。当基础模型处于冻结状态时,该网络通过实时监测去噪过程输出的中间反向均值,计算并注入微小的转向校正量,以此引导生成轨迹。
框架对模型的访问环境划分为两种形式:“灰盒”设置要求基础模型权重冻结,但控制器仍需获取模型去噪过程中的中间反向均值输入;“白盒”设置则允许对基础模型和控制器展开联合或分别训练。在推论阶段,使用者能够通过调节单一的引导强度参数来动态变更对齐强度,官方测试显示该操作不会破坏基线模型的稳定性或引入画面视觉扭曲。
该研究的官方实验基于开源模型 Stable Diffusion v1.4 展开,测试了监督微调(SFT)、奖励加权损失(RWL)及近端策略优化(PPO)三种微调路径。在 HPS-v2 人类偏好基准下,其“灰盒”版本在 SFT 和 RWL 路径下的胜率均超过了 LoRA;而在完全开放基础模型权重调整的“白盒”微调版本中,对比基线模型取得了 90% 的胜率。
在此前生成实践中,强制模型依从诸如“戴墨镜的蜥蜴”等复杂提示词往往会引发画质下降或主体形变,导致开发者必须在用户偏好对齐与图像质量之间进行权衡。Diffusion Controller 证明了在不改动基础模型权重的情况下能够实现轨迹精确控制,为托管或闭源图像生成模型的个性化调优与安全控制提供了可落地的实现路径。

