AI评分 一般 (64)AI 中文改写

扩散控制器如何统一简化AI图像生成 - 谷歌研究

1 天前 2 阅读来源:research.google

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

文本生成图像模型正在快速迭代,从Nano Banana到Stable Diffusion、Flux,用户只需输入一句话就能生成照片级的高保真图像。但一个长期困扰开发者的难题始终没有解决:如何让模型精确理解并执行用户的真实意图。比如输入“一只戴墨镜的蜥蜴”,模型可能生成一只逼真的蜥蜴却忘了墨镜,或者强行加上墨镜后蜥蜴的脸变得扭曲、画质崩坏。这种“要么听话、要么好看”的两难,根源在于现有的控制手段彼此割裂——开发者要么在推理阶段用无分类器引导(classifier-free diffusion guidance)临时调整文本提示词的影响力,要么在训练阶段用LoRA、奖励加权回归或策略梯度等参数高效适配器对模型进行重度微调。这两类工具长期被当作互不相关的独立修补手段,导致整个领域缺少一套统一的数学语言来分析和优化生成模型的控制方式。工程师在“对齐用户偏好”和“保持图像质量”之间做权衡时,往往只能靠猜。 针对这一痛点,Google Research提出了Diffusion Controller框架。它的核心思路是把图像生成不再看作一系列孤立的去噪步骤,而是重新定义为一个平滑、连续的控制问题。在这个框架下,控制信号可以像调节旋钮一样连续地作用于整个去噪过程,而不是在推理和微调之间二选一。实验结果显示,Diffusion Controller的轻量级附加网络在匹配人类偏好方面超过了行业标准;而其完全解锁版本——即拥有“白盒”权限、可以直接修改模型内部权重的微调版本——对基线模型取得了90%的胜率。这意味着,无论是希望快速部署、不触碰模型权重的应用开发者,还是追求极致效果、愿意深度定制的团队,都能在同一套框架下找到对应的控制方案。对于跨境电商卖家和AI工具用户而言,这项进展的直接影响是:未来AI生图工具在理解复杂提示词(如“模特手持产品、背景为纯白、光影柔和”)时将更少出现“顾此失彼”的情况,出图可用率有望显著提升,从而减少反复抽卡的时间成本。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · research.google

内容版权归原作者及 research.google 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0 条

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容