AI评分 一般 (68)AI 中文改写
谷歌研究:实现连贯长视频生成的自动化
4 小时前 1 阅读来源:research.google
AI 中文改写
原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接
谷歌研究院近日公布了一项名为“AI视频联合导演”的多智能体框架,试图解决AI视频生成领域一个长期存在的痛点:单段视频画质再高,一旦拉长到多镜头叙事,角色服装、场景细节就会悄悄漂移,甚至因为某个环节出错导致整条流水线崩盘。这套框架建立在Gemini和Veo之上,把长视频生成当作一个全局优化和“世界状态追踪”问题来处理,而非简单地把几个短片拼接起来。相关论文将陆续在COLM 2026和EMNLP 2026等学术会议上发表,同时配套的还有CANVAS、A²RD和VQQA等子框架。
问题的根源在于,现有的自动化视频流水线大多靠人工设计的提示词串联各个模块,各模块彼此独立,一旦上游生成的素材出现瑕疵,错误会顺着链条一路传导到下游,最终导致成片出现语义漂移——比如主角的衣着在第三个镜头里突然变了颜色,或者背景建筑悄悄换了风格。这在结构上类似于经典的信度分配难题:最终画面崩了,却很难回溯到底是哪一句提示词埋下的祸根。此外还有特征漂移和内容塌缩两种典型失败模式,前者指实体和环境在不知不觉中变形,后者指叙事原地打转、毫无推进。为了修补这些问题,创作者往往需要反复手动干预,效率极低。
谷歌这套方案的核心思路,是把“创意合成”和“一致性维护”拆开处理,将画质和连贯性建模为推理阶段的一个优化目标。框架会自动完成多模型提示、镜头衔接和闭环视觉修正等重复性 orchestration 工作,相当于给创作者配了一个不知疲倦的副导演。从官方披露的评测结果看,该框架在多镜头叙事一致性和角色持久性上都有明显提升,能够生成分钟级的长视频,同时有效抑制视觉漂移和错误传导。对跨境电商卖家和出海内容团队来说,这意味着未来用AI批量制作产品故事片、品牌短剧的门槛会进一步降低——不必再为每个镜头反复调参,可以把精力放回脚本和创意本身。
这篇文章对你有帮助吗?
觉得有用?分享给更多人
留言 · 0 条
暂无留言,来说两句吧
