当前视频扩散模型已能在数秒内渲染高保真画面,但将其串联为连贯的长叙事仍面临挑战。据 Google Research 介绍,现有自动化管线多依赖手工提示词链式调用,容易出现角色服饰或场景在不同镜头间发生偏移的语义漂移,以及上游瑕疵污染下游合成的级联失败。由于早期错误会随流程传播,最终输出往往需要大量人工干预。
为解决这一问题,研究团队构建了一个统一的 AI 视频联合导演(AI video co-director)多智能体框架,作为 Gemini 和 Veo 之上的编排层运行,并原生继承 SynthID 水印等安全机制。该研究包含四个相互支撑的子框架:Co-Director、CANVAS、A²RD 和 VQQA,相关论文将分别发表于 COLM 2026 和 EMNLP 2026。
分层参数化统筹创意意图
Co-Director 将视频叙事形式化为全局优化问题,引入分层参数化替代线性提示链。系统中的 Orchestrator Agent 使用多臂老虎机(MAB)算法,在创意策略、叙事模式和美学原型三个维度上搜索配置组合,并将结果动态注入各子智能体的系统提示词中。
生产阶段由 Pre-Production Agent 合成逐场故事线与视觉资产,形成统一分镜;Production Agent 再通过 Keyframe Agent、Video Agent 和 Audio Agent 分别完成关键帧锚定、动态生成与音轨叠加。最后,多模态大模型评审员对成片打分,将分解后的奖励信号回传 MAB,以迭代优化后续生成循环。该架构具备模型无关性,可置于任意基础生成模型之上。
CANVAS 维持跨镜头视觉连续性
即便脚本统一,连续镜头生成仍常导致角色漂移与环境不稳定。CANVAS(Continuity-Aware Narratives via Visual Agentic Storyboarding)通过维护角色、地点和物体状态的结构化表示来显式规划视觉连续性。
CANVAS 同样构建于 Gemini 之上,依赖持久化视觉记忆。当叙事推进时,系统从记忆中检索视觉锚点或初始化新锚点,以确保同一设定内的平滑过渡。在博物馆盗窃序列的对比测试中,直接使用基础模型生成会出现道具不一致与背景漂移,另一多智能体框架 AutoStudio 亦在剪辑间产生角色帽子消失等问题;而 CANVAS 能够保持角色、空间几何与物体状态在整个叙事中的一致性。
A²RD 处理分钟级时间跨度
为将分镜扩展为数分钟长的视频,A²RD 采用分段自回归生成架构,并配备追踪片段上下文与动态的多模态视频记忆。每个片段执行“检索—合成—精修—更新”循环,系统可在外推与插值两种模式间自适应切换:外推用于推动情节进入新节拍,插值则将片段锚定至已有实体与环境。
在一支十分钟的演示影片中,A²RD 持续查询视频记忆,以在长时间跨度内维持角色身份、服装细节与结构几何,缓解标准生成器中常见的视觉衰减现象。
VQQA 闭环定位与修正瑕疵
VQQA(Video Quality Question Answering)旨在让系统自主识别并修复视觉瑕疵。它根据具体提示动态生成视觉问题,将视觉语言模型的批评意见作为“语义梯度”,为迭代精修提供自然语言方向反馈,从而替代传统被动评估指标。
VQQA 作为黑盒提示优化器运行,不直接修改像素,而是迭代调整文本提示以修正属性绑定错误或角色特征不一致等高层构图缺陷。为防止精修过程引发新的语义漂移,系统引入全局选择机制:由全局评分器对优化轨迹中生成的所有视频对照原始提示打分,选取最高分候选版本。
专项基准与测试结果
研究团队同步开发了三项基准:GenAD-Bench 包含 50 个虚构品牌、400 个场景,用于测试营销约束下的生成能力;HardContinuityBench 评估场景重现间隔极长、服化道频繁变化时的空间连续性;LVBench-C 则针对长程时间动态,要求关键视觉资产至少消失 10 个片段后再以合理变化回归。
据公布的数据,Co-Director 在 GenAD-Bench 上达到 81.4 的峰值质量分数,并在 ViStoryBench 上提升故事一致性;CANVAS 在 ST-Bench 与 HardContinuityBench 上取得连续性增益;A²RD 在 VBench-Long 与 LVBench-C 上减少布局漂移;VQQA 在 T2V-CompBench、VBench2 及 VBench-I2V 上带来绝对质量提升。
研究团队表示,下一步将探索如何把人类在环工作流整合进这些智能体架构,目标是抽象掉时间一致性与世界状态追踪的技术复杂度,使创作者继续掌握叙事设计的主导权。

