
Google多智能体生成分钟级视频:一致性提升仍停在研究阶段

2026年9月24日,Google Research研究员Yale Song和Yiwen Song在长视频研究发布中介绍了建立在Gemini与Veo之上的多智能体方案,展示A²RD生成的十分钟视频,并把这些框架称为“responsive creative partners”。视频说明逐段生成可以支撑更长的叙事;人物、场景和道具跨镜头保持一致,则是这套研究要解决的核心问题。
这次发布汇集了Co-Director、CANVAS、A²RD和VQQA,分别承担创作方向选择、分镜状态管理、长时段生成与画面质量反馈。它给出样片和分项评测,却没有公布一个让公众使用整套流程、一键生成稳定长片的产品入口。对创作者而言,研究展示的能力与现在能够购买或调用的功能,仍需分开判断。
Co-Director先为镜头确定共同的创作方向
短片段各自生成时,局部画面可以成立,接起来却可能偏离同一个故事。Co-Director把这个问题放到全局处理:编排智能体从创作策略、叙事模式和视觉取向中选择组合,再把选择传给前期规划与制作环节。它使用多臂老虎机算法在不同创作配置之间探索,并依据成片反馈调整后续选择,而不是让每个环节只凭独立提示词继续工作。
前期智能体将要求整理成逐场景故事线和分镜;制作智能体再调用负责关键帧、运动画面和音频的子智能体。成片交给多模态模型评价,评价信号返回编排环节,形成下一轮调整的依据。这种机制瞄准的是早期决定造成的连锁错误:如果角色设定或叙事方向从一开始就不统一,后续片段即使单独清晰,也很难靠末端修补恢复整部影片的一致性。
Co-Director在GenAD-Bench上的峰值质量得分为81.4。该基准包含面向虚构产品广告的具体创作约束,因此这个分数描述的是特定测试中的规划表现,不能直接换算成任意题材长片的成功率。全局优化提供共同方向,人物在离开画面后是否仍保持原样,还需要更细的状态记录。
CANVAS记录人物、地点和道具的变化
CANVAS处理的是分镜连续性。它为人物、地点和物体保留结构化状态,并在叙事回到旧场景时调取先前的视觉锚点。这样,角色重新出现时,系统可以参考此前的外观与位置关系,而不是只根据眼前镜头的一段文字重新猜测。对于穿插多个地点的故事,这种回查尤其重要,因为相隔较远的镜头仍可能需要呈现同一个空间。
Google展示的博物馆分镜包含反复出现的窃贼、展厅和宝石。直接使用Gemini-3.1-Pro生成的对照画面出现展品改变、展厅布局漂移;另一套多智能体方法AutoStudio的对照画面则出现窃贼帽子消失。CANVAS版本保留了这些反复出现的特征,展示了视觉记忆如何约束角色和场景状态。这是分镜层面的可见比较,不能单凭它断定完整动态视频中的每个动作同样稳定。
METAL对CANVAS论文结果的梳理列出其相对最强对照方法在背景连续性、角色一致性和道具一致性上的提升,分别为21.6%、9.6%和7.6%。这三个数字对应不同的分镜评价维度,不是整套长片流程的统一改善幅度。画面里帽子和展厅是否保持原状,比把分项百分比合成一个“稳定生成率”更能说明CANVAS解决的具体问题。
A²RD让片段衔接成更长的叙事
分镜规划之后,A²RD负责把故事推进到实际视频。它逐段生成,并用多模态视频记忆保留此前片段中的人物、环境和变化;每生成一段,就检索已有内容、合成新片段、修正结果并更新记忆。下一段因此既有继续讲述故事的依据,也有回到既有角色和场景时可用的参照。
系统会在两种生成方式之间切换:需要推进情节时向前延展,人物或地点重新出现时则借助记忆重新锚定。这个安排针对长视频的两种不同失误:只顾保持旧画面可能使故事停滞,只顾产生新内容又容易让服装、空间结构和人物身份逐渐变样。样片的时长来自片段之间持续衔接,并不表示底层模型一次生成了整部影片。
A²RD的论文在涵盖一分钟至十分钟视频的测试中,报告相对所选对照方法最高30%的一致性提升和20%的叙事连贯性提升。这些是论文所用任务与基准下的结果。它们与样片一起说明长时段记忆有研究价值,却不能保证不同题材、复杂动作或反复出场的人物都会取得相同幅度的改善。
VQQA用视觉提问寻找生成偏差
VQQA针对的是另一类错误:画面本身完整,却没有满足原始要求。它根据提示词提出具体视觉问题,让视觉语言模型指出人物属性、物体材质或镜头衔接中的偏差,再用反馈修改提示词并重新生成。它调整的是生成指令,而不是直接在已有视频的像素上涂改;因此,修正后的画面仍是新一轮生成的结果。
局部修正也可能带来新的偏移。为避免只看最后一次结果,VQQA让评估模型把生成过程中的候选视频重新与最初要求比较,再选出最符合要求的一版。研究展示的钢琴与小提琴合奏对照中,原始结果在切镜后把演奏乐器换到了另一名人物手中,修正结果保持了人物与乐器的对应关系。另一个立方体气球示例则展示了材质与形状同时符合要求的画面。
分项进展还不是公开的长片生成产品
目前能直接看到的是A²RD样片、CANVAS分镜对照和VQQA的局部修正示例;一致性提升的数值来自各框架自己的测试条件。Google对全局规划、视觉记忆和质量闭环的整体判断,建立在这些不同层次的证据之上。分镜连续性、逐段视频生成和单段画面质量不是同一个指标,因此不能把其中一项结果当作整套制作流程已经稳定运行的证明。
相近思路也出现在独立的ViMax研究中:其协作智能体协调叙事规划、人物与环境状态,并以视觉语言模型检查内容质量。这说明跨场景一致性仍是活跃的研究问题;ViMax和Google框架使用不同的设计与评估方式,现有结果不适合直接排成产品能力榜。
Google接下来提出的方向是让人能在生成流程中介入创作决策。对于需要交付完整长片的创作者,更关键的新信息将是整套方案何时提供明确的使用条件,以及能否公布覆盖规划、逐段生成和最终成片的可复现评测。
相关阅读:
相关文章
订阅我们的新闻通讯
将最新 Web3、AI 和加密货币新闻直接发送到您的邮箱。




