据MarkTechPost报道,谷歌研究团队发布了一套AI视频联合导演系统,由四个代理框架组成,可将短片段组织成连贯的分钟级长视频,重点针对多镜头AI视频流程中的身份漂移和级联错误。项目页面显示,相关信息于2026年9月27日验证。

谷歌团队将长视频生成失败归为信用分配问题。扩散模型能快速渲染高保真片段,但拼接成故事更难。多数代理流程把模块与独立手写提示词串联,导致服装或场景在镜头间变化的语义漂移,也会因上游一个错误资产污染后续镜头而形成级联失败。

该系统构建在Gemini和Veo之上,同时保持模型无关,可驱动其他生成器,输出继承基础模型的SynthID水印。四个框架覆盖创意规划、故事板、长视频生成和自校正。

Co-Director已被COLM 2026接收,使用多臂老虎机做创意规划。编排代理在创意策略、叙事模式与美学原型间选择配置,前期制作代理生成故事板,关键帧、视频和音频子代理产出媒体,多模态大模型评审给剪辑打分并将因子化奖励返回老虎机。

CANVAS已被EMNLP 2026接收,以持久视觉记忆跟踪角色、地点和物体状态,在场景回归时调取视觉锚点。在谷歌博物馆盗窃测试中,AutoStudio丢失小偷的帽子,Gemini-3.1-Pro改变宝石,而CANVAS保持二者一致。

A²RD即代理自回归扩散,是免训练架构。每个片段围绕多模态视频记忆运行检索、合成、精炼、更新循环,代理在新故事节拍外推与回归实体插值间切换。谷歌分享了一部由此生成的10分钟影片。

VQQA即视频质量问答,为每个提示词生成视觉问题。视觉语言模型评审充当“语义梯度”改写文本提示词,无需访问模型内部。全局选择步骤从所有迭代中挑选最佳视频,而非采用最后一次结果。

谷歌建立三个新基准:GenAD-Bench包含50个品牌的200个虚构产品、400个广告场景,HardContinuityBench测试场景重现和道具状态变化,LVBench-C包含120个场景,关键资产需消失至少10个片段后再返回。

项目页面显示,Co-Director在GenAD-Bench平均得分81.4,人类评分3.96分(满分5分),基线包括Veo 3.1、Kling 3.0 Omni、Wan 2.6和MovieAgent。CANVAS在背景连续性、角色一致性和道具一致性上分别提升21.6%、9.6%和7.6%。A²RD在1至10分钟视频上一致性提升至多30%,叙事连贯性提升20%。VQQA在T2V-CompBench和VBench2上分别比原始生成绝对提升11.57%和8.43%。

与StoryMem、MovieAgent和AutoStudio相比,谷歌系统输出带旁白和配乐的分钟级多镜头视频;StoryMem输出约1分钟多镜头视频;MovieAgent输出带字幕和音频的多场景多镜头视频;AutoStudio输出多轮图像序列而非视频。谷歌系统不做微调,只编排现有模型;StoryMem在基础模型上做LoRA微调;MovieAgent使用角色级LoRA;AutoStudio免训练。基础生成器方面,谷歌系统使用Gemini和Veo且模型无关,StoryMem基于Wan2.2,MovieAgent使用ROICtrl、SVD和HunyuanVideo I2V,AutoStudio基于Stable Diffusion。最长报告输出为A²RD的10分钟,StoryMem约1分钟,MovieAgent未说明。

代码方面,Co-Director和A²RD已公开,CANVAS即将发布;StoryMem、MovieAgent和AutoStudio的代码也已公开。