谷歌用多智能体系统解决长视频一致性难题
谷歌研究团队公布多智能体视频框架,通过视觉记忆、分段生成和闭环评审,维持分钟级故事中的人物与场景一致性。
谷歌研究团队公布了一套用于生成连贯长视频的多智能体框架。系统将AI视频导演、视觉分镜、分段自回归生成和闭环评审结合起来,试图解决当前视频模型最顽固的问题之一:故事推进后,人物、道具和场景会逐渐变形。
这不是一个单独的新模型
该框架运行在Gemini和Veo之上,而不是替代底层模型。编排智能体负责选择创作方向,前期制作智能体生成分镜,其他专用智能体分别处理关键帧、动作和音频。系统还会持续保存人物、地点和物体状态,使角色或场景在间隔多段镜头后重新出现时仍能保持一致。
其中,A²RD采用逐段生成方式,并在“外推”和“插值”之间切换:前者推动叙事向前发展,后者把画面重新锚定到既有的视觉状态。另一个组件VQQA会针对视频提出具体视觉问题,把评审结果转成自然语言反馈,再进行新一轮生成。系统还会比较多轮结果,而不是默认采用最后一次输出。
为什么值得关注
生成式视频已经能做出惊艳的短片,但长片制作暴露出另一类缺陷:连续性首先是工作流和状态管理问题,而不只是渲染质量问题。谷歌把故事连贯性视为全局优化任务,并将编排、记忆和评估都放进生成管线。
不过,现阶段的结论仍应保持克制。谷歌展示了十分钟视频,并报告了多个基准上的提升,但系统依赖多次模型调用、测试时搜索和自动评审,可能带来更高成本与延迟。基准成绩也不等于导演能稳定控制成片。
这项研究仍揭示了一个重要方向:AI视频的下一步未必只是训练更大的生成器,也可能是让制作系统真正记住故事已经确定的内容。