⚡ 猫叔的AI资讯雷达
研究AIGC

Runway GWM Worlds 2 实时生成可交互视频世界

这项研究预览可持续生成720p、24帧的视听模拟,并根据文字、镜头和玩家操作实时改变场景。

视频开始变成环境

Runway 发布世界模型研究预览 GWM Worlds 2,可持续生成720p、每秒24帧的交互视频,并同步输出48千赫兹音频。它不再制作长度固定的视频片段,而是在用户移动镜头或发出动作后,继续演化人物、物体、天气及整个场景。

用户首先设定环境、主体、视觉风格、物理规则和氛围。模型生成后续画面时,会同时参考初始描述和首帧、当前镜头与文字指令,以及滑动缓存中的历史画面。视频和音频解码器按时间顺序工作,因此模拟没有预设的时长上限。

Runway 展示了三种操作方式:创作者可以预先编排完整的时间轴动作;系统也可以在决策点暂停,形成回合制体验;还可把键盘和鼠标操作绑定为预设文字指令,实现实时控制。不同玩家能够分别控制同一场景中的不同主体。不过,Runway 承认预先编排目前效果更好,因为详细文字可以准确描述镜头刚刚揭示的新区域,而实时输入必须追求低延迟。

仍不是游戏引擎的替代品

该模型可能用于互动娱乐、虚拟角色、设计以及具身智能体模拟,但预览也暴露出尚未解决的问题。实时操作依赖预设文字动作,长期一致性受有限历史缓存约束;Runway 尚未公布独立延迟测试、物理可靠性指标,也没有说明物体和空间关系能够稳定保持多久。

即便如此,这仍推动生成视频向有状态的交互系统迈进。传统视频模型执行一次性镜头要求,Worlds 2 则试图在同步生成画面与声音时持续响应操作。对于后续事件必须继承先前动作的模拟任务,这一差异至关重要。

为何重要

世界模型正在成为连接生成内容、游戏和机器人研究的新竞争领域。持续720p输出让 Runway 的方案比许多概念展示更具体,但商业价值最终取决于几何关系和因果状态能否长期保持,而非单纯画面是否逼真。这两项能力在当前预览中仍未得到证明。

信源