通义万相上线 Realtime 模式:边打字边改画面
阿里万相团队在 wan.video 上线 Realtime 模式,用户持续输入描述时画面即时随之变化,进一步押注实时交互式生成。
把输入框变成实时"方向盘"
阿里通义万相团队 7 月 30 日表示,wan.video 已上线全新的 Realtime 模式,官方说法是"你的文字即刻成为世界"。在配套演示中,用户在提示框里持续输入描述,画面会随着每一句话不断重塑,而不是提交一次、等一张成品。团队同时放出演示片段和直达体验链接,但此次上线没有一并发布模型卡、延迟数据或技术报告。
实时化路线的一部分
这次上线延续了同一团队近期在交互式生成上的动作。7 月 5 日发布的 Wan-Streamer v0.2 是一套端到端双工模型,可做实时音视频对话,语音与画面同步输出,端到端延迟约 550 毫秒、模型侧约 200 毫秒,分辨率提升至 640x368、25 帧。万相产品线覆盖文生图、图生图、文生视频、图生视频与图像编辑,此前的开源权重版本也让它成为在海外部署较广的中国视频生成模型之一。
为何值得关注
目前多数商用图像、视频工具仍是"提交—等待"的循环:写提示词、排队、看结果、再改。把这个循环压缩成连续反馈,改变的是创作动作本身——提示词从下单变成了操控;也改变了服务成本结构,因为一块实时画布意味着持续的单用户推理,而非一次次可计费的离散任务。这对那些主要靠出图质量而非交互延迟建立差异化的对手,也构成新的压力。悬而未决的是质量:行业内的实时模式此前普遍以分辨率与一致性换响应速度,阿里尚未说明自家 Realtime 模式处在这条曲线的什么位置。