Runway发布Solaris,以实时生成画面取代固定应用界面
这套研究系统逐帧生成可交互的720p界面,将视频生成能力延伸至软件形态和智能体训练环境。
把软件界面变成连续生成的视频
Runway发布早期研究系统Solaris。它不执行传统代码编写的应用,而是持续生成可交互的视觉界面。Runway将其称为首个“界面世界模型”,希望连接生成视频、软件交互和计算机操作智能体的训练环境。
Solaris可以从一张图片或一个场景描述开始,以最高720p分辨率逐帧合成界面。用户的点击、拖动和文字指令会成为后续画面的条件,使物体和布局发生响应,而开发者不必预先定义每一种交互。系统由语言模型理解意图并决定场景如何变化,再由基于Runway Gen-4.5技术改造的世界模型负责视觉呈现。
据Runway介绍,团队将原有扩散系统改为自回归生成,通过蒸馏减少去噪步骤,并使用快速模型自身生成的结果继续训练,以改善长时间交互中的稳定性。在一项由公司组织、涵盖250名参与者和近7500次两两判断的研究中,与Claude Opus 5生成的代码界面相比,Solaris在指令执行维度获得61%的偏好,在行为自然度维度获得71%的偏好。
Solaris目前尚未公开发布,Runway正在招募早期合作伙伴。公司同时承认,文字精度、结果确定性、无障碍支持、安全、传统软件集成以及逐帧生成成本等问题仍未解决。
为什么重要
Solaris把世界模型的适用范围从视频片段和物理空间模拟推进到了软件界面。不断变化的界面可以为智能体提供更丰富的训练环境,减少其对固定网站布局的依赖,也可能用于生成高度个性化、以传统方式开发成本较高的视觉应用。
不过,能够生成画面并不等于具备生产软件所需的可靠性、可审计性和无障碍能力。因此,Solaris目前更像一条值得重视的研究路线,也是Runway走出媒体生成市场的战略尝试,而非即将取代代码应用的成熟产品。