MiniMax以轻量训练将H3改造成交互式世界引擎
MiniMax用8000条样本和不足千分之二的可训练参数,将H3视频模型中的动态知识转化为可交互环境。
从生成视频转向响应操作
MiniMax旗下海螺团队展示了一项实验性改造:把现有H3视频生成模型转化为可交互的世界模型。团队称,整个训练只使用8000条样本,并仅更新H3模型0.199%的参数,从而保留绝大部分原有模型,同时重新调用其对运动和场景变化的内部表征。
普通视频模型根据提示生成一段固定影像,这个改造后的系统则接收用户操作,并继续生成与操作相符的环境变化。任务由影视合成变成了有状态的模拟:场景不仅要改变,还要在连续交互中维持物体、空间关系和视觉历史的一致性。
这项工作意味着,大型视频生成器内部可能已经隐含了一部分世界模型能力。模型从海量视频中学习镜头运动、物体移动、接触关系和场景演化规律;通过一个规模较小的可训练接口,这些规律或许可以被直接调动,无需重新训练一套独立的交互模型。
现有证据仍属初步
MiniMax披露了样本规模和可训练参数占比,但尚未提供足以独立评估延迟、可用动作范围、连续运行时长和失败率的信息。系统如何应对陌生场景、不可逆操作,以及长时间交互中不断累积的偏差,也仍不清楚。因此,这次展示证明的是技术路径具有可行性,还不能等同于可投入生产的游戏引擎或通用物理模拟器。
为何重要
如果这种转换方法能够稳定迁移,视频模型厂商便可能把昂贵的生成底座复用于游戏、智能体训练环境和具身模拟。真正关键的是极小的适配成本:交互能力可能成为叠加在视频模型之上的扩展层,而不必发展成完全独立的模型门类。这有望缩短世界模型产品的开发周期,但最终价值仍取决于操控精度和状态持久性,而不只是画面是否逼真。