World Labs 发布空间基础模型 Atlas
Atlas 用统一架构完成生成、三维重建与模拟,目标覆盖影视制作、机器人训练和虚拟世界开发。
用一种架构处理空间任务
World Labs 发布空间基础模型 Atlas,试图在同一系统内完成三维环境的感知、生成、重建和模拟。公司称,该模型从零开始训练,采用多模态自回归扩散 Transformer,可在统一的空间上下文中处理文字、图像、相机位姿和深度图。
Atlas 与普通视频生成模型的重要区别,是可以直接接收精确的相机几何参数,而不只依靠“平移”或“升降镜头”等文字描述。模型可根据一至六张参考图生成最长一分钟、分辨率达到 1440p 的可控视频。用户也可以把互不相关的参考图放置在指定空间位置,由模型补全中间区域,并尽量保持整体几何关系一致。
在三维重建方面,Atlas 可接收一张照片,也可使用超过一百张图像。输入较少时,系统会推测镜头没有拍到的区域;加入更多视角后,虚构成分减少,重建结果更接近真实空间。输出形式包括普通画面、深度图、点云和三维高斯泼溅,因此适用范围不仅是视频生成,还包括游戏、视觉特效与机器人模拟。
World Labs 称,Atlas 在稀疏视角三维重建中超过部分开源专用模型,并在人类评测中比近期视频模型更准确地遵循相机路径。不过,这些结果仍需谨慎看待:Atlas 直接获得相机坐标,而对照模型只能接收文字指令,相关成绩也尚未经过独立复现。
Atlas 目前仅向部分合作伙伴开放早期访问,未来将用于升级 World Labs 的 Marble 产品。公司没有公布公开接口价格、全面上线时间或可下载权重。
为何重要
Atlas 把生成与重建视为同一个空间建模问题,有望减少从实拍素材、可编辑虚拟世界到机器人模拟之间所需的工具数量。不过,它的长期价值取决于展示中的几何一致性,能否延伸到更长路径、运动物体以及训练数据之外的真实环境。