⚡ 猫叔的AI资讯雷达
模型研究

Dyna-2 用百万小时人类视频学习机器人动作

Dyna Robotics 发布世界—动作模型 Dyna-2,以百万小时人类视频预训练,尝试缓解机器人真实轨迹稀缺问题。

用人类视频补足机器人数据

Dyna Robotics 发布世界—动作模型 Dyna-2,称其预训练使用了 100 万小时人类视频。其核心思路是先从人类与物体交互的视频中学习广泛的物理规律,再用规模更小、采集成本更高的机器人动作数据完成适配。

世界—动作模型既要预测场景接下来如何变化,也要理解采取什么动作才能实现目标状态。这与主要把摄像头画面和文字指令直接映射为机器人控制信号的视觉—语言—动作模型有所不同。人类视频虽然不包含机械臂关节指令,却记录了物体运动、动作先后、接触过程、失败与恢复,而且覆盖的场景远多于普通机器人集群能够采集的范围。Dyna 表示,Dyna-2 试图从这种大规模数据中提取可复用的物理交互表征,再将其用于机器人操作。

Dyna 此前推出的 Dyna-1 已进入洗衣等重复性商业场景。公司曾披露该系统在生产任务中的成功率超过 99%,但这类数据对应的是边界明确的部署任务,不能直接等同于通用自主能力。对于 Dyna-2,尚待回答的问题包括:视频预训练能否显著改善陌生物体和新环境中的表现,模型适配不同机器人本体需要多少数据,以及这些增益能否在真实生产所要求的安全性、速度和稳定性下保持。

为何值得关注

机器人学习长期面临明显的数据错配:互联网视频极其丰富,高质量机器人轨迹却昂贵、采集缓慢,而且往往与特定硬件绑定。如果 Dyna-2 能证明,大规模人类视频确实可以减少新任务所需的机器人实操数据,它将为世界模型和具身智能领域正在探索的一条关键技术路线提供有力支持。

因此,“百万小时”的意义不只在数据规模,更在于训练范式。Dyna-2 最终是可跨平台迁移的基础模型,还是主要增强 Dyna 自有软硬件体系的内部能力,仍需等待独立评测、架构细节以及跨机器人实验来判断。

信源