⚡ 猫叔的AI资讯雷达
模型研究

智象发布具身世界模型,强化机器人抗干扰能力

HiDream-O1-Embodied统一表征图像、视频、三维与动作信息,瞄准复杂环境下更稳定的机器人感知和执行。

面向物理环境中的各种意外

中国人工智能公司智象未来(HiDream.ai)发布具身世界模型HiDream-O1-Embodied,目标是让机器人在环境持续变化时完成感知、物理状态预判和任务执行。该模型沿用公司的原生全模态架构,把图像、视频、三维信息和动作放入统一表征空间,而非拼接彼此独立训练的感知与控制模块。

智象称,这种设计可以让信息在理解、推演和执行环节之间直接流动。语言模块着重识别不同表达背后的任务意图;视觉模块则融合多个视角,即使部分画面受损或被遮挡,机器人仍有机会继续执行任务。

训练阶段主动加入光照、材质、视角和图像质量变化,并模拟画面污损与视野遮挡。数据方面,智象与动作捕捉厂商诺亦腾合作,以真人动作数据为基础,再通过生成方法把训练样本扩充至原来的约百倍。

榜首成绩仍有明确边界

HiDream-O1-Embodied首次参加具身智能评测平台RoboColiseum,便在扰动适应项目取得0.692的平均分并位列第一。相关测试会改变背景、照明、表面材质、相机位置、机器人初始状态及指令说法;平台整体评测包含78项高保真仿真任务。

不过,这项成绩主要反映模型面对受控扰动时的稳定性,不能直接等同于机器人在真实场地长时间运行的表现。目前披露的信息尚不足以判断其硬件适配范围、机械故障后的恢复能力,以及长期运行需要人工介入的频率。

此次发布的重要性,在于智象正把此前的图像生成和交互式世界模型延伸至机器人动作。如果统一架构能够顺利从仿真迁移到实体设备,开发者连接感知、预测与控制模块的工程成本可能下降。现阶段,0.692分证明的是一条具备潜力的技术路线,而不是已经成熟的生产级自主能力。

信源