⚡ 猫叔的AI资讯雷达
模型研究

谷歌 Gemini Robotics 2 让人形机器人实现全身控制

谷歌 DeepMind 发布三款具身智能模型,用单一策略统一控制腿、躯干、双臂与手指,并支持多台机器人协同完成同一任务。

谷歌 DeepMind 周四发布 Gemini Robotics 2,这套包含三个模型的系统把其机器人技术栈从桌面操作推进到人形全身控制和多机协同。

三个模型

作为主角的视觉-语言-动作(VLA)模型负责全身控制,把行走、躯干姿态与双手操作统一进同一套策略。在 DeepMind 的演示中,Apptronik 的 Apollo 2 人形机器人只接到一句指令——把洒水壶放进下层货架的绿色箱子——随后自己走到桌边抓取物体、迈步至货架并完成放置,整个过程无需人工拆解子步骤。该模型还能驱动 22 自由度的 SharpaWave 五指手,DeepMind 用打绳结和密封自封袋来展示其灵巧度。

Gemini Robotics ER 2 是具身推理层,一个充当高层规划器的视觉语言模型,具备视频理解与任务进度连续跟踪能力,可原生调用包括谷歌搜索在内的工具,并调度下层 VLA 模型。官方数据显示,其五级进度分类准确率 57.4%,关键时刻定位准确率 91.3%、平均绝对偏差 0.96 秒,延迟低于一秒,约为同类模型的四倍速度。第三个模型 Gemini Robotics On-Device 2 可在机器人本体上离线运行,只需数小时数据即可适配全新构型。

同一份模型 checkpoint 可控制三种本体——搭载 SharpaWave 手和 Inspire 手的 Apollo 2,以及 Franka 机械臂——机器人之间通过共享语义理解交接子任务。合作硬件还包括波士顿动力 Spot 与 Franka F3 Duo。ER 2 已通过 Gemini API 和 Google AI Studio 开放,Gemini Enterprise Agent Platform 则处于私有预览。DeepMind 同时发布了独立的安全技术报告:模型检测到附近有人时会停止动作,在安全指令遵循与人体接近度两项基准上均优于上一代。

为何重要

全身控制一直是"大模型驱动的机器人演示"与"能在未改造的人类空间里干活的机器"之间的那道坎。把移动与操作压进同一套学习策略,并把推理层当作普通 API 产品发售,意味着通用机器人控制正从研究成果变成第三方开发者可以直接调用的能力。

信源