Sakana AI让视觉模型先“排练”再控制机器人
Sakana AI发布SAIL,让视觉语言模型生成、模拟、评估并反复修正机器人轨迹后再执行。
发生了什么
Sakana AI与东京大学研究人员发布了SAIL(Scaling In-Context Imitation Learning),把“测试时扩展”引入机器人控制。该成果于9月27日公布,并计划在IROS 2026上发表。
SAIL不会让视觉语言模型只生成一条轨迹后立即执行,而是先根据少量示范生成多组候选动作,再把这些轨迹放进重建的仿真场景中运行,由另一个视觉语言模型评估任务进度,并将分步反馈返回给生成模型。系统通过蒙特卡洛树搜索,在探索替代方案的同时不断修正更有希望的轨迹。
为什么重要
这套方法针对的是具身模型的基本弱点:末端执行器姿态或夹爪状态出现微小误差,就可能让原本合理的计划失败。模型能够描述“应该怎么做”,并不意味着它能稳定地把描述转成精确动作。
SAIL的意义在于,它把部分改进工作从重新训练转移到了推理阶段。模型可以花更多计算量检查和修改动作,而无需改变参数。这与当前大模型通过测试时推理提升表现的趋势一致,但这里的反馈不是文本评分,而是来自模拟物理后果。
当然,仿真质量仍是关键限制。在重建场景中成功的轨迹,面对摩擦、遮挡、标定误差或复杂接触动力学时仍可能失败。因此,现阶段的真实机器人演示证明了方向可行,还不能等同于通用自主操作。
Uncle Cat 判断
SAIL真正有价值的是“先在仿真里排练”的闭环;能否预测真实物体的混乱接触,才决定它是不是实用突破。