Figure AI 发布了 Helix 2.5。创始人 Brett Adcock 在发布视频中称,这是公司成立以来最重要的项目。这家估值 390 亿美元的未上市人形机器人公司,此前几代 Helix 的演示大多在光线良好的样板间里完成。机器人虽然已经能自主工作,但场景单一始终是外界批评的重点。

Figure AI 把机器人送进 30 户人家,Helix 2.5 的成功率引来同行质疑

这一次,Figure AI 在旧金山湾区租下 30 套住宅,把机器人直接运到现场,让它们整理客厅、铺床、折叠毛巾。公司称,没有针对这些住宅和其中的物品进行训练或适配,30 套住宅里都出现了成功案例。在其讲述中,机器人不再只重复实验室里学过的动作,而是能把积累的经验带到陌生环境中,这正是机器人领域长期追逐的泛化能力。

技术博客随后公布了完整数据:420 次测试成功 237 次,整体任务成功率 56%。三项任务各测试 140 次,铺床成功 94 次,约 67%;折叠毛巾成功 87 次,约 62%;整理玩具成功 56 次,任务要求是把 13 至 15 件玩具全部放进篮子。需要人工安全干预或超出规定时间,都记为失败。训练方式上,此前的 Helix 02 从已预训练的视觉语言模型出发,再用机器人数据学习动作,而数据来自机器人最终工作的环境。Helix 2.5 则从随机初始化开始,先在 Figure AI 的人类行为数据集 Index 上预训练,再用任务数据分别适配三种行为,测试时每种行为使用同一个固定版本,不因具体住宅重新训练。Figure AI 所说的 zero-shot,指的是没见过的住宅、房间布局和具体物品,而不是只听到一句自然语言指令就自行想出铺床的办法。

同行并不认同。Sunday Robotics 联合创始人 Tony Zhao 指出,237 次成功也意味着机器人有接近一半的时间在失败。Stealth 的 CEO Nikolai Ensslen 更为直接,认为这组数据恰好说明 Figure AI 使用的模仿学习系统不能泛化。Figure AI 觉得自己摸到了机器人版的 scaling law,两位同行看到的却是一条可能走不通的路线。