9月17日,Figure AI发布新一代模型Helix 2.5,并在30个真实的湾区民宅中做了零样本测试。这些住宅保留了原有的沙发、床铺和折叠台面,没有为评测进行改造。测试前,玩具、毛巾和床品被单独存放,先由AI模型初筛,再由人工复核,确认它们没有出现在任何任务训练数据中。

Figure在30个陌生家庭测试Helix 2.5,零样本成功率56%

在420次试验中,有237次成功,零样本成功率为56%,评测过程采用盲测。没有任何单一评测任务在Index预训练数据中的占比超过1.90%。作为对照,同样硬件、同样任务数据,但没有经过Index预训练的策略,成功率只有9%。在其他条件不变的情况下,Index预训练让零样本任务成功率从9%提升到56%,整体成功率提升522%。

与上一代模型Helix 02相比,Helix 02需要先在目标场地采集数据再训练;Helix 2.5只用一半的适应数据量,就在30个从未见过的家庭里追平了Helix 02在单一场地的成功率。此前,特斯拉Optimus、1X Neo等演示多依赖场地专属数据或人工远程操作。Figure今年1月发布的Helix 02能完成卸洗碗机等连续几十步的长时任务,但也需要先在目标场地采集数据。

CEO Brett Adcock称这是“我们迄今做过最重要的项目”。AI总监Corey Lynch在发布视频中强调,机器人在30个家庭中“每一个都记录到了成功”。随着预训练数据增加,机器人表现呈现出可预测的、类似语言模型的比例关系。Helix 2.5想回答的问题是,机器人能否走进一个从未见过的家,直接开始干活,不需要主人先配合录一遍自己家的样子。