Figure AI发布Helix 2.5,创始人Brett Adcock在发布视频里说这是公司成立以来最重要的项目。Figure AI目前估值390亿美元,是全球最贵的未上市人形机器人公司。过去几代Helix发布都留下了颇有记忆点的画面,但最大的诟病之一是每次demo总在一个光线良好的样板间工作。Helix 2.5想跨过这一步。Figure AI在旧金山湾区租下30套住宅,把机器人直接运到现场,让它整理客厅、铺床和折叠毛巾。团队此前没有进入这些住宅采集机器人数据,也没有针对里面的床、枕头、毛巾和玩具进行微调。

三项任务的测试数据
Figure AI为三项任务各进行了140次测试。整理客厅时,机器人必须把全部13到15件玩具放进篮子;折叠毛巾时,四条毛巾必须全部折好并放进篮子;铺床则需要满足枕头位置、被子方向和床面覆盖等要求。只要需要人工进行安全干预,或者超过规定时间,就会被记为失败。铺床成功94次,成功率约67%;折叠毛巾成功87次,成功率约62%;整理玩具成功56次,成功率40%。三项任务合计完成237次,完整任务成功率56%。在相同测试中,没有经过Index预训练的对照模型只成功了约9%。
scaling law的叙事
Figure AI用四个不同规模的Index数据集训练模型,数据量依次为1倍、2倍、4倍和8倍,固定模型大小、下游任务数据和评估方法,只增加人类行为预训练数据。数据量每翻一倍,模型预测机器人下一步动作的误差都会继续下降。Figure AI使用前三组实验预测最大规模训练的结果,最终误差只有整个变化区间的0.54%。Figure AI将其称为第一条在人形机器人上测得的人类到机器人迁移scaling law。公司已与Nscale签署包含35亿美元初始算力承诺的合作协议,计划从2027年下半年开始部署,长期目标最高达到10万块英伟达Vera Rubin GPU。Index继续以每秒约35分钟的速度收集人类经验。
同行的批评
Sunday Robotics联合创始人Tony Zhao的批评主要针对56%的可靠性。Tony是ACT和ALOHA系统的核心作者之一,他在Figure AI发布数据后写道,有用的工作等于泛化加可靠性。Figure AI把237次成功理解为机器人可以在陌生环境中工作,Tony将注意力放在另外183次失败上。在家庭环境里,机器人可能接触易碎物品,也可能与儿童和宠物共同活动。它能不能偶尔完成任务,和用户能不能放心让它独立工作,是两回事。Nikolai Ensslen的批评更接近技术路线之争。他是机器人运动控制公司Synapticon的联合创始人和前CEO,他说这些数字本身就是模仿学习不能泛化的证据。在他的定义里,泛化意味着系统换一个地方仍然能工作,而且每次都能工作。争议在于,这种迁移是否足以支撑Figure AI对未来的判断。如果56%能随着Index扩大稳定地变成80%、90%甚至更高,Helix 2.5会成为机器人预训练路线的一个起点。如果成功率迟迟停在一半附近,那么Tony Zhao和Nikolai Ensslen的批评,就不只是一句不客气的评论,而会变成对整条与模仿学习相关的路线的质疑。
