Figure发布Helix 2.5,机器人将进入30个陌生家庭执行家务

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:7,285
人形机器人公司Figure发布Helix 2.5,并将机器人带入30个此前未进入过的湾区住宅,测试整理客厅、折毛巾和整理床铺。Figure称,机器人无需针对测试住宅和物体重新采集数据或微调模型,完整任务成功率达到56%。

产联社编辑 | 黄钰慧

image.png

图片由AI生成

【产联社】人形机器人能否走出实验室、适配陌生场景,正成为规模化部署的关键。当地时间9月17日,人形机器人公司Figure发布Helix 2.5,并公布一项涉及30个真实住宅的测试。

按照Figure的技术文章,搭载Helix 2.5的机器人在此前没有进入过的家庭中,执行了整理客厅、折毛巾和整理床铺三类连续任务。Figure称,测试住宅和被操作物体没有进入任务适配数据,现场也没有进行额外数据采集、模型微调或环境适配。

这次测试试图回答一个与商业部署直接相关的问题,机器人进入新地点后,是否仍需要针对每个场景重新采集数据和训练模型?Figure将这一能力称为“零样本全身泛化”即机器人在没有针对测试环境重新适配的情况下,将此前获得的能力迁移到新的住宅。

一个基础模型适配三类家务

Figure称,Helix 2.5是公司目前构建的“最先进神经网络”。该模型基于Figure建立的人类行为数据集Index进行预训练,再从同一个基础模型出发,适配整理客厅、折毛巾和整理床铺三种行为。

三项任务都不是单步抓取。整理客厅要求机器人把场景中散落的13至15个玩具全部拾起并放入篮子。折毛巾要求机器人完成抓取、折叠和收纳。整理床铺则要求机器人调整两个枕头的位置,并将被子两侧和边角拉到床头一侧。

Figure公布的评测标准要求完整完成任务,不提供部分得分。如果出于安全原因需要人工介入,该次测试将被判定为失败。

这些任务同时涉及感知、移动、抓取、双手协调和全身控制。Figure称,机器人在狭窄或杂乱的家庭空间中,需要调整身体位置,以便观察、够取和操作物体。

例如,机器人可能需要先走到物体附近,再调整站姿完成抓取。在整理床铺时,还需要围绕床移动,重新寻找合适的观察和操作角度。

Helix 2.5所强调的“零样本”,并不是机器人没有经过训练,而是指测试住宅、住宅布局及测试物体没有出现在此前的适配数据中。Figure表示,评测家庭中的玩具、毛巾和床品在实验前被单独留出,并经过人工复核,以确认其未出现在任务定义数据中。

Figure还称,每项任务在30个家庭中使用同一个固定模型检查点,评测过程中没有根据测试结果调整模型权重,也没有使用评测过程产生的轨迹数据选择模型检查点。

Figure此前将Helix定位为视觉—语言—动作模型,用于连接视觉感知、语言理解和机器人控制。Figure官网介绍称,Helix可以在机器人端完成感知、移动和推理闭环,并支持Figure机器人在不依赖固定脚本的情况下执行任务。

成功率提高,但仍不是成熟家务产品

Figure在对照实验中固定了任务数据、模型架构、训练方式和评测条件,仅改变是否使用Index预训练。结果显示,未经Index预训练、从随机权重开始训练的模型,在陌生家庭测试中的完整任务成功率为9%。使用Index预训练的Helix 2.5,成功率为56%。

Figure称,56%的成功率较9%提升了5倍以上,并认为Index预训练解释了Helix 2.5大部分的零样本能力。

但56%并不意味着机器人已经能够稳定承担家庭家务。按照Figure的定义,只有完整完成整理、折叠或铺床任务才算成功。机器人如果漏掉部分物体、未完成折叠,或因安全原因需要人工介入,均不能计入成功。

因此,56%描述的是Figure内部盲测中的完整任务成功率,不是单个动作的准确率,也不是机器人在普通家庭中长期运行的成功率。

Figure在技术文章中明确表示,这项结果并不意味着通用人形机器人问题已经解决。公司将Helix 2.5称为其目前关于“人类经验能否迁移到新场景”的最有力证据之一。

Helix 2.5相较前代Helix 02的另一项变化,是用更少的任务适配数据覆盖更大的环境范围。Figure称,Helix 2.5完成相同任务时使用的适配数据约为Helix 02的一半,同时能够在30个此前未见过的家庭中以零样本方式执行任务。

测试中还出现了一些动作层面的变化。Figure称,Helix 2.5能够在陌生环境里后退重新定位、改变站姿,或者绕到床的另一侧修正折叠。

这表明,在Figure公布的测试中,机器人具备一定的错误恢复能力,但目前还不足以证明这种能力已经可以稳定覆盖更多任务或更复杂环境。

Figure还讨论了Index数据规模扩大后的模型表现。公司称,在保持模型大小和下游训练设置不变的情况下,将Index预训练数据量逐步扩大,机器人动作预测损失呈现规律性下降。

在覆盖8倍数据量的实验区间内,Figure使用较小规模实验结果预测最大规模训练结果,预测误差相当于整个区间损失变化量的0.54%。

陌生场景泛化成为验证重点

对需要使用人形机器人的企业而言,Helix 2.5值得关注的地方,是Figure把验证重点从固定场景下的单项动作,推进到陌生场景中的连续任务。

如果机器人在每个新地点都需要重新采集数据、训练和适配,企业部署就可能需要更多现场工程工作。如果机器人能够将已有能力迁移到新环境,供应商则有机会减少逐场景适配环节。

在工厂、仓储和商业服务场景中,不同客户的场地、货架、工位、物料和安全规则往往存在差异。因此,企业未来评估人形机器人时,除了关注机器人能否完成某个动作,还需要关注更换场景后是否仍需重新采集数据、需要多少人工介入,以及任务失败如何处理。

Figure在9月公布Index时称,该平台已覆盖108个国家,下载量超过26.4万次,周活跃用户超过4.4万。公司还称,Index每秒处理约30分钟的视频上传,并持续收集家庭和工作场所中的实际操作数据。

模型训练和算力投入也正在成为Figure扩大Helix能力的组成部分。9月3日,AI云服务商Nscale宣布与Figure签署多年期战略合作协议。

Nscale称,双方计划部署最多10万块英伟达Vera Rubin系列GPU,初始算力投入为35亿美元,计划从2027年下半年开始在美国得克萨斯州巴斯托部署,并有意将合作规模扩大至超过60亿美元。

对企业采购而言,未来需要评估的可能不只是机器人本体价格,还包括模型授权、现场适配、数据采集、算力服务、运维安全和失败任务处理等成本。

如果机器人能够减少逐场景训练,供应商可能更容易复制项目。如果模型仍需要大量现场数据,企业则需要把机器人项目视为持续运营和持续优化的数字化工程。这一判断仍需后续商业化交付数据验证。

总体来看,Helix 2.5目前仍是一项由Figure公布的内部实验结果。它证明了在三类任务、30个此前未见过的家庭中,基于Index预训练的机器人策略取得了56%的完整任务成功率,并在部分任务中展现出自我纠错能力。

因此,Helix 2.5更接近一条待验证的技术路线,而不是已经成熟的采购结论。人形机器人能否规模化部署,仍取决于供应商能否持续降低新场景适配成本,并把实验室中的泛化能力转化为可重复、可维护、可验收的现场能力。

商务合作,请联系侯经理 18801065284(微信同号)

报料及内容合作,请联系微信号chanlianshe2026

特别声明:本文仅供参考,不构成任何投资建议,未经允许不得转载。

137
43
分享