从打分到诊断:上海AI Lab推出具身操作仿真评测基座EBench

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联深度观察
·阅读量:2,615

想象这样一个场景:两个具身操作模型在同一个 benchmark 上拿到了相近的分数。一个在桌面抓放任务上表现稳定,但一进入移动场景就明显掉点;另一个在已知环境里成功率较高,但换一个物体、换一种表达方式后,表现就开始波动。

如果评测体系最终只给出一个总分,我们知道它们“差不多强”,却很难回答:它们究竟强在哪里,短板又在哪里。

这正是当前具身操作评测面临的核心问题。随着具身基座模型不断涌现,社区对模型能力的判断却仍然高度依赖成功率或任务总分。真机评测虽然贴近真实应用,但成本高、复现难,难以支撑大规模标准化比较;仿真 benchmark 虽然具备可重复性,却往往只能回答“是否做成”,难以进一步解释“为什么做成”或“为什么失败”。更关键的是,当训测边界不清时,benchmark 还可能退化为调参目标,使模型分数提升与真实泛化能力之间出现偏离。

近日,上海AI Lab 物理智能中心推出EBench。该 Benchmark 不再将单一排行榜作为主要目标,而是围绕“能力解析”与“真实泛化”构建一套可复现、可拆解、可比较的评测体系,希望把具身操作评测从“分数排序”推进到“能力测量”。目前,EBench 共包含 26 种任务,并从场景、原子技能、时长、精度、操作模式五个维度进行任务标注;同时覆盖物体、背景、指令、组合四类泛化维度,共 794 条测试任务,用于支撑对模型能力边界的细粒度分析。

不止于“抓与放”的多样化具身操作任务集

为了更接近真实环境中的操作复杂性,EBench 不再局限于单一场景内的“抓取—放置”循环,而是覆盖单步抓放、精细装配、移动操作、长程协同等多种任务形态。

在空间上,任务从二维桌面扩展到具有高度、纵深和层级关系的三维环境;在精度上,从“能放下”进一步走向“能对齐、能调准”;在时序上,从单步动作扩展到多步骤规划与中途纠错;在执行主体上,也从单机械臂延伸到双手协同与移动底盘协同。

这些任务将抓取(Grasp)、放置(Place)、插装(Insert)、倒入(Pour)、翻面(Flip)、推扫(Sweep)、递交(Handover)等动作原语融入真实操作语义中,并为每个任务标注场景、原子技能、任务时长、操作精度和操作模式五个维度,使评测不只回答“做没做成”,也能进一步定位模型到底强在哪、弱在哪。

配合验证集与测试集隔离,以及物体、背景、指令、组合四类泛化测试,EBench 关注的不是固定任务上的记忆表现,而是模型在分布变化下的真实操作能力。

从成功率到能力画像:五维标签如何拆开看模型能力

要让评测真正具备解释力,第一步不是简单增加任务数量,而是回答一个更基础的问题:一条任务结果,究竟由哪些能力因素共同决定? 围绕这一问题,EBench 为每条任务建立五维标签体系,将原本单一的成功率重新映射到不同能力维度中。

其中,场景维度用于观察模型在不同视觉环境中的表现差异;原子技能维度用于拆解模型在基础操作技能上的能力分布;任务时长维度用于刻画任务链条长度,帮助分析模型在短程与长程任务中的稳定性;操作精度维度用于比较模型面对不同精度要求时的表现;操作模式维度则用于区分灵巧操作与移动操作,观察模型在不同操作形态下的能力差异。

这样一来,Benchmark 输出的不再只是一个总分,而是一张可以继续分析的能力画像。

研究者能够进一步追问:某次模型优化究竟改善了移动操作能力,还是提升了低精度任务的成功率?某类失效主要集中在高精度操作中,还是出现在更长任务链条里?这些问题,单靠一个成功率很难回答,而五维标签体系正是为了把这些差异显性化。

不是在测记忆,而是在测泛化:训测隔离与四类泛化测试

仅仅把能力拆开还不够。对于具身操作模型来说,更重要的是判断这些能力能否迁移到新的任务条件中。

为此,EBench 采用验证集—测试集分离机制。验证集用于日常调参与快速迭代;小规模隔离测试集(Test)则用于在分布外条件下评估模型面对新物体、新背景、新指令和组合变化时的适应能力。

这样做的目的,是尽量区分两件事:模型是真的具备泛化能力,还是只是在反复迭代中适应了固定评测配置。

在此基础上,EBench 进一步设置了四类泛化测试:物体泛化、背景泛化、指令泛化和组合扰动。它们分别考察模型面对新物体、新视觉环境、新指令表达,以及多个因素同时变化时的表现。

这些泛化维度并不是简单增加测试场景,而是希望通过相对受控的变量设计,让性能变化能够更具体地对应到不同泛化因素。换句话说,研究者看到的不只是“换了测试集以后掉分”,而是可以进一步判断:模型退化主要来自物体变化、背景变化、语言表达变化,还是多种因素叠加后的综合挑战。

考虑到当前具身模型的能力覆盖范围并不完全一致,EBench 还提供 Specialist 与 Generalist 双轨评测入口。其中,Specialist 面向 Dexterous / Mobile Manip 等专项能力评估,并进一步区分灵巧操作与移动操作;Generalist 则面向更通用的具身操作模型,考察其跨任务、跨场景的综合表现。

一个可用的 benchmark,必须能够真正跑起来

对于具身操作模型而言,评测本身也是高成本环节:链路长、资源重、反馈慢。如果评测体系只能在论文结果页里出现,却很难进入日常研发流程,那么再精细的标签设计也很难真正发挥作用。

因此,EBench 在评测基础设施上也进行了专门设计。一方面,Benchmark 开源了分布式评测工具,支持本地高吞吐验证;在 8 卡 4090 配置下,约 30 分钟即可完成验证集评测,便于研究者进行快速回归测试与日常迭代。

另一方面,平台还提供 7×24 小时在线评测服务,用户无需自行搭建完整环境,即可在统一协议下发起标准化测试。

这种“本地验证 + 在线评测”的组合,本质上是在同时解决两个问题:既要缩短实验反馈周期,让 benchmark 真正进入模型训练、调参与回归测试过程;也要通过统一协议与远程执行环境,尽可能保证不同提交结果之间的公平性与可复现性。

只有同时满足这两个条件,benchmark 才能真正成为模型研发的日常工具,而不是阶段性展示工具。

初步结果:总分接近,不代表能力相同

目前,EBench 已在 π0、π0.5、XVLA、InternVLA-A1 等代表性模型上完成首轮验证。结果显示,不同模型即使整体成功率接近,能力结构也可能存在明显差异。

从验证集进入隔离测试集后,不同模型的分数波动并不一致。这说明,在缺少隔离机制的评测中,验证集上的领先可能包含对训练分布的适配,而不一定代表真实泛化能力。

从小规模隔离测试集(Test)来看,不同模型在操作模式、操作精度、任务时长等维度上呈现出不同分布。InternVLA-A1 在移动操作上表现突出,但在灵巧操作中下降明显;π0 则在移动操作与灵巧操作之间表现得更加均衡。

操作精度维度也揭示了单一总分容易掩盖的问题。在低精度任务中,不同模型之间差距有限;但进入高精度操作后,模型表现开始分化。π0 在高精度任务中仍保持相对领先,而 XVLA 与 π0.5 的表现下降明显。

从原子技能看,不同模型的优势也并不完全重合。π0 在拉(Pull)上表现更好;XVLA 在推(Move)上更具优势,但在交接 / 递送(Handover)任务上相对较弱。

泛化测试进一步说明,背景变化和指令变化相对容易适应;一旦引入新物体,成功率便会明显下降;当多个因素同时变化,也就是进入组合扰动(Mixed perturbation)场景时,模型表现会进一步降低。

整体来看,物体泛化(Object)和组合扰动(Mixed perturbation)是当前模型更容易失守的两个环节。在泛化性上,π0.5同样处于当前领先位置,在背景、物体、组合3个泛化维度上均优于其他模型,其中背景和前景物体泛化维度的优势最为明显。这也在一定程度上解释了社区普遍对于π0.5预训练“好用”的体验——模型经过后训练微调仍具有较好的泛化性。

这些结果进一步说明,对于具身操作模型而言,单一总分并不足以支撑全面判断。相比简单回答“谁更高分”,EBench 更重要的价值在于继续回答:这些分数来自哪类能力,这些能力是否稳定,以及它们能否迁移到分布外任务中。

结语

从这个意义上说,EBench 并不是单纯增加任务数量,也不是重复搭建一个新的排行榜。它更希望推动具身操作评测从“被动计分”走向“主动诊断”。

当 benchmark 不再只是输出一个总分,而是能够映射到模型的能力结构、泛化边界和真实短板时,评测才真正开始成为模型迭代和能力认知的一部分。


本文转自Xbotics具身智能实验室

作者 |  木木

产联社经授权发布

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

20
9
分享
上一篇 下一篇