双榜满分只是热身,Motubrain 凭“跨本体长程决策”把具身智能拉出现实泥潭
最近,具身智能圈子都在热议同一件大事。
两个国际权威技术榜单——WorldArena和RoboTwin2.0同时被一个匿名模型登顶。引发全行业猜测。直到生数科技站出来认领,答案才水落石出。
但这件事情的意义,远不止圈内谁家又发布了个新模型。
Motubrain的霸榜第一次在量化层面证明:一个同时具备“预测世界”和“驱动行动”能力的统一大脑,不仅可行,而且可以做到最好。当整个行业都在比拼谁家机器人的自由度最大,谁家的手更灵巧时,生数科技看向了那个更根本的问题:机器人的大脑,到底该长什么样?
Motubrain的这次亮相,是对这条路的一次公开正名。
机器人的“身体”越来越强,“大脑”还困在割裂里
过去几年,机器人本体的性能飞跃远超预期。运动控制愈发精准,传感器融合日趋丰富,硬件成本也在持续下探。一台人形机器人能跑、能跳、能空翻,早已不再是新闻。
但一道尴尬的裂痕也始终存在:大多数机器人仍然是为特定环境、单一任务训练的专用工具。实验室里精度能达0.1mm的打螺丝机器人,换一颗表面反光的螺丝就可能束手无策;展厅里端茶送水流畅自如的服务机器人,换一间灯光不同的房间就可能彻底迷失。场景变了、目标变了、指令变了,系统便可能失效——这正是当前具身智能“大脑”的核心困境:能感知的未必会行动,会行动的往往难以理解环境变化,更缺乏跨任务、跨场景、跨本体的泛化能力。
具身智能真正要攻克的命题,是构建一个统一模型:既能理解物理世界、预测状态变化,又能据此生成稳定可靠的动作,适配更广泛的任务与场景。这个命题不破,机器人的规模化应用就无从谈起。
这正是Motubrain试图回答的核心问题。两份榜单,一次“能力对账”,Motubrain强在哪里,又凭什么?Motubrain此次引发行业关注,最直接的原因是在两套长期割裂的核心能力基准上同时登顶。
WorldArena,偏“世界模型”。考察的是模型是否理解运动规律、是否能预测物理变化、是否具备对环境状态变化的认知能力。也就是“你懂不懂这个世界”。
RoboTwin2.0,偏“行动模型”。 考察模型能否在多任务、多环境下稳定执行动作,泛化到从新场景,并持续完成复杂操作。也就是“你能不能在这个世界里把事情干成”。
过去几年,两条赛道各有探索,却也彼此割裂。深钻世界模型的团队长于预测推演,却陷入“看得懂但动不了”的窘境;主攻行动策略的团队能把特定任务做到极致,但一换环境就失效,对环境变化缺乏预判。
Motubrain是唯一一个同时在“预测”和“行动”双赛道问鼎的模型,直接将预测与行动统一建模,推倒了横亘在“世界模型”和“行动模型”之间那堵无形的墙。它实现了从“拟合动作”到“理解并预测世界规律”的本质飞跃——机器人不再是简单地模仿指令,而是通过理解物理世界的运行逻辑来生成行动。
在WorldArena上,Motubrain总体EWM Score达到63.77,排名第一,超过高德ABot、极佳GigaWorld-1等同类模型。更关键的是,它在Motion Quality、Flow Score、Motion Smoothness等多个运动维度上均排名第一。这些维度之所以重要,是因为它们衡量的是模型是否真正“理解”运动——不只是看起来像在动,而是动作真实、轨迹连贯、衔接丝滑、符合物理规律,不会出现突兀跳变或不自然抖动。
在RoboTwin2.0上,优势进一步被放大。Motubrain在Clean和Randomized两个场景下分别达到95.8和96.1,是榜单上唯一一个在随机环境下平均分超过95的模型。同时,一半任务成功率达到 100%,九成任务超过 90%。相较于高德ABot、蚂蚁灵波LingBot、JEPA-VLA、pi0.5等模型,这个成绩几乎是断崖式领先。
它强的不是某一个单项,而是面面俱到:动作连续一致、复杂环境稳定执行、跨任务跨场景的泛化能力、在随机扰动下依然能复现结果——这些特征,指向的不再是单项任务的“偶然强”,而是一个通用机器人大脑该有的样子。
Motubrain用成绩证明:把预测世界和驱动行动统一在同一个模型里,这条路是走得通的。
这种领先从何而来?“为行动而生”的Motubrain,给出答案
问鼎是结果,背后的能力架构才是原因。
Motubrain对自己的定位十分清晰:一个通用世界行动模型,具备多本体、多任务、长程执行能力。它从不是只想在单一任务上拿满分,而是要构建面向真实世界的统一行动能力: 从“执行指令”走向“预测世界并行动” ,从“单任务模型”走向“统一行动模型” ,从“固定流程”走向“动态决策执行” 。
这个能力结构由四个“一”支撑:
- 一脑多能,应对多种任务。Motubrain能够在多任务场景中保持稳定表现,不依赖单一任务训练。随着任务数量持续增加,任务之间的共享世界知识越多,模型的平均任务成功率也同步提升,展现出更强的多任务统一与泛化能力。
- 一脑多型,适配多种本体。Motubrain并不是为某一种机器人量身定制,而是面向多机器人本体设计的统一智能底座。它具备多本体适配能力,有望打破“一个机器人一个模型”的传统模式。模型能很好的利用异构数据,随着生态内机器人种类、场景和数据不断丰富,模型能力还能够持续提升,形成更强的通用性,并进一步反哺生态内每一类机器人的表现。
- 一脑贯通,长程任务一步完成。Motubrain能够直接学习完整任务链路,无需上层规划、任务拆解、快慢双系统或多模型拼接,在复杂长程任务中实现更高的成功率。一个World Action Model即可完成 10 个原子动作级别的复杂长程任务,而不止停留在 2-3 个原子动作的 Demo 展示。机器人面对的,不再只是一个个孤立动作,而是一项需要持续推进、完整闭环的任务。
- 一脑预见,实现动态决策。 Motubrain 不只是执行指令,更能够理解世界并预测环境变化,并据此推演更合理的动作与运动路径。通过将理解世界、预测世界和执行动作统一建模,模型能够在动态场景中持续判断、调整与行动,实现“预测世界,也驱动行动”。
这套能力结构共同指向一个目标:Motubrain解决的,不再是“机器人会不会做一个动作”,而是“机器人能不能连续完成一个任务”。
在实际任务中,四个“一”已得到充分验证。机器人制作火锅时,一手从锅中舀取丸子、一手倒果汁,一旦舀勺捞出是空的,Motubrain立刻理解并预测需重新捞取——这正是“一脑预见”驱动下的动态决策;从捞取、斟倒到上餐,十余个动作连贯完成,无需拆解拼接,凸显“一脑贯通”的长程执行能力。调酒时,牛奶与饮料调制、托放、按铃一气呵成;同一模型还能自动调整抓取与按压力度实现插花、浇水以及预测抓取位置并自适应调整自身姿态完成整理沙发等差异极大的任务,这便是“一脑多能”,知识共享,越用越稳。更关键的是,无论是火锅制作、调酒等餐饮场景还是整理洗漱台、沙发等家庭场景,都由同一个 Motubrain 大脑驱动,打破“一机一模型”,实现“一脑多型”。它不强调机械重复指令,而是围绕目标持续感知、动态决策与多步执行——前者是技能,后者是智能。
为什么是生数科技?通向“通用世界模型”的明确路径
Motubrain登顶双榜第一,绝非偶然的运气,而是生数科技在通用世界模型方向上长期积累的集中释放。
过去一年,围绕 world model 和 action model,行业已逐步形成几条有代表性的技术路线。其一是统一世界模型,通过视觉、语言、视频与动作的联合建模,融合视频模型、VLA、世界模型等能力,实现感知、规划、预测、执行和跨任务泛化。其二是“先想象、再行动”的路径,先用视频模型预测未来,再反向驱动机器人动作决策。其三则是“边推演、边行动的 World Action Model路线,同步推演未来状态并生成相应动作。
Motubrain走的正是技术门槛最高的第三条路线:兼具 world model 对环境和未来状态的推演能力,以及 action model 在真实任务中的执行能力。正因如此,它能在“世界建模”和“动作执行”两类榜单上双双领先。
Motubrain 不是一个孤立的模型,它是生数科技“通用世界模型”战略在物理世界的投影。底层基于全球首创的U-ViT架构,构建一个融合视觉、听觉、触觉等多模态信息的基座世界模型。这一底座向上支撑两条并行的业务线:在数字空间,驱动视频大模型Vidu,推动AI内容生成与生产力落地;在物理空间,支撑Motus / Motubrain在真实世界实现泛化行动,推动机器人从“模块化执行”走向“统一智能体”。双线推进,从“理解世界”到“生成世界”,再到“行动于世界”,生数科技始终如一在探索并推进一条完整的通用智能路径。
从“跑通”到“落地”,战略合作,撕开了真实场景的入口
榜单的成绩验证了技术路线的可行性,但能否走出实验室、深入真实场景并驱动产业落地,生数科技近期的一系列产业动作已给出初步回答。
它先后与无界动力、深朴智能、星尘智能达成战略合作,并将生态版图进一步拓展至星尘智能等本体厂商,构建起一个日益完整的战略合作生态。
这一布局释放的信号十分明确:Motubrain不止步于“技术验证”,而是在加速构建“模型能力—本体适配—场景落地”的完整闭环。合作链条从大脑延伸到身体,从单一适配走向多元协同,让通用世界行动模型的落地能力逐步走向从一到多的量级跨越。
如果说双榜第一回答的是“这个大脑行不行”,那么这一系列的合作开始回答的是“这个大脑,能否深度适配不同形态的本体,进入真实世界并持续产生价值?”
双榜样第一是一个起点,不是一个终点
Motubrain 双榜第一,最深远的意义不在于分数本身,而在于它用结果证明了“统一世界行动模型”这条路不仅走得通,而且能领先。
现在,这个“大脑”已经准备好,接下来的问题是:哪些行业、哪些场景,会率先被这个“统一大脑”所改变?这场关于物理世界智能的远征,现在才真正进入激动人心的章节。
本文转自Xbotics具身智能实验室
作者 | 木木
产联社经授权发布
特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。



