“ChatGPT时刻”尚未到来,具身大脑已提前打响“百模大战 ”

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社媒汇
·阅读量:1.4w

当前,机器人产业软件落后于硬件已是行业共识,“脑体倒挂”是行业的痛处,如何突破软件端的瓶颈,业内已开始“八仙过海”。

在刚落幕的“2026世界机器人大会(WRC)”上,银河通用创始人王鹤提到一组对比数据:2025年,银河通用发布世界动作模型论文时,他能找到的相关论文只有他们一篇;一年多后,他再次在网上检索,数字已经变成171篇。另一边,星海图创始人高继扬也谈到,2025年至今的18个月里,全球已经出现100多款开源具身基础模型。

公司一侧也迅速变得拥挤。

仅世界模型这一赛道,截至8月31日,据《每日经济新闻》记者不完全统计,国内至少已有30家公司发布、预告或明确宣布涉足世界模型。

具身大脑开始呈现出上一轮“百模大战”的特征,只是这一次,比很多人预想中来得更早。

2023年,百模大战爆发时,ChatGPT已经完成了一次近乎全民规模的产品教育,大语言模型赛道构成了相对清晰的技术底座。后来者可以争论模型多大、开源还是闭源,但起码清楚自己正在追赶什么。具身智能恰好相反,行业还没有等来一个所有人都能感受到的“ChatGPT时刻”,也没有就模型路线达成一致。

不过,公司数量最繁盛的时候,往往也是淘汰真正开始的时刻。

乐聚机器人展区 图片来源:每经记者 可杨 摄

答案未定,模型涌现

过去几年,具身大脑的主流答案是VLA(视觉-语言-动作模型),把视觉、语言和动作放进同一个端到端模型,让机器人从人类示范中学习下一步动作。这是在“重复”被大语言模型验证过的路线,如果大语言模型可以通过预测下一个词学会写作和推理,那么机器人是否也能通过预测下一个动作,学会工作?

过去两年,机器人行业证明了前半句话——经过充分训练后,机器人已经能够抓取、整理、折叠、搬运,甚至完成几个动作组成的任务。

但也正因如此,下一堵墙才变得清晰起来。

‌宇树科技创始人王兴兴提到,机器人在固定场景、经过充分采集训练后,成功率可以做到接近100%,但环境或物体稍有变化,成功率就会严重下降。“最后几个厘米或者最后几个毫米的成功率或者偏差没办法很好地跟真实世界匹配……最终误差没办法很好修正,导致成功率暴跌得很严重。”

对致力于成为生产力的机器人来说,实验室里的一条失败样本,到了工厂会被连续作业不断放大。

墨奇智能联合创始人兼CTO黄青虬算了一笔账,硬件、软件和算法三个模块,假设每一个模块的失败率是1%,单个动作的成功率就是0.99的3次方,如果机器人要完成一个长程任务,可能是10个动作的集合,那成功率可能就是0.99的30次方。

如此一来,成功率就从99%衰减到73.97%,这意味着在工厂等真实连续作业场景中,如果不解决长程任务的稳定性,机器人每执行三四次任务就有可能失败一次。

世界模型顺理成章地被推到具身智能竞争的中心。

它承接的是行业对下一阶段能力的期待,希望机器人不只模仿过去见过的动作,还能预测动作发生后,环境和自身状态将如何变化,以此提高对新任务和长程任务的处理能力。

但当大家谈及世界模型,所谈论的未必是同一个“世界”。有人强调预测未来画面,有人把视频、动作和机器人反馈放进同一个模型,也有公司尝试引入更多物理规律。

伽利略研发总监刘伯韬认为,现阶段真机实测数据、端侧算力以及模型能力,尚不足以支撑开放环境下的真正通用化能力,很多场景下所谈及的泛化能力仍存在现实瓶颈。

星源智创始人刘东则认为,在物流分拣等边界明确的场景中,让机器人适应不同物体的小范围泛化已经能够实现,而任意环境、任意任务则仍然缺少足够数据。

就这样,世界模型出现了有些反常的繁荣。

VLA已经足够成熟,却没有强大到足以终结技术路线,反而把泛化、长程任务等问题暴露出来,而新的方案还远没有形成强势的共识。

同时,模型本身的门槛也尚未高到把大量玩家挡在牌桌之外。摩尔线程创始人、董事长兼首席执行官张建中提到,目前大量VLA仍集中在70亿参数左右,训练可能只需要几十张甚至几张GPU(图形处理器)。他认为,具身智能的世界模型真正走向“ChatGPT时刻”,算力需求一定会在千卡乃至万卡级。

百万小时之后,数据仍然不够

围绕具身大脑的争论,最后大多会回到数据,但什么才是一条好数据?

大语言模型崛起之前,人类已经花了很多年在互联网上自然生产文本、图片和视频,模型出现以后,只需要把这些已经存在的数据组织起来。

但机器人没有这样的数据基础。

黄青虬举了一个擦桌子的例子。

数采员可能只完成一条标准轨迹,真正的保洁人员却会观察污渍,调整方向、力度和次数,没有擦干净就再来一次。两段数据都叫擦桌子,机器人能学到的内容却相差很大。如果1万小时数据中有9000小时高度重复,时长增加也未必带来新的信息。

数据量成了最容易衡量但也最容易失真的指标。

不同公司的选择也迅速分化,有人坚持真实数据,有人押注仿真,也有公司把互联网视频、人类操作、合成数据、真机遥操和部署回流混合起来。

光象科技将训练过程分成了几个阶段,互联网视频和没有动作标注的人类第一视角数据,主要用于建立模型对物理世界的基础认识;带有动作标注的第一视角数据,帮助模型学习动作发生后物体状态如何变化;真机遥操数据负责适配机器人的真实构型和操作规范;仿真数据则可以在相同状态下批量生成不同动作及其后果,让模型学习哪些动作可行、哪些会导致失败。

王鹤将银河通用的数据体系分为互联网数据、人类数据、合成数据、真机遥操数据和真机回流数据五层。据其披露,公司已积累50万小时高精度人类操作数据和50万小时不依赖手持机械装置的人手数据。

百万小时开始成为部分企业争夺的规模门槛,但如何将这些数据转换为机器人能力,仍取决于标注、筛选和训练方法。

真实数据与仿真数据各有代价,真实数据直接来自物理世界,但采集慢、成本高;仿真数据可以大规模试错,却要承担虚实迁移偏差。

奥比中光创始人、董事长兼CEO黄源浩提到,机器人操作数据正在从视频扩展到第一视角、触觉和力觉,但不同信号之间的时间同步仍不成熟,视觉与触觉数据相差15毫秒,都可能影响数据有效性。机器人的关节范围、手部姿态和传感器配置也各不相同,只有完整记录位置、受力和物体状态,数据才有机会跨本体、跨模型复用。

现阶段,行业还没有探索出一种可以适用于所有任务的比例。

自动驾驶曾经提供过一个很诱人的范本:车先卖出去,人继续驾驶,传感器自然把大量真实驾驶数据带回来,部署越多,数据越多;数据越多,模型越好。

机器人很难照搬。在机器人学会自主工作以前,没有这么多人会主动购买和使用它,冷启动数据只能由企业自己采集。

因此,公司争抢工厂、物流和零售场景,得到的不只是一张订单,也是数据飞轮的第一圈。

黄青虬认为,目前数据规模仍小,今天很多算法实验得到的结论,随着数据增长可能被推翻,VLA之后还会出现新的模型架构,真正能够留下来的,是数据和模型训练基础设施,以及经历过一轮轮范式变化的人才。

工厂手握淘汰赛投票权

“百模大战”这个词,天然带有淘汰赛意味。

在上一轮大语言模型的竞争中,大量模型在发布后迅速消失,竞争从参数规模转向推理成本、产品入口、生态与收入。

对机器人产业来说,更大的变化来自于,客户开始算账了。

星动纪元联合创始人席悦提到,过去不少机器人项目停留在概念验证阶段,客户不会优先考虑价格;今年越来越多客户开始认真计算投资回报率,以及机器人能否批量、持续、稳定运行。

星动纪元WRC展区 图片来源:每经记者 可杨 摄

光象科技首席科学家吕尧认为,行业需要基准来比较模型能力,但最终验证仍要回到真实机器人和工业产线,看具体工位的任务成功率以及能否为客户创造价值。

光象科技创始人兼CEO张涛也提到,现有榜单还不足以全面代表模型能力,排名靠前只能说明模型进入第一梯队,很难直接证明其真实部署水平。

张涛坦言,客户一定会关注成本,如果一家企业声称不关心成本,其目的很可能并非真正推动落地。更重要的是让产品成本与场景价值匹配,对于已经存在更便宜、更成熟方案的任务,没有必要投入一台价格更高的具身机器人。他认为,具身智能更适合传统自动化难以处理,同时具备真实需求和规模化潜力的场景。

这些指标最后都会变成一笔账单:一项新任务需要训练几天,一台机器人每天处理多少件产品,换一个场地要投入多少工程师,单位劳动成本能否低于人。

相比零样本、跨场景和跨本体,这些数字不够醒目,却更早决定公司去留。

训练成本也在上升。

极佳视界联合创始人、首席科学家朱政测算,团队使用几十万小时数据训练几十亿参数的世界模型和具身基础模型,成本已达到约1亿元。如果未来数据扩大到几千万乃至上亿小时,参数增加十倍、百倍,而数据利用效率没有同步提高,意味着训练模型的成本将提高到上千亿元。

王兴兴把机器人进入陌生环境后,仅凭语言指令完成约80%的任务视作接近“ChatGPT时刻”,给出的时间是快则两三年,慢则五到十年。

黄青虬给出两个尺度:如果看商业部署,三年内有1000台机器人在真实产业中工作可以算作标志;如果要求机器人在陌生环境和任务中都达到较高成功率,至少还要五年。

高继扬认为,具身智能未必会拥有一个公众同时感知的GPT时刻。大语言模型上线后,每个人都能立即打开电脑试用;机器人的第一批有效部署却会藏在工厂、仓库和零售后场。技术拐点可能已经发生,公众却要等到机器人渗入足够多的生产环节后,才后知后觉地发现它们无处不在。

尽管如此,“百模大战”仍然有它的价值。

在技术路线没有收敛时,足够多的模型、数据方案和本体实验,可以更快排除错误答案。但它最后不会由参数、名字或一次展台演示决定胜负。

相较于大语言模型的“百模大战”,具身智能的筛选可能更早发生。毕竟,大语言模型可以先训练,再寻找用户和应用,但机器人公司在模型还没有收敛时,就已经被推入产业现场,算法、数据、硬件同时开始接受检验。

不过,套用汽车工业的经验,20世纪初,蒸汽车、电动车和汽油车曾经同时跑在街道上,没有人能够确定哪一种代表未来.如今再回头看,那些消失的技术,共同组成了一个新产业寻找主流形态的过程。

历史总是循环往复,一个产业最不知道答案的时候,往往也是答案最多的时候。


每日经济新闻

本文转自每日经济新闻    作者董兴生

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

138
46
分享
上一篇 下一篇