小鹏第二代VLA模型升级 把时间维度引入智驾模型

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联社CLS
·阅读量:3,316

摘要:搭载新模型的XOS 6.3.0将在G9L车型首发;小鹏称升级后端侧模型参数量扩大3.5倍,可记忆过去30秒、预测未来6秒。

产联社编辑|王琪翔

image.png

【产联社】小鹏将时间维度引入第二代VLA模型。8月27日,小鹏集团(NYSE:XPEV/09868.HK)在广州举行以“TIME时间”为主题的物理AI分享暨第二代VLA全新版本体验日,宣布第二代VLA大模型完成首次重大升级。

搭载新模型的XOS 6.3.0版本将在小鹏G9L上首发,核心变化是把“时间”纳入模型。系统不仅识别当前空间,还试图记住此前发生的事件,并推演未来数秒交通参与者可能采取的行动。

据小鹏介绍,新版端侧模型参数量较此前扩大3.5倍,达到“主流VLA模型”的15倍以上。

此次升级主要有三项核心内容:Infini-VLA长时序架构支持最长30秒有效时序,Streaming Inference流式自回归推理使端到端响应速度提升300%,X-Foresight预测世界模型则可以推演未来约6秒的交通场景。

8月28日,小鹏汽车港股收报44.82港元,跌0.66%,成交额3.61亿港元,总市值858.81亿港元。

从静态3D走向动态4D

VLA全称Vision-Language-Action,即视觉—语言—动作模型。传统VLA通常通过视觉输入识别道路环境,借助语言或语义表征理解场景,再输出车辆动作。小鹏第二代VLA在2025年11月发布时提出去掉中间的“语言转译”环节,从视觉信号直接生成动作指令,希望降低信息转换损失及决策延迟。

今年3月,该模型开始向Ultra车型量产推送。小鹏此前披露,第二代VLA累计使用50PB训练数据,每版模型训练数据达到4万亿Tokens;通过芯片、编译器与模型联合优化,基座模型编译效率提高12倍。

量产车型最高配置三颗小鹏自研图灵AI芯片,有效算力为2250TOPS,用于在车端运行数十亿参数规模模型。

第一版解决的主要问题是扩大模型规模、提高泛化能力,并从传统模块化、规则驱动的辅助驾驶系统转向端到端模型。本次升级则把重点转向“时序”:车辆面对的不再是一张静止照片,而是一段连续发生的道路事件。

以一辆正在路边等待汇入车流的汽车为例,仅根据当前一帧画面,系统可能难以判断它是在临时停车、准备掉头,还是即将突然并线。如果模型保留此前数十秒的转向灯、车轮方向、车身位移及周边车辆反应,就可以建立更完整的行为上下文。

小鹏称,Infini-VLA能够保留最长30秒的有效时序信息,把原本割裂的画面串联成连续事件。

Infini-VLA主要解决“记住过去”的问题。Streaming Inference则试图解决“及时理解现在”。传统处理链路通常表现为“采集画面—完成推理—输出动作—再次采集”,不同环节依次执行。流式自回归推理使感知、计算和动作生成并行推进,即小鹏所称的“边看、边想、边行动”。

据小鹏通用智能中心负责人刘先明介绍,新版模型决策响应速度提升300%,主要用于处理前车紧急制动、行人折返、车辆突然加塞等快速变化的场景。

“预测未来”由X-Foresight世界模型承担。该模型综合目标位置、速度、运动方向及道路结构,推演周边交通参与者未来约6秒的可能轨迹。

例如,车辆驶近没有信号灯的路口时,模型需要同时考虑行人继续等待、突然横穿或折返,以及两轮车抢行、对向车辆转弯等不同分支,再选择风险相对较低的驾驶动作。

新版模型还采用MoT混合架构,根据城区道路、园区、小路及泊车等不同任务动态调度模型能力。其目的在于降低不同驾驶任务之间的相互干扰,高速跟车需要强调稳定性和较长距离预测,城区路口需要处理多方博弈,园区和停车场则更依赖低速环境中的精细空间理解。

Master Agent连接智驾与座舱

除智驾模型外,小鹏此次还发布了Master Agent整车大脑。该系统基于小鹏自研Omni全模态模型,把负责车辆行驶决策的VLA与负责视觉、语言和座舱交互的VLM进一步连接。

在传统智能汽车架构下,辅助驾驶、语音助手、底盘控制、车身控制和座舱应用往往由不同系统分别管理。用户提出一项跨域需求时,语音系统只能识别指令,再通过预设接口调用单一功能。

Master Agent的目标是理解相对模糊的用户意图,把任务拆成多个步骤,并调度智驾、底盘、座舱及车身模块共同执行。

以“前面找个安全的地方靠边”为例,这不只是一项语音指令。系统需要判断道路是否允许停车、寻找合适位置、规划靠边轨迹、观察后方车辆和非机动车,并完成减速、转向和停车。此次新增的语音靠边停车、语音就近泊入和模糊导航,正是这一架构的首批应用。

小鹏加码物理AI规模化落地

今年3月,小鹏第二代VLA首个版本开始量产推送。小鹏披露,第二代VLA推送首月,搭载该模型车型的辅助驾驶里程占总行驶里程的比例超过50%。

在训练端,小鹏今年4月发布X-World生成式世界模型。该模型输入多摄像头历史视频及车辆动作后,可以生成未来多视角视频,用于闭环仿真、在线强化学习和长尾数据合成。

小鹏披露,其自动驾驶仿真场景由一年前约3万个增加至超过50万个,每日仿真测试里程相当于3000万公里实车测试。

此外,小鹏希望把汽车积累的模型、芯片和工程能力延伸至Robotaxi、人形机器人及飞行汽车。此次Master Agent和VLA、VLM融合,实质是在探索统一的物理AI底座,同一套模型既理解人的语言,也感知外部世界,并能调度不同硬件执行动作。

小鹏称,第二代VLA已经在IRON人形机器人端侧部署。IRON搭载三颗图灵AI芯片,有效算力2250TOPS;小鹏机器人业务近期签署首轮融资认购协议,拟融资约9亿美元,投后估值约63亿美元。

VLA也承担小鹏全球化和技术输出任务。小鹏此前宣布大众将成为第二代VLA的首发外部客户,并获得大众对图灵AI芯片的定点。公司还表示,第二代VLA已完成德国本地化验收测试,计划在2027年上半年争取欧洲相关监管许可。

大模型研发需要持续投入。小鹏2026年第二季度研发费用为29.1亿元,主要用于新车型和AI相关技术;同期公司收入197.4亿元,同比增长8.0%,综合毛利率20.7%,汽车毛利率12.1%。

智驾竞争转向世界模型

小鹏把“时间”作为此次升级主题,折射出智驾技术竞争方向的变化。过去数年,车企主要围绕激光雷达数量、芯片算力、城市领航范围和是否依赖高精地图展开竞争。

随着端到端模型逐步量产,关注点正在转向模型能否处理更长时间序列、能否预测未来场景。

将时间维度和世界模型引入智能驾驶,已成为多家车企共同探索的技术方向。理想汽车今年3月发布MindVLA-o1,采用原生多模态MoE Transformer,并引入3D ViT、预测式隐世界模型、动作专家及闭环强化学习。

理想的技术框架由MindData数据引擎、MindVLA-o1模型、MindSim世界模型和强化学习基础设施构成,同样强调三维场景理解、未来状态预测和统一动作生成。

华为今年4月发布乾崑智驾ADS 5,采用WEWA 2.0架构。其云端世界模型引入多智能体博弈和在线强化学习,车端世界行为模型则增加安全风险场,通过风险热力图参与实时决策。

华为称,新架构训练强度和训练效率均提升10倍,碰撞风险降低50%。这些同样属于厂商测试口径。

蔚来的NWM世界模型则沿着“世界模型、监督微调、闭环强化学习”的训练框架迭代。不同车企智驾在传感器配置、模型结构、芯片平台和动作生成方式上有所不同,但总体方向日趋接近:从识别眼前障碍物,到记住过去、推演未来。

商务合作/报料请联系侯经理 18801065284(微信同号)

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

65
25
分享
上一篇 下一篇