ICML 2026 | LaRA-VLA:告别“慢吞吞”的推理,赋予机器人流畅的隐空间思维链

https://assets.wanlianyida.com/industry-uniapp/web/static/image-default.BtYt8t8Z.png
产联深度观察
·阅读量:3,059

出发点:显式思维链(CoT)的“两难问题”:能力与效率的博弈

近年来,Vision-Language-Action(VLA)模型在机器人操控领域取得了显著进展。为了应对复杂的长程任务(Long-horizon tasks),研究者们将思维链(Chain-of-Thought, CoT)引入具身智能系统,代表工作包括 ECoT、ThinkAct 等。显式 CoT 的引入确实赋予了机器人更强的规划能力:它能够先理解任务目标、拆解操作步骤、预测中间状态,再生成动作。然而,这种能力也带来了一个根本性的矛盾——推理的深度与行动的敏捷性难以兼得

  • 计算开销巨大:显式生成长文本推理链会显著增加序列长度,导致 KV Cache 膨胀,推理延迟急剧上升,难以满足高频闭环控制的需求
  • 表示鸿沟(Modality Mismatch):无论是离散的文本符号,还是像素级的视觉预测,都与机器人最终需要执行的连续动作控制(Continuous Control)之间存在天然的表示不匹配,这种鸿沟使得推理过程与动作生成过程在表征层面相互割裂。

换句话说,当一个机器人在抓取物体前还需要先“写一段小作文”时,它就已经很难满足实时交互的需求。

那么,一个关键问题随之出现:能否让机器人像人类形成“肌肉记忆”一样,在潜空间内完成快速、隐式的思考?

来自北京智源、西安交通大学和中国科学院自动化所的团队给出了新的答案:LaRA-VLA(Latent Reasoning VLA)。该工作将显式的多模态 CoT 内化为连续潜空间中的特征演化,从而实现效率与性能的双重突破。

a26b28ebde7f95d838f0f09460eb637f.png

93fbf2a6e689cb3f8959649f2c45e755.png

洞察:从离散符号到连续表征

目前,面向 VLA 的 CoT 方法大致可以分为两条路径:

  • 文本 CoT:通过自然语言显式表达中间推理过程,涵盖任务拆解、目标识别与高层规划,也可能将视觉信息转述为文字。它的优势是可解释性强,但推理阶段依赖长序列文本生成,计算开销较大,难以满足高频闭环控制需求,且文本符号与连续动作控制之间存在天然的表示鸿沟。
  • 视觉 CoT:通过显式的视觉预测来表达推理过程,例如生成未来观测、中间视觉状态或视觉 token。相比文本 CoT,它更贴近场景变化,但通常依赖 VQ 等机制将连续视觉表征离散化为视觉 token,因而不可避免地引入表示损失和模态鸿沟。

这两种范式的共同问题在于:它们都将推理过程限定在离散符号空间,而将动作生成置于连续控制空间,两者之间存在不可忽视的表示不匹配。 这种不匹配不仅增加了模型的学习负担,也限制了推理与动作之间的信息流动效率。 LaRA-VLA 的核心洞察在于:推理与动作生成不应在表征层面相互割裂。 如果将两者统一到同一个连续潜空间中,推理过程就可以直接为动作生成提供条件信息,而无需经过离散符号的“翻译”环节。这不仅能消除模态鸿沟,还能大幅降低推理延迟,因为潜空间中的特征演化比显式 token 生成要高效得多。

方法:如何让机器人学会“内化思考”?

为了破解上述难题,这篇工作提出了 LaRA-VLA(Latent Reasoning VLA)。它的核心思想可以概括为一句话:不再显式输出冗长的推理 token,而是在连续潜空间(Latent Space)中完成多模态推理与行动规划。

核心架构上,LaRA-VLA 将原本显式的多模态 CoT 推理过程内化为潜空间中的特征演化。模型使用少量文本 CoT latent 替代冗长的自然语言推理序列,同时利用连续视觉目标特征作为隐式监督,约束潜空间表示的语义结构,同时,不同于Fast-ThinkAct的教师-蒸馏训练方法,LaRA-VLA提出了三阶段的课程学习( curriculum learning)训练机制,实现了“显式推理”到“隐式推理”的能力演化。

这样一来,模型不需要在推理阶段生成完整的文本推理链,也不需要显式预测高成本的未来图像,而是直接在潜空间中完成“意图理解”“目标对齐”与“路径规划”,从直觉上看,这相当于让机器人把原本外显的“语言思考”逐步内化为一种高效的“行动直觉”。

三阶段课程学习(Curriculum-based Training)

那么,如何让模型学会这种“看不见”的推理?LaRA-VLA 设计了一套循序渐进的三阶段训练方案。

  • 第一阶段:显式监督阶段(Explicit Supervision Stage): 在训练初期,模型仍然接受显式文本 CoT 的监督,用于学习任务逻辑、目标语义和高层规划结构。与此同时,视觉信息始终以连续 latent 的形式参与建模,为模型提供稳定的视觉语义锚点,并为后续潜空间推理提供前瞻性的结构约束。
  • 第二阶段:潜空间转换阶段(Latent Transition Stage): 模型开始逐步引入潜空间推理特征,用少量 CoT latent 替代冗长的文本 CoT 序列。也就是说,模型不再依赖完整文本推理链来表达思考过程,而是学习将文本推理中的逻辑结构压缩到连续潜空间中。视觉 latent 则作为隐式监督信号,帮助模型保持潜空间语义的稳定性与可分性。
  • 第三阶段:动作自适应阶段(Action Adaptation Stage): 最后,模型进一步将潜空间中的推理动力学与动作生成过程深度耦合。此时,latent reasoning 不再只是辅助表征,而是直接服务于行动决策,使模型能够在潜空间中完成意图理解、目标对齐和路径规划,从而实现更加高效的行动导向控制。

实验结果:速度与性能的双重飞跃

       仿真任务达到 SOTA 性能。在 LIBERO 和 SimplerEnv 两个主流机器人操控基准上,LaRA-VLA 分别取得 97.9%68.8% 的成功率,显著优于现有方法,展现出强大的任务完成能力与泛化表现。

       真实机器人长程任务中的鲁棒性。在复杂、长时序的真实机器人操控任务中,LaRA-VLA 同样展现出更高的成功率和更强的鲁棒性。尤其是在多步骤、长程依赖和真实环境扰动下,潜空间推理机制能够更好地帮助模型把握任务结构,并生成稳定的动作序列。

       消融实验证明课程学习的有效性。消融实验验证了各核心组件的贡献,同时也间接说明了采用三阶段课程学习这一组合策略是 LaRA-VLA 成功的关键。它有效地将文本 CoT 中的逻辑结构迁移到高效的潜空间特征中,使模型既保留了显式推理带来的规划能力,又避免了推理阶段的长序列生成开销。

       潜空间表示并未发生坍缩。进一步分析发现,LaRA-VLA 学到的 latent 表征并没有发生坍缩,而是呈现出清晰、可分的语义结构。这说明潜空间推理并不是简单的信息压缩,而是形成了具有稳定语义组织的内部表征。同时,EMA 机制在维持表征多样性方面发挥了关键作用:没有 EMA 虽然表征不会完全坍缩,但会降低特征的丰富程度,特征方向也出现重合,有效信息减少。

       抗干扰能力增强。对比实验表明,LaRA-VLA 能有效应对噪声干扰。作者在 LIBERO 和 SimplerEnv 的观测图像中加入了不同强度的高斯模糊和高斯噪声。结果表明,隐式推理大幅提高了模型面对 OOD 场景的抗干扰能力。这一发现具有重要的实际意义:真实环境中传感器噪声不可避免,而 LaRA-VLA 的潜空间推理机制天然具备更强的鲁棒性。

BenchmarkMethodBlur Gaussian (High)Blur Gaussian (Low)Gaussian Noise (High)Gaussian Noise (Low)
LIBEROQwen-GR00T30.076.055.787.9
LIBEROLaRA-VLA42.988.276.097.0
SimplerQwen-GR00T13.535.48.322.9
SimplerLaRA-VLA56.362.522.931.2

实验结果显示,相比传统显式 CoT 方法,LaRA-VLA 的推理延迟降低超过 90%。这意味着模型能够以更高频率进行闭环控制,从而更加从容地应对动态、快速变化的真实环境。更重要的是,这种效率提升并非以牺牲性能为代价——LaRA-VLA 在几乎所有基准上都取得了最优或接近最优的结果。

展望:隐空间推理——构建实时、通用机器人系统的关键基石

LaRA-VLA 的意义在于,它证明了深度推理并不一定要以牺牲实时性为代价。长期以来,机器人领域始终在“思考的深度”与“行动的速度”之间艰难权衡,而这项研究为打破这一困局提供了全新思路。

过去,CoT 让机器人学会了“先思考再行动”,通过显式的语言推理链条来规划每一个步骤。而 LaRA-VLA 进一步表明,这种思考过程完全可以被内化到连续的潜空间中,转化为一种更快速、更行动导向的隐式推理机制——它不再需要逐字“说出”自己的推理过程,而是让推理在潜空间中悄然完成,如同人类的直觉反应一般。

从显式文本推理,到视觉状态预测,再到潜空间中的内部特征演化,VLA 模型正在经历一场深刻的范式转变:从“会解释自己的动作”,走向“能更快、更自然地完成动作”。这或许正是通向真正敏捷、聪明、通用机器人系统的关键一步。


本文转自Xbotics具身智能实验室

作者 |  木木

产联社经授权发布

特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。

30
9
分享
上一篇 下一篇