今年 WRC 会场," 概念热 " 正在褪去。
去年还被反复挂在展台、演讲和采访里的 VLA,今年很少再被当作一个完整答案来讲," 端到端 " 也退到了更靠后的位置;接棒的新热词 " 世界模型 ",尽管还没有一个确定的答案:有人生成未来视频,有人预测事件,还有人在潜空间里预演,但像去年那种围绕技术路线产生争论的场面也不见了。
更多人开始意识到:所有没有数据支撑的算法路线之争,最后都是梦幻泡影。
无论做 VLA、世界模型,还是端到端具身大模型,最后都会回到数据。没有足够多的真实物理交互数据,VLA 只是把视觉、语言和动作连在一起;端到端只是把模块边界藏进模型里;世界模型也很难真正知道,一个动作之后,世界会怎样变化。
所以今年,问题从 " 谁才是机器人大脑的最终路线 ",变成了更具体的两件事:到底要采什么样的数据?又该怎么采?
我们和行业里重要的 6 家公司聊了聊,也参考了各家的公开演讲,整理出了四个核心观察。
一、VLA 是真的被淘汰了吗?
去年行业还在争论 VLA 是不是机器人大脑的答案。今年更准确的问题变成了:VLA 到底被 " 淘汰 " 到了什么程度?从多家公司的回答看,VLA 没有消失,但它正在从独立技术路线,变成系统里的一环。真正被淘汰的,是 " 只靠 VLA 就够了 " 的想象。
擎朗智能:VLA 是骨架,世界模型让它 " 先想后做 "
行业去年在端到端、VLA、世界模型等路线上确实讨论很多,各有拥趸。但从我们的实践来看,今年已经能看到一些清晰的方向——不是 " 单靠 VLA 够不够 " 的问题,而是如何让 VLA 真正在真实场景里稳定干活的问题。行业不再争论到底是 VLA 还是世界模型,而是转向混合架构;世界模型的焦点从 " 要不要 " 变为 " 做在哪一层 "。
所以我们的思路很明确:VLA 是核心骨架,世界模型是让它 " 先想后做 " 的大脑皮层。机器人执行动作前先在内部预演一遍物理结果,预测物体受力后的运动轨迹、多步骤操作的因果链条,从源头规避失败。这不是用世界模型替代 VLA,而是用世界模型让 VLA 更强。
星海图:VLA 与世界模型同源共生,最终会走向融合
现在行业有些过度关注技术概念,忽略了技术实质。在我们看来二者内核相通。不管是 VLA 还是世界模型,本质都是把输入转化为 Token,通过 Transformer 多层神经网络完成编码,再通过自监督方式开展预训练,基本逻辑是一致的。
二者区别仅在于自监督训练的方式不一样,世界模型主要依靠视频预测来做自监督训练。二者同源共生,未来也会走向融合。
乐享科技 - 元点机器人:单一模型解决不了真实世界,机器人需要一套持续进化的系统
今年行业确实在形成一个更清晰的共识:单一技术路线很难独立解决具身智能在真实物理世界中的全部问题。VLA 让机器人具备了从视觉、语言到动作的直接映射能力,是非常重要的基础;但面对家庭等非结构化场景,仅靠 VLA 往往还不够,还需要数据闭环、任务规划、动作控制、异常恢复以及持续学习机制共同支撑。
元点的路线与行业共识相同的一点,是都认为机器人智能必须从 " 预设执行 " 走向 " 数据驱动 " 和 " 持续进化 "。不同之处在于,我们不是只围绕单一模型做能力叠加,而是通过 OpenBridge 这一开源的开发者生态平台把数据平台、训练平台、Skill Hub 和 Bridge 本体连接起来,让能力能够在开源平台被上创建、复用、共享和迭代。
二、世界模型是下一个 "VLA" 概念股么?
所有人都在讲世界模型,但和去年的 VLA 一样,它还没有形成稳定定义。有人生成未来视频,有人预测动作后果,有人按事件来理解状态变化,还人在潜空间里预演。大家使用同一个词,做的却未必是同一种模型。现在真正值得比较的是它究竟输入什么、预测什么,又怎么影响机器人的动作。
宇树科技:最大瓶颈是,AI 模型的输入和输出与真实世界之间仍然存在偏差
今年大家可能听到最多的还是世界模型这个方向。其实我们在 2020 年初就开始做基于视频生成的世界模型,但是到 2020 年底,做出来的效果不是特别理想,所以中间稍微搁置了一段时间。从去年开始,我们又重新大力发展基于视频生成的世界模型。
目前全球具身智能最大的瓶颈,就是 AI 模型的输入和输出,与真实世界之间仍然存在偏差。比如让机器人移动,把一些东西装配在一起,或者把一个物体搬到另一个位置。从大的趋势来看,现在的模型其实没有太大问题,大差不差能够执行你的任务。问题往往发生在最后几个厘米,甚至最后几个毫米。
自变量:VLA 回答 " 做什么 ",世界模型回答 " 做完会怎样 "
世界模型接收机器人当前和历史的视觉信息、语言任务、动作及本体状态等数据,预测采取一个动作后,物体和环境将发生怎样的变化。VLA 主要回答 " 下一步做什么 ",这部分能力则帮助机器人理解 " 这样做以后会发生什么 "。
两者不是替代关系,也不只是一个模型给另一个模型生成的动作打分,而是会逐渐在统一模型中融合。我们的 WALL-WM 通过以完整事件对齐视觉、语言和动作,让机器人同时理解动作过程、状态变化和最终结果。
擎朗智能:VLA 的架构下,在潜空间里推演物理结果
擎朗 KOM 3.0 时,我们在 VLA 架构里融合了潜空间世界模型。
服务机器人面对的不是实验室里固定的桌面,而是餐厅、酒店、咖啡店这种高动态、非结构化的环境。机器人要做的往往是长序列任务——比如做一杯咖啡,要取杯、承接、递送,中间任何一步出错整个任务就失败。如果只靠 VLA 做 " 感知 - 决策 - 执行 " 的端到端映射,缺少对物理结果的预判能力,在复杂场景下的成功率会断崖式下降。
机器人执行动作前先在内部预演一遍物理结果,预测物体受力后的运动轨迹、多步骤操作的因果链条,从源头规避失败。
三、有多少人工,就有多少智能?
如果 VLA 不是答案,世界模型也不是一个现成答案,那关键问题反而回到了最朴素的地方:数据。去年行业还在讨论算法不行还是数据不够,今年更明确的回答是:数据不够,所以算法才不行。仿真、合成、互联网视频都可以作为补充,但机器人要理解物理世界,最终还是要回到真实交互数据。
奥比中光:无本体数采,要从临时方案变成标准化基础设施
这轮热潮背后首先是真实的数据短板。具身智能模型需要的不只是互联网中的图像和文本,而是大量包含空间、动作、物体状态变化和任务过程的真实世界交互数据。
现阶段,直接依靠机器人本体采集数据,通常面临本体成本较高、部署效率有限、硬件尚未完全定型等问题。无本体数据采集则可以较低成本覆盖更多场景、任务和操作流程,尤其适合采集第一视角下的环境信息、空间关系和长链条任务过程。
这类需求来自多种类型的客户,既包括具身智能模型公司、机器人本体厂商,也包括专业数据采集服务商、数据运营公司以及其他算法驱动型企业。不同客户的共同诉求,是把真实世界数据采集从临时搭建的设备方案,逐步变成可标准化部署和批量交付的基础设施。
智身科技:自研、自采,外部数据无法替代自己的机器人自主运行数据
真人穿戴采集、机器人遥操作、机器人自主运行和仿真数据我们都有在做,因为不同数据源有各自的优缺点。
真人穿戴采集主要用来快速学习;机器人遥操作用来提升操作灵活性;因为智身下半年主打的就是 " 能干活 ",机器人自主运行就是用来提升落地效果,解决真实物理世界中会遇到的各种翻车问题,这个是其它数据源不具有的优势。
仿真数据,量大,能帮我们做场景、任务的多样性扩充,但 sim to real 的问题让我们没办法把这些数据拿来直接用,都要用真实数据做微调。
对我们来说,缺的不是哪一种数据,其实是 " 有用的数据 ",现在海量的数据里很多其实是 " 无效数据 "。
我们的数据都是自己的,包括数采设备这些,都是自研的。在我们看来,数据质量是一方面,另外是外部提供的数据场景分布不匹配," 它的世界≠我的世界 ",数据规模再大,没办法替代我们自己机器人在真实目标场景下产生的交互数据。
自变量:无本体数采扩大数据规模,但不能取代真机数据
当下的这波热潮是 " 无本体数采 ",即不依赖机器人本体,通过头环、手套等穿戴设备等采集人的动作。
无本体数采比真机遥操作更容易规模化,能够以更低成本覆盖更多任务和场景,行业已经基本解决了 " 能采 " 的问题,但从数据可回放、可迁移到真正提升模型能力,仍处于早期阶段。自变量推出 QUANXTA Zero 无本体数采方案,具备全身移动数采和移动采集数据本体回放能力,数据入库有效率超过 85%。
但它无法完全取代真机数据,因为人的身体结构和动作方式与机器人不同,也难以完整呈现机器人执行时的接触、误差和失败。
从技术路线上来看,世界模型也可以减少对单一任务真机示范数据的依赖。VLA 更需要语言指令、机器人观察和动作轨迹准确对齐的示范数据;世界模型则更关注动作发生前后的连续状态和事件演化,可以使用真机、无本体、视频以及仿真和合成等不同来源的数据。它真正解决的不只是减少数据量,而是提高数据利用效率,让模型学习可以迁移的物理规律,从而提升跨场景泛化和长程任务能力。
擎朗智能:采集到的只是 " 原油 ",真正的瓶颈是 " 数据炼油 "
真人数据无法完全替代真机数据,两者的关系是互补而非替代。
真人第一视角数据可以高效采集人类完成任务的完整过程,用来训练基座模型、构建场景认知和任务理解能力。但最终要让机器人本体精准执行,还是需要真机数据来做后训练微调——因为真机数据包含了机器人特定本体的运动学特性、关节力矩、力反馈这些真人数据里根本没有的信号。
现在采集数据本身不难,难的是让采集到的数据真正提升模型能力。不是戴个头环拍几小时视频,数据就能直接用。从原始视频到可训练的结构化数据,中间要经过去畸变、姿态估计、深度重建、手物分割、自动标注等一系列处理环节。如果这整套 " 数据炼油 " 能力跟不上,采集再多原始数据也只是 " 原油 ",没法变成驱动模型的 " 燃料 "。
仿真到真实的 "sim-to-real" 鸿沟在服务场景里尤其明显——物理引擎再逼真,也模拟不出真实咖啡机出水口的微妙差异、不同材质杯子表面的摩擦力变化、顾客临时伸手干扰操作轨迹这些真实世界的 " 意外 "。
四、感知数据能否补位?
今年最先被规模化讨论的,仍然是视觉数据:第一视角、RGB-D、腕部近场、多视角、IMU 和时间同步。但与此同时,触觉、力觉、滑移、材质、接触反馈这些更贴近物理交互的数据,也开始从供应商侧浮出来。
一目科技:视触觉,把每一次接触变成 " 物理真值 "
视触觉路线是最类人的路线。它不是传统力传感器,而是在柔性材料内部建立光学观测系统,当机器人与物体接触时,用图像捕捉材料的微小形变,再把形变转化成压力、摩擦、滑移、软硬、纹理等物理信号。
Physical AI 不能只靠模型继续变大,真正重要的是机器人能不能持续获得来自现实世界的物理真值。每一次接触,都是机器人认识世界的一次学习;每一次抓取,都会产生新的 Ground Truth。
如果世界模型只看视频,它可以学习画面变化,但不一定知道接触瞬间发生了什么。触觉数据的意义,是把机器人和物体接触时的物理结果,也变成模型能学习的东西。一目科技正在做的 TouchNet,就是想把真实接触中的压力、纹理、滑动、材质、力反馈这些数据变成可复用的数据基础设施。
帕西尼:触觉既是机器人的能力,也是模型训练的数据
感知是机器人进入物理世界的第一道关口。帕西尼从触觉传感器起步,业务继续延伸到灵巧手、本体、数据集与模型,希望把感知、决策和执行连成一套完整技术生态。
帕西尼同时在做两条线:机器人端的触觉传感器和灵巧手,以及真人穿戴的数据采集系统,让真人佩戴触觉采集手套完成任务,同步记录触觉、视觉和动作轨迹等多模态信息,以更高效率覆盖真实场景。
比如拿起杯子、拧螺丝、整理衣物,都依赖稳定、可控的接触。在这些精细操作中,触觉已经成为基础能力:它既影响动作能否成功,也能为模型记录接触产生的物理结果。
奥比中光:硬件决定数据质量的起点和上限
今年我们推出 EGO、UMI、WristCam 和 Hub,是希望覆盖真实交互里的关键视角。EGO 主要解决第一视角和环境空间信息采集;WristCam 和 UMI 更靠近手部及操作区域,用于补充腕部近场观察、遮挡条件下的手 - 物交互细节;Hub 则负责多设备同步。客户往往不是单独选择某一种设备,而是根据任务、视角和数据模态,把不同设备组合成采集方案。
从客户价值看,客户最终需要的当然不是设备本身,而是能够有效提升模型能力的数据。但 " 可训练的数据 " 并不是从采集完成之后才开始形成的。传感器配置、视角设计、深度质量、时间同步和标定精度,都会直接决定后续数据能不能用,以及需要付出多大的清洗和修正成本。
所以客户表面上购买的是硬件和定制服务,实际付费的是一种持续获得高质量、可复用训练数据的能力。硬件不是最终目的,但它决定了数据质量的起点和上限。
目前行业已经基本跨过 " 能不能采到数据 " 的第一阶段,正在进入 " 采什么数据、如何评价数据、哪些数据真正提升模型 " 的阶段。下一步竞争重点不会只是设备数量或数据总量,而是数据是否具备准确的空间信息、完整的任务链条、稳定的多模态同步,以及能否通过训练结果证明其有效性。
未来的世界模型如果真的要理解物理世界,触觉和力觉不太可能只是控制系统里的边缘信号。它们会变成世界模型的一部分。
在今年人挤人的 WRC 上,你反而感到具身公司们变得安静了,关于算法的争吵让位给同一件事:采数据。
过去两年,行业习惯把具身智能理解成给大模型装上一副身体:摄像头负责看,关节负责动,灵巧手负责执行,所有人的注意力都放在 " 大脑 " 上。
等机器人真的开始进入餐厅、仓库和家庭,身体反过来卡住了大脑。最后几厘米的偏差、接触瞬间的滑移、不同杯子的摩擦力,都无法从语言和互联网视频里直接长出来。身体过去更像模型的输出接口,现在开始成为智能的输入源。
所以,今年展馆里真正的变化,发生在那些最不像 " 大脑 " 的地方:头环、腕部相机、触觉手套、灵巧手、遥操作台和数据工厂,在找到终极路线之前,先一条条地把物理世界喂给模型。


