豹变 22小时前
这届机器人,开始从「秀肌肉」转向「拼脑子」
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

「核心提示」

具身智能的尽头是大模型,大模型的尽头是数据采集。

作者 |  张经纬

编辑  |  邢昀

又一轮机器人展示绝活的时候来了。

2026 年 8 月 19 日到 8 月 23 日,世界机器人大会(WRC)在北京举行。相比以往,展示机器人各类实操应用的展台更多了。在看客眼中,这些展区像是一个个未来生活的切片: 

一台人形机器人叠起了一摞 T 恤送进洗衣机,另一台正在模拟厨房里翻炒,还有机器人在搭积木、搬箱子……它们之中很多并不依靠 " 遥控器 " 或者固定的驱动程序,而是机器人 " 自己指挥自己 "。

同样地,无论是论坛上的专家圆桌,还是展台上的广告语,也都频繁地提到 " 具身大模型 " 和 " 自主驱动 "。

这些现象共同显示着一个新的行业变化:具身智能的厂商们,正在从 " 秀肌肉 " 转向 " 拼脑子 "。

只会造" 身体 ",已经不够了

" 现在只会做机器人本体已经拿不到融资了,需要同时做机器人大脑;只做本体和运动控制,大概率也做不过宇树、智元这些企业。" 一位创投行业人士对《豹变》说。

这句话,几乎概括了今年具身智能行业最明显的转向。

过去两年,机器人公司最热衷展示的是 " 身体能力 ":能不能走稳、能不能跑跳、会不会翻跟头、灵巧手能否抓住物品。运动控制和硬件本体,是彼时最容易被看见、也最容易拿到融资的方向。

从今年的 WRC 上能看到一些转向信号。

展会上,智平方机器人做咖啡,深朴智能机器人在洗衣服,星尘智能机器人在做饭,银河通用和蚂蚁灵波的机器人则在食品、药品零售区忙上忙下,加速进化机器人则上演了一场与人类小孩的点球大战……

展会上机器人洗衣服的画面

这些动作未必更炫,但是在接近商业化真正要面对的场景,环境不标准,任务可能会变,机器人必须理解自己在做什么,并在出错时调整下一步动作。

厂商们的宣传用词也开始发生变化,其中最多的三个词是 " 具身大模型 "" 让机器人干活 " 和 " 自主驱动 "。

这三个词有着深刻的内在联系。无论是商业、工业还是家庭场景," 让机器人干活 " 都意味着机器人需要在复杂的环境中知道自己在做什么,并独立地做出决策,而实现这一目标的技术手段就是具身大模型,也就是 " 机器人的大脑 "。

以洗衣服为例,机器人洗衣服需要先把衣服送进洗衣机,关上洗衣机门并启动。在这个过程中,衣服如果有边缘露在外面,机器人就需要把衣服再往里挪一挪。

家庭并不是非常标准化的场景,机器人在执行任务过程中会频繁出现光线和空间感知上的变化,这意味着它需要随时调整自己的动作。如果使用固定的程序,机器人很容易因为各类干扰而无法很好地完成任务。

进一步说,机器人进入家庭,也不可能只做 " 洗衣服 " 这一件事情,需要会做多项家务,且能够有条不紊地推进这些家务的完成。

" 知道自己的任务是什么(一致性 / 稳健性)"" 做哪些动作能够完成任务(推理能力和精准动作)"" 会做很多种家务(通用泛化能力)" 都需要具身大模型作为 " 机器人大脑 " 发挥作用。因此,开发具身大模型是机器人商业化的必然。

对家庭、商业服务和复杂工业场景而言,这种能力比 " 能走 "" 能跳 " 更接近真正的门槛。

当然,资本市场早已嗅到这种必然性,风向也在发生变化。随着宇树的科创板敲钟,在一级市场环节,机器人本体及运动控制的融资竞争已接近尾声。

过去 3 年时间里,资本市场其实经历了关注机器人本体到关注机器人大脑的过程。2023 年,国内具身项目以机器人本体和小脑(即运动控制)为主;2024 年 5 月后专注本体的初创企业融资占比下降 36.8%,到今年则完全倒向了具身大模型。

根据量子位的不完全统计,2026 年上半年国内具身智能融资总额超 430 亿元,其中 50.8% 的资金投向以 " 大脑 " 为主的公司,另有 18.5% 的资金投向 " 大脑 + 本体 "。

对于一家机器人公司而言,只做身体的空间已经越来越窄。下游需求的必然要求和融资的市场动向,共同导致行业竞争正在从谁能造出一具更灵活的身体,转向谁能让这具身体真正学会思考。

具身大模型的 " 护城河 "

" 具身大模型竞争现在本质上就是数据的竞争。" 具身大模型开发者 Alex 对《豹变》说。

这个看法背后是对 "ChatGPT 时刻 " 再次出现的期望。所谓 "ChatGPT 时刻 ",指的是大语言模型在数据量达到某个临界点后,突然 " 涌现 " 出训练时并未明确教授的能力,比如推理、举一反三、上下文学习等。

在具身智能领域,整个行业期待类似的 " 涌现 ":当机器人交互数据积累到足够规模时,模型可能突然具备通用性甚至近似人类的物理直觉。

因此,对各家具身大模型厂商来说,谁先积累出足量、高质量的物理数据,谁的模型就有可能具备更强的泛化能力,从而在物理 AI 之争上抢先一步。

而数据则是大厂的强势领域。" 现在的具身模型训练通常需要对外采购数据,大厂有资金上的优势。"Alex 对《豹变》透露。

目前,蚂蚁灵波、字节跳动、京东以及小米纷纷都在推进自己的基座模型。蚂蚁灵波在 2026 年 1 月底发布并开源了空间感知模型、LingBot-VLA 模型和 LingBot-World 模型,并在 7 月又各自发布了 2.0 版本;小米在 2 月 12 日发布并开源 Xiaomi-Robotics-0,在 7 月发布了 2.0 版本;京东则在 4 月 16 日发布 JoyAI-RA 具身大模型。

这些模型除了应用在自己开发的机器人以外,也提供给一些本体小厂。在 WRC 展会上,不止一家厂商对《豹变》透露,自己的机器人用的是某家大厂的基座模型。对大厂来说,除了增加变现渠道,也能够增加数据来源,稳固自己的数据优势。

然而,现有的数据量远远无法满足应用的需求,如果说具身大模型的数据训练是一场马拉松,现在恐怕还没跑到第一个补水点。" 自动驾驶实现需要 10 亿条数据,具身智能要想达到‘ ChatGPT 时刻’,保守估计需要 100 亿条,而现在行业里的体量大约是 100 万条。" 展会上,某家大厂的工作人员对《豹变》说。

这也意味着,大厂的优势不是绝对的,具身大模型竞争还远远没看出谁能在下一个阶段领先。

因此,如何采集数据也就成了一个重要的问题。从方式上看,数据采集主要包括真机遥操作(人类操作机器人本体完成任务)、第一人称数据 / 便携 UMI(人携带数据采集装备完成日常工作获得数据)和仿真数据这几种。

真机遥操太贵,模拟数据不可靠,第一人称数据成本可控且数据可靠,泛化性也有保证,是业内的主流数据采集方式。不过也有专家认为模拟数据因为不用考虑现实的时间流速,训练效率更高,未来随着拟真数据的可靠性提高,会成为主流的数据采集方式。

星海图的互动环节是操作数据采集设备

WRC 展台上那些看似只是 " 让观众玩一玩 " 的互动,背后其实也是一场数据争夺。有厂商让观众戴上采集设备完成抓取、摆放等动作,或者通过遥操作让人类示范一段任务流程。对机器人公司来说,这些动作不只是展示,也是在为模型积累真实世界中的视觉、动作和环境反馈。

不过,机器人需要的不是单一场景里重复几百万次的抓取数据,而是覆盖不同物体、光线、空间、任务和突发情况的高质量数据。谁能更快建立起 " 采集、训练、部署、再采集 " 的闭环,谁才有可能把数据真正变成模型能力。

这也是具身大模型竞争最微妙的地方:数据正在成为新的护城河,却还不是胜负已定的答案。行业都在等待一次类似 ChatGPT 的能力跃迁,但没有人能确定,足够多的数据是否必然会带来那一刻。

"ChatGPT时刻 " 还是陷阱

由于 ChatGPT 时刻还未到来,具身智能产业端存在一种 " 壁垒分明 " 的状态。

" 现在的具身开发中,基座模型是基座模型,主要管机器人的上半身(主要是手臂和灵巧手);运动控制则是运动控制,主要管机器人的腿和平衡。"ALex 认为,运动控制和具身大模型的统一则要等到 "ChatGPT 时刻 " 的来临,到时候市场格局还会发生大的变化。

更大的问题是,ChatGPT 时刻必然会来临吗?

由于数据的缺乏,目前还没有出现被证实可靠的 " 具身原生多模态大模型 ",物理 AI 的技术路线呈现多元分化、尚未收敛的状态。

具身大模型的主流路线大致可分为两类:第一类是 VLA(视觉 - 语言 - 动作)路线,早期通过端到端的方式将视觉感知和语言指令直接映射为动作,这严重依赖训练数据覆盖。

目前端到端 VLA 正在向快慢系统演进,参数规模较大的 " 慢系统 " 负责理解场景、解析指令、进行任务规划;参数规模较小的 " 快系统 " 负责实时输出具体的关节角度、手指力度等低层控制信号。

第二类是世界模型(World Model)路线,以李飞飞的 Marble 和 Google 的 Genie 为代表,强调先构建可推演的物理世界内部模型,再规划动作,具备更强的因果推理和泛化潜力。在本届展会上,标榜自主驱动的厂商大多采用这一路线。

VLA 路线落地快、成本低,但泛化能力弱;世界模型路线更聪明,但算力耗费更高、反馈更慢。新的趋势是两者融合,但具体的融合方式、主导模型各家都有自己的判断。这些路线基于开发者的 " 技术信仰 ",各有拥趸,行业远未形成统一共识。

技术路线之争没有定论,资本市场的情绪波动几乎不可避免。

从 2023 年的 ChatGPT,到 2025 年春节的 " 机器人跳舞 ",再到今年的 Agent 和机器人干活,市场上始终存在 "AI 和机器人像人类一样工作,从而解放人类 " 的美丽愿景,也经历了与之关联的市场情绪的变化。创投圈从 FOMO(Fear of Missing Out,害怕错过)到冷却,再到 FOMO 新赛道,股票市场随着一次次 Shocking 而上涨下降。

对具身智能来说,距离真正 " 开奖 " 还有很长一段路。在这之前,可以预计还会经历多次乐观与悲观、狂热与恐惧的市场情绪循环。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 实操 世界机器人大会 北京
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论