
具身智能的 "ChatGPT 时刻 ",不是机器人又学会了一个新动作,而是它第一次在生产力场景中达到正 ROI。
文|赵艳秋
编|牛慧
在 WRC 世界机器人大会上,一条真实物流产线被搬进展厅。过去必须靠工人手动翻转包裹、让面单朝上,如今由两条机械臂接管,并在顺丰等国内头部物流企业真实运行,从数据采集、训练、部署、跑通,再到完全跑赢市面上所有物流分拣相关产品,只用了三个月,ROI 已经超过人类水平。

自变量 CEO 王潜特别在意这个数字。过去具身智能每换一个任务,就要重新采数据、训一个专用模型;而这条产线背后的 WALL-B 模型,也同时在家庭里叠衣服、开冰箱、换垃圾袋、插花,它是一个从头预训练、试图理解整个物理世界的基础模型。这是他三年前押注的范式——模型越通用,面对下一件新事,需要的数据越少,边际成本越低。

王潜比大多数人都更早确信这条路。2014 年,他在 NIPS 发表全球最早一批注意力机制论文,比 Transformer 早了三年;试图抓住具身智能的泛化诞生的时刻,在做量化三年后,2023 年回国创办自变量。所有人都劝他先做垂类、跑通商业闭环再谈通用,他则认为," 大家按照这条路线做了 80 年,什么也没有做出来。" 他押注了通用具身智能这条路。
如果这条曲线成立,具身智能将改变机器人能力、部署成本和商业化速度。如今基于具身基础模型的 few-shot(极少的样本)、zero-shot(零样本)智能涌现迹象开始出现。2026 年,在某些生产力场景将实现正 ROI。具身智能等待的 "ChatGPT 时刻 ",第一次有了可以被现实验证的迹象。
01
一个大脑,两个世界
具身智能行业里有一个被反复争论的问题:到底是先做一个垂类场景、跑通商业闭环,再从 1 个扩到 10 个、100 个,最终走向通用?还是一开始就做通用基础模型,再向下适配场景?
2023 年自变量成立时,几乎所有人都劝 CEO 王潜走第一条路。" 投资人都给我说,你还是要做一个分层模型或者专用模型。" 但王潜判断,这在技术上绝对不可能成功。
GPT-3 的出现,让他看到了机会:模型越通用,学习新任务所需的样本越少,做新任务的边际成本越低。过去任务越难,所需的数据越多,每个任务都要重新学习,成本会指数级飙升。王潜意识到,GPT-3 带来的范式,就是机器人领域等了 80 年的 " 银子弹 "。
再进一步举例来说,过去是把 1000 万条数据砸向一个任务训练;GPT-3 之后的新做法是,找 1 万个不同任务,每个任务收 1000 条数据。同样都是 1000 万条数据,但后者同时学会了 1 万个不同任务,且每件事的表现通常会更好。
机器人整理鞋柜
背后的原因在于,当模型同时学习 1 万种不同任务时,学到的不只是某个任务的固定动作和细节,而是藏在其中的共同结构和知识:物理规律、基础动作模式和物体属性。一旦这个通识形成,再学习下一件事情的成本便可能大幅下降。这就好像让一个人接受更好的 " 通识教育 ",他适应每项新任务就会更容易、需要的 " 职业培训 " 也更少。
机器人换垃圾袋
在这个判断下,自变量追求基础模型的通用性,而 " 通用 " 有没有做出来,判断标准是预训练之后,看到新任务就能做,或者只需要极少量数据就能适配。
预训练、端到端、通用具身模型,这三个词概括了自变量选择的路径。
在这次展会上,自变量把这个通用基础模型放进两个极不同的物理世界。一边是工业,一边是家庭。这两个场景不是随机挑的,自变量 CTO 王昊曾分析,工厂要求成功率和极致节拍稳定性," 你错一次,对整个产线的影响很大 ";家庭则不重节拍,容错较高,但需要足够强的泛化能力。
家庭演示中,机器人 " 小量 " 要叠好衣服、取外卖、打开冰箱取可乐、换垃圾袋、清理猫砂,甚至拿起一根细长的逗狗棒去逗赛博小狗 ...... 这些任务碎片化、高度长尾," 小量 " 表现得已很丝滑。
机器人清理猫砂
另一侧是工业物流产线,两条机械臂配合夹爪和摄像头,高速翻转不同尺寸、材质的包裹,让面单调整朝上;遇到没有面单的毛绒玩具等异形件,直接推下流水线。
物流分拣产线
WRC 前夕的公开直播实测中,自变量这套方案曾实现连续无脚本稳定分拣 1816 件 / 小时;WRC 期间更是在 5 小时 14 分钟的不间断直播中,累计分拣 10000 件,平均效率达 1911 件小时,全程无托管、无遥操、无人工兜底。较美国头部具身智能企业 Figure AI 公开的 1248 件 / 小时效率再提升,部署成本却下降约 70%。

依托 WALL-B 模型的强泛化与高精度控制,打破了行业 " 依靠堆叠复杂硬件突破性能上限 " 的惯性路径,让结构精简的夹爪即可完成复杂末端执行器才能处理的非结构化分拣作业。目前,自变量已与顺丰达成合作,推进技术落地。
家庭和工业这两套场景背后是同一个通用基础模型 WALL-B。他把这视为技术路线的有效验证,通用基座的泛化能力,让新场景的部署周期和成本显著压缩。具身智能找到了一条可行的产业路径。
02
大一统模型,具身界的 "OpenAI"
如果把自变量展台的所有任务拆开看,从家庭服务到物流分拣,包括灵巧手打开纸盒取出电扇再扭开开关这种超长程操作,全都是同一个模型在驱动。这个模型叫 WALL-B。
2026 年 4 月发布的 WALL-B,没有沿用现成的 VLM 或视频生成模型,而是从头预训练的一个面向物理世界的 " 世界统一模型 ",把视觉、语言、动作、物理预测放进同一个网络联合训练,不做后期拼装。
王潜反对 " 快慢脑 "、" 大小脑 " 式的分层模型,认为要走向统一的端到端。业内分层是因为底层控制要快、高层理解规划可以慢,但他认为速度应交给基础设施和工程手段解决,而不是把模型拆开。一旦分层,中间就会形成信息瓶颈,机器人本来处理视觉、语言、动作跨模态对齐就难,再加上瓶颈更难做。在 WRC 演讲中,他用神经科学来佐证:人脑里负责手部精细操作的皮层,和脊髓直通连接,其他脑区则层层传导," 端到端不光是人类的最佳实践,也是大自然设计的结
果。"
大脑与灵巧手配合完成长程任务
他也明确反对 " 把大语言模型塞到机器人里就是具身智能 "。原因在于 " 动作 " 这个
模态的特殊性:两瓶矿泉水,一瓶被扎了小孔,视觉上只差几个像素,但运动上差异巨大——翻过来一瓶漏水一瓶不漏。这种隐含的真实物理互动,很难通过其他模态获得。所以物理世界需要自己的、原生的基础模型,而不是把 LLM/VLM 搬过来。
自变量的 WALL-B 是一个与数字世界的大语言模型平行的另一套基础模型,把所有的任务都放进去,让模型学习到跨越模态、跨越单一任务的一些通识,不管是逻辑还是物理规律。这个模型某种意义上是一个大统一模型。
在模型领域,开源是一个备受关注的议题。WRC 主论坛上,王潜再次强调了开源重要性。在他看来,开源不再是为了追赶,中国具身智能已与美国基本齐头并进,而是让这条技术曲线跑得更快。" 开源一方面培养人才,另一方面基础设施可以获得很好的提升。"
自变量虽未开源 WALL-B,但已开源 VLA 模型和 World Model,其中 VLA 开源时是唯一不经后训练、仅用预训练就能做 zero-shot learning 的模型。这无异是具身模型预训练获得泛化行的一大步。王潜认为," 将来全世界最好的开源具身模型可能会来自中国。"
这背后是自变量的定位。这家企业的名字来自 X Project,X 在数学上就是自变量,寓意去主动地成为改变的因素。" 我们要做像 OpenAI 那样的公司,从 0 到 1 的原创。" 王潜认为中国科技过去更多成功于 fast follower,但具身智能可能是中国第一次在技术革命一开始就处于第一梯队,有机会做第一名、而非继续追赶。
大语言模型可以蒸馏追赶,但 " 机器人没法蒸馏 ",具身模型的差距可能更难追。这也解释了为什么自变量成为国内唯一一家同时被四家互联网大厂投资的具身智能企业,其中包括阿里、字节、小米和美团。
03
冰山之下:真正拉开差距的是数据和 Infra
在 WRC 自变量的展台上,还摆着三套数采设备,两套 UMI,一套 EGO。UMI 带夹爪,有触觉、环境音和腕部视角,精度更高;EGO 是头戴式纯视觉方案。具身智能行业公认的核心卡点是数据,有人说现在业界掌握的数据,跟大语言模型比起来," 还不到一颗黄豆大小 "。

自变量从创立起就下场自建数据采集体系。" 现在很少有做模型的企业下场做数据,但恰恰是模型厂商,最清楚自身需要什么样的数据。"2024 年初,他们建了第一个数采工厂,完全自己采、自己用、自己投钱。这些数据成为具身模型成长的第一批养料。
王潜强调,过去做 AI,80% 精力花在改网络结构、调算法;今天应该倒过来,"80% 的工作在数据 "。王昊给出排序:先做数据,再做 Infra,最后才做模型结构。" 刚起步,做数据收益最大;到一定规模再做 Infra。这俩都有了,你再做模型结构。"
为什么数据变得如此重要?" 很多人想象,做模型是每天改架构、加层、改训练方法,其实大量工作集中在数据,且与模型架构要深度耦合。" 实际上,很多人低估了数据的难度,它的链路非常长:从怎么定义数据,怎么采集,到怎么判别、怎么处理,再到反过头优化之前的东西,都有大量工作。
王潜也不太认同 " 数据是石油 " 的行业比喻。在 WRC 演讲中,他说石油让人想到大宗商品,不需要复杂处理,但具身数据某种意义上是工业品,高度复杂," 做一个很好的数据,复杂程度比做一个很好的模型要高很多。" 行业为此也交了大量学费," 收了很多数据,收完发现没什么太大用处 ",让具身行业达成数据 know-how 的共识,是迈入正轨的第一步。
自变量为此打造了一条数据管线,至今在持续优化中,实现数据从采集到喂给模型训练,整个处理流程的自主化。在数据管线中,质检被前置到采集阶段,实时监控人、设备、动作及场景,从源头过滤低质量数据;采集后仍由模型把控质量与分布。
不少参观者围在展台周围,看自变量演示无本体数据 " 移动采集、实时回放 ",目前行业内能做出来的还不多。工作人员戴着移动数采设备,蹲下捡起地上的箱子,再放到桌上。动作被采集后上传云端,经过处理,在旁边的机器人上马上复现。此时工作人员已停手,机器人在自主完成刚才那套动作,全程没有人向它发出指令。演示是要展现数据采集精度,采集的数据能够在真机上实现毫米级还原,可用于模型训练。" 核心还是用更低成本获得高质量数据。"
实时回放演示
但当数据真正多起来,怎么把庞大的数据高效地喂给模型?这就涉及 Infra。王潜认为,具身 Infra 可能比语言模型难得多——它面对的不只是 GPU 集群,还要连接大规模机器人集群,不管做预训练、SFT 还是强化学习,都一定要和硬件打交道,会同时碰到通信、时钟同步等一系列问题。" 行业普遍还没把 Infra 提上议事日程,但我觉得很快会需要。"
WRC 上,他举了 Muon 优化器的例子:自变量通过分布式优化,把 Muon 相较 AdamW 多出的约 50% 通信带宽开销去掉,同时获得约 30% 的收敛速度增益,这能够提升整个行业训练模型的效率。发布技术后,自变量还将 DMuon 开源了。
王潜把这些比作冰山:人们看到的是水面上那一角,水面下重得多的,是数据和 Infra。当底座足够厚重,模型架构反而成为最容易替换的模块。数据管线、Infra、训练方法、加速方案,以及它们之间的紧耦合,构成了系统性壁垒,这才是最难复制的东西。至于当下热议的 VLA、世界模型等概念,反而并非最核心的竞争维度。
04
ChatGPT 时刻,这条路线开始被生产力场景验证
2026 年 1 月,王潜给自变量定的最大商业目标是至少在某些场景实现正 ROI。" 这是最大的一个里程碑,是到目前为止,还没有一家做到过的一件事。"
过去几年,人形机器人在解决全身运动控制(locomotion),呈现给大众的是跑步、跳舞、翻跟头。但全身运动控制占据的脑区规模小很多,比起精细操作的复杂度要低得多。这也是为什么,行业一直在情绪价值上打转,还没有在 " 生产力场景 " 证明自己有用。
但 2026 年,王潜认为这个问题第一次有了比较明确的答案,因为技术达到阈值,基础模型好到一定程度,通过少样本学习就能在单点产品上快速部署," 我觉得这挺有标志性。"
他先押了两类场景,一类是工业里原来必须靠人的单点任务,比如打螺丝。之后,他进一步把目标推到家庭,做家务、打扫、收纳。

展会上展示的物流场景,是沿途下蛋最先实现的成果之一。它的效率比美国 Firuge AI 要高 50% 以上,干活儿效率已经超过人类水平。展会现场人士介绍,自变量在汽车、配送等行业也在同时落地。
家庭那条线走得也很快。今年 3 月,自变量和 58 到家合作推出机器人家政服务,保洁阿姨带着她的 " 智能搭子 " 机器人一同进用户家,这个案例已被 APEC 纳入《亚太地区数智赋能案例集》;5 月推出 "X 家庭成员计划 ",机器人 " 小量 " 入驻用户家中,24 小时服务,除了干家务,还能记住用户习惯,比如老人什么时候该吃药、小孩什么时候该吃水果。
7 月的 APEC,王潜又开始公开呼吁开放家庭服务、智慧养老、医疗健康、物流分拣等真实场景,本质上是具身已从 " 模型训练 " 进入 " 真实场景验证 ",不断探索机器人的服务能力边界。
这些场景齐头并进,拿真实订单变现,在真实工况下通过场景数据飞轮,迭代 WALL-B 模型;更强的模型又能以更少的数据、更快的速度,部署进更多家庭和工业场景。
" 我们其实一直在寻找所谓的 ChatGPT 时刻的迹象,现在我觉得已经非常明确了。" 他说," 我们正走在语言模型大约 5 年前走过的路上,它能获得很好的规模化效果,few-shot(极少的样本)、zero-shot(零样本)这些涌现迹象也开始出现。" 我们现在确实是一个对的方向,沿着它走,就非常高确定性地达到我们所谓的物理世界 AGI。"
他判断 2026 年的技术突破是,第一,后训练结合基础模型,真有可能在很多垂直落地上出好结果;第二,海外 1X、Tesla、Figure 用遥操作为主要方式进入家庭,规模不会像大家想得那么小 [ 1 ] ;第三,模型能力包括泛化性、任务复杂度、跨本体、超长序列、推理能力整体会有非常大提升。
至于这个时刻还要等多久,王潜判断,用不着等 5 到 10 年。"5 年之后,如果再回过头来看,机器人可能已经在千行百业、千家万户有了极其广泛的应用,成为人们生活理所应当的一部份。"
© 本文为数智前线(szqx1991)原创内容
未经授权,禁止转载
进群、转载或商务合作联系后台
文章精选
从个人 Agent 到企业级数字分身:组织 AI native 转型的 " 最后十公里 "
当 AI 成为生产力,蚂蚁数科建了一座 " 智能体超级工厂 "


登录后才可以发布评论哦
打开小程序可以发布评论哦