钛媒体 昨天
具身大佬,为这几个问题“吵翻”了
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

文 | AIX 财经(AIXcaijing),作者 | 王璐,编辑 | 阿伦

人形机器人正在加速深入到各个角落。

《2026 人形机器人产业发展报告》数据显示,2026 年上半年我国人形机器人出货量已超 4 万台,中国企业在全球出货量中占比高达 97%,这意味着,全球每出货 100 台人形机器人,就有 97 台来自中国制造商。

但产量飙升的背后,一个更现实的问题摆在行业面前,这些机器人,有多少真正在干活?

过去几年,人形机器人最出圈的瞬间往往是在舞台上跳舞、后空翻," 炫技 " 多于 " 干活 "。但今年各家都在讲 " 落地 "。

2026 年世界机器人大会(WRC)以 " 人机共生,产需共融 " 为主题,将 " 产需 " 置于 " 炫技 " 之前。展馆里,机器人跳舞的展台依然围满观众,但真正吸引专业目光的,是那些在物流仓库、药房货架、工厂产线上 " 打工 " 的机器人,具身智能的 " 表演期 " 正在落幕," 打工期 " 正式开场。

头部企业们的发言堪称一场 " 大实话 " 合集。没有炫技,没有画饼,有的是对泛化瓶颈、数据缺口、落地卡点等真实痛点的直面,以及对商业化路径的务实探讨。这些发言或许不够华丽,却恰恰是行业最真实的动向。本文基于 8 月 20 日 " 应用牵引 " 主题论坛发言,梳理出了人形机器人头部企业在落地上的核心观点与产业动向。

01. 具身智能的 "GPT 时刻 ":两个核心争议

" 具身智能何时迎来 GPT 时刻 " 近两年被反复提及,折射出圈内圈外对人形机器人像大语言模型一样迎来标志性突破的期待。在本次 WRC 上,宇树科技创始人兼 CEO 王兴兴、银河通用创始人兼首席技术官王鹤等头部厂商,对 "GPT 时刻的具体标准是什么 " 以及 " 如何到达 " 等关键问题给出了各自的回答。

争议一:GPT 时刻的门槛是多少?

王兴兴给出了一个量化的临界线,在约 80% 的陌生场景中,机器人能完成约 80% 的任务。但他坦诚,这一时刻最快 2-3 年、慢则 5-10 年才能到来。王鹤则将门槛定为" 零样本泛化成功率 70%-80%",轻量后训练后可接近 100%。

宇树科技创始人王兴兴

苏度科技联合创始人兼 CEO韩铮提出了更高的标准,具身智能要实现规模落地,大于 99% 的高可靠性是绕不开的前提。他指出,当前主流模仿学习路线在榜单上虽能达到 80% 左右的成功率,但一旦走出实验室、面对环境或物体变化,成功率往往会显著下降,难以满足真实生产环境的要求。

三家给出的标准从 70%-80% 到 99% 以上不等,且各自评判的维度也有所不同。虽然头部厂商有了具体指标,但口径不一也反映出行业对 " 具身智能 GPT 时刻 " 的临界标准仍在探索之中。

争议二:泛化的瓶颈在哪里,又如何解决?

王兴兴将未达到 "GPT 时刻 " 的瓶颈聚焦到AI 模型与真实机器人的对齐程度不够上,认为机器人每次输入输出都伴随物理世界的偏差,最后几厘米甚至几毫米的触觉修正无法完成,导致成功率下降。

王鹤则将问题指向 VLA 与世界模型的两段式分离。VLA 必须输出动作,因此训练数据需要带有动作标签。世界模型则通过预测未来进行学习,不需要动作标签,但它的局限性在于 " 只能想象未来,无法直接决定如何执行动作 "。

星动纪元创始人、CEO陈建宇将瓶颈归因到 " 系统级 " 层面。他认为主流 VLA 本质是模仿学习,泛化能力存在天然瓶颈,面对全新场景和任务很难自主生成合理动作。

各家归因的层次不同,解法自然也不同。王兴兴的解法是 " 物理 AI 机器人自进化 ",让 AI 大模型自主检索论文、生成控制代码、在仿真与真机间自动迭代,由 AI 结合人工评价打分,形成正向闭环;王鹤的解法是把 VLA 与世界模型融合,提出 World Action Model(WAM),让模型在理解世界的同时直接生成动作;陈建宇的解法是构建 " 大脑 - 本体 - 场景协同进化的飞轮 "。

跳出各家具体的解法,从行业层面看,泛化的突破路径大致可以归纳为三种侧重。而上述三家的探索恰好分别落在了不同路线里。

一是技术驱动,押注模型架构创新。这是最靠近 " 实验室突破 " 的一种,王兴兴的物理 AI 自进化与王鹤的 WAM 融合均可归入此类。星海图是这一路线的另一代表,其创始人高继扬在 WRC 上明确表示,星海图 " 创新采用统一自回归架构,单模型同时打通零样本泛化、通用抓取、长程任务三大核心能力 ",通俗地讲,这套架构把想和做重新接在了一起。

二是场景驱动,押注真实商业场景中的持续交互与数据闭环。与技术驱动相对,这一路线的底层判断是,泛化能力不是在实验室里设计出来的,而是在真实场景的持续迭代中逼近的。明略科技是典型代表,其创始人吴明辉判断 " 机器人的下半场是大脑 ",并与海康机器人合作,锁定餐饮、零售等具体场景,让机器人在实战中不断进化。

三是生态驱动,押注开源协作、开发者社区与产业链协同。陈建宇强调的 " 大脑 - 本体 - 场景协同进化 ",本质上已带有强烈的生态整合色彩,而自变量、星海图、星动纪元则通过不同程度地拥抱开源,将生态驱动推向更广层面。自变量把 WALL-OSS-0.5 开源给社区,联合主办全球具身智能开发者大会,据其介绍,在开发者黑客松活动中,参赛者仅用三天就跑通从数据采集到真机部署的全流程,而以往专业研究实验室完成类似搭建至少需要六个月。

泛化的突破不是单一维度的选择题。技术驱动、场景驱动、生态驱动三种侧重背后,是各家对 " 瓶颈归因 " 的不同判断,也决定了各自的投入方向和竞争策略。  值得注意的是,这三种驱动并非互斥,星海图既是技术驱动也是生态驱动,明略既是场景驱动也在与海康合作构建数据闭环。真正决定各家差异的,是三种驱动的组合方式与权重分配。

02. 商业化落地:第一波钱从哪赚?

在本次的 WRC 上,各家对 " 具身智能的第一波钱从哪赚 " 也给出了判断。需要说明的是,各家并不是只卖一样东西,而是硬件、能力、平台、服务同时布局,但从论坛发言和展台展示来看,各家当前的商业化重心各有侧重。

第一种是靠硬件铺量,用数据反哺算法。

宇树和星动纪元是这一方向的代表。宇树已在工厂实现落地应用,王兴兴坦言产品尚未大规模推广的原因是 " 效率和泛用性能力还是不够 ",因此当前核心任务是通过高性价比的机器人本体持续铺量,在真实场景中收集数据反哺算法迭代。

星动纪元则展示了从全尺寸双足人形机器人到灵巧手、商业服务机器人的完整产品线,自研硬件占比超过 95%,其具身物流解决方案已在物流领域批量落地。两者的逻辑都是从结构化场景切入,先用硬件铺量、用数据反哺,等技术和产品成熟后再向家庭延伸。

图源 /   星动纪元官网

第二种是通过智能服务,卖 " 开箱即用 " 的智能体能力。

银河通用走的是这条路,但切入方式不同。银河通用主打 " 一脑多本体 ",基于银河星脑(AstraBrain),同一套智能能力驱动双足、轮式、重载等多种形态的机器人,其智慧药房解决方案已在全国数十个城市部署,实现 7 × 24 小时自主运营。

第三种是依赖平台生态,押注商业模式变革。

星海图和自变量代表了这一方向,但也有所不同。星海图发布的 "1+3+N" 品牌战略的背后,源于其商业模式演变的判断,其在演讲中表示,去年到今年,行业内整机产品毛利率大致在 40%-60%,到第二阶段方案订阅,硬件毛利率或降到 20% 左右,而到了真正的 token 销售阶段,整机有可能变成负毛利。

自变量则押注通用模型 + 开源协作,用自研通用模型同时吃下家庭和工业两个市场,通过开源和数采基建扩大影响力,其物流分拣方案硬件成本较人形机器人方案降低约 70%。

第四种是押注基础设施,做产业的 " 水电煤 "。

与前三种做本体或做大脑的公司不同,京东定位为 " 全球最大的物理世界运营商 ",不做机器人本体,而是做数据、供应链、售后网络的 " 卖水人 ",京东云计划两年内累计采集超 1000 万小时真实场景数据。

四种方向背后,是对行业终局的不同判断。本体部署派赌 " 硬件先行、数据为王 ",智能服务派赌 " 能力即服务 ",平台生态派赌 " 商业模式改变 ",基础设施派赌 " 卖水比淘金更稳 "。

03. 殊途同归:2026,具身智能的商业化元年

路径不同,但各家都围绕同一个行业共识展开,从展品变商品,从表演变上岗。 回看本次论坛,各家的发言虽然各有侧重,但不难发现他们对人形机器人行业的当前重点与难点有着四大共识。

第一,2026 年是具身智能从 " 炫技 " 转向 " 干活 " 的转折点。

从论坛主题到各家发言再到展台布局,各家都不再仅放 Demo 视频,而是拿出了真实场景和可落地方案。竞争的维度也从 " 谁的机器人翻跟头更帅 " 变成了 " 谁的实操更稳、场景更多、成本更低 "。

第二,泛化能力是行业公认的 "GPT 时刻 " 门票,大模型路线还在很早期。

对于 " 泛化能力要到什么程度才算合格 ",王兴兴、王鹤等都给出了不同数字,但方向一致,机器人必须能在陌生环境中自主完成任务。

而对于 " 用什么技术路线实现泛化 ",行业还在尝试,VLA(视觉 - 语言 - 动作)更准,世界模型更聪明,现实是各家多条路尝试,但无论走哪条路,当前大模型在固定场景中经过专项训练后成功率可接近 100%,但只要更换物品或环境,成功率就会大幅下降。距离真正的泛化,还有不小的距离。

第三,当前落地难的最大卡点在 " 大脑 " 而非 " 肢体 "。

硬件怎么做已经基本清楚,具身智能主要卡在大脑上,但其进化受制于数据、模型架构和评价标准三个因素,其中在最关键的数据维度上,虽然各家和整体行业的人形机器人数据规模快速增长,但体量还是差很多。

第四,落地的节奏一致,先工业和商业,后家庭。

机械臂、移动底盘、半人形机器人因为成本可控、效果可见,已经在工厂、仓库、商场先用了起来。家庭场景因为环境复杂、要求高,还得再等等。这也解释了为什么银河通用做药房、星动纪元做物流、明略做餐饮、苏度科技做工业,各家都选择了 " 先把一件事做靠谱 " 的垂类场景。

除了共识,在本次的论坛上还有两个 " 尚未讨论 " 清楚的问题。

首先是人形机器人赛道玩家的终局形态,究竟是赢家通吃还是百花齐放。

这个问题在 WRC 上没有定论。一派认为人形机器人行业会像智能手机行业一样,5-10 年后头部企业凭借规模、数据和品牌优势拿走绝大多数利润,中小玩家陆续出局。

另一派则认为具身智能很难简单复刻这一剧本,机器人软硬件一体化的程度远超手机,本体设计、运动控制、场景适配深度绑定,单一巨头很难在所有品类和场景中都做到最优,再加上下游应用场景高度碎片化(工业、物流、商业、家庭对机器人的要求截然不同),更可能出现多家并存的格局,类似今天新能源汽车或工业机器人市场的竞争态势。

两种观点均有道理,各方也没有达成共识,更主流的预期是分阶段演进,短期百花齐放,各路玩家在不同场景中均有生存空间;中期部分头部企业跑出规模优势,至于结局,则难以预料。

其次是人形机器人规模化落地现在卡在了何处。

2026 年是具身智能从技术验证走向商业落地的转折点,但非规模化落地的完成点。机器人造出来了,但真正用来稳定干活的,还很少。这卡在了哪里?行业指向数据和模型架构两个方向。

数据方面,训练一个好用的模型至少需要 1000 万小时数据,目前全球积累量不足 5%。但更棘手的是,现有数据大多是抓杯子、简单移动这类基础场景,工业操作、零售服务等核心场景的数据严重短缺;而且不同型号的机器人数据难以通用,每家都在各自采集,效率很低。

即便数据量上来了,需要什么样的模型架构才能把这些数据转化成好用的 " 大脑 ",目前没人知道答案。数据和架构好比 " 鸡生蛋、蛋生鸡 " 的关系,没有数据,架构难以验证,而没有统一收敛的架构,数据采集的方向也无从统一。这也是 WRC 上各家分歧最大、但也最需要面对的问题。

2026 年的 WRC,没有一家公司说自己已经抵达 "GPT 时刻 ",但每家公司都画出了自己的路线图。大家路线不同,但方向一致,让机器人走下舞台,真正去干活。而当机器人不再跳舞,具身智能或许才真正拉开了大幕。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 创始人 王兴 出货量 王鹤
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论