北极星电力网 16小时前
北京机场偶遇王兴兴,宇树最新突破!扔掉遥控,全自主对打真人
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

作者 | 王馨

编辑 | 汤安迪

9 月 7 日,网友在首都机场接驳车上,偶遇宇树科技 CEO   王兴兴,他全程盯着手机闷闷不乐。

他可能在看一场机器人格斗,思考这拳为什么打轻了。

9 月 7 日,宇树科技放出一段 38 秒的实拍视频:一台 G1 人形机器人与真人拳手对打。它会主动进攻,也会在对方出拳时收拳防守;被一脚踢中后退一步,又迅速站稳。

宇树称,这场对打由机器人自主完成,是 " 全球首次实现世界模型实时驱动的全自主人形机器人格斗 "。背后是一个叫   UnifoLM-X2-1.0   的 " 世界 - 动作大模型 "。

视频很快在网上引发热议。有网友追问,机器人的摄像头、帧率和反应速度,能否真正跟上真实对抗?

更多的人则是感叹,《铁甲钢拳》要照进现实了。

世界模型,跟上了出拳速度

以前的机器人格斗,大致分为两类:一类按预设动作表演,比如宇树在 2025 年进博会和 CES 2026 上的对打;另一种由真人通过 VR 实时操纵,比如旧金山机器人格斗赛事 REK。

但宇树这次把 " 人 " 拿掉了,也把 " 脚本 " 拿掉了。机器人自己在脑内预演对手下一步,再决定闪避、格挡还是反击。

这正是世界模型与普通动作策略的区别。

普通策略更像 " 看到动作 A,就执行动作 B";世界模型则会多想一步:" 如果我执行 B,接下来会发生什么?" 就像机器人脑内的一块 " 预演屏 "。

但真正的难点,是让这一步 " 想象 " 跟上拳速。

世界模型过去多是离线用,生成视频、做仿真、造数据,慢一点也无妨。但格斗是另一回事,对手肩膀一动,留给机器人的反应时间只有几十到几百毫秒。系统要在这段时间里完成感知、预测、攻防决策和全身控制,被击中后还要迅速找回平衡。

换句话说,宇树是把一个原本 " 慢悠悠做仿真 " 的工具,硬压成了一个 " 实时做决策 " 的引擎。

相比之下,NVIDIA Cosmos 等世界模型目前公开展示的重点,仍主要是生成合成数据、构建仿真环境,以及缩小仿真与现实之间的差距,而不是拿来实时控制机器人。

而 " 格斗 " 作为一个绝佳的验证场景,不是图猎奇,而是因为它把 " 实时反应 + 物理理解 + 动态交互 " 压缩到了最极致。

机器人过去只是把拳打出去,这一次,它开始尝试在出拳之前先想一步。

宇树机器人,正在补上 " 好脑子 "

宇树过去经常被业内评价为" 小脑强于大脑 "。

运动控制、关节协调和平衡能力是它的看家本领,从后空翻、武术表演到登上春晚,都在证明这一点。

而负责理解环境、自主规划和完成陌生任务的具身大模型,一直是它的短板。

从 2025 年 9 月起,宇树明显加快了补 " 大脑 " 的速度:

先搭模型框架。  UnifoLM-WMA-0 负责预测机器人与物理世界如何互动;随后发布的 UnifoLM-VLA-0,把视觉、语言理解和动作生成接到一起,并用一个策略完成 12 类操作任务。

再补数据和真实场景。  2026 年初,UnifoLM-X1-0 进入宇树自己的工厂,试点装配关节电机;3 月开源 UnifoLM-WBT 全身遥操作数据集;此后的 WVLA2.0 和 UnifoLM-OminiA-0.3,又把模型带进会议室整理、家居和康养场景。

最后把速度推到极限。  到 9 月的 UnifoLM-X2-1.0,世界模型开始尝试实时驱动全身对抗。

看这条时间线就明白,X2 这一拳不是突然冒出来的,是一年布局的兑现。

其中最关键的是两条技术路线。UnifoLM-WMA-0 以视频模型为基础,预测机器人行动后世界会怎样变化,同时生成动作。

UnifoLM-VLA-0 则把视觉、语言和动作连起来,让机器人理解指令并执行任务。

通俗地说,VLA 负责 " 看懂环境,理解要做什么 ",WMA 负责 " 预想这样做会发生什么 ",小脑再把选定的动作稳稳做出来。X2 的意义,就在于将这几层能力接成了实时闭环。

这条转向也被写进了资本投入。宇树于 2026 年 8 月 19 日登陆科创板,原募投计划总额为 42.02 亿元,其中约 20.22 亿元投向智能机器人模型研发,覆盖 " 大脑 "" 小脑 " 以及数据和训练平台。

不过," 补上大脑 " 还不等于拥有了通用大脑。宇树现在有了 WMA、VLA 两条路线,也积累了工厂、家居和格斗等场景,但这些仍是边界相对明确的任务。把机器人放进一个完全陌生的家庭,仅靠一句话完成各种日常工作,难度要高得多。

王兴兴给出的标准是:机器人能在 80% 的陌生场景中,仅凭语音或文字指令完成约 80% 的任务,具身智能才算迎来 "ChatGPT 时刻 "。他判断,这一刻快则还要两三年,慢则可能需要五到十年。

真正的较量,在擂台之外

X2 让宇树的 " 大脑 " 第一次有了足够醒目的展示,但它不是终点。

人形机器人真正的竞争,也不是谁出拳更快,而是谁能更早走出规定明确的演示场景。

海外的 Figure、波士顿动力和 NVIDIA,分别在长时序操作、" 大脑 " 与 " 身体 " 融合、基础模型与仿真平台上发力。

国内的这几家,众擎把格斗做成了 URKL 人形机器人联赛,继续强化高动态运动;优必选用 Walker S2 深入工业制造;银河通用主攻零售、工业和医疗服务;星动纪元 同时布局 VLA 模型与物流场景;小米则发布 Xiaomi-Robotics-1,探索机器人在陌生环境中的跨任务操作能力。

相比之下,宇树的优势,是已经有一副能跑、能跳、能打,而且成本相对可控的身体。它现在要做的,是把新的 " 大脑 " 接上这副身体。

难点也正在这里。世界模型不仅要预测未来,还要跑得足够快、符合物理规律,并与机器人的动作准确对齐。宇树此前也承认,高质量视频预测计算量大,很难达到 20 Hz 以上的实时控制要求,也就是每秒至少完成 20 次感知和动作更新。

所以,宇树这一拳至少撕掉了 " 身体很强、脑子不行 " 的旧标签,但它证明的是可行性,还不是通用性。

格斗是最难的场景,也是最 " 取巧 " 的场景。它把 " 泛化 " 这个真正的难题暂时关在了擂台外面。

世界模型这条路能不能从擂台走到厨房,才是宇树接下来要回答的问题。而那个时刻,比任何一场格斗都更值得期待。

END •

Question. Write. Narrate. Believe.  

Become a story.

易简传媒的愿景是提问和传播商业故事,让读者更开阔,更聪明。有 2500 万微信粉丝关注我们的账号,欢迎大家关注:

↓↓↓

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 王兴 ceo
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论