量子位 2小时前
清华具身模型登顶全球第一!突围GPT-6、英伟达,不靠外挂和额外数据
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

好家伙,世界动作模型(WAM)赛道,中国团队直接冲到了全球第一?!

而且,GPT-6-Astra、Physical Intelligence 的 π 0.5、英伟达 GR00T-N1.7 等一众全球头部具身模型,这次都被甩在了身后。

出手的是一家中国机器人公司——清华唯一持股的嫡系具身公司,星动纪元。

近日,星动纪元自研的世界动作模型 VPP2,一举登顶RoboDojo 仿真榜单。

综合平均成功率 32.26%,综合平均得分 39.26 分,两个指标双双第一。

关键是,这场比赛还真不好打。

RoboDojo 号称具身智能界的「珠穆朗玛峰」,由香港大学 MMLab 牵头,全球近 20 所顶尖学术机构共同建设。

它专挑机器人不擅长的地方出题:换个环境,还会不会干活?东西摆歪了,还能不能抓准?任务做到一半,还记不记得前面发生了什么?

总之,想靠刷熟练度蒙混过关,没那么容易。

结果呢?

星动纪元 VPP2 不仅拿下综合第一,在泛化能力、精细操作、记忆能力三个维度上,也拔得头筹。

据说,这次 VPP2没有额外加数据,也没用 Agent RSI 等增强手段,仅靠「标准数据集」,就把一众高手给卷了下去。

这代表着 VPP2 模型本身足够强,性能提升来自预训练,基座足够泛化,因此不靠外挂增强策略,不靠扩充数据「刷分」。

不是,哥们儿,这么夯的模型到底是怎么练出来的啊???

我们往技术路线里扒了扒,你别说,VPP2 这次的突破,还真有点东西。

它瞄准了世界动作模型的一道老大难问题:预测错了,动作就跟着错。

VPP2 给出的解法,是先把视频预测能力练到足够强,再让机器人在陌生环境里真正动起来。

从预测到行动,两种泛化能力一起提升。

从目前披露的多项测试结果来看,VPP2 已经成为世界动作模型 WAM 赛道中,最有竞争力的选手之一。

世界动作模型 WAM,卷出一个新冠军

具身智能行业有个挺尴尬的现象。

机器人 Demo 越做越炫,模型榜单分数也越来越高,但真要问一句,谁的机器人更聪明、更能干活?

还真不好回答。

比如让机器人抓杯子。在训练时见过的桌面上,它可能百发百中。结果换个杯子、挪下位置,立刻开始怀疑人生。

更别提那些需要连续执行多个步骤的任务了。

这也是为什么,RoboDojo 这套评测值得关注。

它的目标是为具身智能建立统一、可复现的评测标准,仿真测试包含 42 项双臂操作任务,覆盖泛化、精准操作、长程任务、记忆、开放词汇指令理解五个维度。

说白了,就是把机器人拉出舒适区。

传统机器人模型在熟悉任务上可能接近满分,一旦环境、物体位置、任务组合发生变化,成功率可能明显下降。

RoboDojo 专门对这类复杂情况进行考察,看机器人面对变化时,有多少泛化能力。

而 VPP2 这次交出的成绩单,相当亮眼。

平均成功率 32.26%、平均得分 39.26 分,两个指标均位居榜首。

作为对比,在 RoboDojo 仿真基准的后训练评测中,GPT-6-Astra的平均成功率为 22.48%,平均得分 28.97 分。

而VPP2分别领先 9.78 个百分点和 10.29 分。

△论文截图,基线模型数据取自官方排行榜

这里两个指标各有侧重:成功率看机器人能否完整完成任务;平均得分则衡量任务推进到了哪一步,即便没能全部完成,也能体现其阶段性表现。

两项指标均综合了五大能力维度的测试结果。

换句话说,VPP2 不仅完成任务的比例更高,面对没能做完的任务,也体现出了更强的阶段性完成能力。

而且,这种领先并不局限于综合成绩。

拆开五项能力维度来看,VPP2 在泛化、精准操作、记忆三个维度上,同样拿下第一。

这三项能力对应着机器人进入真实世界的几道难关:换个环境还能不能干活,操作能不能做准,以及连续执行任务时能不能记住前面的步骤。

综合成绩领先,关键能力也能打。

不过,RoboDojo 再难,考场终究还是「仿真环境」。真到了物理世界,物体的摩擦、形变、位置偏差,又会陡生变数。

VPP2 在仿真里展现出的泛化能力,到了真机上还能成立吗?

星动纪元也做了实验。

这次,团队直接把 VPP2部署到真实 ALOHA 双臂机器人上,测试了抓取、放置、堆叠、折叠、倾倒等 10 类零样本操作任务。

也就是说,无需针对这些测试任务进行额外微调,机器人就得直接上手。

结果,VPP2 再次交出领先成绩:平均成功率 58.5%,高于 π 0.5 的 40%。

在 10 类任务里,VPP2 拿下了 9 类最佳成绩。

这下有意思了。

榜单第一,证明的是它在标准评测体系里的能力;真机零样本操作,则进一步考察这些能力能否迁移到真实物理环境。

两份成绩单摆在一起,VPP2 的技术优势就更值得深挖了。

要知道,VPP2 走的是世界动作模型(WAM)路线。

这类模型的基本思路,是借助视频预测理解物理世界接下来会如何变化,再把这种预测转化为机器人动作。

但这条路线长期存在一个问题:视频预测得漂亮,不代表机器人真的会干活。

VPP2 这次,偏偏就冲着这个问题去了。

从预测泛化到行动泛化,VPP2 怎么做到的?

想理解 VPP2 的突破,先来看一个简单任务:让机器人把桌上的杯子放进盒子里。

对人类来说,伸手抓住、抬起来、放进去,几乎不用思考。

但机器人得判断杯子的位置、机械臂的运动轨迹、夹爪何时闭合,还要预测整个操作过程中,物理世界会发生什么变化。任何一步出了偏差,都可能翻车。

现有的世界动作模型(WAM),恰恰容易在这里出问题。

一方面,普通视频模型擅长生成画面,但画面看着合理,和符合真实物理规律是两回事。

比如要求抓左边的杯子,模型却预测抓起右边那个。视频照样能生成,机器人执行时却会直接跑偏。

另一方面,直接把动作学习加入视频模型,还可能损伤原本的泛化能力。

结果动作学会了,机器人换个环境却不会做了。

VPP2 提出了一个很直接的判断:视频预测的质量,决定了动作的上限。

基于这一思路,星动纪元选择将视频预测与动作学习分阶段训练,重点不是「视频、动作一锅炖」,而是把两者「解耦」,重新「排序」。

星动纪元为此设计了一套三阶段训练策略:

第一阶段,事件级视频继续预训练,让模型学会预测完整操作过程。

第二阶段,固定时长视频后训练与蒸馏,让预测能力跟得上机器人实时执行的速度。

第三阶段,动作专家训练,将视频预测转化为具体动作,同时尽量保住原有的泛化能力。

三个阶段层层递进,最终指向两个核心突破:预测能泛化,行动也能泛化。

第一个突破:让视频预测具备泛化能力

VPP2 首先要解决的,是机器人能否准确预测陌生任务中的物理变化。

星动纪元以阿里开源的 Wan2.1-I2V-14B 为基础,整合机器人操作、人类活动、通用视频等多种数据,覆盖不同机器人本体和操作方式。

不过,真正有意思的是它对数据的处理。

团队没有简单地把视频一股脑喂给模型,而是先将操作过程切分成语义完整的片段,再配上详细描述。

比如,不能只告诉模型「把杯子放进盒子」,还要明确是哪只机械臂、哪个杯子、哪个盒子,以及整个操作过程。

因为同一句模糊指令,可能对应无数种动作轨迹。

模型如果连操作对象都没搞清楚,自然很难准确预测未来。

VPP2 索性把任务描述得更细,让语言指令和物理操作形成更稳定的对应关系。

更关键的一步,是事件级视频预测训练。

传统短时预测关注接下来几帧会发生什么,而 VPP2 直接让模型学习一次完整操作从开始到结束的变化。

从机械臂靠近杯子,到抓住杯子,再到放进盒子,模型要理解的是一整件事如何发生。

这样一来,面对新的物体、位置甚至操作任务,它才更有机会预测合理的物理变化。

在机器人操作视频的指令遵循测试中,14B 参数的 VPP2 达到90%的成功率,而 64B 参数的 Cosmos3 模型为 78%。

14B 打赢 64B。

这也说明,在物理操作预测中,参数规模并非唯一的胜负手,能否真正理解操作过程同样重要。

不过,预测得再准,机器人动不起来,也白搭。

第二个突破:让预测泛化变成行动泛化

这里有两道坎,一是速度,二是如何在学会动作的同时,保住视频模型原有的泛化能力。

第一道坎很好理解。如果让机器人干活,每个动作发生前都要花几秒生成视频,那么再强的预测能力也很难派上用场。

星动纪元选择先给预测模型提速。

团队将事件级预测模型进一步调整为固定 8 秒的视频片段预测,再通过一致性蒸馏,将多步计算压缩为单步生成。

最终,预测未来 8 秒的视觉变化,计算耗时约 0.12 秒。

第二道坎,稍微棘手一些。

前面好不容易让视频模型学会了预测陌生任务,结果加入动作训练后,模型反而只会执行熟悉的操作。

动作能力长出来了,泛化能力却丢了?VPP2 要做的,就是同时跨过这两道坎。

VPP2 引入一个0.9B 参数的扩散 Transformer(Action DiT),采用 MoT 架构,学习如何根据预测的未来状态生成机器人动作。

但星动纪元没有直接将视频预测模型(Video DiT)和动作专家一起从头训练。

在动作训练初期,视频模型的基础参数被冻结,仅通过 LoRA 进行适配,尽量避免动作训练破坏已有的预测泛化能力。

相当于先让机器人理解物理世界怎么变化,再训练它如何把这种「理解」转化为「动作」。

两种能力分阶段生长,又相互配合。

最终,视频预测约耗时 0.12 秒,动作专家约耗时 0.1 秒,整体动作片段生成延迟约为 0.22 秒。

当然,架构再漂亮,也得看最终效果。

前面提到的ALOHA 真实机器人零样本测试,已经展现出 VPP2 将预测能力转化为陌生任务操作的潜力。

另外两套泛化测试,则进一步验证了这条路线。

LIBERO-Pro考察物体位置、任务要求变化后的操作能力,VPP2 取得 45.0% 的总体成功率,其他基线模型最高为 11.0%。

LIBERO-OOD则考察组合泛化,将熟悉的物体、布局和任务目标重新组合,形成此前没见过的新任务。

VPP2 的总体成功率达到 63.9%。

把这些结果放在一起看,VPP2 的技术思路就清楚了。

先通过多源数据、详细任务描述和事件级预测训练,让模型更准确地预测物理变化。

再通过蒸馏加速、分阶段动作学习,将这种预测能力转化为实际操作,同时尽量保留原有的泛化能力。

具身智能的性能上限,显然还没到只能靠规模硬堆的地步。

VPP2 再次说明,优化数据管线、调整训练范式,这些看似朴素的工程方法,仍然有机会带来可观的模型性能提升。

从 GPT 到 WAM,物理 AI 正在形成新范式

预测能泛化,行动也能泛化,是 VPP2 作为世界动作模型 WAM,最值得关注的核心突破。

但真实任务往往更加复杂。机器人不仅要知道怎么做,还得判断先做什么、后做什么。

这就需要更高层的认知与规划能力参与进来。

星动纪元这里贡献了一个思路:GPT 负责想,VPP2 负责做。

前者负责理解、推理和规划,把复杂任务拆解成明确步骤;后者负责预测物理世界如何变化,再将规划转化为具体动作。

这一思路,在 VPP2 论文中已经有了初步的实验支撑。

团队实际采用的是 VLM 高层规划器,由其负责语义理解、记忆和任务拆解,再将明确的子任务交给 VPP2 执行。

结果相当直观。在 RoboDojo 选定的长程任务测试中,引入 VLM 子任务规划后,平均成功率从 27.6% 提升至57.6%。

这意味着,机器人要完成复杂任务,光有强大的动作能力还不够。高层规划与底层执行能否配合,同样影响任务完成效果。

顺着这条思路往后看,GPT+VPP2有望形成一种新的物理 AI 技术范式:通用认知+通用物理执行。

GPT 等通用模型负责理解意图、推理和规划,VPP2 这样的 WAM 负责预测物理变化、生成动作,再通过执行反馈持续调整。

从认知、规划、预测,到执行、反馈,一套完整的物理 AI 闭环逐渐清晰。

而这,也让 WAM 的价值有了更大的想象空间。

模型能力要通过本体与物理世界交互,真实使用又会暴露失败、产生反馈,推动模型和硬件继续改进。

星动纪元同时做大脑、本体和灵巧手,「深全栈」的战略可以在这一逻辑中得到解释:公司试图掌握的不仅是训练环节,也包括能力落地与反馈回流的环节。

u1s1,技术路线再漂亮,最终还是得去真实世界里干活。

星动纪元在这方面,已与中国邮政、顺丰等企业开展合作,在全国 5 个省市、10 余个物流中心常态化运营。

物流场景中的货物尺寸、摆放位置、作业流程都可能发生变化。同样一套操作,换个仓库,机器人可能就得重新适应。

这也对机器人的泛化能力提出了更高要求。

模型能否把学过的本事迁移到陌生任务中,直接关系到未来跨场景部署的效率和成本。

当然,已有物流业务的商业化进展,并不意味着 VPP2 已经实现规模化部署。模型能否在更多真实场景中长期稳定运行,还需要进一步验证。

但 VPP2 这次的成绩,已经释放出一个值得关注的信号。

世界动作模型的竞争,正在从预测未来,进一步走向把预测转化为通用行动。

回头再看 RoboDojo 登顶,值得关注的也就不只是一个第一名了。

从仿真到真机,从预测泛化到行动泛化,VPP2 的一系列实验结果表明:视频预测与动作学习的分阶段训练,确实能够提升机器人在陌生任务中的操作能力。

而随着 GPT 等通用认知模型与 WAM 进一步结合,物理 AI 也有望形成更完整的能力体系。

说到底,具身智能下一轮比拼的,就是机器人能否把学到的本事,带进更多陌生场景。

预测得准,还要做得到。这才是世界动作模型真正走向物理世界的关键。

PS:VPP2 现已开源,感兴趣的朋友可以上手试试,复现一下论文结果。

要是真跑出什么惊喜,记得回来跟我们唠唠~

1. 开源代码 :https://github.com/roboterax/video-prediction-policy-2

2. 项目主页:https://robert-gyj.github.io/video-prediction-policy-2

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—  完  —

点亮星标

科技前沿进展每日见

评论
大家都在看