第一新声 昨天
14B打赢64B!清华具身模型登顶“具身珠峰”,GPT-6 Astra被甩在身后
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

分析师/会磊

校对/Tina

策划/Eason

星动纪元,这家清华大学唯一直接持股的具身智能公司,刚刚登顶了"具身智能界的珠穆朗玛峰"。

近日,星动纪元自研的世界动作模型VPP2在RoboDojo仿真榜单上跑到全球第一,综合平均成功率32.26%、综合平均得分39.26分,两项指标双双第一,并在泛化能力、精细操作、记忆能力三个维度拔得头筹。排名超过GPT-6 Astra、Physical Intelligence的π0.5和英伟达GR00T-N1.7。

RoboDojo由香港大学MMLab牵头,全球近20所顶尖学术机构共建,专挑机器人不擅长的地方出题:换个环境还会不会干活?东西摆歪了还能不能抓准?任务做到一半还记不记得前面发生了什么?在VPP2之前,榜单上主流模型的成功率多在个位数到两成出头。

但真正值得注意的,是三个数字:第一,VPP2只有14B参数;第二,它没有使用任何额外数据或Agent RSI等增强手段;第三,它是一个完全开源、可复现的模型。

一个14B的"小模型",靠标准数据集,把64B的大模型和GPT-6 Astra甩在了身后。这背后到底发生了什么?

14B打赢64B:

不是"刷分",是基座真的强

要理解VPP2的含金量,先得看懂RoboDojo这个"考场"有多难。

RoboDojo由香港大学MMLab牵头,联合全球近20所顶尖学术机构共建,仿真环节包含42项双臂操作任务,覆盖泛化、记忆、精度、长程执行、开放词汇指令遵循五个维度。

简言之,该"考场"专门挑机器人不擅长的地方出题:换个环境还会不会干活?东西摆歪了还能不能抓准?任务做到一半还记不记得前面发生了什么?在VPP2之前,榜单上主流模型的成功率多在个位数到两成出头。

而VPP2交出的成绩单是这样的:视频指令遵循测试中,VPP2-14B的指令遵循成功率为90%,高于Cosmos3-64B的78%,原始Wan2.1模型只有4%。在真实ALOHA机器人零样本操作任务中,VPP2平均成功率58.5%,比最强基线高出18.5个百分点。RoboDojo综合评分39.26,比GPT-6 Astra的28.97分高出10.29分。

这些数字背后,有三个关键的"不"。

第一,不靠"外挂"。 VPP2没有使用Agent RSI等增强手段——这是不少模型在评测中"刷分"的常见路径。RSI(可扩展监督推理)本质上是给模型外加一层推理增强模块,相当于考试时带了一个"外挂计算器"。VPP2没用,它靠的是模型本身的能力。

第二,不靠"堆数据"。 很多团队为了冲榜,会在标准数据集之外额外搜集大量针对性数据进行微调。VPP2没有。它仅使用标准数据集就完成了登顶。

第三,不靠"堆参数"。 14B参数打赢64B参数,在这个"大就是好"的时代,几乎是一个反直觉的结果。VPP2论文明确指出,在特定操作预测任务上,参数规模更大不一定就表现更好,训练数据怎么组织、指令与动作轨迹如何对应,同样会影响结果。

那么,性能提升到底来自哪里?答案是预训练。

VPP2以阿里开源的Wan2.1-I2V-14B视频生成模型为基座,进行了大规模的"事件级"继续预训练。团队构建了大规模、多样化的操作视频数据集,用详细标注描述每一次操作的目标对象、执行末端和相机视角,让视频模型真正"理解"操作任务的完整过程。当基座模型对物理世界中的操作行为理解得足够深,动作学习就变成了一件"水到渠成"的事。

一句话总结:VPP2的强大不是"刷"出来的,是"练"出来的。

"预测错,动作就错"

——世界动作模型的老大难,

VPP2怎么破?

世界动作模型(WAM)是当下具身智能最热的技术路线之一。它的核心思路很直观:让视频生成模型"预测未来画面"的能力,迁移为机器人"该怎么动"的动作能力。一个能在脑海中推演未来的机器人,理应知道下一步该做什么。

但理想很丰满,现实很骨感。现有WAM有一个致命的软肋:预测错了,动作就跟着错。

这个问题有三个层面的成因。首先,底座视频模型不懂操作。 视频模型懂画面,但不懂夹爪、不懂任务,在开放环境中预测出来的未来往往是"似是而非"的。其次,硬塞动作模块伤泛化:把动作模块直接端到端混训进视频模型,会让模型"记住"特定动作而"变笨",原有的泛化能力被严重破坏。最后,坐标系混乱。不同机器人的视角、坐标系各异,同一个动作在不同构型下方向可能完全相反,模型学不到稳定的映射关系。

这三重问题叠加,导致了一个尴尬的行业现象:机器人Demo越做越炫,模型榜单分数越来越高,但真让机器人在陌生环境中干活,立刻"怀疑人生"。

VPP2的解法,核心只有八个字:先练预测,再练动作。

它把视频预测与动作学习彻底"解耦",拆成三阶段来训练。第一阶段,事件级继续预训练。在Wan2.1-14B基础上,用大量操作视频让模型学会"如果要做这个操作,接下来画面应该怎么变"。每个训练片段覆盖一个完整子任务,从初始观察到完成。第二阶段,块级后训练与蒸馏。把模型训练成固定8秒时域的视觉规划器,并通过一致性蒸馏把多步迭代生成压缩为单步,换取实时速度。第三阶段,动作专家训练。用一个0.9B参数的轻量动作模块,通过MoT混合架构学习"给定预测的未来画面,机器人该怎么动"。

整个流程的逻辑非常清晰:预测得更好,行动得更好。机器人先"在脑海中预演"一次操作该怎么发生,再把这个预演翻译成具体动作。8秒视频预测约0.1秒完成,动作专家总延迟约0.22秒,可以实时闭环控制。

这种解耦策略带来的最大收益,就是零样本泛化能力的全面跃升。

什么叫零样本泛化?简单说,就是模型在训练时没见过的新物体、新位置、新任务组合面前,仍然能正常完成操作。VPP2在视频预测和动作生成两方面都具备强零样本泛化能力。在实际测试中,团队把VPP2部署到真实的ALOHA双臂机器人上,进行了倒水、倾倒等10类零样本操作任务,VPP2在9/10类任务中排名第一。

目前,VPP2已经在多个场景中得到了验证。

在仿真层面,它通过了RoboDojo、LIBERO-Pro、LIBERO-OOD等主流基准测试。在真机层面,ALOHA双臂机器人上的零样本测试证明了它的实际操作能力。在产业层面,星动纪元的机器人已经批量进驻中国邮政、顺丰集团等10多个物流中心,在部分高温、潮湿等恶劣环境下,部分物流中心机器人效率超过人类水平的85%,并能24小时稳定运行。

未来,VPP2的"预测-行动"解耦范式可以向外延伸。在工业制造中,它可以处理精密装配和质检任务;在医疗场景中,可以辅助手术器械的精准操作;在家庭服务中,可以完成整理、清洁等长程多步任务。核心逻辑是一样的:先让机器人"看懂"该怎么做,再让它"学会"怎么做。

 具身智能的"分水岭":

从Demo竞赛转向工程化竞争

VPP2登顶RoboDojo这件事,放在更大的行业背景下看,意义远超一个榜单排名。

首先,行业正处于从"Demo驱动"到"可量化竞争"的转折点。

过去两年,具身智能行业有一个公开的秘密:各家公司都在发Demo、报成功率,但各家考卷不同、硬件不同、评分标准不同,横向比较几乎无从谈起。RoboDojo的出现,试图终结这种状态——真机与仿真双轨并行,统一硬件、统一协议、公开题库,从根上杜绝针对性优化和过拟合。VPP2用标准数据集、开源代码的方式登顶,意味着具身智能行业开始有了一把真正统一的"尺子"。

其次,世界动作模型正在被推上具身智能竞争的中心。

截至今年8月,国内至少已有30家公司发布或宣布涉足世界模型。英伟达机器人方向负责人Jim Fan甚至在红杉资本AI Ascent大会上抛出论断:"视觉语言模型VLA已死,世界动作模型WAM当立。"银河通用创始人王鹤也提到一组对比数据:2025年发布世界动作模型论文时,他能找到的相关论文只有一篇,一年多后这个数字变成了171篇。这条赛道的拥挤程度,可见一斑。

最后,中国具身智能产业正在加速从实验室走向规模化落地。

从产业基础设施来看,全国已建成启用70多家具身智能训练场,在建、规划40余家,形成长三角、京津冀、珠三角三大核心集群。2025年,中国人工智能核心产业规模超过1.2万亿元,企业数量超过6200家。行业预测,中国具身智能市场规模预计2026年达到1.09万亿元,年均复合增长率22%至23%。从技术验证到规模商用的跨越,正在发生。

但挑战同样存在。核心矛盾在于:机器人产业软件落后于硬件,"脑体倒挂"是行业的痛处。VPP2的成功说明,解决"脑"的问题,靠的不是更大的参数、更多的数据,而是更聪明的训练范式和更扎实的预训练基座。

写在最后

VPP2登顶RoboDojo,不只是一次榜单的更迭,更是一次范式突围。

GPT-6 Astra代表了"通用大模型向下兼容"的路线,用强大的认知能力试图覆盖一切;VPP2代表了另一种路线——围绕物理世界建立专门的能力底座,让机器人真正理解"操作"这件事本身。它用14B的参数规模、标准的数据集、开源的技术方案,证明了具身智能的壁垒不在于"谁的钱多、谁的参数大",而在于"谁的方法对"。

RoboDojo上,VPP2的成功率是32.26%,人类专家的遥操作成功率是76%。差距仍然巨大,但方向已经清晰:当机器人学会高质量地预测未来,好的动作就会随之而来。

显然,参数竞赛的叙事正在失效,物理世界的理解深度,才是具身智能下一程的真正赛点。

更多内容

【人工智能】3.45亿 VS 1.66亿:豆包逼急阿里,千问携40亿淘宝商品库打响"AI购物第一枪" |一觉醒来,马斯克亲手解散xAI!22万张GPU全给Claude,AI战局一夜改写|68元起,豆包迈向收费第一步:免费的"代价",终于兜不住了|Anthropic"连坐"封号、Cursor 9秒删库:AI反噬企业的惨痛一课,代价太贵了|阿里"快乐小马"开启灰度测试:用原生音画定义AI视频的下半场 |每秒10米、无头无手、重心贴地:宇树H1如何让机器人"飞"起来? | 腾讯扔出一只浏览器"龙虾",浏览器赛道迎来最强搅局者| "太危险了,不敢公开发布":Claude Mythos为何让硅谷巨头集体恐慌| 字节、阿里、腾讯的AI工业化暗战:谁在建造AI时代的"工厂"?| 从工具到生态:银联APOP框架发布,勾勒智能体支付新蓝图| 日均120万亿Token,中国大模型终于跑出一个"全球第三"| Claude Code"被开源":一场51万行代码的意外漂流,正在加速AI开发者的竞赛|没等来V4,等来大升级?Deepseek宕机一夜,是重大事故还是偷偷变强|从偏科生到"人形第一股":王兴兴的十年逆袭|亲手砍掉Sora,奥特曼在下一盘什么棋?|龙抬头,向AI"抬头":一部AI短剧如何"捅破"传统广告的天花板|Token经济:谁在瓜分"小龙虾"带来的万亿红利?|谷歌AI Studio深夜放大招:全栈Vibe编码体验上线,一句话开发原生应用

【行业深度】具身智能"爆发",谁将是背后的"投资之王"? | AI会革了百度的命吗? | 真假混战:Agent元年,如何拨开概念迷雾?| 没找到刚需:人形机器人是个好生意吗 | 用得起来 还有"人样" 2025世界机器人大会人满为患 | 2025年WAIC:一票难求,800厂商从"概念"走向"落地" | AI浪潮下,数据库如何"进化"?| AI Agent是中国SaaS的解药 | 央国企的AI征途:抢跑还是稳行?|出走大厂的95后CEO们,已在AI赛道融资数亿|这波AI风口,让青年投资人踩中了|深圳实验创投"群英谱":一所中小学的"硬核"造星之路

【人物周刊】中台化架构+场景化落地:迈富时如何用AI-Agentforce构建企业"智能业务闭环"?|行业困于"伪智能",原力无限以VLA与世界模型双线破局|从技术先锋到生态构建者,贝锐CEO讲述19年"连接革命"与"软硬一体"突围之路 | 一群清华人,与具身智能的四十年 | 用AI Agent征战海外市场| Agent让营销从"人找货"变"货追人" | 专访白惠源:撕掉"阿里副总裁"标签,数亿资金押注"下一代AI"|姚期智和他的"姚班":人生只为一大事而来 | 朱啸虎:萧条时代下的迷途猎手|雷军和他的"小米哲学":把风口玩到next level

【行业研究】《2025年中国企业级AI Agent应用实践研究报告》 | 《2025年中国金融业数据库国产替代能力评估报告》| 《大模型时代 2025年央国企数智化转型新实践与新范式》|《2025年中国IT后市场发展研究报告》| 《2024年央国企RPA市场研究报告》|《2024年中国AI大模型产业发展与应用研究报告》|《2024年中国银行业数据库市场研究报告》|《2024年中国CRM市场研究报告》|《2024年中国智能客服市场研究报告》|《2024年中国网络靶场市场研究报告》| 《2024年中国交通运输行业数字孪生市场研究报告》

关注「第一新声」并设置星标,第一时间GET行业信息

智客推

智客推

ZAKER 智客推 GEO | AI 时代的品牌认知解决方案

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

astra 纪元 机器人 英伟达 清华大学
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论