雷锋网 23小时前
没有全科优秀,具身模型别想进入百万小时
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

原力灵机登顶 RoboDojo:一个专门给机器人 " 卸妆 " 的考场。

                                                                                                       

最近的朋友圈,几乎被机器人运动会和 WRC 2026 上的各种视频刷屏了。

看多了机器人百米冲刺、跳远,再看各个展台叠衣服、冲咖啡,很容易得出一个结论:机器人时代来了。

然而,如果你不幸参与过这些演示背后动辄几千次的调试与过拟合,你就会清楚这里面的水有多深。

行业内管这种情况叫 "Demo 滤镜 "。滤镜有多厚?说实话,即使你积累了一些行业知识,在现场盯着看,你也未必分得清:这个演示到底是提前编好的动作,还是模型在实时驱动。

这些信息差,让具身行业多少有些鱼龙混杂。

好在,学术界还留着几面 " 照妖镜 ",比如 RoboDojo。

01

一个不许摆拍的考场

这是一个来头不小的权威评测:由香港大学多媒体实验室牵头,联合 UC 伯克利、清华等全球近 20 所顶尖机构,背后是知名仿真基准 RoboTwin 的原班人马。它干的事用一句话概括:给全世界的机器人模型办一场统一高考。

其中,42 道题,考泛化、记忆、精细操作、长程执行、开放语义理解五个科目;另外还有 18 道题,考场里摆着三种双臂机器人(ARX X5、Piper 等),灯光、复位流程、部署接口全部统一,评审双盲打分,既看结果也看过程。

翻译一下:不许自带考具,不许挑题,不许摆拍,仿真、真机分开考。

成绩单相当惨烈。截至今年 7 月,仿真榜上 30 多个参评模型里,不乏大家熟悉的 π 0.5(Physical Intelligence)、英伟达 GR00T-N1.7、OpenVLA-OFT,全是这个赛道叫得上名号的选手,头部模型的平均成功率只有 8.80%,作为对比,人类专家是 76.03%。

真机榜更惨:头部模型总体成功率 12.8%,人类 100%。最难看的是开放语义任务,成功率只有 1.67%。

1.67% 是什么概念?考 60 次,蒙对 1 次。而同一个考场里的人类,满分。

所以这个榜单暴露的,不是哪家公司不行,而是一个行业级现实:现在的具身模型,绝大多数离落地还很远。

然而最近,RoboDojo 的一家中国具身头部公司:原力灵机。它的通用具身基础模型   DM0.5,以   24.90   的综合得分、19.34%   的平均成功率,双项第一,综合排名登顶。

02

分数之外,先看它干活的样子

从去年底开始,AI 科技评论判断一个具身模型的含金量时,就越来越关注榜单之外的东西,它干活的样子。

毕竟,分数是给人看的,活是给世界干的。

我们特地找到了 DM0.5 的 GitHub 仓库,结果看到了一些让人意外的细节。

先从一个测试视频开始。桌上随机摆着红、绿、蓝三块积木。给你三个杯子,从左到右把它们挨个盖住。等颜色全部遮住,再按红、绿、蓝的顺序,把杯子依次揭开。

听着像逗小孩的。没错,三四岁的小孩确实能轻松完成,顺便还会嫌你无聊。但让机器人来呢?很遗憾,绝大多数 " 具身大脑 " 都会当场露馅:不是颜色记错,就是步骤乱套。

因为现在的具身模型,大多和金鱼差不多:走一步,忘一步。

主流 VLA 模型做决策时,只看眼前这一帧,或者最近几帧画面。十秒内的短任务没问题,抓个杯子、按个按钮,靠本能反应够了。但真实世界的活儿几乎都是长程的:做一顿饭半小时,收拾一间屋子一小时,流水线一站一整天。没有记忆,机器人就永远只能活在 10 秒的 Demo 里。

这个 " 杯子盖积木 ",正是 RoboDojo 里的一道真题,任务名叫 Cover Blocks,考的就是记忆。 DM0.5 的表现,三个随机种子,DM0.5 全部 100% 通过。

注意,拿满分还有两个附加条件:杯子姿态全程有效,结束后物归原位。也就是说,它不是蒙对了一次开盖顺序,而是稳定走完 " 观察、记忆、按序执行、善始善终 " 的完整闭环。如果你是做具身算法的,就知道这个表现有多惊艳。

这个 100% 的含金量,放到榜单里更直观:Memory 维度,DM0.5 拿到 47.74 分、47.44% 的成功率;而全场第二名,只有 13.37 分、12.11%,得分差了 3 倍多,成功率接近 4 倍。

Memory 一直是原力灵机的强项。PI 的 Mem 具身记忆架构论文,就引用过原力灵机的 MemoryVLA,肯定了其在具身记忆方向的探索。

近期旗舰 π 0.7 论文再度引用该成果。π 0.7 作为全球泛化顶尖的机器人基础模型,架构基于 PI 的 Mem 框架,而 MemoryVLA 在 " 小脑记忆 " 路线的研究,为 PI 提供重要参考。两次引用,足以证明原力灵机在具身智能记忆领域的能力。而这次按榜单的五维综合评价,Memory 正是 DM0.5 拉开差距、最终登顶的关键科目。

03

治 " 金鱼病 ",为什么这么难

可能有读者会问:既然记忆这么重要,为什么这么多公司不去攻克?

首先是贵。把几十秒的历史画面塞进模型,上下文一拉长,计算量暴涨,架构也得重新设计。多数团队的选择是先把短任务跑通,记忆以后再说。

这个剧情其实眼熟。大语言模型的进化史,几乎就是一部上下文长度的扩张史:从几千 token 到十几万、上百万,模型记得住的东西越多,能力就发生一次质变——从陪聊到读论文、写代码、当 Agent。上下文,就是语言模型的记忆。

而如果具身行业因为 " 贵 ",一直解决不了大脑的记忆问题,那不管机器人是进工厂还是进家庭,都是个闯祸精。

DM0.5 为什么能把记忆做成杀手锏?我们翻了它的开源论文,找到了相关章节:

简单说,DM0.5 是把记忆从后面临时打的补丁,变成预训练阶段就长进去的原生能力。具体有三招:

第一招在架构。DM0.5 由 4B 的 VLM 多模态主干加 680M 的 Action Expert 组成,中间专门设了一个 " 上下文抽象层 ":用高效的信息压缩,让 VLM 在预训练阶段就原生学习历史信息,原生支持最长 60 秒记忆,一套架构通吃可变长的时间窗口。

关键是 " 原生 " 两个字:不是把长历史硬塞进去硬算,而是让模型从小学会把历史压缩着用。

第二招在预训练。围绕历史上下文、具身推理、动作监督、数据质量做系统升级,让长程记忆、指令理解、动作连续性、抗干扰作为一个整体长出来,而不是东拼一块、西凑一块。

第三招在微调。针对下游任务的 SFT 里直接加入 20 秒历史观测,把预训练攒下的时序理解能力,真正迁移到考场任务上。

三招的回报,就是 Memory 维度那条接近 4 倍的分差。

04

只会背书,拿不了状元

不过按官方的说法,DM0.5 的登顶并非依赖某一项单点能力,而是预训练与针对性 SFT 共同带来的整体提升。我们在仓库里核对了一圈,确实如此。

LIBERO 综合成功率 99.0%;RoboTwin 2.0 简单和复杂场景分别是 93.6% 和 93.3%;VLA-Arena 三档难度下 89.0%、53.6%、44.1%;导航任务 R2R、RxR 的未见场景成功率 59.7% 和 65.5%,全面压过基线方法。

在另一项同样 " 魔鬼 " 的评测 RoboChallenge Table30 v2 里,面对 ARX5、UR5、ALOHA、Dexmal-Mirror 四种不同构型的机器人、30 个复杂任务,DM0.5 以 43.0% 的整体成功率、54.42 的综合得分位列第一。

榜单看到这里,我们更好奇了:DM0.5 落到真刀真枪的活儿上,到底能不能打?

官方放出的实机演示里,有几段值得细看。

第一段是拼微型积木。最小组件宽度不到 1 厘米,抓取和扣合要在 0.1 到 1 毫米的尺度内完成,而人手的自然抖动极限差不多就是 0.3 到 1 毫米——这个活的精度要求,正好卡在人类手抖的误差带里。

DM0.5 控制下的机械臂有个很 " 人 " 的动作:先对准,再轻轻一震,抖着往下压,用一股 " 寸劲儿 " 把积木送进卡扣。

更神奇的是出错的时候。高强度连续作业中,难免有积木因角度偏差接错。它没有死板地继续拼,而是自主感知到了 " 拼装失败 ":停顿大约半秒——那半秒很像人发现不对时的愣神——然后调整姿态、重新抓取、修正位置、再度按下。平均每台机器人 12   秒完成一次拼装,全天候无间断。

再比如削黄瓜和切黄瓜。

削黄瓜这类需要精细力控的柔性任务,靠的是通过关节电机的电流值实时感知作用力,对接触力做精确判断。

切黄瓜听着简单,但执行端是一双 58 个自由度的灵巧手:握刀、扶稳、下刀、控制力道。黄瓜是软的、会滚动、每根形状都不一样,这种柔性物体,靠写死轨迹的传统工业机器人根本碰不了,只能让底座模型实时感知、实时决策。DM0.5 加一层针对性后训练,就把 58 个自由度管了起来。

物流分拣则是另一个极端,考的不是细,是快。传送带上包裹堆叠、材质各异、姿态随机,DM0.5 不用预设脚本,纯靠实时视觉识别和决策,平均 3 秒分离一件,准确率超过 99%。

还有一段抗干扰测试,让人印象很深。机器人正在收拾桌面,人类中途强行把它推开、相机被猛晃,它的反应是:停下来看清楚,接着干——还记得刚才的东西收到哪了。

这背后就是前面说的原生 60 秒记忆:它能记住整整一分钟内自己做过的所有动作。

这个能力还有个顺手的衍生品:既然记得住长序列,它就能直接 " 看懂 " 人类的演示视频,看完跟着做。绕开语言,看视频上岗。(雷峰网)

05

同一个考场,凭什么它分高

记忆是杀招,但一场五门课的考试,光靠一门赢不了。DM0.5 的基本盘,还有三样东西。

先说数据。具身智能和聊天机器人最大的区别是,语料没法从互联网上白嫖。网上有几万亿字的文本,但没有 " 机器人第一视角抓杯子 " 的数据,这玩意只能拿真机一小时一小时地采,又贵又慢。

原力灵机在数据上的家底有三大块:

真机数:5 万小时高精度操作数据,做到秒级指令 - 动作对齐;

Egocentric 数据:10 万小时第一视角视频,能生成毫米级精度的 3D 空间标注;

场景重建数据:100 万平方米空间建模,把真实室内环境高精度数字化,让模型在仿真里训练时,看到的考场和真机考场尽可能一样。

高质量数据才能带来高质量智能。这套覆盖导航、抓取、全身控制三大任务、六类机器人本体的数据资产,把仿真与现实的鸿沟一寸一寸填平。

再说脑子。

团队内部有句话说得挺直白:" 没有语言能力的 VLA,就是数据集复读机。" 如果模型只是把画面死记硬背地映射到动作,换个场景就废。DM0.5 加了一层 " 具身思维链 ":动作生成之前,模型要先想清楚一串问题——目标物体在哪、上一步干了什么、这步该不该结束、不这么干会怎样(反事实推理)。11 项推理任务,逼模型真正理解指令、环境和自身的关系,而不是背答案。

最后是最硬核的一块:速度。

VLA 模型一直被一个问题卡着脖子:模型越大越聪明,但推理越慢。如果模型半秒才能给出一次动作指令,机器人就像喝了半斤白酒,眼睛看着杯子掉下去,手就是来不及。行业里的解法是 " 双系统 ":慢系统想清楚,快系统手上快。Figure 的 Helix、英伟达的 GR00T 都走这条路,算是行业共识。

DM0.5 也是双系统:Sys2 负责理解指令、预判大局,Sys1 动作专家网络负责高频响应。差别在于,原力灵机把推理速度卷到了离谱的水平:通过 Vision TensorRT、FP8、CUDA Graph 等一串工程优化,模型核心延迟从 534 毫秒压到 57.49 毫秒,9.29 倍加速,API 响应控制在 70 毫秒内。而且在 2000 个 LIBERO 测试 episode 上,成功率只掉了 0.05 个百分点(98.45% → 98.40%),几乎无损。

57 毫秒什么概念?人眨一次眼大约 100 到 150 毫秒。DM0.5 的 " 思考加出手 ",比眨眼还快。大模型的智力,第一次跑进了实时控制要求的时间窗口。前面演示里,它能接住人类的突然打断、能在流水线上 3 秒一单,靠的就是这个。

06

考第一的 DM0.5,

居然是一个开源模型

聊开源之前,得先说清楚这场 " 全科第一 " 为什么值钱。

同一个模型,在仿真、真机、导航、精细操作这些差别极大的场景里都跑进第一梯队,这在具身行业并不多见。它释放的信号是:具身模型的能力上限,正在被真正看见。

更关键的是,行业现在把宝全押在数据上," 百万小时 " 几乎成了口头禅。但数据 Scaling 有个常被忽略的前提:木桶能装多少水,取决于最短的那块板。记忆、推理是短板,灌再多数据,水照样从短板流走。全科优秀,才是进入百万小时时代的必要条件,每门课都没有结构性漏洞,数据才会真正转化为能力。DM0.5 考出的,正是这张 " 值得灌数据 " 的门票。

然后才是开源的故事。

按商业剧本,考第一的模型应该捂着,卖 API、卖授权,把领先优势变现得越久越好。原力灵机反着来:DM0.5 全面开源。模型权重、训练框架,从 LIBERO 到 RoboTwin2、RoboChallenge 再到真机 SO101 的完整工作流,陆续放上 GitHub 和 Hugging Face,核心代码也提交给了 LeRobot 社区。前阵子,国际电信联盟(ITU)具身智能焦点组首次线下会议,原力灵机当选 " 开源生态 " 工作组组长单位。

这个选择接住了上面的逻辑。具身智能缺一个公共底座:每家公司都在重复造轮子,中小团队根本进不了场。一个经过全科验证的底座开源出来,等于告诉所有开发者:放心往里灌数据,这只桶没有洞。短期看是让渡壁垒,长期看,谁成为生态的默认底座,谁就拿走最值钱的门票。

RoboDojo 那张 1.67% 的成绩单,短期看是行业的难堪,长期看是好事:具身智能终于有了一把没人能作弊的尺子," 我家机器人很智能 " 这句话,从此需要证据。

而登顶之后选择开源的 DM0.5,把尺子、证据和答卷一起放到了所有人面前。物理世界的智能觉醒,可能就从有人愿意公开答卷开始。(雷峰网 ( 公众号:雷峰网 ) )

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲 PPT

大会报告全文

热门论文解读

学术新星访谈

扫描上方二维码

或点击「阅读原文」关注专区。

雷峰网原创文章,未经授权禁止转载。详情见转载须知

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

机器人 考场 科目 成绩单 清华
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论