量子位 昨天
具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

一觉醒来,机器人大脑的 SOTA,易主了。

这次,原力灵机的 DM0.5,登顶了具身「珠峰」—— RoboDojo

要知道,这可是 RoboDojo 啊。。。

魔鬼级的具身评测,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近 20 所顶尖学术机构共同发起

这些顶尖学府的「品控」有多严格?

这么说吧,截至 2026 年 7 月,仿真榜单头部模型平均成功率仅 8.80%,真机榜单仅 12.8%。

是的,仍在个位数挣扎。

反正就是难度和真实性极高,专治实验室闭门造车的偏科生。

如今,DM0.5 拿下了第一——

综合得分:24.90

平均成功率:19.34%

此外,仔细看了下表格,发现这个模型有个极其突出的强项——

记忆。

具体可以看这个 Cover Blocks 任务:

机器人先从左到右盖住随机排列的红、绿、蓝三个积木。当颜色被完全遮挡后,再根据此前观测,按红、绿、蓝的顺序依次揭开。

DM0.5 在三次随机考试中,都取得了 100% 成功率。

反映在数据上也很直观,RoboDojo 榜单中的Memory 维度,DM0.5 直接猛砍了 47.74 分,显著领先。。。

绝对是助力其登顶,最关键的绝杀了。

这还没完。

其他权威评测,DM0.5 也都打爆了。

LIBERO:综合成功率 99.0%

RoboTwin 2.0:简单和复杂场景下成功率分别达到 93.6% 和 93.3%,

VLA-Arena:不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。

RoboChallenge Table30 v2:综合得分 54.42,成功率 43%。

而这个 SOTA 级别的大脑——

早已开源。

一个基模,六类场景全通过

榜单数字终究是抽象的。DM0.5 的真实能力到底如何,还得看 demo。

而原力灵机,大概是当前场景 demo 最丰富的基础模型厂商。

抗干扰、拼积木、学黄瓜、分拣快递……给我看的眼花缭乱。

但回过头来仔细一样,这些看似分散的 demo,其实指向同一件事:

基模的泛化能力。

我们一个个说。

1、人类示教。

这是我觉得最有意思的 demo。

DM0.5 化身卡卡西,人类示教一次,它便能光速复制粘贴。

说实话,这项技能点其实并不陌生,大家都在做这个方向。

毕竟物理世界场景稀碎,你模型做得再好,总有泛化性覆盖不到的长尾任务,这类场景下鲁棒性会骤降特别多。

这就永远到不了具身的 ChatGPT 时刻。

目前业内的共识解法是:不追求预训练解决一切,而是在落地环节引入 Human-in-the-Loop。让人类工作者拍摄一段示范视频,机器人便能像开了「写轮眼」一样即时对齐并跟随完成复杂任务。

让教机器人,变得像教徒弟。

原力灵机做的便是这件事。

而开头提到的「记忆」,则是解法的关键。

DM0.5 原生支持最长 60 秒的记忆能力,机器人能深度记住并连贯审视自己此前做过的所有动作序列。

基于这份长记忆,模型可以直接跨越语言限制,理解人类演示的视频片段

2、精细操作。

原力灵机选择的场景,是积木。

其实今年 7 月我在上海 WAIC 看过这个 demo,说实话,比视频里的精彩得多。

原力灵机联手阶跃,搁展区里拼了个长城。。。

是的,6 台机器人,耗时 15 小时,用  81920 块微型积木拼出长 3.5 米的长城模型

现场也是挤爆了,钻都钻不进去。

但这绝对不是个「情绪价值」demo。

积木拼装,最小的组件宽度不到 1 厘米,机器人必须在0.1 到 1 毫米的尺度内完成抓取和扣合。这个精度,已经超越了人手约 0.3 到 1 毫米的自然抖动极限。

与此同时,微型积木存在工艺公差,直接大力出奇迹的话,极易错位卡死。

所以如果仔细看视频,你会发现个蛮有意思的细节。

这哥们会寸劲儿啊!

机器人会先对准,再轻轻一震、抖动下压,把积木扣住。

当然,自动纠错的能力也很关键

毕竟是模型嘛,高精度任务确实没法追求把把 zero-shot,还是得靠 Loop 保证稳定性。

柔性物体则更需要自动纠错了。

比如这个削黄瓜的 demo,一刀下去,黄瓜形态会变。模型需要实时闭环调整。

刀深几分、力道几何,如何削得干净又不伤果肉……全在毫厘之间的拿捏。

你以为黄瓜到这就完成它的使命了?

不,原力灵机还在继续鞭打黄瓜(bushi)。

但这次侧重点有所不同,是用灵巧手切。

模型通过后训练驾驭高自由度,也是对 DM0.5 泛化性的展示吧。

3、长程稳定高节拍。

从这开始,demo 就和场景紧密结合起来了。

今年北京亦庄的 WRC,原力灵机将快递流水线搬到了现场,直击物流中转站最大痛点——

单件分离。

传送带不停,每个包裹的尺寸、材质、摆放姿态都不一样,传统机械方案根本干不了这类任务。

DM0.5 不依赖预设脚本,纯靠实时视觉识别和决策,平均 3 秒一单,准确率超 99%。

上周我也是在现场近距离看过这个 demo 的。

说实话,论论情绪价值,我个人觉得还得是工业场景,超解压啊,跟看清洁直播一样。

至少是能看得下去的,不会慢的要死,捡个枕头都一卡一卡的。。。

ADHD 患者强推打卡(bushi)。

4、抗干扰。

真实世界不是实验室,相机随时可能骤变视角,人类随时可能「空降」捣乱。

DM0.5 的解法是分层双系统,即业界主流的System1 与 System2 架构

Sys2 是深思熟虑的高阶大脑。负责理解、拒绝与大局预判,剑指 zero-shot;

Sys1 则是动作专家网络。就像人类的直觉反射,负责 handle 长程复杂任务中的琐碎细节。

在这套架构加持下,即便外部视点剧烈变化,DM0.5通用 Picking 的鲁棒性依然极强

哪怕人类强行打断任务,机器人也能准确理解当前实际状态,自适应修正后续动作。

六类场景,从毫米级到传送带,从刚性到柔性,从执行到模仿。

同一个模型在如此差别很大的场景中都表现优秀,是很少见的。

现在大家都冲百万小时数据,但光看数据量,或许并不符合第一性原理。

如果基模没有强泛化,每个场景都单独训一个模型,demo 再多,也不过是一堆散落的珍珠。

偏科是没法的 Scaling Up 的。

这也是我觉得 DM0.5 最有意思的 Takeaway 吧,具身模型本身的能力正在被看见,并且上限可以做到很高。

数据、架构、效率全面升级

说了这么多,原力灵机究竟是怎么做到的?

这方面,团队也早把他们的经验,毫无保留地全盘托出了。

答案分为三层,也是具身绕不开的三个核心变量:数据、架构、延迟。

先看数据。

数据决定智能上限,这也是整套具身工程中,最重要的一环,没有之一。

DM0.5 的数据资产,主要分为三类。

1、真机:5 万小时高精度操作,覆盖 100+ 种丰富动作,实现秒级精细指令动作对齐。

2、Ego:10 万小时场景视频,支持毫米级高精度 3D Landmark 生成,实现精准标注。

3、仿真:100 万平空间数据建模复杂室内环境,高精度重建解决 Sim2Real Gap。

感觉他们还是把质量看的很重的,不是光脑门一拍硬采。

数据量的方式则用 omni 融合思路解决,也是目前行业比较主流的方案,风险最小化。

再看架构。

一句话总结,DM0.5 主要有三大创新,对应解决三个问题。

1、怎么记得住?

这个前面提到过,为了降低 DM0.5 的落地门槛,原力灵机引入了原生长记忆

具体而言,团队在上下文抽象层做了大量工作,通过高效的信息压缩技术,让4B 参数的 VLM在预训练阶段就能原生学习并记住历史信息。

2、怎么看得懂?

对此,原力灵机有这么一个判断:

没有语言能力的 VLA,就是数据集复读机。

毕竟不管怎么说,语言确实是最方便蒸馏人类思考能力的模态了,有 Language 这一层赋能,就是很吃香。

于是有了具身思维链任务。

为此,DM0.5 设计了具身思维链任务,用11 项推理任务驱动模型,对指令、本体、环境进行三方联合建模,赋予动作生成以语义理解和世界预判能力。

这个过程中,团队可以构造了「反事实任务」,故意给出错误指令,迫使模型真正「看懂」而非机械匹配。

3、怎么对得齐?

传统动作监督是对点式的,预测轨迹与真值轨迹之间的偏差会不断累积,最终炸掉。

原力灵机做的事对齐式的动作监督,利用约束动态规划高效计算最优匹配,一次性解决动作轨迹不一致的问题。

数据和架构双剑合璧,大幅提升了 DM0.5 的智能上限。

但真正要能用,还得看效率。

具身最终是要在端侧实时跑的。推理不够快,参数就是坨废纸。

为此,原力灵机做了一系列优化,这里就不多做赘述,大家可以直接看官方技术报告。

最后成果如下——

模型核心延迟:534.04 ms → 57.49 ms

累计加速:9.29 ×

延迟降低:89.2%

API 延迟:p50 67.75 ms,p90 70.01 ms

LIBERO 成功率:98.45% → 98.40%

硬生生加速了一个数量级啊。。。

而且,精度基本无损。

可以说是让整套 VLA 推理系统超进化了

登顶,是为了下山

「登顶」确实很惊艳,但说实话,这可能真还不是最值得关注的事情。

具身天上一天地上一年,冠军频繁易主,仅仅是成绩单,很容易过期。

真正能在具身周期里刻下痕迹的,是登顶之后,你愿意留下什么。

这可能也是 DM0.5 选择全面开源原因

不仅仅是模型权重,DM0.5 的训练框架、下游任务工作流……已陆续在 GitHub 与 Hugging Face 开放,供开发者复现、魔改、扩展。

比如下面这个 demo,就是原力灵机基于 DM0.5,结合开源机械臂套件,监督微调出来的。

LLM 领域,开源早不是啥新鲜词,从最开始的 DeepSeek,到如今的 GLM、Kimi、MiniMax ……大家早已习惯了开源的声音。

但在具身行业,我觉得,这件事的意义真不太一样。

物理 AI 实在太早期,太不成熟了,这点是事实。

所以,我们需要更透明的讨论,更真实的评测,更多公开的工作……

如果谷歌当年没有放出 Transfomer,OpenAI 或许永远也摸索不出通往 ChatGPT 的路。

RoboDojo 的火爆,推动了评估从「单点 Demo 展示」走向「标准化全科考试」。让具身真的可以被统一度量、被复现、被挑战。

DM0.5 的登顶与开源,则进一步兑现了这个 Benchmark 的价值。让所有人看到登顶的方法论,也让方法论可以被带走、被复用。

这是原力灵机对当下这场具身竞赛的回答。

登上珠峰,从来不是为了留在山顶。

下一步,是下山——

用开源赋能生态,让第一梯队的具身大脑,走进各行各业的流水线。

GitHub:https://github.com/dexmal/opendm

Hugging Face:https://huggingface.co/Dexmal/DM05

Tech Blog:https://www.dexmal.com/blog/dm0.5

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论