具身大满贯还全开源!原力灵机DM0.5登顶RoboDojo,且clone且珍惜
机器人大脑新SOTA
Jay 发自 凹非寺
量子位 | 公众号 QbitAI
一觉醒来,机器人大脑的SOTA,易主了。
这次,原力灵机的DM0.5,登顶了具身「珠峰」——RoboDojo。

要知道,这可是RoboDojo啊。。。
魔鬼级的具身评测,由香港大学多媒体实验室联合加州大学伯克利分校、清华大学等全球近20所顶尖学术机构共同发起。
这些顶尖学府的「品控」有多严格?
这么说吧,截至2026年7月,仿真榜单头部模型平均成功率仅8.80%,真机榜单仅12.8%。
是的,仍在个位数挣扎。
反正就是难度和真实性极高,专治实验室闭门造车的偏科生。
如今,DM0.5拿下了第一——
- 综合得分:24.90
- 平均成功率:19.34%
此外,仔细看了下表格,发现这个模型有个极其突出的强项——
记忆。
具体可以看这个Cover Blocks任务:
机器人先从左到右盖住随机排列的红、绿、蓝三个积木。当颜色被完全遮挡后,再根据此前观测,按红、绿、蓝的顺序依次揭开。
DM0.5在三次随机考试中,都取得了100%成功率。
反映在数据上也很直观,RoboDojo榜单中的Memory维度,DM0.5直接猛砍了47.74分,显著领先。。。
绝对是助力其登顶,最关键的绝杀了。

这还没完。
其他权威评测,DM0.5也都打爆了。
- LIBERO:综合成功率99.0%
- RoboTwin 2.0:简单和复杂场景下成功率分别达到 93.6% 和 93.3%,
- VLA-Arena:不同难度设置下的成功率分别达到 89.0%、53.6%、44.1%。
- RoboChallenge Table30 v2:综合得分54.42,成功率43%。
而这个SOTA级别的大脑——
早已开源。
一个基模,六类场景全通过
榜单数字终究是抽象的。DM0.5的真实能力到底如何,还得看demo。
而原力灵机,大概是当前场景demo最丰富的基础模型厂商。
抗干扰、拼积木、学黄瓜、分拣快递……给我看的眼花缭乱。
但回过头来仔细一样,这些看似分散的demo,其实指向同一件事:
基模的泛化能力。
我们一个个说。
1、人类示教。
这是我觉得最有意思的demo。
DM0.5化身卡卡西,人类示教一次,它便能光速复制粘贴。
说实话,这项技能点其实并不陌生,大家都在做这个方向。
毕竟物理世界场景稀碎,你模型做得再好,总有泛化性覆盖不到的长尾任务,这类场景下鲁棒性会骤降特别多。
这就永远到不了具身的ChatGPT时刻。
目前业内的共识解法是:不追求预训练解决一切,而是在落地环节引入Human-in-the-Loop。让人类工作者拍摄一段示范视频,机器人便能像开了「写轮眼」一样即时对齐并跟随完成复杂任务。
让教机器人,变得像教徒弟。
原力灵机做的便是这件事。
而开头提到的「记忆」,则是解法的关键。
DM0.5原生支持最长60秒的记忆能力,机器人能深度记住并连贯审视自己此前做过的所有动作序列。
基于这份长记忆,模型可以直接跨越语言限制,理解人类演示的视频片段。
2、精细操作。
原力灵机选择的场景,是积木。
其实今年7月我在上海WAIC看过这个demo,说实话,比视频里的精彩得多。
原力灵机联手阶跃,搁展区里拼了个长城。。。
是的,6台机器人,耗时15小时,用 81920块微型积木拼出长3.5米的长城模型。

现场也是挤爆了,钻都钻不进去。
但这绝对不是个「情绪价值」demo。
积木拼装,最小的组件宽度不到1厘米,机器人必须在0.1到1毫米的尺度内完成抓取和扣合。这个精度,已经超越了人手约0.3到1毫米的自然抖动极限。
与此同时,微型积木存在工艺公差,直接大力出奇迹的话,极易错位卡死。
所以如果仔细看视频,你会发现个蛮有意思的细节。
这哥们会寸劲儿啊!
机器人会先对准,再轻轻一震、抖动下压,把积木扣住。

当然,自动纠错的能力也很关键。
毕竟是模型嘛,高精度任务确实没法追求把把zero-shot,还是得靠Loop保证稳定性。

柔性物体则更需要自动纠错了。
比如这个削黄瓜的demo,一刀下去,黄瓜形态会变。模型需要实时闭环调整。
刀深几分、力道几何,如何削得干净又不伤果肉……全在毫厘之间的拿捏。

你以为黄瓜到这就完成它的使命了?
不,原力灵机还在继续鞭打黄瓜(bushi)。
但这次侧重点有所不同,是用灵巧手切。
模型通过后训练驾驭高自由度,也是对DM0.5泛化性的展示吧。
3、长程稳定高节拍。
从这开始,demo就和场景紧密结合起来了。
今年北京亦庄的WRC,原力灵机将快递流水线搬到了现场,直击物流中转站最大痛点——
单件分离。
传送带不停,每个包裹的尺寸、材质、摆放姿态都不一样,传统机械方案根本干不了这类任务。
DM0.5不依赖预设脚本,纯靠实时视觉识别和决策,平均3秒一单,准确率超99%。
上周我也是在现场近距离看过这个demo的。
说实话,论论情绪价值,我个人觉得还得是工业场景,超解压啊,跟看清洁直播一样。
至少是能看得下去的,不会慢的要死,捡个枕头都一卡一卡的。。。
ADHD患者强推打卡(bushi)。
4、抗干扰。
真实世界不是实验室,相机随时可能骤变视角,人类随时可能「空降」捣乱。
DM0.5的解法是分层双系统,即业界主流的System1与System2架构。
Sys2是深思熟虑的高阶大脑。负责理解、拒绝与大局预判,剑指zero-shot;
Sys1则是动作专家网络。就像人类的直觉反射,负责handle长程复杂任务中的琐碎细节。
在这套架构加持下,即便外部视点剧烈变化,DM0.5通用Picking的鲁棒性依然极强。
哪怕人类强行打断任务,机器人也能准确理解当前实际状态,自适应修正后续动作。
六类场景,从毫米级到传送带,从刚性到柔性,从执行到模仿。
同一个模型在如此差别很大的场景中都表现优秀,是很少见的。
现在大家都冲百万小时数据,但光看数据量,或许并不符合第一性原理。
如果基模没有强泛化,每个场景都单独训一个模型,demo再多,也不过是一堆散落的珍珠。
偏科是没法的Scaling Up的。
这也是我觉得DM0.5最有意思的Takeaway吧,具身模型本身的能力正在被看见,并且上限可以做到很高。
数据、架构、效率全面升级
说了这么多,原力灵机究竟是怎么做到的?
这方面,团队也早把他们的经验,毫无保留地全盘托出了。
答案分为三层,也是具身绕不开的三个核心变量:数据、架构、延迟。
先看数据。
数据决定智能上限,这也是整套具身工程中,最重要的一环,没有之一。
DM0.5的数据资产,主要分为三类。
1、真机:5万小时高精度操作,覆盖100+种丰富动作,实现秒级精细指令动作对齐。
2、Ego:10万小时场景视频,支持毫米级高精度3D Landmark生成,实现精准标注。
3、仿真:100万平空间数据建模复杂室内环境,高精度重建解决Sim2Real Gap。
感觉他们还是把质量看的很重的,不是光脑门一拍硬采。
数据量的方式则用omni融合思路解决,也是目前行业比较主流的方案,风险最小化。
再看架构。
一句话总结,DM0.5主要有三大创新,对应解决三个问题。
1、怎么记得住?
这个前面提到过,为了降低DM0.5的落地门槛,原力灵机引入了原生长记忆。
具体而言,团队在上下文抽象层做了大量工作,通过高效的信息压缩技术,让4B参数的VLM在预训练阶段就能原生学习并记住历史信息。
2、怎么看得懂?
对此,原力灵机有这么一个判断:
没有语言能力的VLA,就是数据集复读机。
毕竟不管怎么说,语言确实是最方便蒸馏人类思考能力的模态了,有Language这一层赋能,就是很吃香。
于是有了具身思维链任务。
为此,DM0.5设计了具身思维链任务,用11项推理任务驱动模型,对指令、本体、环境进行三方联合建模,赋予动作生成以语义理解和世界预判能力。
这个过程中,团队可以构造了「反事实任务」,故意给出错误指令,迫使模型真正「看懂」而非机械匹配。
3、怎么对得齐?
传统动作监督是对点式的,预测轨迹与真值轨迹之间的偏差会不断累积,最终炸掉。
原力灵机做的事对齐式的动作监督,利用约束动态规划高效计算最优匹配,一次性解决动作轨迹不一致的问题。
数据和架构双剑合璧,大幅提升了DM0.5的智能上限。
但真正要能用,还得看效率。
具身最终是要在端侧实时跑的。推理不够快,参数就是坨废纸。
为此,原力灵机做了一系列优化,这里就不多做赘述,大家可以直接看官方技术报告。
最后成果如下——
- 模型核心延迟:534.04 ms → 57.49 ms
- 累计加速:9.29×
- 延迟降低:89.2%
- API 延迟:p50 67.75 ms,p90 70.01 ms
- LIBERO 成功率:98.45% → 98.40%
硬生生加速了一个数量级啊。。。
而且,精度基本无损。
可以说是让整套VLA推理系统超进化了。
登顶,是为了下山
「登顶」确实很惊艳,但说实话,这可能真还不是最值得关注的事情。
具身天上一天地上一年,冠军频繁易主,仅仅是成绩单,很容易过期。
真正能在具身周期里刻下痕迹的,是登顶之后,你愿意留下什么。
这可能也是DM0.5选择全面开源原因。
不仅仅是模型权重,DM0.5的训练框架、下游任务工作流……已陆续在GitHub与Hugging Face开放,供开发者复现、魔改、扩展。
比如下面这个demo,就是原力灵机基于DM0.5,结合开源机械臂套件,监督微调出来的。
LLM领域,开源早不是啥新鲜词,从最开始的DeepSeek,到如今的GLM、Kimi、MiniMax……大家早已习惯了开源的声音。
但在具身行业,我觉得,这件事的意义真不太一样。
物理AI实在太早期,太不成熟了,这点是事实。
所以,我们需要更透明的讨论,更真实的评测,更多公开的工作……
如果谷歌当年没有放出Transfomer,OpenAI或许永远也摸索不出通往ChatGPT的路。
RoboDojo的火爆,推动了评估从「单点Demo展示」走向「标准化全科考试」。让具身真的可以被统一度量、被复现、被挑战。
DM0.5的登顶与开源,则进一步兑现了这个Benchmark的价值。让所有人看到登顶的方法论,也让方法论可以被带走、被复用。
这是原力灵机对当下这场具身竞赛的回答。
登上珠峰,从来不是为了留在山顶。
下一步,是下山——
用开源赋能生态,让第一梯队的具身大脑,走进各行各业的流水线。
GitHub:https://github.com/dexmal/opendm
Hugging Face:https://huggingface.co/Dexmal/DM05
Tech Blog:https://www.dexmal.com/blog/dm0.5
- 具身创业里的香港教授们2026-08-23
- 他给了王兴兴第一个200万,现在给下一个「宇树」当董事长2026-08-23
- WRC最忙机器人:猛干15分钟家务,收纳、补货、叠衣服…2026-08-21
- 深度体验DeepSeek Harness,我原谅它涨价了2026-08-14




