网易首页 > 网易号 > 正文 申请入驻

横扫四榜,DM0.5 凭什么面面俱到?

0
分享至


单科冠军不够,具身智能落地需要没有结构性短板的底座

作者丨邓哲敏

编辑丨齐铖湧

一个模型同时占据四个能力子榜单的榜首,这在具身智能行业里不多见。

RoboColiseum 是由智元机器人发起,联合高校、科研机构、开源社区及机器人企业共同建设的评测平台,它把评测拆成四个维度:指令跟随、空间理解、扰动适应、通用操作。参评者只要在任何一个维度上有结构性短板,就会在对应的子榜上掉下来。

而原力灵机的通用具身基础模型 DM0.5 在四个子榜上全部排名第一,且目前是唯一做到这一点的模型。


AI科技评论想知道,这张成绩单有多可信?DM0.5 又凭什么霸榜?

01


一把可信的尺子

演示效果和真实场景之间存在差距,这在机器人行业早不是什么新鲜事。普通商品尚有卖家秀与买家秀之别,遑论技术尚未成熟的具身智能。因此,模型越是层出不穷,行业就越需要可信赖、细颗粒的公共标尺,帮助挑选出真正的强者。

然而现实并不乐观,AI科技评论观察到,具身评测行业长期存在几个痛点,让分数的可信度打了折扣。

第一个痛点,是仿真跑分高、真机落地差。仿真环境里的物理参数、视觉渲染和真实世界相差甚远,模型在仿真里得了高分,搬到真机上可能是一塌糊涂。市面上大部分仿真评测基准并没有做系统的真机-仿真对比实验,更没有公开结果。

针对 Sim2Real 的一致性问题,RoboColiseum 负责人吴墨告诉AI科技评论,平台通过空间智能技术在仿真环境中高保真重建真实世界,配合激光雷达还原几何信息,再对物体的质量、重心、碰撞几何、动静摩擦力、转动惯量,以及机器人本体的相机内外参、刚度阻尼、末端控制响应等物理参数逐项校准。最终验证结果显示,仿真与真机的模型表现一致性达到89.5%,单个任务的成功率差异均小于10%

第二个痛点,是评测基准生命周期短。具身模型迭代太快,一套榜单推出后半年,头部模型就把分数堆满了,无法再区分好坏。“刷榜”现象在大语言模型领域早有端倪,原本被设计为终身学习的 LIBERO,从发布到被刷穿,只坚持了不到三年。

RoboColiseum 现有 78 个评测任务、超过 3000 个泛化 case,训练集和评测集完全隔离,评测集对每个任务都做了充分的泛化配置,让轨迹回放类方案彻底失效。

第三个痛点,是单点能力强不代表真实场景好用。行业里不少评测基准的设计,本质上是在考一道题——把模型在某个原子能力上压榨到极限,然后把这个数字当成模型能力的代理指标。这种评测逻辑在能力单一、任务简单的早期阶段是够用的。但问题在于,真实场景的任务几乎没有一个是单科题。工厂里的分拣机器人,要同时听懂调度指令、判断传送带上包裹的空间位置、应对随机摆放姿态的干扰,最后把一系列原子动作组合成完整的操作流程。单点能力强的模型进了真实场景,这边表现不错,那边掉链子,整体任务完成率依然惨淡。

而 RoboColiseum 围绕四个维度展开评测,分别对应机器人在真实世界中完成任务所需要的能力分层:指令是基础,空间是认知,扰动是鲁棒,操作是落地。从语义到物理,从感知到执行,构成了一套相对完整的考察链条。

02


四榜同时第一,远比单项第一难

在四大子榜单上,原力灵机 DM0.5 以指令跟随 0.8444、空间理解 0.6146、扰动适应 0.7344、通用操作 0.6370 的成绩,全部排名第一。

四榜同时第一比单项第一难得多,因为这四个维度考的是不同层次的能力,彼此之间并不互相加持。一个记忆能力超强的模型,未必能在空间理解上占优;擅长执行精细操作的模型,未必在扰动适应上稳得住。四个子榜,相当于对模型做了四次独立考核,任何一个短板都会直接体现在对应的排名上,无法被其他维度的优势掩盖。这也是为什么行业里单项能力突出的模型并不少见,但能同时在多个维度维持领先的模型极少。

我们仔细研究了 DM0.5 的架构和数据源,每个维度上都有具体的技术支撑。

指令跟随方面,DM0.5 在预训练阶段设计了具身思维链: 动作生成之前,模型要先走完一套内部推理流程——目标物体在哪、上一步干了什么、这步该不该结束、不这么干会怎样。11 项推理任务覆盖任务规划和动作生成两个层面,逼模型理解“指令×本体×环境”三方的关系,而不是背答案。这一层预训练能力沉淀下来之后,DM0.5 展现出 zero-shot 级别的泛化——在没有见过的任务配置上,仍然能应对多样的动作组合和语言条件约束。

空间理解方面,DM0.5 的预训练数据包含 10 万小时 Egocentric 视频,并基于这些数据支持毫米级精度的 3D 空间标注生成。这意味着模型在预训练阶段就在大规模地学习从第一视角理解三维空间,而不是事后用有限的机器人操作数据“打补丁”。

我们注意到,原力灵机与天津大学、清华大学合作的论文《GeoVLA: Empowering 3D Representations in Vision-Language-Action Models》入选 IROS 2026 认知机器人最佳论文奖提名,核心工作正是把三维几何表征显式引入 VLA 模型的决策过程——让模型不只在二维图像空间里做判断,而是在具有深度、距离和几何关系的三维世界里理解场景。


扰动适应和工业落地最直接相关,这方面,DM0.5 靠两件事兜底。一是推理速度:通过多项工程优化,模型核心延迟从 534 毫秒压到 57.49 毫秒,9.29 倍加速,同时在 2000 个 LIBERO 测试 episode 上成功率几乎无损(98.45% 降至 98.40%)。人眨一次眼约 100 到 150 毫秒,DM0.5 的“感知-思考-出手”全流程比眨眼还快,干扰发生的瞬间,模型已经完成了重新感知和决策。二是原生 60 秒记忆:即使任务被中断,模型知道刚才做到哪里了,能够续接而不是从头来。

通用操作方面 ,考的是在前三项能力全部就位之后,把原子技能有效组合完成完整任务序列的能力。物流分拣场景里,DM0.5 不依赖预设脚本,纯靠实时视觉识别和决策,平均 3 秒一件,准确率超 99%;亚毫米积木拼装场景里,出现接错时能自主感知失败,半秒内调整姿态重新抓取纠错,每 12 秒完成一次拼装,全天候无间断;灵巧手场景里,DM0.5 配合后训练,控制带有 58 个自由度的灵巧手完成切黄瓜、削黄瓜等厨房任务——柔性物体形状随机、易滚动,传统工业机器人靠预设轨迹根本无法应对,只能让底座模型实时感知、实时决策。

03


底座模型能力的直接检验

第一的获取方式,值得拿出来单独说。

DM0.5 在 RoboColiseum 上的路径是:强大的预训练底座,没有针对评测任务做专项优化,只是通过常规监督微调将模型能力迁移到了 RoboColiseum 的机器人构型和任务上,完成从底座到榜单任务的适配。


这个细节的意义在于,它让这份成绩更接近对底座模型真实能力的测量,而不是对评测优化技巧的测量。

额外对齐并非没有价值,但在具身领域,这类介入往往意味着模型开始针对特定的任务做定向优化。这种优化在某些场景下效果显著,但也容易让模型的泛化能力下降——在训练分布内表现优异,出了分布就掉价。

DM0.5 靠 SFT 就能登顶,说明它的预训练底座在指令理解、空间感知、历史记忆和动作生成上,已经形成了足够坚实的通用能力基础。这种通用性,才是支撑它在不同评测框架下都能维持领先的根本原因。

04


其他维度的佐证

原力灵机并非第一次拿到这样的好成绩。

上个月,DM0.5 刚刚登顶 RoboDojo——由香港大学多媒体实验室联合 UC 伯克利、清华大学等全球近 20 所顶尖机构共同发起的权威评测基准。AI 科技评论当时专门做了一篇深度分析,重点在于 Memory 维度。DM0.5 在记忆维度上取得 47.74 分和 47.44% 的成功率,而第二名只有 13.37 分和 12.11%——得分差了 3 倍多,成功率差了接近 4 倍。


如果说 RoboDojo 是一次横向比较,那么 DM0.5 在其他评测基准上的纵向成绩,则构成了另一条佐证线索。在真机与仿真评测中,LIBERO 综合成功率达到 99.0%;RoboTwin 2.0 简单和复杂场景下成功率分别为 93.6% 和 93.3%;VLA-Arena 三档难度下依次为 89.0%、53.6%、44.1%;导航场景仿真测试中,R2R 和 RxR 的 Val-Unseen 成功率分别达到 59.7% 和 65.5%,相比所有基线方法均取得显著优势。真机评测 RoboChallenge Table30 V2 里,面对 ARX5、UR5、ALOHA、Dexmal-Mirror 四种异构机型、30 个复杂任务,DM0.5 以 43.0% 的整体成功率、54.42 的综合得分同样位列第一。



跨越仿真与真机、覆盖操作与导航、兼容单一机型与多种异构构型,这些数字共同指向同一个结论:DM0.5 的成绩并非依赖某一个场景或评测框架的特殊适配,而是在多个独立的考场上反复被验证过的。

第三个佐证来自国际同行的引用。Physical Intelligence(π)在两次关键输出中,都将原力灵机的 MemoryVLA 纳入了学术参照系:一次是发布具身记忆架构论文 MEM(Multi-Scale Embodied Memory for Vision Language Action Models),一次是将 MEM 的理念落地为旗舰产品 π0.7。


MemoryVLA 受认知科学中工作记忆与海马体双机制启发,提出感知-认知记忆库,构建了一套面向动作控制的双流 latent memory 机制。PI 在大脑和小脑的全局视角定义问题,而 MemoryVLA 则在小脑记忆这条路径上给出了一套经过大规模实验验证的完整方案。两者是独立探索、方向趋同,这大概是 PI 连续两次引用的原因。

05


推理提速、全面开源、真机落地

DM0.5 目前的状态,可以用三件事来描述。

第一件:推理速度进入实时控制的时间窗口。通过 Vision TensorRT、Tuned FlexAttention、FP8 E4M3 Tensor Core、Triton 融合算子和 CUDA Graph 的联合优化,DM0.5 的模型核心延迟从 534 毫秒压到 57.49 毫秒,API 响应控制在 70 毫秒内(p50 67.75 ms,p90 70.01 ms),累计加速 9.29 倍,延迟降低 89.2%。整套 VLA 推理系统快了一个数量级,大模型的智力第一次跑进了实时控制要求的时间窗口。


第二件:全面开源。DM0.5 模型权重、训练框架,以及从 LIBERO、RoboTwin 2.0 到 RoboChallenge、真机 SO101 的多个下游任务完整工作流,已陆续在 GitHub 和 Hugging Face 上开放,核心代码也提交给了 LeRobot 社区。这个选择的背后有一个值得关注的行业逻辑:具身智能目前最缺的不是哪家公司独占一切,而是一个经过全科验证的公共底座。一个全科有效的底座开源出来,开发者可以把有限的资源用在特定场景的微调和落地上,而不必从零开始验证架构是否可靠。国际电信联盟(ITU)具身智能焦点组首次线下会议上,原力灵机当选了“开源生态”工作组组长单位。

第三件:真机落地持续推进。原力灵机已 在多个真实场景中部署测试:大型国际零售商仓储中,多台搭载 DM0.5 的机器人正与其他类型机器人协同作业,完成商品搬运与分拣;大型 3C 制造商工厂里,搭载 DM0.5 的机器人正配合生产线进行包装和废料回收。从榜单到工厂,这是评测成绩在真实世界中被验证的下一步。


06


全科优秀,才是真正的通行证

RoboDojo 和 RoboColiseum,一个由顶级学术机构操持,一个由产业机构主导;一个侧重记忆、长程执行和开放语义,一个侧重指令理解、空间认知、鲁棒性和操作组合。两套体系的出题逻辑几乎没有刻意对齐,但 DM0.5 在两个考场上都站在了最高处。

具身智能的评测体系还在建立中,行业至今没有一个像大语言模型那样被普遍接受的权威基准。在这个标准尚未收敛的阶段,能在多个不同方向的严格评测上都稳在第一梯队,含金量反而比刷穿某一套题更重。因为它证明的是,在标准统一之前就已经做好了应对任何标准的准备。

AI 科技评论之前写道,“全科优秀,才是进入百万小时时代的必要条件,每门课都没有结构性漏洞,数据才会真正转化为能力。”这句话说的是数据 Scaling 的前提。而现在看来,它同样适用于落地:工厂要求鲁棒性和节拍,家庭要求语义理解和精细操作,仓储要求长程稳定性,没有哪个真实场景会迁就你的短板。一个能力有结构性漏洞的模型,在某一类场景里可能跑得不错,但很难真正跨越到普适落地。

这也是为什么四榜同时第一,比任何一个单项冠军都更值得关注。只有整个能力谱系足够宽、足够均衡,才能同时承接真实世界里多样的任务要求。

物理世界的智能,靠单科状元是不够的。行业最终需要的,是能经得住不同考 场、不同考官、不同考题的长期答题者。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
笑麻!原来这才是浙江人有钱的原因,网友:全家没有一个闲着

笑麻!原来这才是浙江人有钱的原因,网友:全家没有一个闲着

另子维爱读史
2026-09-23 20:07:36
日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

日本人悟了:赴日签证大涨后,没有中国游客的日本,就是一潭死水

史之铭
2026-09-21 17:26:54
笑喷!女排夺冠,一人领奖激动到穿反裤子,球迷:肯定兴奋过头了

笑喷!女排夺冠,一人领奖激动到穿反裤子,球迷:肯定兴奋过头了

南海浪花
2026-09-23 07:49:47
农民交公粮,能不能视同缴社保?

农民交公粮,能不能视同缴社保?

城事堂
2026-09-22 09:30:50
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
同学聚会每人收费3万,我转身就走,次日警察找上门:就你幸存了

同学聚会每人收费3万,我转身就走,次日警察找上门:就你幸存了

牛魔王与芭蕉扇
2025-09-01 16:53:51
感人!中国男足亚运会爆发大规模冲突:张玉宁1举动令人动容

感人!中国男足亚运会爆发大规模冲突:张玉宁1举动令人动容

邱泽云
2026-09-23 16:36:08
离谱!闲鱼平台一枚手机卡针卖1000元,这是圈内人才懂的涉黄暗号

离谱!闲鱼平台一枚手机卡针卖1000元,这是圈内人才懂的涉黄暗号

火山詩话
2026-09-23 17:40:24
炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

炸裂!女网红和男子开房,因动作太猛导致女网红腰部骨折,告上法庭索赔50万

小徐讲八卦
2026-09-17 09:49:48
2027年底机顶盒将取消,有线电视每年300元费用,还有必要交吗

2027年底机顶盒将取消,有线电视每年300元费用,还有必要交吗

小柱解说游戏
2026-09-23 12:16:27
杀疯了!大跌65%之后今天又一字跌停,两万多股民全线深套!

杀疯了!大跌65%之后今天又一字跌停,两万多股民全线深套!

股侠指北针
2026-09-23 14:49:04
蚊子打飞的来欧洲咬人!德国机场3人死亡,戴高乐机场病例欧洲第一

蚊子打飞的来欧洲咬人!德国机场3人死亡,戴高乐机场病例欧洲第一

新欧洲
2026-09-22 19:40:19
34岁香港歌手传出死讯!死因引热议,前经纪人称太可悲,一言难尽

34岁香港歌手传出死讯!死因引热议,前经纪人称太可悲,一言难尽

感恩每一刻
2026-09-23 13:02:07
Angelababy米兰时装周封神!棕黑复古穿搭好洋气,美回颜值巅峰

Angelababy米兰时装周封神!棕黑复古穿搭好洋气,美回颜值巅峰

明星私服穿搭daily
2026-09-22 20:51:55
土耳其总统提议取消安理会否决权,被俄方“否决”

土耳其总统提议取消安理会否决权,被俄方“否决”

第一财经资讯
2026-09-23 21:45:37
郭士强林葳矛盾细节曝光!媒体人:想要林葳回来,必须换掉郭士强

郭士强林葳矛盾细节曝光!媒体人:想要林葳回来,必须换掉郭士强

弄月公子
2026-09-23 19:31:26
2026中央巡视人社部!养老金补发、扣钱真相一次性说透

2026中央巡视人社部!养老金补发、扣钱真相一次性说透

白昼说故事
2026-09-23 09:45:06
消费者网购纯牛奶剪开包装竟倒出水,涉事企业:工人分拣失误,误将测试样品混入成品装箱流出

消费者网购纯牛奶剪开包装竟倒出水,涉事企业:工人分拣失误,误将测试样品混入成品装箱流出

极目新闻
2026-09-23 12:57:16
吴曦谈两队发生冲突:有时必须要有这种争执,也应该聪明一些

吴曦谈两队发生冲突:有时必须要有这种争执,也应该聪明一些

懂球帝
2026-09-23 20:10:08
电车普及最后一公里的难题,615户同意禁停新能源车被当地叫停

电车普及最后一公里的难题,615户同意禁停新能源车被当地叫停

TMC动力
2026-09-22 17:28:52
2026-09-23 22:16:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

头条要闻

女子骑车被30余厘米长竹棍贯穿脖颈 丈夫跪地哭求救命

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

焕新价17.78万起 长城猛龙PLUS力魂版与Hi4 255 Ultra上市

态度原创

教育
房产
家居
数码
公开课

教育要闻

不订奶就站着喝水?

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

小米首款RGB-Mini LED电视!S Pro RGB 2027正式发布:65英寸5099元起

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版