网易首页 > 网易号 > 正文 申请入驻

理想具身首次交卷太全面!大脑、VLA世界模型到触觉灵巧手…

0
分享至

杰西卡 发自 ROBO-智
量子位ROBO | 公众号 AI4ROBO

理想的具身智能研发,开始集中交卷了。

而且这次交出的不是单点能力,而是一整套覆盖机器人大脑、统一模型、端侧部署和触觉操作的技术成果。

理想最新发布了MachEmbodied系列四份技术报告:ME-Brain-1.0、ME-VLM、ME-U0和ME-Dex-1.0。

四篇工作各有分工:

  • ME-Brain搭建记忆、认知与行动协作的系统;
  • ME-VLM提供其中的核心认知能力;
  • ME-U0把任务理解、未来预测和动作生成放进统一模型;
  • ME-Dex则进一步把触觉纳入预测范围。

同时,理想已经开始把机器人的核心“大脑”真正搬到本地芯片上。ME-Brain的记忆、认知和行动三大模块,都完成了马赫M100上的迁移和优化,ME-VLM 4B的预填充时延从400毫秒降到188毫秒。

对机器人来说,这意味着长期记忆、环境理解和任务决策不再只能依赖云端算力,理想开始把一套完整的具身智能系统,往可本地运行的方向推进。

从物理感知、记忆与认知,到统一模型、触觉和端侧部署,理想由此勾勒出了一整套具身智能技术成果。

先让机器人记住,再让记忆真正管用

让机器人记住过去,看起来似乎只要把历史视频存下来就行。但用的时候,问题才刚开始。

比如,让机器人拿起杯子,换好桌布,再把杯子放回原处。

如果只记下一句“杯子原来在桌上”,记忆虽然没错,却不足以指导最后一次放置,机器人还需要原来的具体位置,以及当时的视觉和空间信息。

ME-Brain的可进化记忆,就是围绕这种需求设计的。

它把经历放进独立于模型上下文窗口的外部记忆结构:

近期的图像、动作和状态先保存在短期记忆中;抓取、放置、失败等关键事件被整理进中期记忆;反复出现的成功条件、失败模式,再沉淀为可以跨任务复用的长期经验



这些记录之间还保留关联。系统既能读到一次任务的概要,也能沿着概要找到具体操作时的场景和结果,避免记忆越压缩,越丢失真正有用的细节。

调取记忆同样讲究分工。负责规划的模块要知道任务进展到哪一步,负责动作的模块则可能只需要某个物体之前的位置。

ME-Brain因此按用途检索相关记录,把需要的信息送到对应模块。

论文开头的移杯演示,就能说明这套机制的作用:当前画面无法定位方块,历史观察补上了缺失的信息,推理结果再变成移开左侧杯子的实际动作。

理想尝试的另一个演示中,用户只说“把桌面恢复成之前的样子”,系统便从记忆中找回玩具和小车原来所在的篮子,再分别放回去。



不过,记得多,不代表每次都能做对。执行失败之后,还需要判断问题出在哪里,决定是重新定位物体、修改计划,还是调整动作。

这就轮到认知核心出场了。它负责理解现场、拆解任务、调用技能、验证结果,并把执行结果和失败原因写回记忆。动作模型则负责把这些决策变成机器人控制指令。



一次执行留下记录,记录被整理成经验,经验再影响下一次执行。这就是ME-Brain所说的“部署后进化”

这里更新的主要是外部记忆、技能库和规划依据,不需要每积累一批新经历,就重新训练模型参数。

这套系统的认知模型,也被理想单独写成了另一篇报告:ME-VLM

和更偏图文理解的传统 VLM 相比,ME-VLM 把重点进一步放到了物理世界的感知和时空理解上。

机器人不仅要识别眼前有什么,还要判断物体处于什么状态、空间关系怎样变化,以及自己的动作究竟产生了什么结果。

比如夹爪合上,并不代表物体已经抓稳;抓取动作发出之后,模型还要继续观察物体是否被抬起、是否滑落,再判断任务是否可以进入下一步。



在此基础上,ME-VLM又加入了任务规划、工具与技能调用、结果验证和反馈纠错等Agent能力。物理感知负责理解真实环境,Agent能力再基于这些信息组织后续任务,两部分最终被整合进同一个模型。

训练时,团队分别强化具身认知专家和多模态Agent专家,再通过多教师在策略蒸馏,将两类能力合并到最终模型中。



按报告中的评测口径,ME-VLM 35B-A3B版本在具身基准上的平均分为70.9,比表中最强对照模型高8.2分;在智能体基准上平均分为72.5,高出9.6分。



回到真实操作,ME-Brain在Piper双臂机器人上的六项任务中,平均成功率达到66.7%,对照模型DM0.5为55.0%。每项任务测试十次,叠碗十次全部成功,不过插充电器只有一次成功。

这组结果既说明系统有进展,也把难点摆了出来:能记住、会规划之后,精细动作仍然是一道需要单独攻克的关。

把机器人大脑放到本地芯片

机器人要真正长期运行,记忆、认知和动作能力,最终都需要面对本地算力约束

据理想方面介绍,其已经率先将机器人的认知和记忆能力部署到本地芯片。

理想把ME-Brain的记忆、认知和行动三大模块迁移到了自研的马赫M100,并围绕端侧运行进一步压缩计算开销。

也就是说,机器人的记忆、认知和行动链路,已经开始从云端模型和离线实验真正落到本地芯片。机器人可以更持续地保存和调用自身经验,也让认知与动作之间的反馈链路更短。

为了适应端侧算力,模型本身也在做针对性收缩。

ME-Brain的EventCell把世界预测集中在真正发生交互的局部区域。在论文给出的三视角、十个未来窗口设置下,世界表征token从1920 个降到270个,减少约85.9%。



动作时间轴也做了类似处理:减少几乎不动、重复变化的状态,把预测集中在关节和夹爪发生明显变化的关键帧上。

读取历史时,则由动作模块从独立记忆库中选择相关证据,避免每次都把越来越长的历史塞进视觉语言模型。

这种取舍也延伸到了端侧部署。报告称,ME-Brain的记忆、认知和行动三大模块,都已完成在理想马赫M100芯片上的迁移与优化,能够分别在端侧运行。

其中,ME-VLM 4B给出了具体时延数据。团队压缩重复的视觉token,采用W4A8量化再配合芯片编译和运行调度优化,将预填充时延从400毫秒降到了188毫秒,下降约53%。



这背后其实体现出一个很明显的工程方向:具身模型开始和芯片共同设计

模型需要什么样的计算,以及芯片能够提供怎样的算力和带宽,两边开始互相约束。

对于理想来说,马赫M100原本服务于车端AI,现在又被进一步用来承载机器人的认知、记忆和行动模块。汽车时代积累的端侧算力、编译优化和软硬件协同能力,如今也开始延伸到机器人了。

把理解和动作接起来,还要预测动作的后果

ME-Brain解决了系统如何组织能力的问题,ME-U0则进一步研究:能否把更多能力统一进一个可扩展的预训练模型?

先看两条已有路径:

VLA根据画面和指令生成动作,擅长利用预训练模型的语义知识;世界动作模型把未来视觉状态与动作一起预测,让控制学习同时接受环境变化的监督。



两者各有长处,也留下了一个衔接问题。

理解“把杯子放进盒子”,不代表知道眼下应该先抓杯子还是寻找盒口;生成一段看着合理的未来画面,也不代表交互位置足够准确。

ME-U0把这个过程拆成了四个相互关联的问题:接下来做什么、在哪里操作、场景会怎样变化,以及具体如何运动。

它采用混合Transformer架构,让不同专家保留各自的处理能力,并通过共享注意力交换信息。

理解专家负责识别当前子任务和可供性(后者指物体或区域能支持什么操作,以及适合从哪里交互);生成专家则利用这些语义和空间信息,联合预测未来视觉变化与机器人动作。



比如抓杯子,模型需要把“抓取”这个意图,落实到当前画面里的具体目标和交互位置,再让动作生成与预期的物体运动相互配合。

视觉预测也不局限于彩色画面。ME-U0还学习了深度,即场景中各点与相机的距离;表面法向,即物体表面的朝向;以及光流,即画面中各点在相邻帧之间的运动。

它们分别补充几何和运动信息,让训练目标更贴近实际操作需要。

模型按提示选择要生成的视觉模态,并将它与动作联合生成。这背后涉及流匹配(一种学习如何把噪声逐步变成目标数据的生成方法),用于生成视觉表征和连续动作。

还有一个容易忽略的工程问题:视频可以隔几帧看一次,动作却需要更密集的控制。

为此,ME-U0采用了多速率旋转位置编码,在对齐视频与动作时间关系的同时,保留同一段视频对应的多个动作之间的先后顺序。

支撑这些能力的,是约4200小时筛选后的机器人与第一视角演示数据。团队既统一不同机器人的状态、动作单位和控制语义,也筛除异常轨迹,并补充子任务、交互位置、几何和运动标注。



那么结果如何呢?

完成相应后训练之后,ME-U0在标准LIBERO机器人操作基准上的平均成功率达到99.1%

换到引入视角、光照、语言、布局等扰动的LIBERO-Plus,同一套权重、不做该基准专项适配,在10030个测试实例上的平均成功率为81.8%。

在更复杂的RoboDojo中,ME-U0的整体过程得分为17.66,即按任务推进程度计分;完整任务成功率则为11.18%。其过程得分在论文列出的WAM组中最高。

精细操作的下一关:让模型理解接触

只是看清物体的位置,仍然不能解决所有操作问题。

插头和插座对准了,继续推进时究竟是顺利插入,还是顶到了边缘?摄像头有时很难直接看出差别,力的变化却能提供新的证据。

ME-Dex-1.0研究的就是这一层:把未来触觉和未来视频一起预测,让动作模型学习接触如何发生、如何变化。



触觉在这里既是输入,也是模型需要学习预测的结果。模型需要把自己将要执行的动作,与接下来可能出现的受力变化联系起来。

而真要实现起来,首先要面对的一关就是数据格式

两指夹爪和五指灵巧手的形状不同,传感器数量、位置和覆盖区域也不同。同一个数值,出现在指尖还是手掌上,物理意义并不一样。

ME-Dex为此设计了标准手模型,给不同硬件的触觉测量建立共同的空间参照。五指手映射到相应手指和手掌区域,两指夹爪则映射到拇指和食指区域。

没有传感器的位置会被单独标记,避免把“没有测量”误认为“测到了零接触”



随后,统一触觉自编码器把不同布局的信号压缩成可共享的内部表征,同时学习保留接触位置、力的大小和接触变化。

在模型层面,视频、触觉、动作三个专家分别负责预测,再通过H-Bridge共享注意力——一种在网络中间层交换不同模态信息的机制——协同生成。

动作专家由此可以在生成过程中,利用未来视觉和未来接触状态的中间表征。



数据不够的问题,则交给触觉数据引擎处理。

理想团队把已有机器人轨迹放回仿真环境中执行,通过仿真力传感器记录触觉,再与视觉和动作按时间对齐。补出来的是仿真接触数据,其价值在于让原本缺少触觉的数据集也能参与联合训练。

实验里,还有一个值得关注的结果是,触觉并非加上去就一定有效。

在RoboTwin的随机场景测试中,ME-Dex自身的模型对比显示,从只建模视频和动作开始,加入当前触觉、进一步联合预测未来触觉,再使用H-Bridge,成功率依次从86.90%升到89.54%、90.60%和91.92%。

在DexJoCo的11项灵巧手仿真任务中,ME-Dex的平均成功率为65.3%,比表中最强基线高7.5个百分点;其中五项双手任务平均达到48.8%。

在ManiFeel的四项插拔、装配仿真任务中,平均成功率为70.0%,比官方基线高15个百分点。



而最终把四篇论文放在一起,就能看出理想对机器人能力建设的分层思路了。

理想展开具身路线图

理想将其路线图划分出了三层:

  • 短期由ME-Brain和ME-VLM面向可运行的系统闭环及端侧部署;
  • 中期由ME-U0探索可继续扩展的统一预训练基座;
  • 更长期则由ME-Dex推进力触感知与灵巧操作。

三层分别对应了具身智能当下需要应对的三个问题

第一层,是先让机器人形成一个能真正运行起来的大脑系统;第二层,是把原本分散的能力进一步统一起来;第三层就是继续走向更加细腻的物理交互。

而把视野放到整个具身智能行业,这种分层其实也对应着行业正在经历变化。

前一阶段,机器人竞争很大程度集中在单模型能力上,随着模型开始真正进入机器人,问题正在快速从模型能力扩展到完整系统能力



最终决定实际体验的,更接近于一条完整技术链条。

这也在重新定义具身智能的技术门槛。

机器人一旦进入长期部署阶段,真正难复制的部分会逐渐沉到系统内部。

训练一次模型可以带来一轮能力提升,持续运行却要求机器人把真实交互转化为可复用经验,并在新的任务和环境里继续调用这些经验。

真正的分水岭,或许依旧是在长期运行中积累经验,并把这些经验稳定地转化成下一次行动。

项目官网:machembodied.com
ME-Brain-1.0:https://machembodied.com/ME-Brain/ME-Brain-1.0.html
ME-VLM:https://machembodied.com/ME-Brain/ME-VLM.html
ME-U0:https://machembodied.com/ME-U/ME-U0.html
ME-Dex-1.0:https://machembodied.com/ME-Dex/ME-Dex1.0.html
ME-U0代码仓库:https://github.com/MachEmbodied/ME-U0
ME-Dex代码仓库:https://github.com/MachEmbodied/ME-Dex-1.0

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
未来四年“双一流”高校本科招生数还将扩容7.6万人

未来四年“双一流”高校本科招生数还将扩容7.6万人

界面新闻
2026-09-23 10:44:35
美国网友:特朗普是百年难遇的总统,他把美国从毁灭边缘拉了回来

美国网友:特朗普是百年难遇的总统,他把美国从毁灭边缘拉了回来

墨策史
2026-09-22 16:00:47
孙宇晨再抛小作文,彻底反转了!

孙宇晨再抛小作文,彻底反转了!

互联网品牌官
2026-09-22 15:49:16
小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

小汪宝七个月了,自己拿枕头玩累了就躺,马筱梅在家炖汤陪娃

荒野老五
2026-09-23 12:39:41
邮报:马特乌斯携小38岁的女友逛啤酒节

邮报:马特乌斯携小38岁的女友逛啤酒节

懂球帝
2026-09-22 18:46:38
悲剧!那位明星基金经理,跳楼自杀了……

悲剧!那位明星基金经理,跳楼自杀了……

星图金融研究院
2026-09-23 00:06:09
中美谈妥的消息传回北京,中方官宣中美头等大事

中美谈妥的消息传回北京,中方官宣中美头等大事

果妈聊娱乐
2026-09-22 08:18:00
兰香如故:直到韩梁惨死,许兰香才知,最爱她的人是林锦岐!

兰香如故:直到韩梁惨死,许兰香才知,最爱她的人是林锦岐!

枫尘余往逝
2026-09-23 10:37:33
官方:咪咕转播国足vs马尔代夫,CCTV5将在25日22:35录播

官方:咪咕转播国足vs马尔代夫,CCTV5将在25日22:35录播

懂球帝
2026-09-23 12:35:08
0-2惨败!4强出炉!就在刚刚,亚运会羽毛球爆大冷:世界冠军轰然倒下,陈雨菲复仇成功,圣坛组合强势横扫,国羽半决赛压力大

0-2惨败!4强出炉!就在刚刚,亚运会羽毛球爆大冷:世界冠军轰然倒下,陈雨菲复仇成功,圣坛组合强势横扫,国羽半决赛压力大

锐评利物浦
2026-09-22 17:04:31
华夏历史上最接近神的10个人

华夏历史上最接近神的10个人

小豫讲故事
2026-09-23 06:00:15
海昏侯“刘贺”螭纽玉印最新研究公布:是进入中原最早的和田籽料作品,开启中国玉器器型与纹饰并举时代

海昏侯“刘贺”螭纽玉印最新研究公布:是进入中原最早的和田籽料作品,开启中国玉器器型与纹饰并举时代

澎湃新闻
2026-09-22 16:17:18
苦战5场:中国男羽3-2淘汰韩国男羽,惊险晋级亚运羽毛球男团四强

苦战5场:中国男羽3-2淘汰韩国男羽,惊险晋级亚运羽毛球男团四强

侧身凌空斩
2026-09-22 19:55:48
多地开展新一轮生育意愿调查

多地开展新一轮生育意愿调查

澎湃新闻
2026-09-22 15:30:26
涉嫌严重违纪违法,张丽萍被查

涉嫌严重违纪违法,张丽萍被查

中国基金报
2026-09-22 21:56:46
接连反转!周玉琴因祸得福 中天彻底坐不住了

接连反转!周玉琴因祸得福 中天彻底坐不住了

喜欢历史的阿繁
2026-09-23 11:49:16
马云试穿淘宝闪购骑手服照片曝光 服装获法国设计金奖

马云试穿淘宝闪购骑手服照片曝光 服装获法国设计金奖

快科技
2026-09-21 11:34:10
西贝裁员:个人朋友圈转广告算贪污,30万赔偿金飞了

西贝裁员:个人朋友圈转广告算贪污,30万赔偿金飞了

小小河
2026-09-23 01:31:12
爱奇艺股价从42块6跌到了9毛8,直接被逼到退市红线

爱奇艺股价从42块6跌到了9毛8,直接被逼到退市红线

流苏晚晴
2026-09-23 07:59:16
惊人的母子定律:看一个男孩的命,看他母亲就知道

惊人的母子定律:看一个男孩的命,看他母亲就知道

有态度网友19Dsym
2026-09-21 10:22:29
2026-09-23 14:08:49
智能车参考 incentive-icons
智能车参考
在这里看懂智能车产业变革
1941文章数 3635关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

女子酒后被送入酒店房间 深夜赤足跑出房间从7楼坠亡

头条要闻

女子酒后被送入酒店房间 深夜赤足跑出房间从7楼坠亡

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

手机
艺术
家居
房产
公开课

手机要闻

高通展示第六代骁龙8超级至尊版ANF游戏渲染能力:覆盖《异环》《崩坏:星穹铁道》等

艺术要闻

五粮液新经济中心工地实景,新川第一高楼为何被“限低”?

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版