网易首页 > 网易号 > 正文 申请入驻

破局单模型局限!清华大学李秀教授团队提出EMERGE-Policy:以多智能体协作迈向「具身智能系统」时代

0
分享至



在长期的机器人操作 (Robot Manipulation) 的研究中,单模型 (如视觉语言动作模型,Vision-Language-Action, VLA) 被广泛研究。然而,单一种类模型难以应对复杂的长程任务与突发干扰。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg

为此,清华大学深圳国际研究生院智能计算实验室硕士生方智睿,于清池,陈子扬等在李秀教授的指导下,联合多家高校推出了全新的多智能体异步并发框架 ——EMERGE-Policy。它打破了过去各项技术割裂研究的局面,将 VLA、WAM、世界模型、验证器等不同架构和用途的模型整合为系统可调用的「多元工具集」。

该框架打破了「单一 Policy 决定一切」的传统范式,通过主智能体 (Main Agent)、角色化子智能体 (Sub Agents) 与统一技能库 (Skill Library) 的闭环协作,向具身智能领域做出「我们需要怎样的具身智能系统架构?」的回答。



  • 论文标题:EMERGE-Policy: A Rob ot Mind Emerges Beyond a Single Policy
  • 论文地址:https://arxiv.org/abs/2608.29896v2
  • Website: https://emerge-policy.github.io/EMERGE-Policy/
  • Code: https://github.com/EMERGE-Policy/EMERGE-Policy
  • 清华智能计算实验室官网:https://thusigsiclab.github.io/thu.github.io/

破局「分而治之」:从单一模型到多模型集成具身智能系统

Annie Murphy Paul 在《延展的意识》中写道:「在大脑之外思考,意味着巧妙地借助头脑之外的实体。」(「Thinking outside the brain means skillfully engaging entities external to our heads。」)

在以往的具身智能研究中,大家往往追求用单个「端到端模型」解决问题。然而,单模型在面对复杂的长程任务时,频繁的低级感知数据处理,高层规划器的上下文思考和细粒度的动作输出等任务往往不能很好的兼容,导致逻辑混乱或累计误差崩塌。

EMERGE-Policy 提出了全新的「具身智能系统」范式:智能不应拘泥于某一个模型,而是通过图结构 Agent 的编排异步并发的处理任务,将各类专项模型作为「工具」统一调度,让系统级智能在多组件的协同互动中「涌现」(Emerge)出来。

这样的系统架构和人类发挥智能的方式不谋而合:人在与环境进行交互的过程中通过视觉模块(眼睛)感知环境,通过双手执行操作「技能」,通过大脑进行想象…… 不同异构的器官执行不同种类的技能。

基于 VLA、WAM、世界模型与验证器等模型的异构工具库

EMERGE-Policy 的核心突破在于其统一技能库(Unified Skill Library)的设计。它不再把各种主流操作模型视为相互竞争的替代方案,而是将它们全部封装为标准化的工具接口,融合进同一个具身智能系统中(见图 1):



图 1:EMERGE-Policy 系统及其协调组件的总体架构

按图 1 所示,Emerge-policy 将技能分为 3 类:

  • 操作技能(Operational Skills):VLA, motion planner 与 WAM. VLA(Vision-Language-Action)模型:作为低级视觉 - 语言 - 动作映射工具,专注于高频、精确的机器人末端轨迹与物理控制生成(EMERGE-Policy 中采用 pi_{0.5})。运动原语:在众多操作任务当中,作为宽域动作或宏观动作生成工具,在粗粒度或大范围运动规划时快速响应。
  • 想象与预测技能(Imagination Skills):世界模型(World Model)将世界模型(WM)(如 Cosmos Policy 等)引入工具链。系统在真正执行动作前,可调用世界模型作为「仿真器」,预测未来可能生成的视频状态,实现「想好了再做」。
  • 评估与校验技能(Evaluation & Verification Skills):验证器(Verifier Model)集成评价与验证器模型,在动作执行前校验前提条件(Preconditions),在动作执行后校验目标完成度(Completion Criteria),在预演阶段为世界模型预测的多种候选路径进行打分筛选。

结合了想象技能以及评估技能的动作使得操作过程能考虑 “后验” 得更好完成任务,其工作机制如图 2.



图 2:带想象力和评估技能的动作选择与不带想象力的评估

系统级架构:精细分工的图结构调度

在大模型 agent 工程范式变革历史中,从 prompt engineering 到 harness engineering 再到 loop engineering,AI agent 开始设计多个过程(往往就是多个 loop)之间的关系 —— 谁在谁之前、谁能并行、谁的输出喂给谁。

(1) 主智能体(Main Agent):决策和调度中枢

如图 3,主智能体维持全局任务状态,将复杂的长程任务拆解为子目标(Subgoals)。通过分层上下文工程(Hierarchical Context Engineering),Main Agent 屏蔽掉冗余的低级感知数据,只通过结构化接口调用子 Agent 与工具库。



图 3:主代理的协调与反馈流程

(2) 角色化子智能体(Sub-Agent):独立的专职单元

子智能体运行在隔离的上下文环境中,协助处理高密度的专有数据。

  • Perception Sub-Agent:感知场景 3D 边界框与空间语义;
  • Verification Sub-Agent:实时调用验证器工具检查目标完成度;
  • Monitor Sub-Agent:监控执行过程中的物理异常。

(3) 三层外记忆和上下文管理机制

为保证长程任务不失忆,系统引入了三层文件级记忆(见图 4):

  • PLAN.md:记录任务图与当前进度;
  • HISTORY.md:追加存储历史观测与工具调用摘要;
  • MEMORY.md:动态修正更新的环境事实。

当上下文达到上限时,系统自动触发 Memory Integration 压缩历史,保证系统在超长时序下的稳定运行。



图 4:三层记忆与上下文管理

实验结果:全方位刷新 Benchmark,真机表现惊艳

EMERGE-Policy 研发团队在LIBERO、LIBERO-Plus、LIBERO-Pro 以及 RoboDojo四大被广泛采用的基准及真实机器人上进行了全面评估:

(1). 在 Standard LIBERO 上,得益于将 Cosmos Policy 作为世界模型技能进行轨迹想象和动作选择,EMERGE-Policy 取得了99.2%的平均成功率(超越底座模型 0.7%);在以 pi_{0.5} 作为执行技能的 robot policy 后,平均成功率达到了98.8%(超越底座 2.0%)。

(2). 在面对各种光照变幻、相机位姿突变的 LIBERO-Plus 扰动测试中,EMERGE-Policy (w/ WM) 取得了 93.9% 的超高完成率,比单一 Cosmos Policy 基础底座大幅提升了 11.7%(libero 系列的实验结果可见图 5)



图 5:Libero, LIBERO-Plus, Robodojo 和真机实验的不同维度的效果对比

(3) 在测试视觉记忆与长程规划的 RoboDojo-Sim 测试中,EMERGE-Policy 在 Memory 维度取得了 25.00/22.51%(score/success rate) 的优异成绩,Open 维度取得了 19.98/11.20% 的成绩,这样的指标远超同类型的其他模型(见表 1 和图 5)这表明其具备强大的历史信息编码能力和非马尔可夫推理能力,在技能重组以及开放词汇语义与动作的对齐方面表现尤为出色。



表 1:EMERGE-Policy 在五个 RoboDojo-Sim 能力维度上的结果。每项数据报告了五个能力维度的得分和成功率(%),以及它们的平均值。

(4) 真实机器人部署:多层纸杯叠放长程任务为例。EMERGE-Policy 团队在真实机械臂上部署了高难度的「多层纸杯叠放(Multi-layered Cup Stacking)」任务(见真机实验视频演示和图 6a)。机器人需要将桌面上的纸杯依次倒扣、定位并精准堆叠成 3-2-1 的三层金字塔。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg



图 6:真实机器人多层纸杯叠放工作流与实验结果

高稳定度:在 100 次标准真机实验中,EMERGE-Policy 具身智能系统展现出了极高的完成度(见图 6b)。

强抗干扰:面对人为破坏(将叠好的纸杯拆毁)、纸杯尺寸变化(5%-15%)、颜色变幻及相机视角变动时,系统凭借分支栈恢复与工具库的在线重规划,依然保持了 85%-94% 的惊人成功率(见图 6c)。

结语

EMERGE-Policy 成功开辟了一条具身智能研究的新路径:我们无需强求单个模型无所不能,通过将 VLA、WAM、世界模型与验证器解耦为协同工具,以图结构的理念将多智能体系统进行统一编排,能够构建出适应力极强、高鲁棒的全栈具身智能系统。

清华大学深圳国际研究生院智能计算实验室团队专注于模式识别,决策智能,具身智能研究方向。

未来,团队将进一步推出 EMERGE 系列工作,向具身智能领域阐述「如何做好现代具身智能系统」的团队观念!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
前脚指挥官被俘,后脚拿下穆哈:胡塞这场仗到底打得有多快?

前脚指挥官被俘,后脚拿下穆哈:胡塞这场仗到底打得有多快?

马蹄烫嘴说美食
2026-09-13 17:45:01
金价又跌了!9月13日最新黄金每克报价速查,这个价你敢入手吗?

金价又跌了!9月13日最新黄金每克报价速查,这个价你敢入手吗?

坠入二次元的海洋
2026-09-13 18:09:37
调查发现:恶性肿瘤病人过了70岁,基本都有这5现状,要坦然接受

调查发现:恶性肿瘤病人过了70岁,基本都有这5现状,要坦然接受

芹姐说生活
2026-09-13 14:03:09
四川宜宾一女子称被公职人员推入厕所强奸,县警方不予立案,市公安局复核“有犯罪事实”

四川宜宾一女子称被公职人员推入厕所强奸,县警方不予立案,市公安局复核“有犯罪事实”

第一财经资讯
2026-09-12 21:27:41
你手欠过吗?网友:就因为一次手贱,毁了三个家庭!

你手欠过吗?网友:就因为一次手贱,毁了三个家庭!

另子维爱读史
2026-09-04 21:17:00
“小女孩阳光自信就够了,穿这样是想干嘛!”小学过度打扮照片火了

“小女孩阳光自信就够了,穿这样是想干嘛!”小学过度打扮照片火了

泽泽先生
2026-09-08 13:16:09
女性负债,真的开始“集中爆雷”了。

女性负债,真的开始“集中爆雷”了。

老陆不老
2026-09-04 21:51:34
中国首次以武力威慑美国!特朗普批准对台军售,中方那就用最直接的方式作出有力回应!中国海军在台湾周边空域驱离美军军机

中国首次以武力威慑美国!特朗普批准对台军售,中方那就用最直接的方式作出有力回应!中国海军在台湾周边空域驱离美军军机

暮雨清歌u
2026-09-11 16:39:35
超强厄尔尼诺逼近!国家全面出手,普通家庭现在要做3件事

超强厄尔尼诺逼近!国家全面出手,普通家庭现在要做3件事

随遇而安之心
2026-09-13 09:05:54
“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

“不如炒盘鸡蛋!”山东家长晒4个孩子晚餐,蛋白质趋近于0!

林林先生
2026-08-27 19:14:35
看德国悲惨现状就明白:中国为何坚决打击性交易,原因不言自明

看德国悲惨现状就明白:中国为何坚决打击性交易,原因不言自明

怪味历史连连看
2026-07-01 14:49:12
高市想不到,中方下手这么狠,日本签证费暴涨7倍,这叫以牙还牙

高市想不到,中方下手这么狠,日本签证费暴涨7倍,这叫以牙还牙

策前论
2026-09-13 14:06:51
烟草系统拉响警报:再这样下去,中国烟草真要出大问题

烟草系统拉响警报:再这样下去,中国烟草真要出大问题

阿振观点
2026-08-25 05:56:32
中国最奇怪的现象:亲家和亲家,基本不联系!看透后,全是智慧

中国最奇怪的现象:亲家和亲家,基本不联系!看透后,全是智慧

来去自如的小章
2026-08-04 01:37:40
《交锋》真实台海谍战:我潜伏在台特工妙计揪出两名大陆军界间谍

《交锋》真实台海谍战:我潜伏在台特工妙计揪出两名大陆军界间谍

阿胡
2026-09-10 11:48:33
《纸牌屋》道出实情:大佬并不看重你的才干、魄力与眼光。想要被当成自己人,不靠立下功劳,而是靠这两条不会当众讲明的生存潜规则

《纸牌屋》道出实情:大佬并不看重你的才干、魄力与眼光。想要被当成自己人,不靠立下功劳,而是靠这两条不会当众讲明的生存潜规则

心理观察局
2026-08-25 06:46:08
一张“附中女孩吃火锅”照片火了,4点多就放学的高中生,青春又自信

一张“附中女孩吃火锅”照片火了,4点多就放学的高中生,青春又自信

番外行
2026-09-06 16:43:34
今明两年,不要随便买“新能源车”!内行人:有这3个原因很现实

今明两年,不要随便买“新能源车”!内行人:有这3个原因很现实

沙雕小琳琳
2026-09-13 12:30:03
奥尼尔评21世纪最佳阵容:保罗哈登仅三阵,杜兰特约基奇二阵!

奥尼尔评21世纪最佳阵容:保罗哈登仅三阵,杜兰特约基奇二阵!

你的篮球频道
2026-09-13 08:15:23
斯大林接到志愿军伤亡惨重的密电后,脸色骤变,当即怒令部下:立刻将36个师的武器装备装车,火速运往彭德怀前线。

斯大林接到志愿军伤亡惨重的密电后,脸色骤变,当即怒令部下:立刻将36个师的武器装备装车,火速运往彭德怀前线。

人生录
2026-09-12 10:37:44
2026-09-13 19:28:51
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13985文章数 142733关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

头条要闻

烧烤店被检查15次致停业 12345:同一举报人投诉116次

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

主持人敬一丹去世,女儿悲痛发讣告

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

本地
旅游
时尚
数码
公开课

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

旅游要闻

“牌子还在人早没了”,“僵尸景区”需及时出清 | 新京报快评

伊姐周六热推:电视剧《生逢其时》;综艺《大哥小助理》......

数码要闻

大眼橙推出C5 Ultra高亮版/旗舰版投影仪,首发价1799元起

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版