网易首页 > 网易号 > 正文 申请入驻

破局单模型局限!清华大学李秀教授团队提出EMERGE-Policy:以多智能体协作迈向「具身智能系统」时代

0
分享至



在长期的机器人操作 (Robot Manipulation) 的研究中,单模型 (如视觉语言动作模型,Vision-Language-Action, VLA) 被广泛研究。然而,单一种类模型难以应对复杂的长程任务与突发干扰。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg

为此,清华大学深圳国际研究生院智能计算实验室硕士生方智睿,于清池,陈子扬等在李秀教授的指导下,联合多家高校推出了全新的多智能体异步并发框架 ——EMERGE-Policy。它打破了过去各项技术割裂研究的局面,将 VLA、WAM、世界模型、验证器等不同架构和用途的模型整合为系统可调用的「多元工具集」。

该框架打破了「单一 Policy 决定一切」的传统范式,通过主智能体 (Main Agent)、角色化子智能体 (Sub Agents) 与统一技能库 (Skill Library) 的闭环协作,向具身智能领域做出「我们需要怎样的具身智能系统架构?」的回答。



  • 论文标题:EMERGE-Policy: A Rob ot Mind Emerges Beyond a Single Policy
  • 论文地址:https://arxiv.org/abs/2608.29896v2
  • Website: https://emerge-policy.github.io/EMERGE-Policy/
  • Code: https://github.com/EMERGE-Policy/EMERGE-Policy
  • 清华智能计算实验室官网:https://thusigsiclab.github.io/thu.github.io/

破局「分而治之」:从单一模型到多模型集成具身智能系统

Annie Murphy Paul 在《延展的意识》中写道:「在大脑之外思考,意味着巧妙地借助头脑之外的实体。」(「Thinking outside the brain means skillfully engaging entities external to our heads。」)

在以往的具身智能研究中,大家往往追求用单个「端到端模型」解决问题。然而,单模型在面对复杂的长程任务时,频繁的低级感知数据处理,高层规划器的上下文思考和细粒度的动作输出等任务往往不能很好的兼容,导致逻辑混乱或累计误差崩塌。

EMERGE-Policy 提出了全新的「具身智能系统」范式:智能不应拘泥于某一个模型,而是通过图结构 Agent 的编排异步并发的处理任务,将各类专项模型作为「工具」统一调度,让系统级智能在多组件的协同互动中「涌现」(Emerge)出来。

这样的系统架构和人类发挥智能的方式不谋而合:人在与环境进行交互的过程中通过视觉模块(眼睛)感知环境,通过双手执行操作「技能」,通过大脑进行想象…… 不同异构的器官执行不同种类的技能。

基于 VLA、WAM、世界模型与验证器等模型的异构工具库

EMERGE-Policy 的核心突破在于其统一技能库(Unified Skill Library)的设计。它不再把各种主流操作模型视为相互竞争的替代方案,而是将它们全部封装为标准化的工具接口,融合进同一个具身智能系统中(见图 1):



图 1:EMERGE-Policy 系统及其协调组件的总体架构

按图 1 所示,Emerge-policy 将技能分为 3 类:

  • 操作技能(Operational Skills):VLA, motion planner 与 WAM. VLA(Vision-Language-Action)模型:作为低级视觉 - 语言 - 动作映射工具,专注于高频、精确的机器人末端轨迹与物理控制生成(EMERGE-Policy 中采用 pi_{0.5})。运动原语:在众多操作任务当中,作为宽域动作或宏观动作生成工具,在粗粒度或大范围运动规划时快速响应。
  • 想象与预测技能(Imagination Skills):世界模型(World Model)将世界模型(WM)(如 Cosmos Policy 等)引入工具链。系统在真正执行动作前,可调用世界模型作为「仿真器」,预测未来可能生成的视频状态,实现「想好了再做」。
  • 评估与校验技能(Evaluation & Verification Skills):验证器(Verifier Model)集成评价与验证器模型,在动作执行前校验前提条件(Preconditions),在动作执行后校验目标完成度(Completion Criteria),在预演阶段为世界模型预测的多种候选路径进行打分筛选。

结合了想象技能以及评估技能的动作使得操作过程能考虑 “后验” 得更好完成任务,其工作机制如图 2.



图 2:带想象力和评估技能的动作选择与不带想象力的评估

系统级架构:精细分工的图结构调度

在大模型 agent 工程范式变革历史中,从 prompt engineering 到 harness engineering 再到 loop engineering,AI agent 开始设计多个过程(往往就是多个 loop)之间的关系 —— 谁在谁之前、谁能并行、谁的输出喂给谁。

(1) 主智能体(Main Agent):决策和调度中枢

如图 3,主智能体维持全局任务状态,将复杂的长程任务拆解为子目标(Subgoals)。通过分层上下文工程(Hierarchical Context Engineering),Main Agent 屏蔽掉冗余的低级感知数据,只通过结构化接口调用子 Agent 与工具库。



图 3:主代理的协调与反馈流程

(2) 角色化子智能体(Sub-Agent):独立的专职单元

子智能体运行在隔离的上下文环境中,协助处理高密度的专有数据。

  • Perception Sub-Agent:感知场景 3D 边界框与空间语义;
  • Verification Sub-Agent:实时调用验证器工具检查目标完成度;
  • Monitor Sub-Agent:监控执行过程中的物理异常。

(3) 三层外记忆和上下文管理机制

为保证长程任务不失忆,系统引入了三层文件级记忆(见图 4):

  • PLAN.md:记录任务图与当前进度;
  • HISTORY.md:追加存储历史观测与工具调用摘要;
  • MEMORY.md:动态修正更新的环境事实。

当上下文达到上限时,系统自动触发 Memory Integration 压缩历史,保证系统在超长时序下的稳定运行。



图 4:三层记忆与上下文管理

实验结果:全方位刷新 Benchmark,真机表现惊艳

EMERGE-Policy 研发团队在LIBERO、LIBERO-Plus、LIBERO-Pro 以及 RoboDojo四大被广泛采用的基准及真实机器人上进行了全面评估:

(1). 在 Standard LIBERO 上,得益于将 Cosmos Policy 作为世界模型技能进行轨迹想象和动作选择,EMERGE-Policy 取得了99.2%的平均成功率(超越底座模型 0.7%);在以 pi_{0.5} 作为执行技能的 robot policy 后,平均成功率达到了98.8%(超越底座 2.0%)。

(2). 在面对各种光照变幻、相机位姿突变的 LIBERO-Plus 扰动测试中,EMERGE-Policy (w/ WM) 取得了 93.9% 的超高完成率,比单一 Cosmos Policy 基础底座大幅提升了 11.7%(libero 系列的实验结果可见图 5)



图 5:Libero, LIBERO-Plus, Robodojo 和真机实验的不同维度的效果对比

(3) 在测试视觉记忆与长程规划的 RoboDojo-Sim 测试中,EMERGE-Policy 在 Memory 维度取得了 25.00/22.51%(score/success rate) 的优异成绩,Open 维度取得了 19.98/11.20% 的成绩,这样的指标远超同类型的其他模型(见表 1 和图 5)这表明其具备强大的历史信息编码能力和非马尔可夫推理能力,在技能重组以及开放词汇语义与动作的对齐方面表现尤为出色。



表 1:EMERGE-Policy 在五个 RoboDojo-Sim 能力维度上的结果。每项数据报告了五个能力维度的得分和成功率(%),以及它们的平均值。

(4) 真实机器人部署:多层纸杯叠放长程任务为例。EMERGE-Policy 团队在真实机械臂上部署了高难度的「多层纸杯叠放(Multi-layered Cup Stacking)」任务(见真机实验视频演示和图 6a)。机器人需要将桌面上的纸杯依次倒扣、定位并精准堆叠成 3-2-1 的三层金字塔。



视频链接:https://mp.weixin.qq.com/s/aPjlKTb7A_dMH7KtrVd2qg



图 6:真实机器人多层纸杯叠放工作流与实验结果

高稳定度:在 100 次标准真机实验中,EMERGE-Policy 具身智能系统展现出了极高的完成度(见图 6b)。

强抗干扰:面对人为破坏(将叠好的纸杯拆毁)、纸杯尺寸变化(5%-15%)、颜色变幻及相机视角变动时,系统凭借分支栈恢复与工具库的在线重规划,依然保持了 85%-94% 的惊人成功率(见图 6c)。

结语

EMERGE-Policy 成功开辟了一条具身智能研究的新路径:我们无需强求单个模型无所不能,通过将 VLA、WAM、世界模型与验证器解耦为协同工具,以图结构的理念将多智能体系统进行统一编排,能够构建出适应力极强、高鲁棒的全栈具身智能系统。

清华大学深圳国际研究生院智能计算实验室团队专注于模式识别,决策智能,具身智能研究方向。

未来,团队将进一步推出 EMERGE 系列工作,向具身智能领域阐述「如何做好现代具身智能系统」的团队观念!

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
亚运男篮战报:陈盈骏仅8分省队却大胜出线,8强决出5席中日韩

亚运男篮战报:陈盈骏仅8分省队却大胜出线,8强决出5席中日韩

求球不落谛
2026-09-13 13:48:54
WTT澳门冠军赛男单太残酷:随着张本智和3-4,亚洲军团已全军覆没

WTT澳门冠军赛男单太残酷:随着张本智和3-4,亚洲军团已全军覆没

侧身凌空斩
2026-09-13 14:24:41
战争每天烧掉1.9亿美元!乌克兰经济部长:我们正被这场仗拖向深渊

战争每天烧掉1.9亿美元!乌克兰经济部长:我们正被这场仗拖向深渊

西游日记
2026-09-13 15:39:09
中网官宣:孙心然获正赛外卡首战WTA1000赛 刚夺美网青少年女单冠军

中网官宣:孙心然获正赛外卡首战WTA1000赛 刚夺美网青少年女单冠军

醉卧浮生
2026-09-13 18:41:12
周末两个超级事件

周末两个超级事件

贩财局
2026-09-13 14:09:29
抚恤待遇:机关计发40个月,事业20个月,企业为何另有一套算法?

抚恤待遇:机关计发40个月,事业20个月,企业为何另有一套算法?

据说说娱乐
2026-09-13 08:57:50
买一台iPhone18 Pro:美国只要工作5.5天,中国要36天,印度71天

买一台iPhone18 Pro:美国只要工作5.5天,中国要36天,印度71天

互联网.乱侃秀
2026-09-13 09:35:20
蝴蝶效应,又有车队宣布退赛China GT,直至全面升级整改

蝴蝶效应,又有车队宣布退赛China GT,直至全面升级整改

KG说球
2026-09-13 14:16:11
一段“穿睡衣的奔驰大小姐”视频被骂惨了,某些人的认知,配不上松弛感

一段“穿睡衣的奔驰大小姐”视频被骂惨了,某些人的认知,配不上松弛感

泽泽先生
2026-09-12 13:23:01
英语之争舆论升级!项立刚发文怒怼郎咸平,质疑他要么水平差要么坏到骨子里,网友评论炸锅

英语之争舆论升级!项立刚发文怒怼郎咸平,质疑他要么水平差要么坏到骨子里,网友评论炸锅

火山詩话
2026-09-13 05:42:07
“我已经蠢的不像人了!”女大学生报道路上崩溃,网友:社会化程度太低了!

“我已经蠢的不像人了!”女大学生报道路上崩溃,网友:社会化程度太低了!

林林先生
2026-09-11 07:40:03
王卫,被查

王卫,被查

第一财经资讯
2026-09-13 16:11:13
女篮世界杯美国法国争冠战!中国队却赢麻了:他们只输给世界第1第2

女篮世界杯美国法国争冠战!中国队却赢麻了:他们只输给世界第1第2

篮球快餐车
2026-09-13 10:56:05
攻下红海咽喉岛屿,胡塞武装打电话给美国:别介入!此前沙特两次求助特朗普遭拒

攻下红海咽喉岛屿,胡塞武装打电话给美国:别介入!此前沙特两次求助特朗普遭拒

红星新闻
2026-09-13 15:50:23
报名费22万!上海站离谱内幕:日薪3千招聘安保 层层外包只剩60

报名费22万!上海站离谱内幕:日薪3千招聘安保 层层外包只剩60

念洲
2026-09-13 09:03:19
卫龙“162吨进口魔芋粉二氧化硫超标”!客服回应:原料没用于任何卫龙产品 和卫龙在售产品无关

卫龙“162吨进口魔芋粉二氧化硫超标”!客服回应:原料没用于任何卫龙产品 和卫龙在售产品无关

闪电新闻
2026-09-13 11:20:35
女选手疑似赛场失禁,HYROX中国:将更换地毯,并开展全场深度消杀

女选手疑似赛场失禁,HYROX中国:将更换地毯,并开展全场深度消杀

都市快报橙柿互动
2026-09-13 08:46:53
美股半导体股暗盘集体下挫

美股半导体股暗盘集体下挫

每日经济新闻
2026-09-13 16:56:21
央视新闻联播播报巡视组反馈,武大被批了一分多钟

央视新闻联播播报巡视组反馈,武大被批了一分多钟

A活着
2026-09-13 11:32:06
约1600名中国公民仍被困!数据对比:遣返2万人仅救出46人

约1600名中国公民仍被困!数据对比:遣返2万人仅救出46人

鹤羽说个事
2026-09-12 22:53:21
2026-09-13 19:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13985文章数 142733关注度
往期回顾 全部

科技要闻

三位AI大佬,罕见呼吁AI减速

头条要闻

攻下红海咽喉岛屿 胡塞武装打电话给美国

头条要闻

攻下红海咽喉岛屿 胡塞武装打电话给美国

体育要闻

乔丹的得分统治力:如何违背篮球规律?

娱乐要闻

敬一丹留给世间最后的温柔

财经要闻

“1+N+X”!私募业,监管规则密集落地!

汽车要闻

全新配色和新样式轮毂 乐道L80星光设计套装限时惊喜价10080元

态度原创

本地
健康
家居
艺术
公开课

本地新闻

Onestage x 乐华娱乐暑期巡回选拔2026

手脚发麻口齿不清?也可能是中风!

家居要闻

2026建博会(广州) 公装联探展交流活动

艺术要闻

费欣 一张妻女同桌的画,值1390万元!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版