网易首页 > 网易号 > 正文 申请入驻

Agent 走向具身世界:从语言智能到机器人「大脑指挥官」

0
分享至


RoboHarness用编排异构策略,让VLA、WAM、RL和TAMP不再各说各话,并零样本完成长时序任务。

作者丨邓哲敏

编辑丨齐铖湧

想象这样一个任务:打开柜门,找到藏在里面的积木,然后把它们搭成一座桥。

对人来说,这是一件很简单的事,几个动作自然衔接,幼儿园小朋友也能顺利完成。

但对机器人来说,这个任务横跨多种完全不同的能力:找积木,需要视觉理解和语言指令跟随;开柜门,需要与环境进行复杂交互;搭积木,需要几何规划和精准操控并推测环境变化。

更麻烦的是,这些种能力分属多个不同“门派”的模型——VLA(视觉-语言-动作模型)、WAM(世界-动作模型)、RL 策略(强化学习)、TAMP(任务与运动规划)。它们各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。

今天在机器人领域,能力不缺,但协作缺位。

华为诺亚方舟实验室近期发布了一篇论文,提出了名为 RoboHarness 的系统,专门解决不同策略之间无法协作的问题。围绕这项工作,论文作者与我们进行了交流。


论文:https://arxiv.org/abs/2607.18060

项目主页:https://www.robo-harness.com/

01


万能模型的幻觉和现实的鸿沟

今年夏天,机器人研究领域密集出现了几项围绕 Harness 展开的工作,它们共同指向一个认知:靠更大的模型解决一切,暂时行不通,机器人需要一层执行组织系统。

清华大学于超教授团队在 7 月发布了 Harness VLA,将数字智能中广泛使用的 Harness Layer 引入具身智能,让一个冻结的 VLA 专注于最擅长的接触密集操控,同时用一层 Harness 学会何时、以何种方式调用它,以及在 VLA 失败后如何重置、如何重试。在 LIBERO-Pro 扰动评测中,这套系统把成功率从 50% 提升到 82.4%。

思路上,Harness VLA 解决的是一个模型如何在分布外扰动下稳定发挥。它的问题是单策略的稳定性。

华为诺亚方舟实验室的 RoboHarness,面对的是另一层问题:当任务超出任何一个模型的能力边界时,怎么办?

两者都叫 Harness,都用 Coding Agent 做组织层,但解决的是不同维度的挑战。前者让一个专才变得更稳,后者让一群各有所长的专才协同作战。随着机器人任务复杂度不断上升,后一个问题正变得越来越无法回避。

这个问题的根源,要从各路模型的能力边界说起。

VLA 模型的优势在于理解开放式语言指令、在新环境里泛化,但它端到端生成动作的方式,在长时序任务中很难保持一致性;强化学习策略能在特定训练场景内磨出稳定的闭环行为,但这种稳定性高度依赖训练分布,环境稍有变化便可能失效;TAMP 擅长符号推理和几何约束,但需要预先定义动作原语,面对开放场景和模糊目标时规划器很快就会吃力;WAM 能通过预测未来状态辅助长时序决策,但容易随预测时域增长产生误差累积。

复杂的真实任务同时要求语义理解、几何规划、闭环控制、长时序推理和环境变化推测,这些能力对应的训练目标不同,有时甚至相互冲突。从各项能力分别取得突破,到单一模型在开放环境里长期稳定兼顾所有能力,横亘着一道至今没有被真正跨越的鸿沟。

RoboHarness 的出发点正是:与其等待这道鸿沟被填平,不如先让已经存在、各有所长的模型真正协同起来。作者认为,直到某一个模型能够完全压制其他所有模型、展现出绝对的统治力之前,这样的编排架构都是非常有意义的。

这项工作并非凭空而来。作者告诉我们,RoboHarness 的雏形诞生于去年参加全球机器人挑战赛 BEHAVIOR Challenge 的经历。当时赛题任务又长又难,团队发现无论是端到端训练 VLA 还是用行为克隆之类的模型,都没法覆盖任务本身的难度。这次受挫,反而让团队看清了真正的问题所在。

02


调度大脑如何决定该谁上场

RoboHarness 的核心思路,是把 VLA、WAM、RL 策略、TAMP 等独立开发的控制系统,封装成可以被统一调度的 agentic skills,由 Coding Agent 负责高层决策。

这个设计有一个重要前提:不改变、不重训任何底层策略。各个策略保留自己的原始实现,不需要共享模型结构、动作空间或训练数据。RoboHarness 只是在它们之上增加了一层组织能力。

选对策略,可没那么容易。

对于一个 Coding Agent 来说,单靠原始图像输入,很难可靠地判断这个任务该派发给谁。因为这个决定背后藏着很多靠语言模型的语义理解能力答不出来的量化问题。它能读懂把杯子放到盘子上,但无法从一张 RGB 图像里算出当前场景与某个策略训练分布的相似度,更没法评估此刻传感器数据的可靠程度。

为了解决这个问题,系统设计了三类辅助技能,专门替 Coding Agent 把判断所需的信息提炼出来。


Understanding Skills,负责将原始输入转化为可量化的信号,比如:图像嵌入与各策略训练数据的相似度、物体位姿在时间窗口内的稳定性、当前光照和图像质量是否达标等。这些指标是策略路由的真正依据。作者认为,这个模块的本质,就是从多维度去衡量每一个策略到底适不适合当下的任务。

Memory Skills,检索历史执行经验,为选策略提供参照,并通过 Memory Bridge 处理策略之间的状态分布不匹配——这是系统最核心的设计,下文单独展开。

Evolution Skills,利用在线反馈持续更新策略的元数据和编排逻辑,让系统从每一次执行中学习,而不是每次面对新情况都从零判断。

三类技能的信息流相互交互,共同辅助 Coding Agent 决策。在实际执行中,这套机制主要有两层作用:一是任务拆解,将长指令切分为适合不同策略承接的子任务;二是动态切换,当当前策略逐渐接近其能力边界时,系统会及时切换到更合适的策略,实现不同策略之间的能力互补。

论文用一组消融实验说明了这两层的各自贡献:仅用语言模型帮 pi0.5 拆解任务再发给它,成功率已经明显上升;在此基础上接入多个异构策略后,成功率进一步大幅提升。拆得对是第一步,派得准是第二步,两者缺一不可。

但还有第三个问题,也是最难的一个,是光靠选策略解决不了的。

03


决定接力跑胜利的是交接的瞬间

两个独立训练的策略,通常生活在各自的数据世界里。它们的输入格式不同,对机器人状态的经验分布也不同。TAMP 操作完毕停下来的那个位置,很可能恰好落在 VLA 从未处理过、无法稳定启动的状态空间里。

这是异构策略编排独有的难题。

因此,负责让两个策略稳定交接的 Memory Bridge 被作者列为 RoboHarness 里第一重要的模块。他坦承,如果未来某个通用模型能完美覆盖全部状态空间,Memory Bridge 或许就非必需;但在现状下,任何模型都很容易在交接瞬间落进能力分布之外。


Memory Bridge 的工作分三步。

检索:根据下一子任务和当前观测,通过文本和视觉相似度,从多模态记忆库里找出目标策略曾经成功执行的 Top-K 条相似轨迹,提取末端执行器位姿、关节角度等机器人状态。

建模:根据各状态在轨迹中的相对进程赋予监督信号,通过在线回归实时拟合目标策略“习惯接手”的状态范围。

桥接:采样并评分候选状态,综合考虑进入目标策略舒适区的置信度和运动代价,选出最合适的桥接目标,生成过渡轨迹;机器人抵达这个状态后,再把控制权交给下一个策略。

这套机制完全依赖历史执行数据在线学习,对任意策略即插即用,无需修改底层实现,也不需要联合训练。

消融实验中,移除 Memory Bridge 后,任务进度下降不算太大,说明策略选择依然基本正确,但完整成功率从 86.0% 骤降至 60.4%。大量任务走到最后一步,因为交接状态不兼容而功败垂成,从方面证明了 Memory Bridge 的价值。

04


两条技术谱系,一场悄悄发生的汇流

把视野从这篇论文拉开,我们更想去描述一幅更大的具身技术版图。

RoboHarness 的作者观察到,在过去三年 VLA 快速发展的背景下,传统 TAMP 与分层规划由于在开放场景中的泛化能力明显弱于端到端 VLA,一度淡出社区关注。然而,随着今年 agentic systems 和 coding agents 的快速进展,分层架构重新获得了新的生命力:高层 agent 可以借助可组合的 skills 进行任务拆解、工具调用与动态规划,从而显著增强传统层级方法的泛化能力与适应性。由此,学术社区正重新关注,并开始探索如何将强泛化的高层推理与异构底层策略相结合。

这篇文章的作者来自多所加拿大东部高校和研究机构。笔者观察到,北美机器人研究长期存在两条具有明显学术渊源的技术路线:美国西海岸,以 Stanford、Berkeley 等为代表,更强调 learning 与 scaling,关注端到端学习、数据规模和模型泛化;而美国东北部及加拿大,以 MIT、多伦多大学、MILA 等为代表,则长期更重视分层架构、符号推理、逻辑规划和结构化决策。

RoboHarness 的作者们,正处于后者这条谱系的延伸之上。

技术路线的分化,在具身智能工业界留同样下了清晰印记。近年来快速发展的团队逐渐形成了从foundation model scaling 到 agentic hierarchy的技术谱系:一类更强调通用具身基础模型、VLA 与 world model,通过统一模型、数据规模与模型能力的提升不断拓展泛化边界;另一类则更强调可复用操作技能与分层架构,通过任务规划、技能组合和底层控制协同完成复杂任务。国内以智源为代表的团队更接近前者,而苏度科技、魔法原子等则更突出后者;在海外,Physical Intelligence 的 pi 系列长期代表了 scaling 路线,而 Gemini Robotics,则延续了“高层推理与规划 + 底层技能执行”的分层传统。

有意思的是,这种技术谱系的分化并非静态对立,而是在不断演化中形成互补。近几个月,两条技术路线开始出现明显的汇流现象。例如,Physical Intelligence 在 pi0.7 中将可控性与技能组合提升到更核心的位置;与此同时,NVIDIA 等团队也持续推出更具分层特征的 robot agentic systems,将基础模型的理解与推理能力与VLA结合。整体来看,foundation model scaling 与 agentic hierarchy 正在从两条相对独立的技术路径,逐渐演化为同一套机器人系统中的互补能力。

05


以编排为径,走向更通用的智能

RoboHarness 本身有明确的局限:它能调度的是已有策略,无法解决所有策略都做不到的事。Memory Bridge 的可靠性依赖足够的历史执行数据,新接入的策略在早期阶段的能力评估会有较大的不确定性。

论文的核心论点并非否定统一大模型的必要性。

作者强调,长时序任务的编排不仅是对现有能力的组合,本身也会持续产生单个模型难以独立获得的跨能力、跨场景执行数据。这类数据记录了不同策略之间的切换、衔接、失败恢复与协同过程,恰恰可能成为训练下一代通用机器人模型的重要来源。基于这一思路,RoboHarness 团队也正在探索将混合策略编排与执行过程中产生的数据重新用于底层策略训练,异构编排的执行经验进一步反哺模型基础能力的提升。

从寻找最强模型到组织最合适的能力,具身智能的竞争,正在悄悄延伸到系统层面的设计。异构策略编排与统一大模型,像是沿着两条不同山脊展开的跋涉,最终都指向同一个远方:让机器人拥有更通用、更可靠的智能。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
冷空气来了!广州今天还有大雨!中秋假期天气→

冷空气来了!广州今天还有大雨!中秋假期天气→

广州交通电台
2026-09-23 13:19:25
经济学家刘元春:居民消费上不去,根子不在老百姓,在分配!

经济学家刘元春:居民消费上不去,根子不在老百姓,在分配!

罗sir财话
2026-09-23 12:25:29
“苹果跳号小米跟不跟”上热搜 网友锐评:雷总别跳了!

“苹果跳号小米跟不跟”上热搜 网友锐评:雷总别跳了!

小柱解说游戏
2026-09-22 12:54:23
亚运战报:再爆大冷世界第2两连败!国羽2-0,韩国1-1

亚运战报:再爆大冷世界第2两连败!国羽2-0,韩国1-1

求球不落谛
2026-09-23 11:27:19
独家揭秘!郭士强为何拒用周琦?媒体人曝出真实原因,球迷炸锅

独家揭秘!郭士强为何拒用周琦?媒体人曝出真实原因,球迷炸锅

桃叶渡春
2026-09-23 15:13:55
全国公安机关视频会议召开,中共中央书记处书记、公安部部长王小洪出席并讲话

全国公安机关视频会议召开,中共中央书记处书记、公安部部长王小洪出席并讲话

政知新媒体
2026-09-23 00:29:59
为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

另子维爱读史
2026-09-17 20:41:04
错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

老猫观点
2026-09-23 07:05:55
62岁阿里董事长蔡崇信回湖州祖宅,乡亲夹道欢迎,风光无限!

62岁阿里董事长蔡崇信回湖州祖宅,乡亲夹道欢迎,风光无限!

大厂财经社
2026-09-23 01:23:03
iPhone 18 Pro Max被曝拍照出现绿斑 苹果客服回应

iPhone 18 Pro Max被曝拍照出现绿斑 苹果客服回应

TechWeb
2026-09-23 15:18:06
13冠!中国队夺得亚运会体操男子团体金牌

13冠!中国队夺得亚运会体操男子团体金牌

界面新闻
2026-09-23 15:05:39
美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

吕醿极限手工
2026-08-27 14:18:48
央视+爱奇艺首播!40集民国谍战剧首发预告,圆滑秘书VS市侩记者,乱世兄妹演绎信仰觉醒之路!

央视+爱奇艺首播!40集民国谍战剧首发预告,圆滑秘书VS市侩记者,乱世兄妹演绎信仰觉醒之路!

影视快通车
2026-09-23 15:02:52
拆开21个月后,支付宝又合回去了

拆开21个月后,支付宝又合回去了

钛媒体APP
2026-09-23 11:31:34
十二点共识曝光,岛内震动!武器交中央、解放军驻台、台岛裁军?

十二点共识曝光,岛内震动!武器交中央、解放军驻台、台岛裁军?

冰语历史
2026-09-22 13:07:50
俄方:泽连斯基的声明自相矛盾

俄方:泽连斯基的声明自相矛盾

参考消息
2026-09-23 13:29:26
为啥很多娱乐公司不太待见谭松韵?不是演技不行,也不是长相问题,是她太清醒了,清醒到公司算完账发现,那套变现路子在她身上走不通

为啥很多娱乐公司不太待见谭松韵?不是演技不行,也不是长相问题,是她太清醒了,清醒到公司算完账发现,那套变现路子在她身上走不通

黎兜兜
2026-09-22 17:43:12
中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

界面新闻
2026-09-23 15:09:23
平均年龄仅20.5岁!2场比赛进9球丢0球,成U23国足淘汰赛潜在对手

平均年龄仅20.5岁!2场比赛进9球丢0球,成U23国足淘汰赛潜在对手

大卫的篮球故事
2026-09-22 19:49:11
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
2026-09-23 17:11:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7667文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

亲子
旅游
家居
房产
公开课

亲子要闻

红金纳福,萌娃送财

旅游要闻

“入城就是剧中人”!中秋国庆活动第二波来了——

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版