网易首页 > 网易号 > 正文 申请入驻

Agent 走向具身世界:从语言智能到机器人「大脑指挥官」

0
分享至


RoboHarness用编排异构策略,让VLA、WAM、RL和TAMP不再各说各话,并零样本完成长时序任务。

作者丨邓哲敏

编辑丨齐铖湧

想象这样一个任务:打开柜门,找到藏在里面的积木,然后把它们搭成一座桥。

对人来说,这是一件很简单的事,几个动作自然衔接,幼儿园小朋友也能顺利完成。

但对机器人来说,这个任务横跨多种完全不同的能力:找积木,需要视觉理解和语言指令跟随;开柜门,需要与环境进行复杂交互;搭积木,需要几何规划和精准操控并推测环境变化。

更麻烦的是,这些种能力分属多个不同“门派”的模型——VLA(视觉-语言-动作模型)、WAM(世界-动作模型)、RL 策略(强化学习)、TAMP(任务与运动规划)。它们各有所长,又彼此割裂,训练方式不同、输入格式不同、状态空间也不同。

今天在机器人领域,能力不缺,但协作缺位。

华为诺亚方舟实验室近期发布了一篇论文,提出了名为 RoboHarness 的系统,专门解决不同策略之间无法协作的问题。围绕这项工作,论文作者与我们进行了交流。


论文:https://arxiv.org/abs/2607.18060

项目主页:https://www.robo-harness.com/

01


万能模型的幻觉和现实的鸿沟

今年夏天,机器人研究领域密集出现了几项围绕 Harness 展开的工作,它们共同指向一个认知:靠更大的模型解决一切,暂时行不通,机器人需要一层执行组织系统。

清华大学于超教授团队在 7 月发布了 Harness VLA,将数字智能中广泛使用的 Harness Layer 引入具身智能,让一个冻结的 VLA 专注于最擅长的接触密集操控,同时用一层 Harness 学会何时、以何种方式调用它,以及在 VLA 失败后如何重置、如何重试。在 LIBERO-Pro 扰动评测中,这套系统把成功率从 50% 提升到 82.4%。

思路上,Harness VLA 解决的是一个模型如何在分布外扰动下稳定发挥。它的问题是单策略的稳定性。

华为诺亚方舟实验室的 RoboHarness,面对的是另一层问题:当任务超出任何一个模型的能力边界时,怎么办?

两者都叫 Harness,都用 Coding Agent 做组织层,但解决的是不同维度的挑战。前者让一个专才变得更稳,后者让一群各有所长的专才协同作战。随着机器人任务复杂度不断上升,后一个问题正变得越来越无法回避。

这个问题的根源,要从各路模型的能力边界说起。

VLA 模型的优势在于理解开放式语言指令、在新环境里泛化,但它端到端生成动作的方式,在长时序任务中很难保持一致性;强化学习策略能在特定训练场景内磨出稳定的闭环行为,但这种稳定性高度依赖训练分布,环境稍有变化便可能失效;TAMP 擅长符号推理和几何约束,但需要预先定义动作原语,面对开放场景和模糊目标时规划器很快就会吃力;WAM 能通过预测未来状态辅助长时序决策,但容易随预测时域增长产生误差累积。

复杂的真实任务同时要求语义理解、几何规划、闭环控制、长时序推理和环境变化推测,这些能力对应的训练目标不同,有时甚至相互冲突。从各项能力分别取得突破,到单一模型在开放环境里长期稳定兼顾所有能力,横亘着一道至今没有被真正跨越的鸿沟。

RoboHarness 的出发点正是:与其等待这道鸿沟被填平,不如先让已经存在、各有所长的模型真正协同起来。作者认为,直到某一个模型能够完全压制其他所有模型、展现出绝对的统治力之前,这样的编排架构都是非常有意义的。

这项工作并非凭空而来。作者告诉我们,RoboHarness 的雏形诞生于去年参加全球机器人挑战赛 BEHAVIOR Challenge 的经历。当时赛题任务又长又难,团队发现无论是端到端训练 VLA 还是用行为克隆之类的模型,都没法覆盖任务本身的难度。这次受挫,反而让团队看清了真正的问题所在。

02


调度大脑如何决定该谁上场

RoboHarness 的核心思路,是把 VLA、WAM、RL 策略、TAMP 等独立开发的控制系统,封装成可以被统一调度的 agentic skills,由 Coding Agent 负责高层决策。

这个设计有一个重要前提:不改变、不重训任何底层策略。各个策略保留自己的原始实现,不需要共享模型结构、动作空间或训练数据。RoboHarness 只是在它们之上增加了一层组织能力。

选对策略,可没那么容易。

对于一个 Coding Agent 来说,单靠原始图像输入,很难可靠地判断这个任务该派发给谁。因为这个决定背后藏着很多靠语言模型的语义理解能力答不出来的量化问题。它能读懂把杯子放到盘子上,但无法从一张 RGB 图像里算出当前场景与某个策略训练分布的相似度,更没法评估此刻传感器数据的可靠程度。

为了解决这个问题,系统设计了三类辅助技能,专门替 Coding Agent 把判断所需的信息提炼出来。


Understanding Skills,负责将原始输入转化为可量化的信号,比如:图像嵌入与各策略训练数据的相似度、物体位姿在时间窗口内的稳定性、当前光照和图像质量是否达标等。这些指标是策略路由的真正依据。作者认为,这个模块的本质,就是从多维度去衡量每一个策略到底适不适合当下的任务。

Memory Skills,检索历史执行经验,为选策略提供参照,并通过 Memory Bridge 处理策略之间的状态分布不匹配——这是系统最核心的设计,下文单独展开。

Evolution Skills,利用在线反馈持续更新策略的元数据和编排逻辑,让系统从每一次执行中学习,而不是每次面对新情况都从零判断。

三类技能的信息流相互交互,共同辅助 Coding Agent 决策。在实际执行中,这套机制主要有两层作用:一是任务拆解,将长指令切分为适合不同策略承接的子任务;二是动态切换,当当前策略逐渐接近其能力边界时,系统会及时切换到更合适的策略,实现不同策略之间的能力互补。

论文用一组消融实验说明了这两层的各自贡献:仅用语言模型帮 pi0.5 拆解任务再发给它,成功率已经明显上升;在此基础上接入多个异构策略后,成功率进一步大幅提升。拆得对是第一步,派得准是第二步,两者缺一不可。

但还有第三个问题,也是最难的一个,是光靠选策略解决不了的。

03


决定接力跑胜利的是交接的瞬间

两个独立训练的策略,通常生活在各自的数据世界里。它们的输入格式不同,对机器人状态的经验分布也不同。TAMP 操作完毕停下来的那个位置,很可能恰好落在 VLA 从未处理过、无法稳定启动的状态空间里。

这是异构策略编排独有的难题。

因此,负责让两个策略稳定交接的 Memory Bridge 被作者列为 RoboHarness 里第一重要的模块。他坦承,如果未来某个通用模型能完美覆盖全部状态空间,Memory Bridge 或许就非必需;但在现状下,任何模型都很容易在交接瞬间落进能力分布之外。


Memory Bridge 的工作分三步。

检索:根据下一子任务和当前观测,通过文本和视觉相似度,从多模态记忆库里找出目标策略曾经成功执行的 Top-K 条相似轨迹,提取末端执行器位姿、关节角度等机器人状态。

建模:根据各状态在轨迹中的相对进程赋予监督信号,通过在线回归实时拟合目标策略“习惯接手”的状态范围。

桥接:采样并评分候选状态,综合考虑进入目标策略舒适区的置信度和运动代价,选出最合适的桥接目标,生成过渡轨迹;机器人抵达这个状态后,再把控制权交给下一个策略。

这套机制完全依赖历史执行数据在线学习,对任意策略即插即用,无需修改底层实现,也不需要联合训练。

消融实验中,移除 Memory Bridge 后,任务进度下降不算太大,说明策略选择依然基本正确,但完整成功率从 86.0% 骤降至 60.4%。大量任务走到最后一步,因为交接状态不兼容而功败垂成,从方面证明了 Memory Bridge 的价值。

04


两条技术谱系,一场悄悄发生的汇流

把视野从这篇论文拉开,我们更想去描述一幅更大的具身技术版图。

RoboHarness 的作者观察到,在过去三年 VLA 快速发展的背景下,传统 TAMP 与分层规划由于在开放场景中的泛化能力明显弱于端到端 VLA,一度淡出社区关注。然而,随着今年 agentic systems 和 coding agents 的快速进展,分层架构重新获得了新的生命力:高层 agent 可以借助可组合的 skills 进行任务拆解、工具调用与动态规划,从而显著增强传统层级方法的泛化能力与适应性。由此,学术社区正重新关注,并开始探索如何将强泛化的高层推理与异构底层策略相结合。

这篇文章的作者来自多所加拿大东部高校和研究机构。笔者观察到,北美机器人研究长期存在两条具有明显学术渊源的技术路线:美国西海岸,以 Stanford、Berkeley 等为代表,更强调 learning 与 scaling,关注端到端学习、数据规模和模型泛化;而美国东北部及加拿大,以 MIT、多伦多大学、MILA 等为代表,则长期更重视分层架构、符号推理、逻辑规划和结构化决策。

RoboHarness 的作者们,正处于后者这条谱系的延伸之上。

技术路线的分化,在具身智能工业界留同样下了清晰印记。近年来快速发展的团队逐渐形成了从foundation model scaling 到 agentic hierarchy的技术谱系:一类更强调通用具身基础模型、VLA 与 world model,通过统一模型、数据规模与模型能力的提升不断拓展泛化边界;另一类则更强调可复用操作技能与分层架构,通过任务规划、技能组合和底层控制协同完成复杂任务。国内以智源为代表的团队更接近前者,而苏度科技、魔法原子等则更突出后者;在海外,Physical Intelligence 的 pi 系列长期代表了 scaling 路线,而 Gemini Robotics,则延续了“高层推理与规划 + 底层技能执行”的分层传统。

有意思的是,这种技术谱系的分化并非静态对立,而是在不断演化中形成互补。近几个月,两条技术路线开始出现明显的汇流现象。例如,Physical Intelligence 在 pi0.7 中将可控性与技能组合提升到更核心的位置;与此同时,NVIDIA 等团队也持续推出更具分层特征的 robot agentic systems,将基础模型的理解与推理能力与VLA结合。整体来看,foundation model scaling 与 agentic hierarchy 正在从两条相对独立的技术路径,逐渐演化为同一套机器人系统中的互补能力。

05


以编排为径,走向更通用的智能

RoboHarness 本身有明确的局限:它能调度的是已有策略,无法解决所有策略都做不到的事。Memory Bridge 的可靠性依赖足够的历史执行数据,新接入的策略在早期阶段的能力评估会有较大的不确定性。

论文的核心论点并非否定统一大模型的必要性。

作者强调,长时序任务的编排不仅是对现有能力的组合,本身也会持续产生单个模型难以独立获得的跨能力、跨场景执行数据。这类数据记录了不同策略之间的切换、衔接、失败恢复与协同过程,恰恰可能成为训练下一代通用机器人模型的重要来源。基于这一思路,RoboHarness 团队也正在探索将混合策略编排与执行过程中产生的数据重新用于底层策略训练,异构编排的执行经验进一步反哺模型基础能力的提升。

从寻找最强模型到组织最合适的能力,具身智能的竞争,正在悄悄延伸到系统层面的设计。异构策略编排与统一大模型,像是沿着两条不同山脊展开的跋涉,最终都指向同一个远方:让机器人拥有更通用、更可靠的智能。

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
台湾提和统2大条件,缺一不可!大陆已满足1条,马英九曾有预测

台湾提和统2大条件,缺一不可!大陆已满足1条,马英九曾有预测

花漾夜雨飘雪
2026-09-22 15:40:00
突发!陈冠希的新瓜,有点料!

突发!陈冠希的新瓜,有点料!

财经要参
2026-09-23 07:56:49
伊朗代表团抵美,其总统安全由美特勤局负责

伊朗代表团抵美,其总统安全由美特勤局负责

红星新闻
2026-09-22 13:21:13
大家发现没有了吗?油车跑1000公里要500块,电车跑1000公里呢?

大家发现没有了吗?油车跑1000公里要500块,电车跑1000公里呢?

白米饭怎么吃
2026-08-04 20:31:41
workbuddy确实有点离谱了,附最新保姆级教程!

workbuddy确实有点离谱了,附最新保姆级教程!

郭拽拽
2026-09-20 19:43:50
普京大换血:梅德韦杰夫亲手把自己从名单里划掉,2030的大棋终于摊开了?

普京大换血:梅德韦杰夫亲手把自己从名单里划掉,2030的大棋终于摊开了?

扶苏聊历史
2026-09-22 12:00:44
媒体人:周琦主动表态愿战亚运却落选,郭士强称其没参加夏天集训

媒体人:周琦主动表态愿战亚运却落选,郭士强称其没参加夏天集训

懂球帝
2026-09-23 08:09:08
日本混双被零封,栋曼组合或对阵韩国组合,莎头组合八强对阵日本

日本混双被零封,栋曼组合或对阵韩国组合,莎头组合八强对阵日本

米师傅安装
2026-09-23 14:41:24
央妈“摸排”结果:全国能一次性拿出50万的家庭,数量超乎想象!

央妈“摸排”结果:全国能一次性拿出50万的家庭,数量超乎想象!

平说财经
2026-08-29 07:39:18
今晚18:20见分晓!孙颖莎可能轮休,王曼昱究竟会被怎么用?

今晚18:20见分晓!孙颖莎可能轮休,王曼昱究竟会被怎么用?

林子说事
2026-09-23 02:47:55
长期有效!北京周边超大空域管控,这些飞行一律禁止

长期有效!北京周边超大空域管控,这些飞行一律禁止

新浪低空
2026-09-22 19:49:24
父母出资400多万元在上海买两套房,儿子签多张借条,年利率最高36%;事后小夫妻被起诉还钱,两审均判儿子独偿,儿子:要求夫妻共同还款

父母出资400多万元在上海买两套房,儿子签多张借条,年利率最高36%;事后小夫妻被起诉还钱,两审均判儿子独偿,儿子:要求夫妻共同还款

新民晚报
2026-09-23 12:19:15
高中学历可报!广州市公安局招聘辅警917人

高中学历可报!广州市公安局招聘辅警917人

白云融媒
2026-09-23 15:14:40
八旬老人离世将6亿元遗产留给再婚配偶 与前妻所生女儿起诉索要5734万

八旬老人离世将6亿元遗产留给再婚配偶 与前妻所生女儿起诉索要5734万

闪电新闻
2026-09-23 12:40:47
离开中国100多年,阿穆尔州的荒凉现状:比江苏大三倍,人口从160万减少至79万

离开中国100多年,阿穆尔州的荒凉现状:比江苏大三倍,人口从160万减少至79万

世界地缘档案
2026-09-23 09:07:30
风雨飘摇!13名华人坐船偷渡美国,挤在小船上随时侧翻,佛州近海全被抓

风雨飘摇!13名华人坐船偷渡美国,挤在小船上随时侧翻,佛州近海全被抓

华人生活网
2026-09-23 05:06:58
银行行长再三强调:78岁以后存钱,千万不要全部存在个人名下

银行行长再三强调:78岁以后存钱,千万不要全部存在个人名下

三农老历
2026-09-22 06:50:44
2015年,方静客死他乡,11年后,那个诬陷她是间谍的主持人已荣休

2015年,方静客死他乡,11年后,那个诬陷她是间谍的主持人已荣休

小先生笔记
2026-09-21 17:37:33
罗永浩宣布播客暂停更新:目前已卷进舆论漩涡 为了避免连累嘉宾

罗永浩宣布播客暂停更新:目前已卷进舆论漩涡 为了避免连累嘉宾

快科技
2026-09-23 07:15:06
“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

“韦东奕这么牛,为啥没女孩子喜欢他呢?”女儿白了我一眼说:“别的先不讲,要是有人能把这三点都接纳了,我不光服,还得佩服。”

背包旅行
2026-09-01 11:59:13
2026-09-23 17:59:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7667文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

艺术
时尚
手机
房产
亲子

艺术要闻

穿浴衣的女子,日本写实画家新作

消失的天后,带病复出,先赚10个亿

手机要闻

共研旗舰手机新体验,搭载天玑9600 Pro的OPPO Find X10 Pro Max

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

亲子要闻

媒体:举报“炒菜锅洗拖把”幼师的担心不能成真

无障碍浏览 进入关怀版