网易首页 > 网易号 > 正文 申请入驻

用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单

0
分享至

编辑|冷猫

谁也没想到, AGI 随着 GPT-6 的到来竟然来得这么快。

GPT-6 Astra 的强大的基础通用模型能力有目共睹,大模型的 RSI 竟恐怖如斯。

几家欢喜几家愁。在此之前,谁也没有想到,这个基础模型能够在具身智能领域掀起一场巨大的浪潮。

就在 GPT-6 Astra 发布后的第二天,Robocurve 将它直接接入机器人执行任务,并惊奇的发现 GPT-6 Astra 在控制机器人方面强悍的夸张,Token 消耗也低的夸张。



GPT-6 Astra 在一项机器人控制任务中的成功率达到 95%,高于 Fable 5.1 的 40%;与此同时,输出 Token 用量仅为后者的约 1/6.2,成本约为后者的 1/2.3。

于是这一切开始一发不可收拾,用 GPT-6 基模控制机器人执行复杂操作的案例似雨后春笋。



好了好了,这下好了。我在具身智能领域很焦虑。



通用人工智能模型将接管具身智能领域的讨论越来越多,甚至大有「GPT-6 横扫具身」,具身智能将成为「这类模型的一个子领域」的趋势。

有知名具身智能企业的创始人表示,今天的具身智能还没有真正的护城河,通用模型公司在人才、算力和资金上占优,「未来一两年将是关键窗口」。Robocurve 提到,如果这一趋势持续,大语言模型最早可能在今年年底、最晚在 2029 年实现对机械臂的实时控制。

不过,亮眼的单项成绩,并不意味着基模已经能够在真实环境中安全、稳定地控制机器人。RoboDojo 团队在官方评测中指出,「Astra 在真机测试中反复发出物理上不合理或不安全的动作,部分事故甚至造成了硬件损坏。」出于安全考虑,团队提前停止测试,因此 Astra 未能完成原定包含 18 项任务的 RoboDojo-Real 评测。

这也提醒我们:基模能力的突破只是起点。如何约束动作、处理失败,让机器人安全、稳定地持续工作,仍是系统层面必须解决的问题。

基模在变强,但通用是一把双刃剑。正如打造智能体需要在基模之上构建 Harness 一样,具身智能上缺少的,是一套让经验积累、让能力持续生长的系统。我们发现了这样一个研究工作:

近日,穹彻智能发布 RoboRSI ,一个面向真实复杂场景的机器人多智能体自进化框架。


视频地址:https://mp.weixin.qq.com/s/5S53vy6KXPEp2DzyQ-eAlQ


穹彻智能试图回答的正是这个问题:当基础模型已经具备强大的理解和推理能力后,如何在系统层面构建起持续执行、诊断、修订和复用的完整闭环。



  • 技术博客:https://lab.noematrix.ai/blog/2-roborsi/
  • GitHub:https://github.com/nssmd/RoboRSI

多智能体自进化:为具身智能打造的 Harness

单次成功和长期稳定运行之间,隔着一整套系统级的能力。

两个核心难题:

第一,谁来处理执行过程中的各种异常? 机器人报错停止、抓取失败、位置偏移之后,需要结果检查、异常恢复、进行安全决策。这些工作过去全靠工程师手动跟进。大模型可以理解任务目标,但它不能负责现场恢复,不判断执行是否成功,也不决定下一步从哪个节点继续。

第二,历史经验如何真正实现沉淀复用? 如果每次都让 Agent 参考过去的完整执行记录,Token 消耗会持续增长,反而让模型难以聚焦。如果每次碰到局部失败就重写整套流程,系统也很难收敛。研究团队观察到一个关键现象:Coding 模型擅长处理局部细节,但在反复修改中容易偏离全局目标。缺少结构性约束的迭代,往往越改越乱。

Context 管理是新时代的代码管理。 过去,机器人系统的核心挑战是写出正确的控制代码。在 Agent 时代,代码可以由模型生成和迭代,真正的瓶颈转移到了如何管理 Agent 在持续运行中产生的海量上下文:轨迹、日志、视频、代码版本、失败记录。管理不当,系统就会在迭代中走向混乱。

穹彻智能的设计哲学由此展开,可以概括为一句话:给人和 Agent 各自提供合适的接口。

对人,提供「高层引导」(Human-Friendly Steering):无需深入底层实现,专注于目标设定、专业判断和安全边界,将日常执行交给多智能体。

对 Agent,提供「清晰结构」(Agent-Friendly Structure):通过层级化技能树,明确修改范围、成功标准和失败反馈路径,让局部修订始终围绕全局目标展开。

所以,不管基模能力再强大,也需要一个系统级的 Harness 框架,使其能够适应具身智能的需求。RoboRSI ,正是围绕这两个问题构建的具身智能版的 Harness。



四个角色,一个闭环

具身的上下文可不是那么好管理的。

机器人的执行过程包含大量图像、轨迹、工具调用和失败细节,如果全部堆在一个上下文里,模型很快就会在信息膨胀和错误归因中失去方向。为此,多智能体是一个很好的解决方案。

RoboRSI 的做法是把规划、执行、诊断和修订拆分到不同的上下文中,采用 Manager、Planner、Engineer、Reviewer 四类智能体协作的架构



  • Manager 是整个系统的调度中枢,负责任务队列管理、并发 worker 调度、断点恢复和技能版本管理。它把用户输入的高层目标分解成可执行的任务序列。
  • Planner 根据当前环境观察和已有技能库,生成具体的执行计划。它做的事情接近于「我看到了什么、手里有什么工具、所以这一步应该怎么做」。
  • Engineer 是真正动手的角色。它调用机器人 的底层工具(感知、导航、抓取、放置等),执行动作并生成候选能力。
  • Reviewer 在执行完成后登场,根据执行结果(日志、视频、轨迹)复盘问题、定位失败原因,并把修订建议返回给 Manager,推动下一轮迭代。

这四个角色围绕同一个任务和同一份执行证据接力运行,形成一个完整的「执行→诊断→修订→再执行」闭环。 关键在于,人类仍然保留着对目标、价值判断和安全边界的控制权。在真机上,人负责安全监管和方向调整;在仿真中,系统可以自动完成更多的复位和判定。

工程师的角色因此发生了根本转变:从逐行编写任务代码、跟进每一次底层执行,转向设定目标、审核结果和提供方向性指导。

TSR:给 Agent 一棵「技能树」

让机器人持续迭代,并不只是让 Agent 一遍遍尝试。最重要的是把尝试后的结果与经验沉淀下来。

穹彻智能为此提出了 TSR(Top-down Skill Refinement,自顶向下技能细化) 机制。它用一棵四层的技能树来组织机器人的全部能力:

  • 任务族(Task Family) :定义总体目标与约束,比如「家庭地面清理」。
  • 复合技能(Compound Skill) :组合多步能力,比如「搜索目标→移动→抓取→放置」。
  • 原子任务(Atomic Task) :边界明确、结果可验证的最小任务单元,比如「抓取地面上的黄色包装袋」。
  • 基础技能(Base Skill) :与机器人直接交互的底层能力,包括视觉感知、移动控制、抓取、放置等。

为什么需要这样一棵树?这棵技能树的作用,是为 Coding Agent 提供结构性约束。每次修改都被限制在清晰的技能边界内,Agent 可以专注于局部实现和修订,但不会因为连续调试而偏离全局任务目标。

历史经验由此从对话记录和日志,变成了下一轮真正可调用的能力。

从「探索」到「复用」

在早期探索阶段,Agent 需要逐步观察环境、选择工具、执行动作,每一步都需要模型推理。但当某条执行路径被反复验证为稳定后,继续让 Agent 逐步调用每一个工具就成了浪费。

穹彻智能设计了一个三阶段的演进机制:从成功的调用链中提取稳定结构,把物体类别、目标区域和空间关系参数化,然后将可复用流程固化为代码技能。当类似任务再次出现时,Agent 只需选择、监控和必要时修订整条技能,重复的工具调用步骤则由代码承担。



在 LIBERO 基准测试的实验中,启用代码固化(Code-on)相比未启用(Code-off)版本,回合通过率从 21.5% 提升到 29.0%,中位 Token 消耗下降 29.4%,中位 VLM 调用次数下降 27.2%,中位执行时间下降 17.0%。

Agent 的推理资源,只留给真正变化和不确定的部分。

实验验证:零样本适配与扰动鲁棒性

在仿真环境中,穹彻智能进行了更系统的定量验证。



零样本任务适配。 在没有现成任务代码的情况下,系统从基础技能开始迭代。经过约一天的并行执行,LIBERO 基准上的累计任务通过率从 32/120 提升到 95/120;RoboTwin 从初始的 9/50 提升至 36/50。与仅使用 Engineer 单角色的基线相比,完整的多智能体配置(Planner + Engineer + Reviewer)在 RoboTwin 上将通过率提升了 4 倍



代码固化效果。 在 LIBERO 的 120 个任务、5 组初始布局、共 600 个 episode 实验中,启用代码固化(Code-on)相比未启用版本(Code-off):回合通过率从 21.5% 提升到 29.0%;中位 Token 消耗下降 29.4%;中位 VLM 调用次数下降 27.2%;中位执行时间下降 17.0%



扰动鲁棒性。 在 LIBERO-Plus 的 840 个扰动实例中(涵盖视觉纹理、相机视角、语言指令、光照条件、物体布局、机器人初始状态、传感器噪声七个维度),RoboRSI 通过自适应修订将通过率从 31.1% 提升至 47.4%,额外恢复了 137 个原本失败的实例。



解锁全场景的商业潜力

让我们回到文章开头的真机演示的视频里。

以同类任务为参照:2024 年,完成一个类似的家庭地面清理 Demo,需要两名工程师连续投入约一个月,编写约 2,000 至 3,000 行任务代码。而在 RoboRSI 的框架下,同样级别的能力构建在一天内就走完了一个完整闭环

显而易见,在优秀的基模上,配合运行良好的系统框架,新场景的适配成本会被大幅压缩。

穹彻智能用 RoboRSI 给了我们一个解法。系统能够自主完成任务拆解、技能实现、执行诊断和代码修订的闭环,那么适配一个新场景的核心成本就从「工程师驻场数周」变成了「设定目标 + 系统自主迭代 + 人工审核和安全把关」。

这种变化也为家庭等高度个性化的场景打开了新的商业空间。

每个家庭的户型、家具布局和物品摆放都不同,如果每次部署都需要工程师驻场数周,服务成本就很难支撑大规模推广。穹彻智能打造的 RoboRSI 这类基于智能体的机器人系统提供了一种可能:在通用能力的基础上,通过现场反馈自主迭代,逐步学会适合这个家庭的清理路径和操作技能。家具移动、物品更换后,也有机会沿用同一套机制完成适配,减少重新开发的工作。

类似的需求也存在于布局各异的门店、办公室和小型仓储空间。缩短适配周期,意味着过去因定制成本过高而难以覆盖的分散场景,都有机会成为可服务的市场。

当然,一次实验中的「一天迭代」还不等于任意场景都能一天部署,但能够率先把新场景的适配周期和人力成本大幅压缩,那么自然,其商业价值将不可估量。

尾声:在基础模型之上

GPT-6 之后,具身智能公司该何去何从?

行业里有这样一种观点,我们深以为然。仅在语义基座上做微调改造得到的具身模型,容易遭遇 GPT-6 的降维冲击。

GPT-6 Astra 告诉我们,当模型的通用能力足够强,许多看似需要专门设计的功能会被「涌现」出来。

基模解决了「理解」的问题,但从理解到持续稳定地执行,中间还有一层系统级的能力需要构建。我们认为,这正是具身智能公司不可替代的价值之一。

  • 第一,经验的结构化管理与复用。 GPT-6 可以理解一个任务,但它不管理这个任务在多轮执行中积累的经验。
  • 第二,行为边界与安全约束。 机器人在物理世界中操作,错误的代价远高于软件世界。本质上,我们需要一个 Agent 的行为约束框架,让自进化在可控的范围内发生。
  • 第三,部署后的持续迭代能力。 真实世界的场景永远在变。新物体、新布局、新的失败模式会不断出现。能够在部署之后继续从真实执行中学习、积累、改进的系统,才是长期竞争力的来源。

而穹彻证明了,一套设计得当的自进化框架,可以让机器人在部署之后持续沉淀经验,持续进化。 当模型层的 RSI 和系统层的 RSI 最终合流,具身智能有望进入一个新的阶段:机器人不仅能完成人类教给它的任务,还能从每一次真实执行中发现人类尚未构建的解决方案。

对具身智能公司而言,下一阶段的机会,是把不断增长的模型能力,变成用户在真实世界中用得起来、用得长久的机器人能力。在这一方面,穹彻智能还将探索 RoboRSI 和不久前发布的 Noe-0 世界动作模型 协同,突破机器人能力边界、走向真实应用。

强大的基础模型已经到来,具身智能行业需要改变与破局的关键节点也已迫在眉睫。

「Welcome to the AGI era.」

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
卫健委已将左氧氟沙星列为重点监控药物!提醒:服用千万注意

卫健委已将左氧氟沙星列为重点监控药物!提醒:服用千万注意

任医生聊健康
2026-09-22 10:40:16
中央严令规范国企:防止5%中高层拿走80%工资总额

中央严令规范国企:防止5%中高层拿走80%工资总额

职场资深秘书
2026-09-22 08:57:20
有些地方的手越伸越长,都管到老百姓家里了,还有人叫好?

有些地方的手越伸越长,都管到老百姓家里了,还有人叫好?

走读新生
2026-09-21 10:40:17
再见了敬一丹,再见了董卿,再见了朱军,中国主持界迎来全新时代

再见了敬一丹,再见了董卿,再见了朱军,中国主持界迎来全新时代

皮皮电影
2026-09-21 17:30:22
揭幕战倒计时!CCTV5直播全新国足首秀,对手排名世界第172,邵佳一或启用新人

揭幕战倒计时!CCTV5直播全新国足首秀,对手排名世界第172,邵佳一或启用新人

篮球圈里的那些事
2026-09-22 18:20:00
国乒女团1-4决赛对手出炉:3-2大逆转,难度不大!日本女团遇硬仗

国乒女团1-4决赛对手出炉:3-2大逆转,难度不大!日本女团遇硬仗

郭錉包工头
2026-09-22 12:37:45
印度3-0击败日本,率先晋级羽毛球男子团体半决赛

印度3-0击败日本,率先晋级羽毛球男子团体半决赛

懂球帝
2026-09-22 17:22:07
骇人听闻的推测:中美日可能都暗自期待着一场中日大战

骇人听闻的推测:中美日可能都暗自期待着一场中日大战

孝沛与世界
2026-09-19 20:11:18
挖槽!作死!作死啊!拒绝5年2亿大合同!毁掉东部最强常规赛球队

挖槽!作死!作死啊!拒绝5年2亿大合同!毁掉东部最强常规赛球队

技巧君侃球
2026-09-22 18:50:07
果然还是网友更懂资本市场!同一趟火车,买到上饶无票,买到上海却卧铺充足!网友吐槽:只有长途票没有卖完,才会放开短途票额

果然还是网友更懂资本市场!同一趟火车,买到上饶无票,买到上海却卧铺充足!网友吐槽:只有长途票没有卖完,才会放开短途票额

火山詩话
2026-09-21 13:31:40
13分钟完胜!张本智和赛后又一次嚣张喊话:要让日本国歌多次响起

13分钟完胜!张本智和赛后又一次嚣张喊话:要让日本国歌多次响起

娱圈办事处
2026-09-22 18:54:02
伊朗战场越打越清楚,法国老牌媒体终于认了:中国真正的杀手锏压根不是导弹,而是这盘大布局?

伊朗战场越打越清楚,法国老牌媒体终于认了:中国真正的杀手锏压根不是导弹,而是这盘大布局?

回京历史梦
2026-09-22 10:35:42
亚运爆出大冷门,国乒首败诞生,世界第一1-3落败,孙颖莎出战

亚运爆出大冷门,国乒首败诞生,世界第一1-3落败,孙颖莎出战

军情观察家
2026-09-21 19:44:23
博主:奥运冠军张家齐总收入超150万元,本人不清楚资金去向

博主:奥运冠军张家齐总收入超150万元,本人不清楚资金去向

懂球帝
2026-09-22 16:17:40
敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

敬一丹曾爆料:主持揭露东莞特殊服务节目时,她与导演发生争执

言过于诚
2026-09-21 10:04:14
人生四大天规、七大天律,看完醍醐灌顶!原来我们一直都活反了

人生四大天规、七大天律,看完醍醐灌顶!原来我们一直都活反了

风起见你
2026-09-10 01:15:53
足疗店的“特殊服务”藏不住了:店里没技师,客户来了,却能“随叫随到”,叫声还很大

足疗店的“特殊服务”藏不住了:店里没技师,客户来了,却能“随叫随到”,叫声还很大

汉史趣闻
2026-09-22 16:55:33
国家一级女演员陈丽云被逮捕!

国家一级女演员陈丽云被逮捕!

许三岁
2026-03-28 09:24:30
儿子去取母亲100万遗产,银行:需本人到场,儿子:你什么意思?

儿子去取母亲100万遗产,银行:需本人到场,儿子:你什么意思?

牛魔王与芭蕉扇
2025-04-03 11:06:16
刘銮雄半山豪宅被蓄意曝光!游泳女教练不讲武德,以后难进富豪圈

刘銮雄半山豪宅被蓄意曝光!游泳女教练不讲武德,以后难进富豪圈

揽星河的笔记
2026-09-21 13:05:12
2026-09-22 19:55:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14051文章数 142737关注度
往期回顾 全部

科技要闻

Meta智能体爆火!亚马逊却把门关了

头条要闻

网友质疑成雅高速要价太高:撞坏1个防撞桶要赔500元

头条要闻

网友质疑成雅高速要价太高:撞坏1个防撞桶要赔500元

体育要闻

跟着华裔天才重仓AI,勇士旧将成资本大佬

娱乐要闻

曝王玉雯杨玏结婚又离婚

财经要闻

关于中国太空算力的来龙去脉,这篇文章讲透了

汽车要闻

拥抱中国技术与产业链 本田在华开启全新战略

态度原创

教育
健康
亲子
家居
军事航空

教育要闻

初中压轴题,一不小心就错了

青春痘,究竟是怎么冒出来的?

亲子要闻

最佳治疗期6岁前,孤独症干预康复指南公布

家居要闻

2026建博会(广州) 公装联探展交流活动

军事要闻

特朗普被指下令空袭胡塞武装后变卦 最后一刻叫停

无障碍浏览 进入关怀版