网易首页 > 网易号 > 正文 申请入驻

用GPT-6 Astra就能直接控制机器人?可具身真机没那么简单

0
分享至

编辑|冷猫

谁也没想到, AGI 随着 GPT-6 的到来竟然来得这么快。

GPT-6 Astra 的强大的基础通用模型能力有目共睹,大模型的 RSI 竟恐怖如斯。

几家欢喜几家愁。在此之前,谁也没有想到,这个基础模型能够在具身智能领域掀起一场巨大的浪潮。

就在 GPT-6 Astra 发布后的第二天,Robocurve 将它直接接入机器人执行任务,并惊奇的发现 GPT-6 Astra 在控制机器人方面强悍的夸张,Token 消耗也低的夸张。



GPT-6 Astra 在一项机器人控制任务中的成功率达到 95%,高于 Fable 5.1 的 40%;与此同时,输出 Token 用量仅为后者的约 1/6.2,成本约为后者的 1/2.3。

于是这一切开始一发不可收拾,用 GPT-6 基模控制机器人执行复杂操作的案例似雨后春笋。



好了好了,这下好了。我在具身智能领域很焦虑。



通用人工智能模型将接管具身智能领域的讨论越来越多,甚至大有「GPT-6 横扫具身」,具身智能将成为「这类模型的一个子领域」的趋势。

有知名具身智能企业的创始人表示,今天的具身智能还没有真正的护城河,通用模型公司在人才、算力和资金上占优,「未来一两年将是关键窗口」。Robocurve 提到,如果这一趋势持续,大语言模型最早可能在今年年底、最晚在 2029 年实现对机械臂的实时控制。

不过,亮眼的单项成绩,并不意味着基模已经能够在真实环境中安全、稳定地控制机器人。RoboDojo 团队在官方评测中指出,「Astra 在真机测试中反复发出物理上不合理或不安全的动作,部分事故甚至造成了硬件损坏。」出于安全考虑,团队提前停止测试,因此 Astra 未能完成原定包含 18 项任务的 RoboDojo-Real 评测。

这也提醒我们:基模能力的突破只是起点。如何约束动作、处理失败,让机器人安全、稳定地持续工作,仍是系统层面必须解决的问题。

基模在变强,但通用是一把双刃剑。正如打造智能体需要在基模之上构建 Harness 一样,具身智能上缺少的,是一套让经验积累、让能力持续生长的系统。我们发现了这样一个研究工作:

近日,穹彻智能发布 RoboRSI ,一个面向真实复杂场景的机器人多智能体自进化框架。


视频地址:https://mp.weixin.qq.com/s/5S53vy6KXPEp2DzyQ-eAlQ


穹彻智能试图回答的正是这个问题:当基础模型已经具备强大的理解和推理能力后,如何在系统层面构建起持续执行、诊断、修订和复用的完整闭环。



  • 技术博客:https://lab.noematrix.ai/blog/2-roborsi/
  • GitHub:https://github.com/nssmd/RoboRSI

多智能体自进化:为具身智能打造的 Harness

单次成功和长期稳定运行之间,隔着一整套系统级的能力。

两个核心难题:

第一,谁来处理执行过程中的各种异常? 机器人报错停止、抓取失败、位置偏移之后,需要结果检查、异常恢复、进行安全决策。这些工作过去全靠工程师手动跟进。大模型可以理解任务目标,但它不能负责现场恢复,不判断执行是否成功,也不决定下一步从哪个节点继续。

第二,历史经验如何真正实现沉淀复用? 如果每次都让 Agent 参考过去的完整执行记录,Token 消耗会持续增长,反而让模型难以聚焦。如果每次碰到局部失败就重写整套流程,系统也很难收敛。研究团队观察到一个关键现象:Coding 模型擅长处理局部细节,但在反复修改中容易偏离全局目标。缺少结构性约束的迭代,往往越改越乱。

Context 管理是新时代的代码管理。 过去,机器人系统的核心挑战是写出正确的控制代码。在 Agent 时代,代码可以由模型生成和迭代,真正的瓶颈转移到了如何管理 Agent 在持续运行中产生的海量上下文:轨迹、日志、视频、代码版本、失败记录。管理不当,系统就会在迭代中走向混乱。

穹彻智能的设计哲学由此展开,可以概括为一句话:给人和 Agent 各自提供合适的接口。

对人,提供「高层引导」(Human-Friendly Steering):无需深入底层实现,专注于目标设定、专业判断和安全边界,将日常执行交给多智能体。

对 Agent,提供「清晰结构」(Agent-Friendly Structure):通过层级化技能树,明确修改范围、成功标准和失败反馈路径,让局部修订始终围绕全局目标展开。

所以,不管基模能力再强大,也需要一个系统级的 Harness 框架,使其能够适应具身智能的需求。RoboRSI ,正是围绕这两个问题构建的具身智能版的 Harness。



四个角色,一个闭环

具身的上下文可不是那么好管理的。

机器人的执行过程包含大量图像、轨迹、工具调用和失败细节,如果全部堆在一个上下文里,模型很快就会在信息膨胀和错误归因中失去方向。为此,多智能体是一个很好的解决方案。

RoboRSI 的做法是把规划、执行、诊断和修订拆分到不同的上下文中,采用 Manager、Planner、Engineer、Reviewer 四类智能体协作的架构



  • Manager 是整个系统的调度中枢,负责任务队列管理、并发 worker 调度、断点恢复和技能版本管理。它把用户输入的高层目标分解成可执行的任务序列。
  • Planner 根据当前环境观察和已有技能库,生成具体的执行计划。它做的事情接近于「我看到了什么、手里有什么工具、所以这一步应该怎么做」。
  • Engineer 是真正动手的角色。它调用机器人 的底层工具(感知、导航、抓取、放置等),执行动作并生成候选能力。
  • Reviewer 在执行完成后登场,根据执行结果(日志、视频、轨迹)复盘问题、定位失败原因,并把修订建议返回给 Manager,推动下一轮迭代。

这四个角色围绕同一个任务和同一份执行证据接力运行,形成一个完整的「执行→诊断→修订→再执行」闭环。 关键在于,人类仍然保留着对目标、价值判断和安全边界的控制权。在真机上,人负责安全监管和方向调整;在仿真中,系统可以自动完成更多的复位和判定。

工程师的角色因此发生了根本转变:从逐行编写任务代码、跟进每一次底层执行,转向设定目标、审核结果和提供方向性指导。

TSR:给 Agent 一棵「技能树」

让机器人持续迭代,并不只是让 Agent 一遍遍尝试。最重要的是把尝试后的结果与经验沉淀下来。

穹彻智能为此提出了 TSR(Top-down Skill Refinement,自顶向下技能细化) 机制。它用一棵四层的技能树来组织机器人的全部能力:

  • 任务族(Task Family) :定义总体目标与约束,比如「家庭地面清理」。
  • 复合技能(Compound Skill) :组合多步能力,比如「搜索目标→移动→抓取→放置」。
  • 原子任务(Atomic Task) :边界明确、结果可验证的最小任务单元,比如「抓取地面上的黄色包装袋」。
  • 基础技能(Base Skill) :与机器人直接交互的底层能力,包括视觉感知、移动控制、抓取、放置等。

为什么需要这样一棵树?这棵技能树的作用,是为 Coding Agent 提供结构性约束。每次修改都被限制在清晰的技能边界内,Agent 可以专注于局部实现和修订,但不会因为连续调试而偏离全局任务目标。

历史经验由此从对话记录和日志,变成了下一轮真正可调用的能力。

从「探索」到「复用」

在早期探索阶段,Agent 需要逐步观察环境、选择工具、执行动作,每一步都需要模型推理。但当某条执行路径被反复验证为稳定后,继续让 Agent 逐步调用每一个工具就成了浪费。

穹彻智能设计了一个三阶段的演进机制:从成功的调用链中提取稳定结构,把物体类别、目标区域和空间关系参数化,然后将可复用流程固化为代码技能。当类似任务再次出现时,Agent 只需选择、监控和必要时修订整条技能,重复的工具调用步骤则由代码承担。



在 LIBERO 基准测试的实验中,启用代码固化(Code-on)相比未启用(Code-off)版本,回合通过率从 21.5% 提升到 29.0%,中位 Token 消耗下降 29.4%,中位 VLM 调用次数下降 27.2%,中位执行时间下降 17.0%。

Agent 的推理资源,只留给真正变化和不确定的部分。

实验验证:零样本适配与扰动鲁棒性

在仿真环境中,穹彻智能进行了更系统的定量验证。



零样本任务适配。 在没有现成任务代码的情况下,系统从基础技能开始迭代。经过约一天的并行执行,LIBERO 基准上的累计任务通过率从 32/120 提升到 95/120;RoboTwin 从初始的 9/50 提升至 36/50。与仅使用 Engineer 单角色的基线相比,完整的多智能体配置(Planner + Engineer + Reviewer)在 RoboTwin 上将通过率提升了 4 倍



代码固化效果。 在 LIBERO 的 120 个任务、5 组初始布局、共 600 个 episode 实验中,启用代码固化(Code-on)相比未启用版本(Code-off):回合通过率从 21.5% 提升到 29.0%;中位 Token 消耗下降 29.4%;中位 VLM 调用次数下降 27.2%;中位执行时间下降 17.0%



扰动鲁棒性。 在 LIBERO-Plus 的 840 个扰动实例中(涵盖视觉纹理、相机视角、语言指令、光照条件、物体布局、机器人初始状态、传感器噪声七个维度),RoboRSI 通过自适应修订将通过率从 31.1% 提升至 47.4%,额外恢复了 137 个原本失败的实例。



解锁全场景的商业潜力

让我们回到文章开头的真机演示的视频里。

以同类任务为参照:2024 年,完成一个类似的家庭地面清理 Demo,需要两名工程师连续投入约一个月,编写约 2,000 至 3,000 行任务代码。而在 RoboRSI 的框架下,同样级别的能力构建在一天内就走完了一个完整闭环

显而易见,在优秀的基模上,配合运行良好的系统框架,新场景的适配成本会被大幅压缩。

穹彻智能用 RoboRSI 给了我们一个解法。系统能够自主完成任务拆解、技能实现、执行诊断和代码修订的闭环,那么适配一个新场景的核心成本就从「工程师驻场数周」变成了「设定目标 + 系统自主迭代 + 人工审核和安全把关」。

这种变化也为家庭等高度个性化的场景打开了新的商业空间。

每个家庭的户型、家具布局和物品摆放都不同,如果每次部署都需要工程师驻场数周,服务成本就很难支撑大规模推广。穹彻智能打造的 RoboRSI 这类基于智能体的机器人系统提供了一种可能:在通用能力的基础上,通过现场反馈自主迭代,逐步学会适合这个家庭的清理路径和操作技能。家具移动、物品更换后,也有机会沿用同一套机制完成适配,减少重新开发的工作。

类似的需求也存在于布局各异的门店、办公室和小型仓储空间。缩短适配周期,意味着过去因定制成本过高而难以覆盖的分散场景,都有机会成为可服务的市场。

当然,一次实验中的「一天迭代」还不等于任意场景都能一天部署,但能够率先把新场景的适配周期和人力成本大幅压缩,那么自然,其商业价值将不可估量。

尾声:在基础模型之上

GPT-6 之后,具身智能公司该何去何从?

行业里有这样一种观点,我们深以为然。仅在语义基座上做微调改造得到的具身模型,容易遭遇 GPT-6 的降维冲击。

GPT-6 Astra 告诉我们,当模型的通用能力足够强,许多看似需要专门设计的功能会被「涌现」出来。

基模解决了「理解」的问题,但从理解到持续稳定地执行,中间还有一层系统级的能力需要构建。我们认为,这正是具身智能公司不可替代的价值之一。

  • 第一,经验的结构化管理与复用。 GPT-6 可以理解一个任务,但它不管理这个任务在多轮执行中积累的经验。
  • 第二,行为边界与安全约束。 机器人在物理世界中操作,错误的代价远高于软件世界。本质上,我们需要一个 Agent 的行为约束框架,让自进化在可控的范围内发生。
  • 第三,部署后的持续迭代能力。 真实世界的场景永远在变。新物体、新布局、新的失败模式会不断出现。能够在部署之后继续从真实执行中学习、积累、改进的系统,才是长期竞争力的来源。

而穹彻证明了,一套设计得当的自进化框架,可以让机器人在部署之后持续沉淀经验,持续进化。 当模型层的 RSI 和系统层的 RSI 最终合流,具身智能有望进入一个新的阶段:机器人不仅能完成人类教给它的任务,还能从每一次真实执行中发现人类尚未构建的解决方案。

对具身智能公司而言,下一阶段的机会,是把不断增长的模型能力,变成用户在真实世界中用得起来、用得长久的机器人能力。在这一方面,穹彻智能还将探索 RoboRSI 和不久前发布的 Noe-0 世界动作模型 协同,突破机器人能力边界、走向真实应用。

强大的基础模型已经到来,具身智能行业需要改变与破局的关键节点也已迫在眉睫。

「Welcome to the AGI era.」

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
广西24岁男子驾车连撞9辆电动车致2死6伤!警方通报排除酒驾毒驾

广西24岁男子驾车连撞9辆电动车致2死6伤!警方通报排除酒驾毒驾

听心堂
2026-09-22 11:22:21
日本8金,韩国5金,22日亚运金牌差距大得离谱,中国最让人意外!

日本8金,韩国5金,22日亚运金牌差距大得离谱,中国最让人意外!

无心小姐姐
2026-09-23 12:51:39
毛主席两次为刘胡兰题词,却拒绝给董存瑞题词,主席坦言:我写不合适

毛主席两次为刘胡兰题词,却拒绝给董存瑞题词,主席坦言:我写不合适

舆图看世界
2026-09-21 11:40:04
我国首批航天员已全部停航停训,背后释放的信号不简单

我国首批航天员已全部停航停训,背后释放的信号不简单

军武咖
2026-09-23 00:14:57
房价上涨前夜:各路资本疯狂围猎中国房地产

房价上涨前夜:各路资本疯狂围猎中国房地产

专业聊房君
2026-09-21 19:37:55
逆天发挥!韩国泳将同一天两破亚运纪录,21,秒,66,拿下金牌

逆天发挥!韩国泳将同一天两破亚运纪录,21,秒,66,拿下金牌

无月可归辛
2026-09-23 01:40:37
西贝迎来舆论“最强”声援!网友:声讨西贝很容易,20000名打工人的饭碗谁来担?

西贝迎来舆论“最强”声援!网友:声讨西贝很容易,20000名打工人的饭碗谁来担?

火山詩话
2026-09-23 05:34:43
CCTV5直播!国足对阵“归化军团”,王钰栋力争破进球荒,目标=夺小组第一

CCTV5直播!国足对阵“归化军团”,王钰栋力争破进球荒,目标=夺小组第一

篮球圈里的那些事
2026-09-22 18:00:32
国内将逐渐停止“肠息肉手术”?做完人就废了?医生讲出实情

国内将逐渐停止“肠息肉手术”?做完人就废了?医生讲出实情

健康科普365
2026-09-20 14:45:08
吃大补的东西身体会有什么反应?

吃大补的东西身体会有什么反应?

康富贵碎碎念
2026-09-22 11:48:26
马克龙:哈马斯从未在约旦河西岸活动,以方怒斥后法方澄清

马克龙:哈马斯从未在约旦河西岸活动,以方怒斥后法方澄清

桂系007
2026-09-23 09:05:13
北京一男子花500万买下法拍房,装修时发现屋里藏了10亿现金

北京一男子花500万买下法拍房,装修时发现屋里藏了10亿现金

牛魔王与芭蕉扇
2025-02-28 10:32:53
重磅:乌克兰摧毁赫尔松的俄安全局总部!同时打击四支部队

重磅:乌克兰摧毁赫尔松的俄安全局总部!同时打击四支部队

项鹏飞
2026-09-22 20:02:40
2015年,方静客死他乡,11年后,那个诬陷她是间谍的主持人已荣休

2015年,方静客死他乡,11年后,那个诬陷她是间谍的主持人已荣休

小先生笔记
2026-09-21 17:37:33
亚运会乒乓球:一轮游!神秘之师朝鲜2:3张本美和,混双全军覆没

亚运会乒乓球:一轮游!神秘之师朝鲜2:3张本美和,混双全军覆没

国乒二三事
2026-09-23 10:32:18
727亿砸出出海的平陆运河,刚开门就遇难题:大批货还是直奔广东

727亿砸出出海的平陆运河,刚开门就遇难题:大批货还是直奔广东

小蜜情感说
2026-09-23 02:10:01
2026事业单位档案倒查来了,这次彻底动真格!

2026事业单位档案倒查来了,这次彻底动真格!

职场资深秘书
2026-09-23 12:16:29
A股:没必要等跌破3900点了,今明两天起,股市或将迎来关键拐点

A股:没必要等跌破3900点了,今明两天起,股市或将迎来关键拐点

财经大拿
2026-09-23 06:05:11
36岁朴信惠二胎产女,结婚四年终于儿女双全,李敏镐IU到场送祝福

36岁朴信惠二胎产女,结婚四年终于儿女双全,李敏镐IU到场送祝福

白面书誏
2026-09-22 13:12:52
我特别喜欢我公公,我嫁过来20年了一直喜欢,他跟别的老人不一样

我特别喜欢我公公,我嫁过来20年了一直喜欢,他跟别的老人不一样

千秋文化
2026-06-27 20:15:54
2026-09-23 14:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14055文章数 142737关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

女子酒后被送入酒店房间 深夜赤足跑出房间从7楼坠亡

头条要闻

女子酒后被送入酒店房间 深夜赤足跑出房间从7楼坠亡

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

梅启明被彻底除名遗产清零

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

艺术
本地
房产
手机
公开课

艺术要闻

五粮液新经济中心工地实景,新川第一高楼为何被“限低”?

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

手机要闻

高通展示第六代骁龙8超级至尊版ANF游戏渲染能力:覆盖《异环》《崩坏:星穹铁道》等

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版