网易首页 > 网易号 > 正文 申请入驻

看一遍就会,三星&上交提出RoboICL新方法,GPT-6 Astra多项机器人操控评测全面领先

0
分享至



机器人学习通常意味着收集数据、训练策略、再部署模型。RoboICL 走了另一条路线:冻结 GPT-6 Astra,不训练任务专用 VLA,只在推理时向模型提供少量示范,并持续保留机器人刚刚执行过什么、环境发生了什么。当前项目页给出了 30 项 RoboDojo 任务的完整结果入口,以及 929 条可播放、可逐布局核查的三视角执行记录。



  • 论文:RoboICL: Embodied In-Context Learning with GPT-6 Astra
  • arXiv:https://arxiv.org/abs/2609.34261
  • 项目主页:https://mosi-ai.github.io/RoboICL-GPT6-Astra.github.io/
  • 代码:https://github.com/Mosi-AI/RoboICL

如果不训练模型参数,只给机器人看一段同任务示范,它能否学会精密插入、长程双臂协作和依赖初始状态的操作?

这正是 RoboICL 想回答的问题。

通用视觉语言模型已经能识别物体、理解自然语言指令,并在开放式操作中展现出很强的推理能力。但机器人控制不只要求 “知道该做什么”,还要求模型把意图转换成连续动作,并根据接触、抓取失败和环境变化不断修正。一次看似合理的抓取可能没有夹住物体,一段轨迹可能被控制器提前中断,长程任务后半段还可能需要重新查看最初的目标状态。

RoboICL 的核心思路很直接:把示范和机器人自己的执行历史都组织为模型能够读取的具身上下文,让冻结的 GPT-6 Astra 在每次决策时参考这些经验,直接输出下一段双臂动作。

30 项任务:Open 零样本,其余类别只用一段示范

RoboICL 在 RoboDojo 的 30 项双臂操作任务上进行评测。任务分为 Open、Memory、Precision 和 Long-Horizon 四类:Open 任务没有可用的任务专属训练示范,因此采用零样本;其余三类统一采用一段示范。



其中 RoboProbe https://robodojo-benchmark.com/report-gpt-6-astra-eval 就是 robodojo 官方团队做的一个 GPT-6 Astra zero-shot 结果。PhysicalRSI、Simate-beta 和 VPP2-Preview 是最新的榜单前三名。

在当前项目页纳入的对比方法中,RoboICL 的 30-task Overall 为 50.64,高于更新后最强对比方法 PhysicalRSI 的 39.56。与官方零样本 GPT-6 Astra 控制器 RoboProbe 相比,RoboICL 在四类任务中分别提高约 20—27 个 progress-score points:



这里的 progress score 是 RoboDojo 原生评分器给出的阶段性任务得分,范围为 0—100。它能区分 “完全没有进展”“完成了若干子目标” 和 “完整成功”,因此不能直接等同于任务成功率。论文中的 Overall 是 30 个任务均值的非加权平均。

Open 类结果尤其值得关注。这里没有专家示范,RoboICL 只能依靠任务描述、当前视觉状态和机器人在本次 episode 中积累的交互记忆。其 54.75 分说明,如何保存和组织在线经验,本身就能明显改变同一个冻结模型的控制能力。

不只公开均值:929 条执行记录可以逐布局查看

机器人论文常用一张表汇总结果,但均值无法回答很多关键问题:模型是从一开始就做错了,还是在接触阶段失败?它有没有识别出错误并重新抓取?得分为 0 的轨迹是否完全没有动作能力?

为此,项目页公开了当前 30 项任务的 929 条可播放记录,覆盖全部 30 个任务。其中 880 条属于完整评测计划,另有 49 条标为 partial evaluation 的参考轨迹。后者用于透明展示已经执行的记录,主榜单仍按当前正式评测口径计算。



网页中可以先选任务大类,再选 task 和 layout,在同一个面板内查看:

  • 左腕、头部和右腕三个同步视角;
  • 该布局的 official score、结果状态和评测协议;
  • 与视频进度对齐的 GPT-6 Astra 执行说明;
  • 播放、暂停、回到开头和 0.5×—4× 倍速控制。

RoboICL 做了什么:让 TRAIN 和 LIVE 使用同一种交互语法

RoboICL 不训练新的机器人基础模型,也不让另一个 VLA 先生成动作提议。系统中的学习组件是冻结的 GPT-6 Astra,外部控制框架负责准备上下文、校验动作格式、执行逆运动学和返回控制器反馈。



模型看到的经验分为两部分:

  • Demonstration context(示范上下文):来自同任务的已记录轨迹,在一个 episode 内保持不变。
  • Interaction memory(交互记忆):来自机器人当前 rollout,随着动作执行不断更新。

两类经验使用同一种 “观察 → 动作 → 执行回执 → 结果观察” 语法。示范中的回执描述记录下来的专家动作区间;在线回执则告诉模型,刚才提出的动作实际执行了多少、哪些后缀没有执行、是否发生控制器中断,以及执行后的新观测。

这个设计解决了一个常被忽略的问题:模型提出的动作,不等于机器人真实完成的动作。如果只保存模型原先的计划,后续决策可能建立在错误状态上;加入 execution receipt 后,模型能够把动作和实际后果对应起来。

在 RoboDojo 中,每次观察由左腕、头部和右腕三张 640×480 RGB 图像横向拼成一张 1920×480 triptych,同时提供机器人本体状态。GPT-6 Astra 通过一个受约束的 Act 接口输出 H × 14 的动作矩阵,描述双臂逐步的笛卡尔增量与夹爪目标。

长任务不能只记最近几步

如果完整保存所有历史图像,请求会随着 episode 变长,很快超过多模态上下文预算;如果只保留最近几步,模型又会遗忘任务初始状态和早期关键操作。

RoboICL 使用 bounded anchored memory:固定保留最初的交互,在整个任务时间轴上设置若干锚点,同时保留最近完成的一次交互。两个被保留片段之间如果省略了内容,系统会插入明确的

,避免模型误以为两帧是连续发生的。

示范也不会被整条塞入上下文,而是从轨迹不同阶段抽取不重叠的动作块。这样,模型能同时看到任务早期、中期和末期的程序性信息。

论文对这部分做了两组对照。单示范设置固定总预算 J + B = 24,其中 J 是示范块数量,B 是交互记忆槽位。四种分配 (8, 16)、(12, 12)、(16, 8)、(22, 2) 的四任务均分分别为 57.50、80.25、80.00、60.75。示范塞得最密、只留下两个在线记忆槽时,表现反而明显下降。主实验因此采用平衡的 J = B = 12。

在相同的一示范配置下,锚点记忆得到 80.25,只保留第一段加最近历史的方案得到 73.50。差异主要来自 Build Tower、Put Bottles into Dustbin 和 Insert Tubes,说明长程任务既需要最新反馈,也需要早期视觉证据。

Deposit Coin:从反复掉落到毫米级插入

Deposit Coin 要求机器人抓起一枚薄硬币,对准存钱罐上的狭窄投币口,完成插入后还要让双臂回到原位。在当前 50-layout 结果中,RoboICL 平均得分为 78.00,其中 37 条轨迹得到满分;当前项目页上的次高方法 PhysicalRSI 为 62.27。



公开的 layout 0 轨迹展示了模型如何利用最新腕部视角修正操作。此前几次夹取没有稳定保留硬币,模型改变了覆盖位置和抓取高度;在 step 205,它从右腕画面判断投币口位于硬币右侧,先做横向移动和偏航角修正。随后几轮继续校准前后与左右偏差,在 step 225 松开夹爪,step 230 确认硬币已离开夹爪并进入槽内,最终 official score 为 100。

这一案例并不是 “照着示范重放”。示范提供的是任务过程和动作先验,当前观察与交互记忆则负责处理本次布局中的抓取失败、物体偏移和插入误差。

与 GPT-as-Policy 的十任务对照:只用 GPT-6 Astra 接近混合系统

论文还保留了一组独立的十任务比较,每个任务请求五个布局。该面板用于和 GPT-as-Policy 的公开结果对照,评测规模与 30-task 主榜单不同,因此两者不能混为同一次实验。



RoboICL 的一示范结果比 Direct 高 22.10 分,与 π₀.₅ + GPT-6 Astra 混合方案相差 2.00 分。区别在于,RoboICL 没有使用学习到的 VLA 动作提议,动作由 GPT-6 Astra 通过单一接口直接生成。

Build Tower 能直观体现示范的作用:在这个五布局面板中,RoboICL 从零样本的 16 提升到一示范的 100。扩大到 50 个布局后,当前主榜单中的一示范均分为 80.60,说明小面板结果不能代替更宽布局的评测,但提升并不只出现在单个示例上。

从仿真到真实机械臂:三段示范平均达到 78.89

研究还在 Franka Research 3 单臂机器人上测试 Peg in Hole、Folding Towel 和 Building Bridge。每个任务使用 GELLO 采集三条人类示范,观测来自腕部 D405 与外部 D515 相机;零样本、一示范和三示范条件各进行五次随机化试验。



三个真实机器人任务的平均 progress score 从零样本的 14.45 提升到一示范的 63.33,三示范进一步达到 78.89。三个任务都呈现 0-shot < 1-shot < 3-shot 的趋势。Peg in Hole 的三示范条件中有 2/5 次完成插入;Building Bridge 从一示范到三示范又提高 26.67 分。

论文还测试了毛巾折叠的实例外泛化。三示范模型在已见毛巾上得 100,在一条未见毛巾上得 90,但换成更大的未见毛巾后下降到 40。这个结果一方面表明示范能把通用模型已有的折叠知识落到具体机器人与动作空间,另一方面也显示模型可能过度沿用示范中的运动尺度。

上下文很长,但大部分前缀可以复用

多模态具身上下文会带来推理成本。论文选择 Build Tower、Classify Objects 和 Put Bottles into Dustbin 的零样本 / 一示范配对,共 30 个 episode,统计了 token、模型调用、API 时间和端到端时间。

在 1810 次完成的模型请求中,输入 token 为 1.2251 亿,其中 1.1315 亿命中缓存,token 加权 KV-cache hit rate 为 92.4%。这来自请求结构的稳定性:任务指令、示范、相机标定和已经固定的锚点构成稳定前缀,只有最新交互及其附近的 gap 继续变化。

论文另在两个开发任务上测试可选的 Jev 动作复用门控。它不生成动作,只判断是否继续执行 GPT-6 Astra 已提出但尚未执行的动作后缀。Align Blocks 的 GPT-6 Astra 请求数从 181 降到 121,General Pickup 从 116 降到 60,即减少约 33% 和 48%。不过成功率影响依赖任务:General Pickup 从 4/5 提升到 5/5,Align Blocks 则从 3/5 降到 2/5。因此这部分被明确定位为开发集实验,而不是已经解决的通用加速方案。

这项工作说明了什么?

RoboICL 的结果支持一个具体判断:对具备视觉理解与数值动作生成能力的通用多模态模型,少量示范的价值不只在于给出 “正确答案”,更在于提供可执行的过程结构;而机器人自身的在线经验必须以动作和真实后果配对的形式保留下来。

它也有清晰的边界:

  • 仿真主结果使用 seed 0,不同方法的训练数据与评测协议并不完全相同;
  • progress score 衡量阶段性进展,不能当作完整成功率;
  • 真实机器人实验只有三个任务、每个设置五次试验;
  • 当前验证围绕 GPT-6 Astra 展开,跨模型、跨机器人形态的普适性仍需进一步实验。

但与只发布一个平均分相比,论文和项目页已经提供了更完整的证据链:30-task 类别结果说明覆盖面,十任务面板给出与直接控制和混合系统的对照,真实机器人实验检验跨 embodiment 的示范适应,929 条 Episodes 则让读者可以直接查看每个布局中机器人到底做了什么。

当演示和执行历史被组织为同一种 “观察 — 动作 — 回执 — 观察” 语言时,机器人无需等待下一轮参数更新,就能在上下文中利用少量经验调整行为。RoboICL 展示的不是一个新的机器人预训练模型,而是一种让现有通用模型在部署时继续学习的方法。

  • 项目主页:https://mosi-ai.github.io/RoboICL-GPT6-Astra.github.io/
  • 论文:https://arxiv.org/abs/2609.34261
  • 代码:https://github.com/Mosi-AI/RoboICL

作者信息

三位第一作者刘方程、沈叶青、程安达均为三星大模型研究员,分别毕业于北京大学、清华大学和中国科学院自动化研究所,曾为头部基础大模型厂商及一线大厂的核心团队成员,现聚焦ScalingLaw驱动的基础模型大规模训练,推动模型能力从数字世界延伸至物理世界。

通讯作者唐业辉博士,现任三星大模型负责人,系三星最年轻战略业务负责人,全面主导大模型训练。据公开信息,他组建并领导 AI MODEL TF,这是一支高实力“95后”基模团队,面向三星全球生态,负责从数字世界到物理世界的基础模型训练及核心技术研发。TF(Task Force)是三星面向公司级战略任务设立的核心攻坚组织,由三星集团 CTO 直接推动成立,聚焦关系公司未来核心竞争力的关键技术方向。他拥有非常亮眼的学术履历,他在GoogleScholar上的引用量逾1.4万次,长期担任NeurIPS、ICML、ICLR等AI顶会领域主席,多项技术被GoogleDeepMind、ByteDance等顶尖团队引用并用于模型训练,具有广泛的国际学术影响力。加入三星后,他依托超大规模集群,主导多个参数规模基础模型的大规模训练,支撑Galaxy旗舰手机、AI可穿戴设备及智能家居的智能体验,累计部署终端近亿台,推动前沿研究与产业实践深度融合。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
服务区闪充变慢充,不同品牌充电上限搞“双标”遭吐槽,“差别待遇”合理吗?节假日排队充电体验如何改善?

服务区闪充变慢充,不同品牌充电上限搞“双标”遭吐槽,“差别待遇”合理吗?节假日排队充电体验如何改善?

贵重物品爱美食
2026-10-04 15:31:27
樊艺文已任宝鸡市委常委、组织部部长

樊艺文已任宝鸡市委常委、组织部部长

黄河新闻网吕梁
2026-10-07 08:10:43
空姐被逼下跪风波迎来新进展,人民日报发声:服务不是无底线退让

空姐被逼下跪风波迎来新进展,人民日报发声:服务不是无底线退让

智慧生活笔记
2026-10-07 15:32:59
德国联邦情报局前局长因涉嫌间谍罪被捕,欧媒:德国情报机构的巨大耻辱

德国联邦情报局前局长因涉嫌间谍罪被捕,欧媒:德国情报机构的巨大耻辱

观察者网
2026-10-06 20:03:22
阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

阿里P8:人一旦失业,就会“扣扣搜搜”。家庭收入从去年140万降到今年50多万

蚂蚁大喇叭
2026-09-06 17:09:52
练了5年引体向上,今天才发现,9成的人大拇指都放错了位置

练了5年引体向上,今天才发现,9成的人大拇指都放错了位置

荷兰豆爱健康
2026-10-07 16:25:58
真不愧是“化痰冠军”,才喝2回,痰根拔掉,润喉又顺畅

真不愧是“化痰冠军”,才喝2回,痰根拔掉,润喉又顺畅

王二哥老搞笑
2026-10-01 20:43:05
浙江男篮揭幕战!超级后卫正式亮相,余嘉豪回归首秀,央视直播

浙江男篮揭幕战!超级后卫正式亮相,余嘉豪回归首秀,央视直播

体坛瞎白话
2026-10-07 17:03:26
贤妻和萧峰“深夜咏鹅”的后遗症!

贤妻和萧峰“深夜咏鹅”的后遗症!

八卦疯叔
2026-10-07 10:48:27
10月7日,真相逐渐浮出水面:就是055驱逐舰拉爆了美军驱逐舰!

10月7日,真相逐渐浮出水面:就是055驱逐舰拉爆了美军驱逐舰!

果妈聊娱乐
2026-10-07 16:12:28
2026国庆节黄金周,全国最堵的十大景区出炉:一眼望不到边的人头

2026国庆节黄金周,全国最堵的十大景区出炉:一眼望不到边的人头

小嵩
2026-10-03 13:53:55
中国每天一万人确诊癌症,医生忠告,想长寿,4种肉最好不吃

中国每天一万人确诊癌症,医生忠告,想长寿,4种肉最好不吃

九哥聊军事
2026-10-06 21:04:17
港股世茂集团尾盘涨超30%

港股世茂集团尾盘涨超30%

每日经济新闻
2026-10-07 15:49:09
央一将播!60集革命新剧来袭!接档《征途》,演员阵容强大

央一将播!60集革命新剧来袭!接档《征途》,演员阵容强大

趣味八卦
2026-10-07 16:44:31
谁是NBA新赛季得分王?官网列10大竞争者:东契奇领衔多位巨星

谁是NBA新赛季得分王?官网列10大竞争者:东契奇领衔多位巨星

罗说NBA
2026-10-07 18:29:19
洗澡和寿命挂钩?医生坦言:想要更长寿,洗澡时需要牢记“4不要”

洗澡和寿命挂钩?医生坦言:想要更长寿,洗澡时需要牢记“4不要”

熊猫医学社
2026-09-23 11:30:05
儿子问妈妈有多少存款?妈妈的回答堪称教科书,让人感动

儿子问妈妈有多少存款?妈妈的回答堪称教科书,让人感动

大熊欢乐坊
2026-10-07 00:08:54
55岁男子肌肉溶解离世,医生痛心提醒:长期吃降脂药犯3个错误

55岁男子肌肉溶解离世,医生痛心提醒:长期吃降脂药犯3个错误

垚垚分享健康
2026-10-07 18:42:53
江西小伙内蒙旅游误入蒙族婚宴,随礼2888,走前被新娘妹妹拦住

江西小伙内蒙旅游误入蒙族婚宴,随礼2888,走前被新娘妹妹拦住

故事秘栈
2025-06-21 18:56:16
贵州女子五天爬完五岳,白天爬山晚上赶路,每天走两三万步,当事人:全程花费不超过四千元,但不建议盲目跟风,大家量力而行

贵州女子五天爬完五岳,白天爬山晚上赶路,每天走两三万步,当事人:全程花费不超过四千元,但不建议盲目跟风,大家量力而行

台州交通广播
2026-10-06 19:20:14
2026-10-07 19:36:49
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14143文章数 142744关注度
往期回顾 全部

科技要闻

诺贝尔化学奖揭晓,两位科学家摘得大奖

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

头条要闻

男子带妻子和10岁娃爬山走野路 用手机照亮半夜没走出

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

蔡康永风波再升级!这次谁也救不了他

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

亲子
教育
手机
本地
公开课

亲子要闻

宝蓝和叔叔玩过家家扮演大人,叔叔藏起来吃零食不让宝蓝找到

教育要闻

这题做起来,错误率怎么这么高呢?

手机要闻

还得是苹果!iPhone Duo 强制 APP 适配,不适配直接下架,安卓办不到

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版