网易首页 > 网易号 > 正文 申请入驻

机器人进入“边做边学”时代:星尘发布在线强化学习框架,让动态投掷成功率提升超141%

0
分享至


作者 | 四月

静态演示走向动态部署,如何让机器人在真实世界持续学习?

当机器人从展厅展台走进产线,棘手的工程矛盾日益凸显:机器人的物理世界是连续、不可逆且具有物理惯性的,而驱动机器人的端侧推理却动辄耗时数百毫秒。

尽管业界普遍依赖“动作分块(Action Chunking)”机制,一次预测数十帧动作,但在有限的端侧算力下,模型依然追不上机械臂的高频节拍。面对不能泄力的高速动态操作,停顿就等于失败

工业上通用的妥协是“异步推理(Asynchronous Execution)”:机械臂不停,模型在后台错位计算下一批动作。但这套保住连续运动的机制,却同时破坏了在线强化学习赖以成立的因果基础,常常让机器混淆“计划过的”、“真正干过的”与“半路被覆盖的”的动作,导致算法在复盘更新时永远在“对错账”。

针对这一普遍制约具身模型在线微调的难题,星尘智能(Astribot)基座模型团队近日公布了其面向异步执行环境的在线强化学习框架——SmoothRL(Online Reinforcement Learning During Asynchronous Execution)

该框架的关键,在于让策略更新严格对应硬件的实际执行:剔除那些没来得及下发的预测指令,只把电机真正走过的轨迹拿来算账更新。


SmoothRL 整体框架:机器人在异步执行中持续产生真实数据,基础策略提供通用能力,在线 RL 会根据真实执行结果更新动作策略。

它在一定程度上攻克了强化学习在高速物理交互中的延迟失准问题。在极易因卡顿泄力的连续投掷任务中,通过 250 轮真机训练,任务成功率便从基础策略的 39% 跃升到了 94%。

投掷是衡量机器人物理动态控制能力的经典标尺。与简单的机械臂“抓取-放置”不同,投掷任务要求机械臂在空间划过一条连续加速的摆动曲线,并在毫秒级的临界窗口精准释放夹爪。


SmoothRL论文可见https://arxiv.org/abs/2608.29768,由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究

异步推理的“时差陷阱”

在具身大模型的真实部署中,异步推理已经成为一种工程常态:机械臂保持高频运动,模型在后台流水线式地计算下一段动作序列——手在执行动作 A,大脑已经在算动作 B

但这套保障机器人“不停机”的机制,却击穿了强化学习最根本的时序逻辑

传统的在线强化学习假定了一种极其规整的因果关系:模型算出一组动作,机械臂照单全收,算法再根据任务成败来复盘更新。但在异步流水线中,这种一对一的对应关系不复存在


- 当一段包含数十帧的动作分块(Action Chunk)刚刚算好,机械臂早就顺着上一轮的指令往前走了一大截;

- 而当前这段新指令还没执行完,后台算好的下一轮动作又已经下发,直接将后半段未执行的动作强行覆盖替换。

这就导致了一场严重的算法灾难:模型“计划过的”、机械臂“真正做过的”,以及中途“被覆盖扔掉的”动作彻底混在了一起。

如果强化学习依然把整段动作混为一谈去更新策略,就会出现荒唐的误判:那些因为时延来不及改的前置动作,或是压根没在物理世界发生过的被丢弃动作,都会因为任务最终侥幸成功而被莫名“奖励”,或者因为突发失误而无辜“背锅”。

算法对错了账,策略更新自然陷入剧烈震荡。

解法:剔除无效预测

星尘智能提出的 SmoothRL,核心逻辑极其务实:切断未执行动作的奖惩链路,只针对机械臂在现场真正执行过的动作进行优化。

在具体实现上,SmoothRL 将异步执行下的每一个动作分块(Action Chunk)划分为三个物理区域:

- 已提交区域(Committed): 在模型推理的这几百毫秒内,机器人必须保持运动而执行上一轮旧指令的区间。这属于无法更改的既成事实;

- 执行区域(Execution): 当前新指令生成后、且在下一轮计算结果抵达前,真正驱动了电机、与物理环境产生交互的动作切片;

- 丢弃区域(Discarded): 模型构想过、但尚未下发就被后续新指令覆写替换的无效预测。


SmoothRL 将异步 action chunk 划分为 Committed / Execution / Discarded 三个区域,并只让价值梯度通过真正执行的 Execution Region

在算法回传阶段,SmoothRL 建立了精准的掩码机制:严格只让策略与价值梯度穿过 Execution 区域。至于来不及改的 Committed 区域和未执行的 Discarded 区域,直接切断其更新链路。

为了让训练与部署环境完全一致,SmoothRL 确立了“在部署中强化(Reinforce in Deployment)”的原则——从训练开始,就让模型在真实的异步延迟与时钟节拍下运行,而不是在理想化的无延迟环境里微调。

在工程架构上,团队采用了更稳健的残差强化学习:

- 冻结大模型底座:采用针对特定任务微调后的π 0.5作为基础策略,提供宏观操作意图;

- 轻量残差网络调细节:在底层动作空间上构建轻量级 Actor-Critic 网络,专门预测微调修正量 ;

- 硬件节拍适配:以星尘 S1 机械臂为例,硬件以 30 Hz 频率执行动作,后台模型以 5 Hz 频率(200 ms 推理预算)生成一段 32 帧的动作分块。在这 200 ms 窗口内,真正驱动电机执行的 Execution 区域仅占 6 帧,其余 20 帧在执行前直接被下一轮预测覆盖。算法只拿这 6 帧真实轨迹进行算账更新

实战检验:把系统性失误收敛为微小扰动


这套机制在星尘智能 S1 绳驱本体上完成了三项极具代表性的真机测试,覆盖了两类典型工况:

动态投掷(39% →94%)


投掷不同于慢速放置,机械臂必须在摆动中持续积累加速度,并在临界点精准释放。一旦在动作衔接处出现哪怕数十毫秒的停顿,手臂速度就会瞬间跌落,失去抛射动量。在异步执行保障连续运动的前提下,SmoothRL 仅用 250 轮真机交互,就将成功率从 39% 提升至 94%。

给笔戴帽(8%→83%)

双臂协同对齐,容许公差仅在 5 mm 左右。基础大模型能够将笔带到笔帽附近,但缺乏微观调整能力。SmoothRL 通过现场试错,补齐了末端毫米级的自适应微调。

快递开箱(30% →90%)


机械臂需持 1 mm 宽的刀片刺入仅 2—3 mm 的箱盖接缝并切开胶带。基础策略由于视觉标定偏差存在固定的“向左偏”。真实探索并不总是一帆风顺:在 150 轮训练节点时,因物理缝隙边缘的接触阻抗探索,成功率一度从 30% 跌落至 20%,随后策略逐步收敛并克服局部卡顿,最终达到 90%。


三项真机任务随累计 rollout episodes 增加的成功率变化

比单纯成功率更有说服力的,是机器人的“错法”变了

微调前,机器人的失误多是致命的结构性偏差——投掷距离恒定无法自适应、开箱刀片永远向左偏。微调完成后,这些顽固偏差被彻底抹平,剩下的极少数失败样本,开箱偏差收敛在 1—2 mm 以内,戴帽也仅是孔位边缘的微小擦碰。


动态投掷中的 Velocity / Acceleration / Jerk 对比

这意味着在线 RL 并非在重新教机器人理解任务,而是在充当“肌肉记忆修正器”。同时,引入动作平滑约束后,机械臂末端的加速度均方根降低了 52%,加加速度(Jerk)降低了 47%——在成功率近倍增的同时,动作反而更加平顺,降低了机械磨损。

如果说,预训练大模型解决了机器人“会不会做”的广度问题,而在真实物理阻力与计算时延中,像 SmoothRL 这类剔除时差干扰、精准对齐执行轨迹的在线后训练机制,正在解决机器人在真实工业现场“能不能稳定做好”的深度问题

声明:本文为 AI 前线编译,不代表平台观点,也不构成投资建议,未经许可禁止转载。

会议推荐

QCon 全球软件开发大会·2026(上海站)现已正式启动。本届大会聚焦 Harness AI 时代的工程实践,从「构建 AI」到「驾驭 AI」,围绕 AI Native 架构、Agent Runtime、AI Infra、Agent 安全与可观测、Loop Engineering、具身智能与世界模型等热门技术方向,邀请全球技术社区与产业一线实践者,共同分享 AI Native 时代最具价值的工程经验。

今日荐文

你也「在看」吗?

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
委内瑞拉给了中国一个说法。 
委内瑞拉把650亿桶石油控制权交给美国后,终于给最大债主中国交底了

委内瑞拉给了中国一个说法。 委内瑞拉把650亿桶石油控制权交给美国后,终于给最大债主中国交底了

扶苏聊历史
2026-09-10 16:42:29
25死5伤!青岛货轮火灾搜救结束,本次事故至少有4个重要信息披露

25死5伤!青岛货轮火灾搜救结束,本次事故至少有4个重要信息披露

火山詩话
2026-09-10 20:24:19
长沙琴岛女团,到底在演什么?消费女性身体收割流量的低俗狂欢!

长沙琴岛女团,到底在演什么?消费女性身体收割流量的低俗狂欢!

天天热点见闻
2026-09-10 06:43:51
脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

脸都不要了!湖南洞口孩子买了50元学平险,结果真得癌了,谁料保险公司翻出国际疾病分类,说编码不对,不符合“恶性肿瘤-重度”条款

火山詩话
2026-09-10 10:40:36
别让刘翔带着“问号”离开

别让刘翔带着“问号”离开

齐鲁壹点
2026-09-10 18:09:09
又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

又曝出轨大瓜,男子自曝妻子出轨班长5个月,班长只给他妻子买过情趣内衣,还曝光俩人大尺度聊天内容

汉史趣闻
2026-09-10 18:28:47
不敌法国队,中国女篮无缘世界杯四强

不敌法国队,中国女篮无缘世界杯四强

界面新闻
2026-09-10 22:13:09
湖北小县城的工资已经开始崩塌

湖北小县城的工资已经开始崩塌

火锅局
2026-09-10 13:09:05
中国女篮输法国,看看媒体专家怎么说!杨毅:没有人想打大清篮球

中国女篮输法国,看看媒体专家怎么说!杨毅:没有人想打大清篮球

章民解说体育
2026-09-10 22:22:02
吴柳芳称直播带货销量不理想,账号超90%是男粉,但“他们不消费”

吴柳芳称直播带货销量不理想,账号超90%是男粉,但“他们不消费”

韩小娱
2026-09-10 09:05:17
这种“网红鞋”很伤脚,千万别天天穿!

这种“网红鞋”很伤脚,千万别天天穿!

环球网资讯
2026-09-10 10:26:10
美气象预报机构:2026-27年北半球秋冬期间 出现极强厄尔尼诺概率超90%

美气象预报机构:2026-27年北半球秋冬期间 出现极强厄尔尼诺概率超90%

财联社
2026-09-10 21:40:03
英格兰公开赛8强产生4席,吴宜泽爆大冷,丁俊晖周跃龙双龙合璧

英格兰公开赛8强产生4席,吴宜泽爆大冷,丁俊晖周跃龙双龙合璧

天涯远行人
2026-09-11 04:23:48
乌克兰特工曝光2648名俄罗斯榛树导弹工程师!定点清除?

乌克兰特工曝光2648名俄罗斯榛树导弹工程师!定点清除?

项鹏飞
2026-09-10 18:42:48
“打我妈不行”,排队冲突中老人多处骨折,不予刑事立案

“打我妈不行”,排队冲突中老人多处骨折,不予刑事立案

中国新闻周刊
2026-09-10 20:35:09
欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

欧冠上演英超西甲焦点大战:6.8亿豪门1-2被逆转 惨遭死敌5连斩

狍子歪解体坛
2026-09-10 04:57:39
上海体育局通报刘翔安置工作,未来将持续优化退役运动员安置

上海体育局通报刘翔安置工作,未来将持续优化退役运动员安置

澎湃新闻
2026-09-10 13:56:02
女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

女儿跟对象开玩笑,说父母是农民,没有退休金。男方愣了下:“你说的是真的吗?”女儿点头,男方脸色一沉:“那咱们不合适。”

背包旅行
2026-09-10 18:14:09
“高考数学132分,入学考试12分”,大学回应

“高考数学132分,入学考试12分”,大学回应

第一财经资讯
2026-09-10 11:04:09
户晨风骂了三年华为折叠屏是智商税,苹果也出了折叠屏,他连还嘴的机会都没了

户晨风骂了三年华为折叠屏是智商税,苹果也出了折叠屏,他连还嘴的机会都没了

不掉线电波
2026-09-10 13:04:14
2026-09-11 06:55:00
AI前线 incentive-icons
AI前线
面向AI爱好者、开发者和科学家,提供AI领域技术资讯。
1724文章数 170关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

教育
房产
本地
数码
公开课

教育要闻

当头棒喝!大学开学考,新生集体“翻车”:高考数学130分,大学摸底考12分

房产要闻

别不服!海南的亿万富豪,只有不到300个!

本地新闻

拼假 13 天国内长线路线合集

数码要闻

驳斥“运营2.16亿台间谍电视”指控 LG官方声明数据合规并强调用户隐私保护

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版