网易首页 > 网易号 > 正文 申请入驻

VLA开环盲区,终于被堵上了:40M Corrector让机器人边做边纠错

0
分享至





视频链接:https://mp.weixin.qq.com/s/rfSPbtc2_fRpggXeBPPC3Q

机器人抓住积木,正准备往碗里放。就在这时,有人突然把碗挪走了。

人会本能地停一下、看一眼,再重新对准;但不少 VLA 机器人不会。它明明还在接收相机画面,手上却继续执行几百毫秒前生成的旧动作,最后把积木放进空气里。

这不是模型「没看见」,而是它在这段时间里,根本没被允许重新思考。

浙江大学 ACES 实验室 OmniAI 团队与阿里巴巴达摩院的最新工作VLA-Corrector,盯住了这个长期被 action chunk 掩盖的问题:VLA 一次预测一串动作确实高效,但从开始执行到下一次推理之间,也出现了一块危险的开环盲区

  • 论文:VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon
  • 作者:Yi Pan, Miao Pan, Qi Lu, Jiaming Huang, Man Zhang, Siteng Huang, Xin Li, Jie Zhang, Yongliang Shen, Xuhong Zhang, Wenqi Zhang
  • 单位:Zhejiang University;Alibaba DAMO Academy
  • 论文链接:https://arxiv.org/abs/2607.01804
  • 项目主页:https://zju-omniai.github.io/vla-corrector/
  • 代码:https://github.com/ZJU-OmniAI/vla-corrector

他们给出的答案很直接:不必逼大模型每一步都重算,也别让机器人闭着眼把整段动作做完。给 VLA 加一个约 40M 参数的轻量级 Corrector,让它知道什么时候该继续,什么时候必须停手纠错。



长 action horizon 与严格闭环执行的对比

VLA 明明一直睁着眼,为什么还像没看见?

现在主流的生成式 VLA,常用 action chunk 来摊薄推理成本:模型看一次画面,一口气生成未来一段动作;机器人再从中连续执行前 H 步。H 越大,调用模型的次数越少,动作也更连贯。

代价同样明显。抓取时打滑、插入时偏了两毫米,或者目标被人移动,后面的动作就已经「过期」了。但只要 horizon 还没结束,机器人仍会照着旧计划往下做。小偏差很快滚成大错误,等下一次推理终于到来,状态可能已经偏到救不回来了。

把 H 设成 1,当然可以步步闭环,却等于每个控制步都调用一次 VLA。论文的 horizon sweep 也把这笔账算得很清楚:以 π0.5 为例,拉长 horizon 能把 policy call 降低约 4 倍,但成功率会从约 64% 掉到 49% 以下。

所以,问题并不是再猜一个「最佳 H」。真正该问的是:当前这段动作,什么时候已经不值得信了?

不要一直重规划,

只在动作失效的那一刻接管

VLA-Corrector 没有改动 VLA 主干权重,而是在推理链路外加了一条「监测—打断—纠正」的旁路。

第一步是监测。Latent-space Vision Monitor(LVM)学习一个很局部的问题:执行这个动作后,视觉特征接下来应该往哪个方向变化?在线运行时,它不断比较「预期变化」和相机里「真实发生的变化」。模型不是直接预测像素,而是在信息密度高的 latent space 中预测视觉动态残差。这样有助于减少静态背景,光照的干扰,让模型优先关注对执行任务而言重要的动态部分,降低学习难度的同时还能让预测更加准确。

第二步是打断。如果这种偏差持续出现,而非单帧抖动,系统立刻清空队列中尚未执行的 stale actions。动态阈值、迟滞机制和连续步检查,保证它不会一有风吹草动就停机。

第三步才是纠正。简单地再问一次 VLA,可能只会得到另一段同样出不去的动作。为此,Online Gradient Guidance(OGG)会把刚才检测到的视觉偏差变成梯度信号,只引导中断后的那一次恢复推理,把新动作往更可恢复的方向推。



VLA-Corrector:监测、打断与纠正

这套机制最终得到的不是另一个固定 horizon,而是事件触发的自适应 horizon:搬运平稳时,大步往前走;到了抓取、对齐、插入这些容易出错的阶段,随时准备切回短视野纠错。实验中,83.7% 的截断恰好发生在这些关键阶段。

换句话说,它不是在开环和闭环之间二选一,而是把闭环反馈用在了最值钱的时刻。

成功率涨了,调用次数反而还能降

在 MetaWorld 上,给 π0.5 加入 VLA-Corrector 后,平均成功率从48.70% 提升到 64.35%;在 Very Hard 任务上,提升达到24 个百分点

更有意思的是,它并不是靠疯狂增加推理次数换来的。SmolVLA 在 horizon 10 下,成功率从61.90% 提升到 73.00%,平均 policy call 却从19.27 次降到 15.64 次。原因不难理解:及时扔掉过期动作,远比在失败轨迹上继续浪费整段 chunk 划算。

真实 AgileX PiPER 机械臂上的结果更直观。九项任务的平均成功率从55.6% 提升到 73.3%;在人为移动物体或目标的扰动恢复任务中,成功率从40.0% 跃升到 68.3%。而在 LIBERO 上,加入 Corrector 的 few-shot 模型达到97.8%,还超过了 fully fine-tuned baseline 的 96.95%。



VLA-Corrector 的真实机械臂结果

这项工作真正值得带走的 insight

过去我们常把 VLA 的可靠性理解成「第一次就预测出完美动作」。但机器人进入物理世界后,动作会反过来改变环境,计划也会随时过期。一个永远不犯错的长动作块并不现实,真正重要的是:系统能不能尽早知道自己已经走偏,并保留打断自己的权力。

VLA-Corrector 给出了一种很有启发的系统分工:大模型负责提出计划,小模型负责审计计划,执行层拥有随时叫停的权力。这可能比一味堆大 backbone 更接近具身智能的可靠落地。

它当然不是万能恢复器。OGG 仍受基础策略能力上限约束。但VLA-Corrector真正的核心在于它能有效抑制错误在开环盲区中被放大,大幅降低VLA policy从错误中恢复的难度。它改变了问题的解法:不再要求 VLA 时时严格闭环,而是让系统在该闭环的瞬间,真的闭上这个环。

一句话概括:机器人未必需要永远不出错,但它必须学会不把错误继续做完。

作者介绍

本工作由浙江大学 OmniAI 团队与阿里巴巴达摩院联合完成,第一作者是浙大准研一的硕士研究生潘翼,研究聚焦 action-chunked VLA 的开环盲区与真实机器人纠错,通讯作者为浙大百人计划研究员张文祺。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
已立案!摄影师被交往一年多的女coser偷走相机,网友:它被卖掉前还一直在喊你的名字

已立案!摄影师被交往一年多的女coser偷走相机,网友:它被卖掉前还一直在喊你的名字

国创漫话
2026-09-05 20:01:09
韩国慌了!高层紧急发声,宁得罪自己人,也不敢重蹈日本覆辙

韩国慌了!高层紧急发声,宁得罪自己人,也不敢重蹈日本覆辙

易昂杨
2026-09-07 01:42:54
我发现大多数女人洗完澡后都有同一个心愿,今天坦诚讲给大家听听

我发现大多数女人洗完澡后都有同一个心愿,今天坦诚讲给大家听听

千秋文化
2026-09-06 20:32:32
现场车手:救援人员因害怕放下灭火器逃跑,救护车司机睡着了

现场车手:救援人员因害怕放下灭火器逃跑,救护车司机睡着了

懂球帝
2026-09-06 14:36:10
强肝冠军!不是枸杞,也不是山药,而是每家厨房里最不起眼的普通食材!

强肝冠军!不是枸杞,也不是山药,而是每家厨房里最不起眼的普通食材!

小谈食刻美食
2026-09-04 09:24:39
米体:齐沃言论点燃米兰德比火药味

米体:齐沃言论点燃米兰德比火药味

懂球帝
2026-09-06 21:50:07
27岁博主去世引关注,发病到死亡仅1天多!妻子痛悔"全家都被误导了""两个女儿还太年幼"……

27岁博主去世引关注,发病到死亡仅1天多!妻子痛悔"全家都被误导了""两个女儿还太年幼"……

鲁中晨报
2026-09-05 16:50:05
首都机场客流逆势增长,大兴机场分流是失灵还是回归常态?

首都机场客流逆势增长,大兴机场分流是失灵还是回归常态?

水泥土的搞笑
2026-09-06 13:53:35
武大教授被实名举报:师德与学术调查不能只查曾某某

武大教授被实名举报:师德与学术调查不能只查曾某某

新京报
2026-09-04 11:45:44
默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

默茨无力回天,德国选择党取得压倒性优势,72岁前总理再度出山

霁寒飘雪
2026-09-06 16:30:58
霍启刚全家新疆度假!他紧搂郭晶晶好恩爱,霍震霆给亲家公让主位

霍启刚全家新疆度假!他紧搂郭晶晶好恩爱,霍震霆给亲家公让主位

一盅情怀
2026-09-04 12:26:30
堡垒一夜间崩塌!“超级要塞”被掏空,革命卫队被困地道断水断粮

堡垒一夜间崩塌!“超级要塞”被掏空,革命卫队被困地道断水断粮

民间马后炮
2026-09-05 09:04:13
未来五年,最危险的不是你没钱,而是你还在用十年前的方式花钱

未来五年,最危险的不是你没钱,而是你还在用十年前的方式花钱

流苏晚晴
2026-09-04 18:44:02
东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

东南亚的骗子都已经说了:普通人一辈子存款天花板是30万,电诈人员经过数据分析出来的。日本旅游签门槛是存款10万,招行金葵花门槛是50万

纯洁的微笑
2026-09-02 12:19:46
日元保卫战输了!日本专家一针见血,高市就是日元最大的空头!

日元保卫战输了!日本专家一针见血,高市就是日元最大的空头!

历史点行
2026-09-07 02:19:50
福建福鼎集中销毁近10吨“泡水茶”,价值200万元左右,“接下来每天都有集中销毁”

福建福鼎集中销毁近10吨“泡水茶”,价值200万元左右,“接下来每天都有集中销毁”

大风新闻
2026-09-06 12:17:02
3200 亿套现退场!98 岁李嘉诚彻底交棒儿子李泽钜,香港一个商业时代落幕

3200 亿套现退场!98 岁李嘉诚彻底交棒儿子李泽钜,香港一个商业时代落幕

白梦日记
2026-09-06 19:12:39
郑钦文美网史诗级逆转后再发声:迎万难,赢万难

郑钦文美网史诗级逆转后再发声:迎万难,赢万难

封面新闻
2026-09-06 12:26:23
“厨房客厅全是味!”居民家中恶臭弥漫一年多,记者上门揭开真相……

“厨房客厅全是味!”居民家中恶臭弥漫一年多,记者上门揭开真相……

8099999街头巷尾
2026-09-06 18:32:06
哈佛大学惊人发现:寿命长的人,从来不是靠多运动,而是靠这3点

哈佛大学惊人发现:寿命长的人,从来不是靠多运动,而是靠这3点

千秋文化
2026-06-21 19:47:58
2026-09-07 05:39:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13933文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

头条要闻

中尼两国遇难失联人数为何相差如此大 专家解读

体育要闻

3.9秒绝平!杨舒予18+5成女篮救世主

娱乐要闻

杨紫获白玉兰影后!爸爸:累了就回家

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

游戏
本地
旅游
教育
公开课

一台PS5的结局:败给家人拔电源 暑假工心血付诸东流

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

旅游要闻

浙江绍兴葫芦娃爷爷,游客太多影响休息:狠心剪掉7个葫芦娃

教育要闻

干得漂亮!小学被投诉要求家长到校打扫卫生,教育局:责成学校整改

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版