网易首页 > 网易号 > 正文 申请入驻

机械臂做到第10步就容易出错?一个 2B 模型靠动态调整注意力解决了 | IJCAI 2026

0
分享至


S²-VLA 引入信念状态和自适应动态门控,仅用2B参数、7GB显存,长程操控超越7B模型。

作者丨张 璐

编辑丨幸丽娟

过去一段时间,Scaling Law 在具身智能里被看得很重。为了让机械臂完成复杂的搬运、对准和组合,多数工作把视觉-语言-动作(VLA)模型做到 7B 甚至 8.5B。参数变大后,语义理解和场景识别确实更强了,但长程操控里的不稳定问题并没有随之消失。

很多大参数量 VLA 在执行到第 10 步或更后面时会出现突然失败。核心原因是累积误差放大(Cumulative Error Propagation):早期哪怕只有毫米级定位偏差,也会在后续步骤中逐步放大,最终导致抓取失败或动作中断。参数量大了,语义理解确实更强,但模型在动作后半程还是很难及时纠正偏差。

华东师范大学与上海交通大学团队提出的 S²-VLA 针对这个问题做了改进。工作由谢志鹏、韩宗益(共同一作)、赵静(通讯作者)和孙仕亮等完成。

他们没有继续堆参数,而是加了信念状态和自适应动态门控,让模型能按当前阶段调整注意力。结果是:2B 参数量的模型在 LIBERO-Long 上达到 96.4% 成功率,超过了多数 7B 甚至 8.5B 的模型。


论文链接:https://arxiv.org/pdf/2606.27872

下面我们从机制和实际表现来看它具体怎么做的。


01


静态注意力:为什么微小偏差会一路放大

先看传统 VLA 在长程任务里常见的失败模式。

在解耦式 VLA 里,上层策略头把视觉和语言特征映射成控制指令。多数方法用的是静态特征融合(Static Fusion):视觉、语言和动作历史的权重比例,在整个任务里一直固定不变。视觉、语言语义和动作历史的权重一旦定下来,就不会随执行进度改变。


这在短任务里问题不大,但在长程序列中会暴露两个明显缺陷。

第一,早期如果出现毫米级定位偏差,模型无法及时提高视觉权重来纠偏,误差会逐步累积,最终导致任务失败。

第二,子任务切换时,缺少对高层意图的动态调整,模型容易偏离当前指令,动作中断或卡在半空。

静态融合相当于全程用同一套“注意力配比”去应对不同阶段的需求。需要精细对准时,视觉权重不够;需要切换目标时,意图权重又上不去。结果就是误差一旦出现,就很难在后续步骤里被压下去。

S²-VLA 会随阶段调整:需要精准对准时,就提高视觉权重来纠偏;到了任务切换时,再提高意图权重,把目标重新锁定。



02


核心机制:信念状态 + 三路自适应注意力

为了实现阶段自适应的注意力分配,作者把架构分成两个主要部分:


▎信念状态(Belief State)

模型用一个很轻量的循环网络,实时接收上一时刻的动作历史和关节传感器反馈。

它不直接输出动作,只在内部维持一个信念状态(Belief State),用来判断“现在走到哪一步了”和“有没有出现偏差”。

这套状态不需要人工标注阶段标签,完全靠端到端预测下一个动作的损失来驱动,在潜空间里自己学会估计任务进度和执行质量。

训练时只优化最终动作预测,信念状态作为中间表征被间接监督,因此能自发形成对“进度”和“偏差”的感知,而不依赖额外的阶段标注。

▎三路自适应注意力(SSGAA Module)

信念状态提供当前阶段的信号后,SSGAA 模块把策略头的特征融合拆成三条平行通道:

  • 局部视觉通道(Visual Cross-Attn):接 VLM 的低层视觉 Token,负责精细空间定位和对准;

  • 全局意图通道(Intent Cross-Attn):接高层语义 Token,负责子任务规划和目标理解;

  • 动作自注意力通道(Action Self-Attn):在预测的未来多步动作间建立时序关系,保持轨迹连贯。

信念状态会生成动态门控权重(gating weights),根据当前阶段决定三条通道各占多少比重。

需要高精度定位时,视觉通道权重上升;需要切换子任务时,意图通道权重上升;在平稳移动阶段,动作自注意力通道占主导。

消融实验显示,把门控加在策略头中间层(比如第 12 层)效果最好,既能保持特征稳定,又能保留自适应能力。


03


31 步里的注意力变化:和关键动作帧对齐

实际执行时,三路门控权重会随任务阶段明显变化。作者把 31 个推理步骤的门控曲线和关键动作帧对齐后,就能看出具体规律。


以“把芝士盒和黄油都放进篮子里”为例,作者画出了 31 个推理步骤的三路门控权重曲线,并和关键动作帧对齐。

瞄准与定位阶段(Aim target / Locate,关键帧 4、9、21、26)绿色曲线(视觉门控权重)明显升高。末端执行器接近目标时,模型提高视觉权重,做更精细的空间定位。此时如果继续用固定比例,毫米级偏差很容易被带到后续抓取步骤;提高视觉权重后,纠偏更及时。

抓取与子任务切换阶段(Grip / Put / Task change,关键帧 7、16、23、30)红色曲线(意图门控权重)升高。夹爪闭合、物体放入篮中,或从第一个物体转向第二个物体时,模型提高高层意图权重,保证子任务切换不中断。

这一阶段如果意图权重不足,模型容易“忘记”下一个目标,动作链条就会断掉。

稳态平移阶段(关键帧之间的过渡期)蓝色曲线(动作自注意力)保持较高水平,主导轨迹生成,主要靠时序关系保持运动平滑,减少对无关视觉细节的计算。此时不需要过高的视觉或意图权重,把计算留给动作连贯性更划算。

从这些对齐结果能看出,2B 的 S²-VLA 能超过多数更大的模型,关键就在于注意力不再一成不变,而是会按阶段把算力分到更需要的地方。


04


动态注意力、分层解耦与端侧效率

S²-VLA 的做法,和这两年空间智能、世界模型方向的讨论比较贴近,主要体现在三点。

▎随任务阶段调整注意力,而不是全程固定

空间智能相关讨论里常提到:物理世界的模型不能只是静态看图,而要在时间和空间变化中,把注意力动态分到几何细节和逻辑关系上。

传统 VLA 的静态融合缺少这一点。S²-VLA的信念状态 + 动态门控,相当于在机械臂控制里做了类似的事:接近物体时提高局部视觉权重,任务切换时提高意图权重。注意力随执行状态变化,而不是预先锁死。

▎把高层语义理解和低层控制分开

不少工作(包括 Yann LeCun、Yilun Du 等人的讨论)都在推动把“看”(高层语义)和“动”(低层控制)解耦。用一个大单体模型去直接拟合所有关节角度,成本和鲁棒性都不理想:参数量大、训练贵,而且一旦早期出错,后续很难自我纠正。

S²-VLA的路径比较直接:底层 VLM 负责预训练带来的语义和几何表征;策略推理用轻量信念状态,根据控制反馈调节注意力门控。 这对应了当前常见的分层解耦思路,也让小模型有机会在长程任务上表现得更稳定。

▎端侧可用的显存和吞吐

实验室成功率重要,但实际部署更看成本和响应速度。

S²-VLA推理显存约7GB,吞吐量80.8 Hz(同类 7B 模型通常只有几 Hz),对家电或工厂场景来说,这意味着不需要把大模型塞进服务器再远程控制,响应延迟和部署门槛都会低不少。这对以后从实验室走到实际应用,会更有参考价值。


05


结语:参数量之外,更需要阶段自适应的调度

S²-VLA的价值不只是把成功率再提高几个点。它直接说明:长程操控里,单纯加大参数量不够,还需要能按阶段调整注意力的机制。

参数量大,确实能带来更强的语义理解和世界知识。但长程动作稳不稳,更要看能不能在对的阶段,把算力分到对的地方。

静态融合把所有阶段当成同一种需求来处理,误差一旦出现就容易被放大;动态门控则让模型在需要纠偏时多看视觉,在需要切换时多看意图,在平稳移动时多维持动作连贯。

实际部署时,家电或工厂场景很难依赖大型服务器。能在端侧显卡上以约7GB 显存、80Hz量级运行的方案,对落地更有参考价值。

参数规模当然还是重要的,但在长程物理交互里,能不能按阶段灵活调度资源,同样关键。对具身智能和Agent系统而言,阶段自适应的调度能力,或许比单纯把模型做大,更具长期价值。雷峰网

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」?

  • 会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航:场馆分布、报告厅怎么走,群里随时问;

    议题共读:热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编:现场海报精华整理,一键收藏不遗漏;

    约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

? 进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
乌军迎来坏消息!解放军赴俄后,大批国家紧随其后,美国也在其中

乌军迎来坏消息!解放军赴俄后,大批国家紧随其后,美国也在其中

莹莹的历史说
2026-09-10 13:42:05
即将复出!她这次要当演员了!

即将复出!她这次要当演员了!

奋斗在韩国
2026-09-10 14:09:08
马斯克旗下Boring Company完成30亿美元D轮融资,估值230亿美元

马斯克旗下Boring Company完成30亿美元D轮融资,估值230亿美元

IT之家
2026-09-10 13:46:05
潜逃25年!命案女逃犯在乌鲁木齐落网

潜逃25年!命案女逃犯在乌鲁木齐落网

环球网资讯
2026-09-10 20:20:46
女篮惨败淘汰后揪出三大水货!李缘0分常客:宫鲁鸣误信一人了

女篮惨败淘汰后揪出三大水货!李缘0分常客:宫鲁鸣误信一人了

不如恋物j
2026-09-11 04:14:01
李泽楷再次证明,找女友要找年轻的,即使你老,她还美得心旷神怡

李泽楷再次证明,找女友要找年轻的,即使你老,她还美得心旷神怡

刘森森
2026-09-10 12:52:11
从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

从135到98,肚子瘪下去才明白:内脏脂肪最怕的,从来不是跑步

健身狂人
2026-09-06 02:07:39
火力全开 几度哽咽 扎哈罗娃五分钟怒斥日本

火力全开 几度哽咽 扎哈罗娃五分钟怒斥日本

看看新闻Knews
2026-09-10 12:15:09
蒋奇明这次翻车给内娱上了一课

蒋奇明这次翻车给内娱上了一课

乡野小珥
2026-09-09 01:00:02
西藏网警:捏造泥石流系人为造成、歪曲救援工作,多人造谣被处罚

西藏网警:捏造泥石流系人为造成、歪曲救援工作,多人造谣被处罚

界面新闻
2026-09-10 21:22:12
形势已经大变!西方媒体集体改口:中国,已不用再向世界证明什么

形势已经大变!西方媒体集体改口:中国,已不用再向世界证明什么

近史博览
2026-09-10 14:16:41
14球14助攻仍被放弃,巴萨多花4300万选了另一个人

14球14助攻仍被放弃,巴萨多花4300万选了另一个人

星河漫山野
2026-09-11 04:00:29
境外势力,太坏了!

境外势力,太坏了!

胖胖说他不胖
2026-09-09 10:00:27
统一进入倒计时?解放军随时能战,赖清德表态,近500万台胞赴陆

统一进入倒计时?解放军随时能战,赖清德表态,近500万台胞赴陆

乌克兰小静
2026-09-06 08:36:08
助攻破僵局,多古当选曼联vs沙巴巴库全场最佳

助攻破僵局,多古当选曼联vs沙巴巴库全场最佳

懂球帝
2026-09-11 05:19:11
刘翔工资卡11年0支出,月均工资才是上海平均工资的一半,让普通人按平均工资缴社保合理吗

刘翔工资卡11年0支出,月均工资才是上海平均工资的一半,让普通人按平均工资缴社保合理吗

Mr王的饭后茶
2026-09-10 16:13:13
24集《早春晴朗》大结局:96%的观众都没看懂,明明尚之桃说做孙远翥女朋友会很幸福,为什么蕞后会爱上毒舌的栾念

24集《早春晴朗》大结局:96%的观众都没看懂,明明尚之桃说做孙远翥女朋友会很幸福,为什么蕞后会爱上毒舌的栾念

胖六聊剧
2026-09-08 16:48:35
全球震惊,英国居然做了一件好事,千年历史头一回!

全球震惊,英国居然做了一件好事,千年历史头一回!

一个坏土豆
2026-09-10 20:59:41
一公司犯强迫交易罪被罚3000万后,又因垄断被罚2700万 为何两度处罚?最高法释法

一公司犯强迫交易罪被罚3000万后,又因垄断被罚2700万 为何两度处罚?最高法释法

红星新闻
2026-09-10 11:39:21
真是草台班子!苹果又出现低级失误

真是草台班子!苹果又出现低级失误

花果科技
2026-09-10 11:57:00
2026-09-11 07:24:49
雷峰网 incentive-icons
雷峰网
关注智能与未来!
70915文章数 656232关注度
往期回顾 全部

科技要闻

一文看懂:iPhone折叠屏顶配2万6,10月才卖

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

头条要闻

外媒:伊朗捕获美国"大鱼"后发了条消息 令五角大楼受挫

体育要闻

16岁的国产小库里,还有多少功课要做

娱乐要闻

参加晚宴,刘亦菲因合照深陷争议

财经要闻

向松祚:年轻人不必过早买房

汽车要闻

标配全线控底盘 全新一代智己LS6预售20.99万起

态度原创

房产
本地
家居
教育
公开课

房产要闻

别不服!海南的亿万富豪,只有不到300个!

本地新闻

拼假 13 天国内长线路线合集

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

当头棒喝!大学开学考,新生集体“翻车”:高考数学130分,大学摸底考12分

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版