网易首页 > 网易号 > 正文 申请入驻

反击VLA中「L」无用论:用对位置指令泛化能力暴涨20-40%

0
分享至



作为具身智能最主流的路线之一,VLA 快速发展的同时也因为其各种问题被诟病。其中最主要的痛点之一便是指令泛化能力。

大部分论文展示的能力都在训练和测试集指令分布一致的数据上刷点,结果哪怕是像 LIBERO 这种现在看起来简单的数据,在简单改写指令后性能都会暴降。如下图所示,vla-adapter 在 LIBERO-para 上性能暴降 51%。对于具身 AGI 来说,这是一个不能接受的问题,我们期待的是一个在各种环境下能听懂人的各种表述形式的任务指令的机器人。

因此,VLA 真正难的,并不是在固定指令模板上再多拿几个点,而是让同一个任务在不同说法下,最终落到同一套机器人动作上。也就是目标物体没有变化、视觉场景没有变化、成功条件也没有变化,只是换了一种语言表达,机器人仍然应该完成原来的任务。

围绕 VLA 语言泛化的问题,来自上海交大和无界动力具身智能实验室的联合团队提出了一项极其简单但非常有效的解法。通过重新设计语言语义进入视觉与动作计算路径的方式,让模型不依赖大量 paraphrase 训练,也能更稳定地执行改写后的指令。



  • 论文标题: Grounded Semantic Re-Binding for Robust Instruction Generalization in Vision-Language-Action Models
  • 论文地址:https://arxiv.org/abs/2608.02497
  • GitHub地址: https://github.com/AutoLab-SAI-SJTU/GSR-ParaVLA

指令只改几个词,VLA 的动作就可能完全不同

当前不少 VLA 工作都在 LIBERO、RoboTwin 等 benchmark 上不断刷新成功率。但标准 benchmark 中的语言通常较为固定,模型在训练和测试阶段看到的指令表达高度相似。

这会掩盖一个基础问题:模型究竟理解了 Instruction 所表达的任务含义,还是只把某种固定说法当成了 0,1,2 这样的任务标签?

例如:抓取较大的红色物体;改写为:拿起尺寸更大的红色方块。对人类而言,两句话对应的是同一个任务。但对 VLA 来说,这种看似微小的变化,可能让原本能够稳定完成的任务直接失败。

本文首先在 LIBERO-Para 上评估了 VLA-Adapter、SmolVLA 和 π0.5 三个模型。LIBERO-Para 是在 LIBERO-Goal 任务基础上构建的语言泛化 benchmark。它保持机器人面对的场景、物体、初始状态和成功标准不变,只改写任务指令中的动作表达、物体描述,或同时改写两者,用来测试模型在任务没变、只是换了一种等价表述的情况下能否继续正确执行任务。



换个表述,VLA性能就会掉这么多

结果显示,SmolVLA 在原始指令上的成功率为 72.0%,面对改写指令时却只剩 4.47%;VLA-Adapter 从 98.2% 降至 46.82%。即便是经过大规模异构数据训练的 π0.5,也仍然存在语言改写带来的性能损失。

换句话说,在标准指令上取得高成功率,并不等于模型具备稳定的 Instruction 跟随能力。

但成功率下降只能说明问题存在,并不能解释问题出在哪里。

对于后训练微调来说,常见的解法是是继续收集更多等价表述,将改写语句加入训练。对于预训练来说,像 pi 一样经过大规模的数据训练,模型见多了语言任务形式,也能增强指令泛化的能力。但这个论文发现,或许还有一种更简单的解法。本文从模型结构中「L」的设计角度考虑重新思考这个问题。

分析 1:失败动作里,仍然保留着正确任务的结构

为了判断任务信息是否已经消失,论文首先设计了一个动作级检索实验。

对于同一个视觉 Observation,模型先接收当前任务的改写指令,生成一个 action chunk。随后,在完全相同的视觉输入下,再分别输入十个 LIBERO-Goal 任务的原始指令,得到十组候选动作。

接下来只需要判断:改写指令生成的动作,最接近正确任务的原始动作,还是更接近其他错误任务?假如模型已经完全误解了指令,那么改写指令产生的动作不应该稳定地指向正确任务。相反,如果其中仍然包含任务相关信息,它就应该比错误任务更靠近对应的原始动作。



三个模型的 Retrieval@1 均显著高于随机水平 (0.1),Semantic Retention 也全部为正。π0.5 的改写动作尤其明显地靠近正确任务;VLA-Adapter 和 SmolVLA 虽然最终成功率下降较大,但其动作中仍然保留了一定的任务区分结构。

这组结果并不意味着每一个失败 episode 中,模型都已经完整理解了指令。但它至少说明,语言改写并没有让正确任务信息彻底消失。

任务相关信息仍然存在,问题更可能发生在这些信息被转换为连续动作的过程中。

分析 2:逐层替换:语言偏移如何变成动作偏移

上面的实验只能说明任务结构仍然存在。为了进一步判断内部语言特征是否真正控制动作,论文对模型进行了逐层特征干预。

以 VLA-Adapter 为例,同一个 episode 分别使用原始指令和改写指令运行,两次运行中的视觉输入、机器人状态、初始环境以及动作生成条件全部保持一致。在改写指令进入最后一个 Bridge-Attention block 前,实验不改变 image token,也不改变 state token,只将该位置接收到的语言特征替换为原始指令对应的语言特征。

结果显示:

  • 预测动作之间的差异恢复了96.8%;
  • 配对闭环成功率从60% 提升至 96%。



替换具体层带来的恢复效果热力图

这说明,改写指令并没有让模型进入一个完全无关的状态。更接近实际情况的是:原始指令和改写指令之间产生了一定的语言表示偏移,而下游 Action Expert 对这种偏移非常敏感,最终将较小的特征差异放大成了不同的机器人动作。为了确认这一位置确实参与任务控制,论文还进行了 wrong-task intervention:将语言特征替换成另一个错误任务的特征后,模型生成的动作会向被注入的错误任务偏移。

不过,这并不是所有 VLA 的共同特征。

在 VLA-Adapter 中,最后一个 Bridge-Attention block 的单层替换就能恢复 96.8% 的动作差异;而在 SmolVLA 和 π0.5 中,对任意单层进行相同替换,最高只能分别恢复约 10.5% 和 31.3%。

这说明三类架构处理任务语义的方式并不相同:VLA-Adapter 将语言信息送入相对独立的 Bridge-Attention policy,控制位置较为集中;SmolVLA 和 π0.5 则在多层多模态计算中持续融合语言、视觉和状态,任务信息更加分散。

因此,语言泛化问题不能简单概括为「所有 VLA 的 Action Head 都在某一层失效」。不同架构的信息流不同,语义修复的位置也需要随之变化。

分析 3:两项控制实验:动态图像与措辞都会扰动语言表示

在确认语言特征差异会影响动作后,论文继续追踪这些差异是如何产生的。分析主要围绕 VLA-Adapter 的辅助 Qwen 分支展开。该分支同时接收当前图像和任务指令,因此语言 token 并不是由文本单独编码得到,而是在视觉 — 语言联合建模过程中产生。

第一项实验用于隔离动态视觉输入对语言表示的影响。模型进行两次前向。第一次前向中,Qwen 接收真实图像和任务指令;第二次前向中,Qwen 接收相同指令,但图像被替换为一张固定图像。随后,第二次前向产生的语言 token 被送回第一次前向的计算路径,而机器人的主视觉分支仍然使用真实 Observation。

也就是说,机器人依旧能够看到当前场景,只是不再让任务语言表示随着辅助 Qwen 分支中的动态图像共同变化。



分析3概述图

仅通过这一处理,VLA-Adapter 在完整 LIBERO-Para 上的成功率就从46.82% 提升至 61.58%。将 dummy image 换成固定的自然图像后,也能观察到相同趋势。

这一结果说明,在该结构中,任务描述与动态图像被共同编码时,可能会引入额外的特征波动。对于机器人动作而言,这些波动并不代表任务本身发生了变化,却仍然会改变后续控制结果。


分析 4:移除「措辞」方向,闭环成功率从 55% 提升到 90%

第二项实验用于分析原始指令和改写指令之间的措辞差异。

论文采用交叉验证,先使用八个任务估计 32 个能够区分原始指令和改写指令的特征方向,再将这些方向从剩余两个未见任务的改写指令特征中移除。

移除后:

  • 原始指令与改写指令之间的动作差异从0.4361 降至 0.2282;
  • 20 个闭环 episode 上的成功率从55% 提升至 90%;
  • 移除相同数量、相同范数的随机方向,动作差异基本保持不变。

这说明,等价指令不一定会让模型彻底忘记任务,但可能在特征空间中引入系统性的措辞偏移。下游 Action Expert 没有学会忽略这些与任务无关的变化,反而将它们映射成了不同的动作。

这也构成了 GSR 的直接动机:与其通过大量改写数据不断覆盖不同说法,不如先提供一个更加稳定的任务语义源,再重新学习这部分语义如何影响动作。



分析4概述图

解法:GSR——重建语言到动作的信息流

基于前面的分析,论文提出Grounded Semantic Re-Binding,简称 GSR。GSR 的基本过程可以分成三步。

首先,使用冻结的 T5 编码器单独处理语言指令。T5 不接收图像,也不接收机器人状态,只负责提取任务本身的文本语义,从源头上减少动态图像与措辞变化带来的表示干扰。

随后,根据不同 VLA 原本的多模态计算方式,将投影后的 T5 语义重新注入模型用于融合任务、视觉和状态信息的位置。注意,像上文分析所述,不同模型的融合位置不一样,因此注入的位置也不一样。

最后,重新初始化并训练 Action Expert,使其从训练开始就学习如何使用新的语言条件,而不是继续沿用已经适配旧语言路径的动作映射。



GSR整体架构

T5 提供「需要完成什么任务」,目标物体的位置、当前机器人状态以及具体动作轨迹,仍然由模型原有的视觉和状态路径决定。

因此,GSR 处理的不是单纯的文本编码问题,而是语言语义如何重新进入真实场景计算,并最终控制连续动作的问题。


结果:轻量模型指令泛化能力暴涨,

经过大规模机器人数据预训练的更大模型也能继续获得增益

所有 GSR 模型均只使用 LIBERO-Goal 中的原始指令训练,没有额外使用改写指令。

完整 LIBERO-Para 包含 4,092 个 episode,其中包括 870 个动作表达改写、259 个物体描述改写,以及 2,963 个组合改写。



VLA-Adapter 的 Full Para 成功率从 46.82% 提升至 70.94%,增加 24.12 个百分点;SmolVLA 从 4.47% 提升至 49.12%,增加 44.65 个百分点。

π0.5 原本已经通过大规模异构数据获得了较强的语言泛化能力,但 GSR 仍将其 Full Para 成功率从 73.60% 推进到 75.59%,并取得论文中报告的最高 PRIDE 分数 70.4。此项分数高于近期发布的大规模预训练模型 Xiaomi-Robotics,证明了其进一步提升当前 VLA 模型指令泛化能力的潜力。

更重要的是,简单地在原生路径的 Action Expert 旁边增加一个 T5 并不能得到同样的结果。VLA-Adapter 的 Native + T5 只从 46.82% 提升至 47.31%;SmolVLA 的对应版本也只有 13.49%。真正产生提升的并不是「模型里多了一个语言编码器」,而是原生语言路径、稳定语义源、视觉 grounding 和 Action Expert 之间的信息流被重新组织。

分析:路径冲突:接入两个语言源后,谁真正控制动作

论文还设计了一组 language-route authority 实验,分别向原生语言路径和 T5 路径输入正确或错误任务。

C/C 表示两条路径都接收正确指令;W/C 表示原生路径接收错误指令、T5 接收正确指令;C/W 则相反。




VLA-Adapter 在 C/C 下的成功率为 47.31%。当原生 Qwen 路径接收到错误任务时,成功率降至 5.11%;而当 T5 接收错误任务时,成功率仍为 44.0%。

这说明,即使 Qwen 对改写指令的泛化较差,它仍然掌握着主要动作控制权。只在旁边加入一个更稳定的语言编码器,并不能阻止原生路径继续主导机器人。SmolVLA 在两种冲突条件下都会严重下降,说明两条语言路径之间存在明显干扰。

π0.5 则主要依赖原生 PaliGemma,且该路径本身已经较为可靠,因此适合保留原生指令,并将 T5 作为辅助。

这组结果解释了为什么 GSR 必须采用架构相关的设计:语言特征是否存在是一回事,哪条路径真正拥有动作控制权是另一回事。

探索:ParaVLA:探索新 VLA 架构的可能性

在 GSR 之外,论文还尝试了一个更加彻底的实验性架构 ParaVLA。

ParaVLA 使用冻结的 T5 处理指令,使用 DINOv2 处理视觉。语言与图像在前端保持相对独立,最终在 Action Expert 中与机器人状态和动作信息融合。



ParaVLA 与经典 VLA 架构的对比

在 LIBERO-Goal 的原始指令和改写指令上,ParaVLA 分别取得了 92% 和 91% 的成功率,二者只相差 1 个百分点。

作为对照,在相同结构中将 T5 替换为 SmolVLM decoder 后,原始指令成功率仍有 85%,但改写指令成功率下降至 41%(多模态基模不能提供稳定的语义)。这组实验进一步支持了论文的核心观察:一个相对稳定、独立于当前视觉输入的语言条件,有助于降低等价措辞对动作生成的干扰。

不过,完全解耦也带来了新的问题。当视觉模型进一步扩大时,ParaVLA 没有表现出传统 VLM 常见的 scaling 能力。因此,本文未来工作会继续研究如何同时保留稳定的任务语义、充分的场景 grounding,以及大规模多模态模型的扩展能力。

结语:从增加语言数据,到重新设计语言如何控制动作

GSR 的重点,不是证明数据扩增没有价值,也不是简单地用 T5 替换现有 VLM。

它关注的是一条更容易被忽略的链路:语言模型是否保留了任务信息,这些信息在哪里与视觉和状态交互,以及它们最终通过哪条路径控制动作。

对 VLA 而言,语言泛化失败可能并不总是意味着模型彻底没有理解指令。任务相关信息可能仍然存在,只是在多模态融合和动作生成过程中,等价表达之间的特征偏移被不断放大。

因此,真正可靠的 VLA 需要解决的不只是模型规模和训练数据量,还包括:语言语义从哪里进入模型;它在什么阶段与视觉和机器人状态结合:多条语言路径发生冲突时,哪条路径拥有控制权;以及 Action Expert 能否对语义等价、表面不同的语言表示保持稳定。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
51岁黄渤锁骨骨折消息曝光不到6小时,恶心的事情就发生了!

51岁黄渤锁骨骨折消息曝光不到6小时,恶心的事情就发生了!

叨唠
2026-09-04 00:01:53
3542万印度移民流出,西方多国关上大门,中国恐意外“接盘”?

3542万印度移民流出,西方多国关上大门,中国恐意外“接盘”?

千羽解读
2026-09-03 10:17:05
大一女生穿“洛丽塔”报到,本以为能惊艳全场,没想到连行李都没人愿意帮忙搬

大一女生穿“洛丽塔”报到,本以为能惊艳全场,没想到连行李都没人愿意帮忙搬

妍妍教育日记
2026-08-23 10:10:12
没想到林肯号刚到泰国,5000美军就被上了一课,泰警方还是太懂了

没想到林肯号刚到泰国,5000美军就被上了一课,泰警方还是太懂了

厨房里的神
2026-09-04 05:54:13
雷军宣布小米18 Fold新功能:是不是超级棒!

雷军宣布小米18 Fold新功能:是不是超级棒!

3DM游戏
2026-09-03 12:54:21
孙俪当年能够演甄嬛,其实捡了三个女人的“漏”,一开始导演想找蒋勤勤,可皇帝是陈建斌,两口子演这戏太尴尬,只好作罢

孙俪当年能够演甄嬛,其实捡了三个女人的“漏”,一开始导演想找蒋勤勤,可皇帝是陈建斌,两口子演这戏太尴尬,只好作罢

背包旅行
2026-09-01 18:21:17
细思极恐!中国常用的一类降压药,可能让糖尿病患者肾脏风险高出33%!

细思极恐!中国常用的一类降压药,可能让糖尿病患者肾脏风险高出33%!

徐德文科学频道
2026-08-21 20:06:13
越南或购买法国“阵风”战机,装备战略将出现重大转变?

越南或购买法国“阵风”战机,装备战略将出现重大转变?

澎湃新闻
2026-09-02 22:10:30
燃油新政即将生效,11月全面推开!车主欢喜,这两类人恐要彻夜难眠!

燃油新政即将生效,11月全面推开!车主欢喜,这两类人恐要彻夜难眠!

生活魔术专家
2026-09-03 09:28:14
当DLSS 5把赛博朋克2077变成噩梦,玩家开始怀念老画质

当DLSS 5把赛博朋克2077变成噩梦,玩家开始怀念老画质

奶凶的小霸王
2026-09-03 04:09:40
深圳一叉车夜间作业侧翻致1人死亡,调查报告公布:死者没系安全带、没开车灯,公司负责人面临行政处罚

深圳一叉车夜间作业侧翻致1人死亡,调查报告公布:死者没系安全带、没开车灯,公司负责人面临行政处罚

扬子晚报
2026-09-04 07:47:59
法国第一夫人女儿官宣年下恋!妈妈嫁了小25岁总统,她爱上小20岁冲浪教练... 这也复刻?

法国第一夫人女儿官宣年下恋!妈妈嫁了小25岁总统,她爱上小20岁冲浪教练... 这也复刻?

英国那些事儿
2026-09-03 00:07:13
难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

难怪朱倩老公这次下手这么狠,这女人的聊天记录,实在是太野了

皮蛋儿电影
2026-09-02 10:26:48
韩国生育率彻底爆发,打脸了全球人口学家。

韩国生育率彻底爆发,打脸了全球人口学家。

流苏晚晴
2026-07-12 19:08:14
外媒:看完中国歼-16,埃及还想买24架“阵风”,并非歼-16不好,而是埃及想要歼-35

外媒:看完中国歼-16,埃及还想买24架“阵风”,并非歼-16不好,而是埃及想要歼-35

蓝星杂谈
2026-09-03 15:49:46
穆里尼奥铁腕清洗!皇马冠军功勋直接除名!19 岁天才强势上位

穆里尼奥铁腕清洗!皇马冠军功勋直接除名!19 岁天才强势上位

澜归序
2026-09-04 09:12:05
1398年朱元璋去世,同年浙江出生一男孩,51年后为大明续命200年

1398年朱元璋去世,同年浙江出生一男孩,51年后为大明续命200年

文史达观
2026-03-31 14:00:20
凌晨2点战报:赵心童4-2险胜!连爆大冷世界第2第3第7第9出局了

凌晨2点战报:赵心童4-2险胜!连爆大冷世界第2第3第7第9出局了

漫川舟船
2026-09-03 11:18:38
广州网友称有家长抱孩子在南越王博物院展柜上趴着,小孩还不断用舌头舔玻璃;工作人员回应:有人巡场,看到会提醒,不会有安全问题

广州网友称有家长抱孩子在南越王博物院展柜上趴着,小孩还不断用舌头舔玻璃;工作人员回应:有人巡场,看到会提醒,不会有安全问题

潇湘晨报
2026-09-03 21:26:07
摊牌!冯德莱恩下达最后通牒,中国要么认栽,要么就付出代价

摊牌!冯德莱恩下达最后通牒,中国要么认栽,要么就付出代价

画夕
2026-09-04 08:04:50
2026-09-04 10:31:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13915文章数 142729关注度
往期回顾 全部

科技要闻

OpenAI深夜王炸!GPT-6 Astra来了

头条要闻

牛弹琴:荷兰悄悄干了一件大事 值得高度关注

头条要闻

牛弹琴:荷兰悄悄干了一件大事 值得高度关注

体育要闻

梅西:巴萨10号与阿根廷10号

娱乐要闻

王宝强冯清八年未领证!真相令人泪目

财经要闻

电池税开征,纯电车利润快归零了

汽车要闻

限时权益价28.99万起 FREELANDER神行者8正式上市

态度原创

家居
亲子
艺术
旅游
军事航空

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

至今不知道我们面剂子到底有多少漂亮小衣服

艺术要闻

放大《汉宫春晓图》:撕掉宫斗剧滤镜,这才是明代深宫女子的真实日常

旅游要闻

长江边这座千年古镇的寺庙群里,竟然藏着一所中国顶尖大学的旧址,太令人意外了

军事要闻

乌特工内战街头对射 互认对方为"俄特工"

无障碍浏览 进入关怀版