网易首页 > 网易号 > 正文 申请入驻

VLA模型比你想象的更具泛化能力:重新审视物理与空间建模

0
分享至

VLA模型比你想象的更具泛化能力:重新审视物理与空间建模

VLA Models Are More Generalizable Than You Think:Revisiting Physical and Spatial Modeling

https://openaccess.thecvf.com/content/CVPR2026/papers/Li_VLA_Models_Are_More_Generalizable_Than_You_Think_Revisiting_Physical_CVPR_2026_paper.pdf



摘要
视觉-语言-行动(VLA)模型在分布内任务上表现强劲,但在新颖的相机视角和视觉扰动下性能急剧下降。我们表明,这种脆弱性主要源于空间建模中的错位,而非物理建模。为此,我们提出一种单次适应框架,通过轻量级、可学习的更新来重新校准视觉表征。我们的第一种方法——特征令牌调制(FTM),对视觉令牌应用全局仿射变换,仅用4K参数即将Libero的视角准确率从48.5%提升至87.1%。在此基础上,特征线性适应(FLA)对ViT编码器引入低秩更新,以470万参数实现90.8%的成功率——在远低于LoRA量级微调成本下达到相当性能。综合来看,这些结果揭示了预训练VLA模型中大量未开发的鲁棒性潜力,并表明针对性的、最小化的视觉适应足以恢复视角泛化能力。

1. 引言
近年来,视觉-语言-行动(VLA)模型的进展显著推动了具身智能领域的发展。通过将预训练的视觉-语言基础模型扩展至机器人控制,这些模型能够解读视觉观测,并在多种操作任务中遵循自然语言指令。在大规模、多样化的机器人数据集上预训练,已带来强劲的域内性能,展示了语言条件化视觉定位对通用机器人的潜力。

然而,鲁棒性和泛化性仍是关键挑战。尽管训练语料规模庞大且多样,VLA模型在面对分布外场景时往往失败,在未见过的相机视角、光照变化或场景扰动下表现出显著退化。这种脆弱性限制了它们在现实世界环境中的适用性,因为视觉条件本质上是动态且不可预测的。

提升VLA鲁棒性的现有方法大致可分为数据中心和表征中心两类。数据中心方法通过增加视觉多样性来增强鲁棒性,通常依赖大规模多视角机器人数据集(如Libero-Plus)。虽然该策略使模型接触更广泛的视觉条件,但在现实场景中扩展数据收集成本高昂且劳动密集,使得持续适应不切实际。相反,表征中心方法旨在通过几何一致性实现鲁棒性,学习几何感知或3D一致的表征。通过利用多视角监督或专用3D感知架构,这些方法改善了视角不变性。然而,尽管具备几何感知,它们仍对背景杂乱和光照变化等任务无关视觉因素敏感,暴露出视角鲁棒性与通用视觉适应性之间持续的鸿沟。

先前方法隐含假设鲁棒性需要额外数据或3D一致架构,但很少有工作明确检验失败是否实际上源于空间表征本身。


为探究这一问题,受近期关于VLA中视觉空间推理局限性的讨论启发,我们提出一个概念框架,将VLA模型分解为两个部分(见图1(a)):
(1)空间建模,由视觉编码器实现,从图像中构建物体间的空间关系(如位置、方向、接触关系和遮挡结构),生成下游任务所需的空间表征;
(2)物理建模,由VLM和行动专家实现,整合任务语言、空间表征和行动历史,进行高层推理并生成可执行的行动序列。

视角偏移主要改变观测场景的空间配置,而非底层任务语义或行动动态。这表明VLA性能在视角变化下的退化主要源于空间建模中的错位,而物理建模组件仍功能完备。换言之,高层策略仍保留推理和控制能力,但接收到的视觉嵌入发生空间扭曲,导致下游协调失败。

鉴于空间建模是视角偏移下的主要瓶颈,我们提出一种单次鲁棒性适应框架,使预训练的视觉-语言-行动模型能够通过轻量级、可学习的调制来重新校准其视觉表征。具体而言,我们引入特征令牌调制(FTM)——一种简单而有效的机制,仅使用两个可学习参数向量(γ, β)对视觉令牌嵌入应用全局仿射变换。该操作重新缩放并重新中心化特征分布,使模型能快速适应新视觉域。尽管参数少于4K,FTM显著提升视角鲁棒性,将准确率从48.5%提高至87.1%(见图1(b))。

受此结果启发,我们进一步提出特征线性适应(FLA)——通过对ViT编码器的线性层进行低秩更新来实现轻量级增强。该适应以适中的参数开销(总计470万参数)重新校准内部特征,将平均成功率进一步提升至90.8%(见图1(b)),与LoRA等全参数微调方法相当,但成本仅为其一小部分。

为支持系统评估,我们构建了Libero-V(Visual)基准,该基准整合了Libero-Plus中不同程度的视角和视觉扰动。Libero-V引入四种受控扰动类型——相机视角、光照、背景纹理和视觉噪声——为评估多种分布偏移下的鲁棒性提供统一框架。

我们的实证发现表明,预训练VLA模型内在地编码了潜在的鲁棒性,这种鲁棒性可通过最小化适应而非大规模重训来有效激活。这一视角强调,实现鲁棒的具身感知未必需要更多数据或复杂架构,而是需要高效且抗扰动的特征适应机制(见图2)。


主要贡献总结如下:

  • 我们重新评估了预训练VLA模型的鲁棒性,并表明视觉扰动下的性能退化主要源于空间建模中的表征偏移。

  • 我们提出统一的单次鲁棒性适应框架,包含特征令牌调制(FTM)和特征线性适应(FLA),能以最小参数更新高效重新校准视觉表征。

  • 我们的方法在Libero基准上对未见相机视角和视觉扰动实现了最先进的泛化性能,揭示了现有VLA模型中未开发的鲁棒性潜力。

2. 相关工作

2.1. 视觉-语言-行动模型

VLA模型旨在将视觉感知、语言定位和行动生成统一在单一策略框架内。通过将预训练的视觉-语言基础模型扩展至机器人领域,最近的VLA模型(如RT-2、Pi0、PaLM-E、Octo和OpenVLA)在多种操作任务中表现出强劲的分布内泛化能力。这些系统利用大规模具身数据集,整合多样的视觉输入、语言指令和本体感觉状态,以及带噪声的行动,以生成共享的行动策略,使机器人能够执行多种行为。

尽管取得了这些进展,近期分析表明,最先进的VLA模型即使在预训练并随后在数据集上微调后,在分布偏移下仍然出奇地脆弱。当模型暴露于未见过的相机视角、新光照条件或场景噪声扰动时,性能急剧下降——即使在数百万次演示上训练的模型中也存在这一局限。因此,理解和解决这种脆弱性对于在现实世界环境中部署VLA系统至关重要,因为现实世界的视觉环境远比Libero设置复杂。

2.2. 视角鲁棒性与嵌入稳定性

对视觉扰动的鲁棒性是提升VLA性能的一个长期挑战。先前工作探索了数据中心策略,通过领域随机化、多视角演示或大规模视觉扰动数据集来增加视觉多样性,从而改善视角不变性。虽然有效,但这些方法需要大量的数据收集或标注,限制了其可扩展性。

另一条研究路线侧重于表征中心的鲁棒性,通过强制几何一致性来实现。近期研究进一步表明,视角偏移会在预训练ViT编码器的嵌入空间中引起显著漂移,破坏感知与下游策略模块之间的协调。

受这些发现启发,我们探究是否仅通过纠正这种嵌入错位——而不修改整体VLA架构或收集额外数据——就足以恢复视角鲁棒性。

2.3. 参数高效适应

参数高效微调(PEFT)已成为全模型适应的一种有效替代方案,使模型能够以最少的可训练参数适应新任务或新领域。代表性方法包括适配器、LoRA、前缀微调和BitFit,它们都在保持大部分骨干网络冻结的同时引入小型可学习模块。由于高效和稳定,这些技术已被广泛应用于大语言模型和多模态基础模型中。

在具身AI中,PEFT主要应用于语言或策略组件,例如对决策Transformer或指令编码器进行轻量级更新。在处理视角偏移时,大多数现有方法很少通过直接微调视觉模块本身来解决问题。在VLA模型内对视觉通路进行轻量级、针对性适应的方法尤为稀缺。

与这些通常适应整个VLA堆栈的方法不同,我们的工作聚焦于视觉通路的参数高效适应,探究仅对视觉令牌或视觉编码器进行轻量级适应是否足以恢复鲁棒性。

3. 方法

先前工作通常通过对VLA的大部分进行微调或重新训练整个视觉运动策略来解决对视觉扰动的脆弱性,如图3(a,b)所示。相比之下,我们认为全局适应是不必要的:由视觉扰动引起的偏移主要在视觉嵌入空间中引起系统性漂移——破坏视觉编码器与VLM头部之间的协调,而非暴露出视觉运动能力的不足。这一观察表明,仅通过轻量级机制——即令牌调制或基于LoRA的更新——来适应视觉模块,而非全局微调整个VLA。


3.1. 预备知识






3.2. 鲁棒性适应方法

为减轻对视觉扰动的脆弱性,先前工作已探索多种适应策略,如图3所示。

(a)LoRA微调。一种常见解决方案是对VLA骨干网络 θ θ进行全参数或参数高效微调,例如基于LoRA的更新(图3a),该方法在保留预训练权重的同时调整中间特征映射。这种后训练技术在大语言和视觉-语言模型中被广泛采用,并已被进一步纳入VLA的训练范式中。

(b)替代视觉骨干网络。另一条工作路线将视觉编码器完全替换为更鲁棒的骨干网络(图3b),旨在通过更强的视觉表征来提升不变性。然而,这种替换需要额外训练VLA,以重新建立更新后的视觉特征与其语言条件化行动头之间的一致性。

(c)基于提示的适应。基于提示的适应(图3c)引入可学习令牌,直接拼接到多模态嵌入上,使模型以扰动上下文为条件,实现跨域的部分对齐。

虽然这些方法可以提升分布偏移下的性能,但它们往往带来大量的参数开销或需要广泛的重新训练。相比之下,我们的方法专注于对预训练视觉骨干网络进行轻量级、模块化的适应,而不改变其架构或数据分布。

与此相对,我们追求一种更轻量级、模块化的解决方案,以单次方式适应预训练的VLA而不改变其架构。如图3(d–e)所示,我们的框架引入了两种简单而有效的机制:特征令牌调制(FTM),通过可学习的仿射变换全局调整视觉令牌嵌入;以及特征线性适应(FLA),对视觉骨干网络进行低秩更新以实现更深层次的特征重新对齐。这两种机制共同构成了一个统一的单次鲁棒性适应框架,能以最少的参数更新高效地恢复视角和扰动鲁棒性。

3.3. 特征令牌调制




3.4. 特征线性适应

鉴于特征令牌调制(第3.3节)的有效性,我们进一步探索是否也可以通过直接适应视觉骨干网络本身来校正视角引起的错位。具体而言,我们不对输出令牌进行调整,而是对ViT编码器内部的线性层应用参数高效的LoRA[11]更新,如图3(e)所示。




4. 实验 4.1. Libero-V 基准

为系统评估当前VLA策略对视觉扰动的泛化能力,我们构建了Libero-V(Visual)基准,该基准扩展了原始LIBERO基准,纳入了多样化的视觉扰动。原始LIBERO基准评估多任务和持续机器人学习中的知识迁移,包含四个任务套件,每个套件包含10个任务。

遵循[31]的方法,我们在新颖的相机视角下对每个策略在每个任务上进行50次试验评估。此外,Libero-V整合了来自Libero-Plus的视觉扰动,涵盖四种视觉变化类型:(1)不同相机视角,(2)光照变化,(3)背景和桌面纹理,(4)传感器引起的图像噪声。这些扰动模拟了现实的分布偏移,并允许在视觉域变化下进行统一的鲁棒性评估。重要的是,我们的方法执行单次适应——每个任务仅需一次人工演示即可适应新的视觉域。

4.2. 基线方法



4.3. 实现细节


4.4. 结果与分析

对新颖相机视角的鲁棒性。表1总结了所有方法在LIBERO基准套件上跨新颖相机视角的性能,图5可视化了不同适应前后的成功率。我们的方法在所有四个LIBERO套件(Spatial、Object、Goal、Long)上均实现了一致的提升,证明了其在缓解预训练VLA在视角偏移下脆弱性方面的有效性。




对视觉扰动的鲁棒性(Libero-V)。我们进一步在Libero-V(Visual)基准上评估所有方法(表3),该基准引入了四种受控扰动:相机、光照、纹理和噪声。在所有视觉域中,我们提出的单次适应均提供了稳健且一致的性能。

特别地,FLA实现了94.8%的平均成功率,与LoRA微调相当或略优,同时参数效率高出两个数量级。尽管单次LoRA基线已经表现强劲,我们的FLA在相机扰动子集上略优于LoRA(90.8%对90.3%),并且在光照、纹理和噪声扰动上同样保持优异性能,表明其具有更好的跨扰动泛化能力。同时,FTM仅用4K参数就已恢复了大部分视角鲁棒性(87.2%),证实即使简单的令牌级空间适应也能重新激活预训练VLA表征中的潜在不变性。

这些结果强化了我们的核心主张:视觉扰动下的鲁棒性主要受限于空间建模,而有针对性的轻量级适应足以重新激活预训练VLA模型的潜在鲁棒性——无需大规模重新训练或广泛的域随机化。


对适应秩和基线的消融研究。我们对特征线性适应(FLA)模块的适应秩以及基线选择进行了消融研究。表5报告了在新颖相机视角下Libero套件上的结果。如表5所示,将适应秩从16增加到32带来成功率的小幅提升(从90.8%升至91.2%)。这符合预期,因为更高的秩对应视觉骨干网络中更多可学习参数,从而实现更细粒度的特征重新对齐,并在复杂视觉扰动下提升鲁棒性。


参数效率与适应策略。表4比较了所有适应机制在可训练参数数量和Libero-V准确率方面的表现。提示学习(图3c)以极少的参数(0.13M)实现了适度的提升(75.1%),但其浅层条件化不足以实现完整的特征重新对齐。相比之下,FTM(0.004M)实现了显著更高的鲁棒性(90.5%),表明对视觉令牌的直接调制是一条更有效的适应路径。FLA进一步扩展了这一思想,在ViT编码器中引入低秩结构,以470万参数实现了94.8%的成功率——相比LoRA参数缩减99倍,同时保持几乎相同的准确率。

这种效率-性能权衡展示了我们单次适应框架的可扩展性和实用性。它支持我们的总体结论:在具身VLA模型中恢复鲁棒性不需要更多数据或复杂架构,而是可以通过简单、高效且有针对性地面向特征适应来完成。

5. 结论

我们表明,这种脆弱性主要源于空间建模中的错位,而非物理建模的局限,这意味着视觉运动策略本身在根本上仍然是胜任的。我们引入了两种轻量级机制——特征令牌调制(FTM)和特征线性适应(FLA)——以最少的参数重新校准视觉表征。在Libero-V基准上,我们的框架在新颖相机视角和多样化视觉扰动下实现了最先进的泛化性能,同时参数效率比LoRA微调高出高达99倍。这些结果表明,增强具身视觉鲁棒性不需要更大的模型或更多的数据;相反,高效的、有针对性的适应能够解锁现有VLA架构中固有的泛化潜力。

原文链接:https://openaccess.thecvf.com/content/CVPR2026/papers/Li_VLA_Models_Are_More_Generalizable_Than_You_Think_Revisiting_Physical_CVPR_2026_paper.pdf

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
杀疯了!红果8部播放量破10亿的爆款短剧,部部精彩,好评如潮!

杀疯了!红果8部播放量破10亿的爆款短剧,部部精彩,好评如潮!

乡野小珥
2026-10-05 09:56:01
国行免税版 iPhone 18 Pro Max 上架!便宜上千元

国行免税版 iPhone 18 Pro Max 上架!便宜上千元

XCiOS俱乐部
2026-10-04 19:40:53
哈里想恢复王室职务!查尔斯威廉态度一致:不可能,绝不会恢复

哈里想恢复王室职务!查尔斯威廉态度一致:不可能,绝不会恢复

史行途
2026-10-05 22:14:24
上海老师泰国失联七天,精心编织谎言独自出境,定位却身现缅甸

上海老师泰国失联七天,精心编织谎言独自出境,定位却身现缅甸

伴史缘
2026-10-05 09:14:53
如果中国人的低工资是一种优势,那谁最希望我们永远低工资?

如果中国人的低工资是一种优势,那谁最希望我们永远低工资?

熊倌儿
2026-09-19 10:48:32
不查不知道,一查吓一跳!林诗栋妈妈开的农家餐馆,原来这么大

不查不知道,一查吓一跳!林诗栋妈妈开的农家餐馆,原来这么大

仙味少女心
2026-10-04 16:12:48
申花报价2000万遭拒,青岛西海岸门将李昊为何被标5000万?

申花报价2000万遭拒,青岛西海岸门将李昊为何被标5000万?

林子说事
2026-10-05 13:14:11
人不会无故长肠息肉!研究发现:长肠息肉人群多半有这7个特征

人不会无故长肠息肉!研究发现:长肠息肉人群多半有这7个特征

健康之光
2026-09-28 16:54:12
一所小学把iPad变成教具,苹果拍了部纪录片

一所小学把iPad变成教具,苹果拍了部纪录片

报错免疫体
2026-10-05 20:48:17
有人大胆预言:5年后,4-6层步梯老破小可能比高层更值钱?

有人大胆预言:5年后,4-6层步梯老破小可能比高层更值钱?

说故事的阿袭
2026-10-03 15:15:56
74比24程序过关,这项法案把NCAA告上风口浪尖

74比24程序过关,这项法案把NCAA告上风口浪尖

赛场速报局
2026-10-04 20:29:39
姆巴佩养伤期间高调约会,西班牙女友惊艳巴黎,懒理恋情风波

姆巴佩养伤期间高调约会,西班牙女友惊艳巴黎,懒理恋情风波

艺兔体坛
2026-10-05 07:00:04
台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

台湾和上海都是 2000 多万人口,上半年台湾 GDP3.48 万亿,上海多少

抽象派大师
2026-09-20 16:57:21
四川东部17县一夜之间改属重庆

四川东部17县一夜之间改属重庆

糖逗在娱乐
2026-10-05 11:17:24
西交大学生周凯旋被判死刑,行刑前拒见家属,孤身赴死!

西交大学生周凯旋被判死刑,行刑前拒见家属,孤身赴死!

华人星光
2026-05-23 10:51:12
首届“东北超”冠军出炉

首届“东北超”冠军出炉

极目新闻
2026-10-05 22:09:09
对国足两连败主动揽责,邵佳一:全队统一思想迎收官战

对国足两连败主动揽责,邵佳一:全队统一思想迎收官战

北青网-北京青年报
2026-10-05 19:46:04
2005年与2025年的张靓颖,女人过了30,越来越有女人味

2005年与2025年的张靓颖,女人过了30,越来越有女人味

娱你同欢
2026-07-29 22:42:29
中国大满贯战报,1-3,2-3,国乒日本纷纷输球,两队合计5人出局

中国大满贯战报,1-3,2-3,国乒日本纷纷输球,两队合计5人出局

南海浪花
2026-10-05 02:03:57
万万没想到,消失 11 年的李兆会,竟给 44 岁未婚的车晓留下一手

万万没想到,消失 11 年的李兆会,竟给 44 岁未婚的车晓留下一手

卷史
2026-10-04 00:15:08
2026-10-05 23:27:00
CreateAMind incentive-icons
CreateAMind
CreateAMind.agi.top
1610文章数 21关注度
往期回顾 全部

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

头条要闻

高市早苗新内阁遭"当头一棒":日农相丑闻被披露遭围攻

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

艺术
本地
旅游
时尚
房产

艺术要闻

北京出生,现年81岁!建筑大师参选日本市长职位

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

甜城两日,溯脉千年 国庆长假仅余两日,何不向内江而行?

帆布鞋,今年这样穿酷极了!

房产要闻

保利大爆发,冲到榜一!海南楼市前三季度,热销榜出炉!

无障碍浏览 进入关怀版