网易首页 > 网易号 > 正文 申请入驻

IJCAI 2026 专访:动作指挥计算,VLA 加速不降准 | GAIR Paper 125

0
分享至


将动作从输出端搬到调度端,推理速度提升1.79倍。

作者丨邓哲敏

编辑丨齐铖湧

机器人想要真正走进千行百业、千家万户,有一道绕不开的坎:它得足够快。

不说快到能打羽毛球那,至少得快到让人觉得这玩意儿能用。一个机械臂每动一下都要停顿两三秒,哪怕成功率再高,在工业场景里算下来的投入产出比也很难说服人。

VLA 模型是当前具身智能领域最受关注的技术路线之一。它把视觉感知、语言理解和动作生成整合进一套模型,让机器人能够依据语言指令完成复杂操作任务。但 VLA 模型有一个部署层面的老大难问题:推理太慢。

每个控制时刻,模型都要把一个庞大的视觉语言骨干网络跑一遍,计算量极大,导致延迟居高不下,实时控制频率难以保证。

这个问题并不新鲜,学界已经有不少人在尝试解决。今年 IJCAI 收录的一篇论文认为,现有的大多数方案都走偏了一步。AI科技评论联系到一作于闻达,围绕高效 VLA 方法进行交流。


论文原文:https://arxiv.org/abs/2601.19634

01


大家都在剪视觉,

但问题真的在这儿吗

现有的高效 VLA 方法,主流路线是在视觉侧做文章,剪掉“不重要”的视觉 token,跳过一些 Transformer 层,或者直接复用上一帧的计算结果。逻辑上听起来合理:视觉信息最占计算,减掉多余的视觉计算,自然就快了。

但这里有一个被忽视的矛盾。

在机械臂执行任务的过程中,视觉上的复杂程度和操作上需要的精度,并不总是同步的。机械臂接近目标的阶段,画面可能非常简单,但这时候恰好需要全力计算,因为精细的夹取动作容不得误差;反过来,大幅移动阶段画面变化激烈,但其实不需要太多计算资源。

换句话说,视觉复杂度不等于控制难度以视觉信号来决定这一帧算多少,天然就抓错了对象。

AC²-VLA 一作于闻达告诉AI科技评论,团队在调研文献时发现了这个矛盾,并意识到 VLA 模型闭环控制过程中,真正能反映当前时刻需要多少计算的,是机器人的动作状态,而不是视觉画面。


这个判断很直观,和 VLA 的逻辑也很吻合——V是视觉,L是语言,A是动作,既然VLA的最终产出是动作序列,那用动作来指导计算分配,才是真正贴近这类模型本质的做法。

基于这个出发点,他们提出了 AC²-VLA,全称是Action-Context-Aware Adaptive Computation for VLA models,即动作上下文感知的自适应计算框架。两个 AC,一个代表Action Context(动作上下文),一个代表Adaptive Computation(自适应计算),名字里藏着双关。

02


让动作来“拍板”

AC²-VLA 的框架主图展示了整体架构:视觉观测经过视觉编码器,语言指令经过 embedding,加上上一时刻的动作信息,三者共同构成一个动作先验条件向量,输入进一个统一的路由器(router)。这个 router 的输出,决定了当前时刻的计算策略。


具体来说,router控制三件事:

一、cognition caching(认知缓存复用)

如果当前动作状态比较稳定,router 认为可以尝试复用上一步的 VLM 骨干网络输出,就会发起复用请求。但这个请求不等于直接复用,还需要看缓存是否能命中,综合判断运动状态是否连续、视觉状态是否匹配。两个条件都满足,才会跳过整个 VLM 骨干的计算,直接将缓存中的特征向量送入 action head 生成动作序列。

二、token pruning(视觉token剪枝)

router 会为每个视觉 token 打分,判断它与当前操作阶段的相关程度。不相关的 token 被直接丢掉,缩短序列长度,减少计算量。这一步的依据同样来自动作上下文,机械臂正在接近夹取目标时,夹爪附近区域的 token 更重要;大范围移动时,这些区域的权重会相对下降。

三、layer skipping(层跳过)

并非每一层 Transformer 都需要每次执行。router 根据动作上下文判断当前需要多深的计算,对不需要的层直接跳过。有意思的是,不同任务阶段跳过的不一定是同样的层,同样保留28层,接触阶段和移动阶段调用的层序号可能完全不同,模型学会了在不同阶段调用最合适的网络深度。

这三个机制由同一个 router 统一调度,而不是各自用不同的启发式规则来判断。这也是 AC²-VLA 和此前工作最核心的区别之一,之前的方法即使有类似的机制,也往往相互独立,没有统一的训练过的路由来智能分配。

03


自蒸馏,一个很关键的训练设计

Router 的训练方式值得单独解释。

自然会有人想到,为什么不直接用任务成功率来监督 router 的学习?让它学会成功率高的时候可以少算,成功率低的时候多算?

问题在于,任务成功率是一个非常稀疏、非常离散的信号,而且只有完整跑完任务才能知道结果,没有办法实时反馈到每个时间步的计算决策上。更重要的是,如果以成功率为优化目标,框架的泛化性就会受损,换一个 backbone,成功率分布完全不同,原来学到的计算策略就失效了。

AC²-VLA 的解法是自蒸馏(self-distillation):用稠密策略(dense policy,即原始未稀疏化的模型)作为teacher,让稀疏化之后的 student 模型去模仿 teacher 的动作输出和骨干网络特征表示。

稠密模型已经在 Open X-Embodiment 数据集上训练过,对这些任务有一定的成功能力,用它作为 teacher,就能在尽量少算的约束下,让稀疏策略保持接近稠密策略的表现。

这个设计让 AC²-VLA 的高效框架有了可迁移性,换一个 VLA 骨干,只需要重新走一遍蒸馏流程,不需要为每个任务单独调参。

04


推理速度快了多少

AC²-VLA 基于 CogACT 构建,在 SIMPLER 仿真基准上进行了评测。SIMPLER 是当前具身智能领域常用的高保真仿真基准,旨在缩小真实世界与仿真的迁移差距。

在 Google Robot 的 Visual Matching 设定下,AC²-VLA 在四个任务上的平均成功率达到 76.8%,超过稠密基线 CogACT 的 74.8%,也超过了 RT-2-X 的 46.3%。其中 Drawer Opening 任务的成功率从 71.8% 提升到 80.6%,幅度最为明显。


效率数据更直观:计算量降低到原始模型的29.4%(FLOPs),实际推理速度提升 1.79 倍。这个 1.79 倍,在论文发表时是同类方法中的当前最优水平。


值得注意的是,这个加速并没有带来成功率的下降,反而略有提升。论文的解释是,被去掉的那部分计算大量对应于干扰项和冗余特征,移除它们反而让模型的决策更稳定。

FLOPs 降到 29.4% 而实际速度只提升 1.79 倍,两者之间的差距,于闻达解释为理论计算量与实际运行之间不可避免的开销:router 本身的运算、token 剪枝时的内存移动、缓存的查询和命中过程,这些都不完全体现在 FLOPs 里,但在实际运行时都会占用时间。因此,实际端到端加速才是更真实的参考指标。

消融实验进一步验证了三个组件各自的必要性。去掉缓存复用,成功率下降到 70.5%,速度也从 1.79 倍降到 1.66 倍;去掉层跳过,成功率跌至 67.4%;去掉 token 剪枝,速度降至 1.52 倍。三轴同时启用,才能达到最优的速度-精度平衡。


还有一个有趣的发现:在合适的缓存阈值设定下(τcache = 0.2),缓存复用不仅带来速度提升,还把成功率推到了 87.1%,超过稠密基线 12.3 个百分点。论文将这个意外收益归因于时间一致性——逐帧推理容易放大高频视觉噪声,导致动作抖动;而在动作上下文稳定时复用特征,相当于给决策过程加了一层平滑,反而让控制更稳。

05


这套框架的意义

从论文本身看,AC²-VLA 解决的是一个具体的工程问题:让 VLA 模型在不大幅牺牲成功率的前提下,快到可以用。

但它背后有一个更值得关注的思路转变——把动作从“模型输出”变成“模型计算的调度信号”

之前的高效 VLA 工作,把动作当做需要被输出的结果;AC²-VLA 第一次尝试让动作反过来指导模型该看哪里、该想多少、哪些东西可以复用。于闻达提到,这个思路其实和 VLA 模型自身的逻辑一脉相承——既然动作是终点,那用动作上下文来规划通往终点的路径,顺理成章。

团队后续还有一篇工作(Actfovea,尚未发表)沿着相同的逻辑延伸,把动作作为先验信号,往安全性和鲁棒性的方向探索:如果动作序列和视觉状态之间出现了不一致,这种不一致本身就可以用来判断当前的观测和动作是否可信,以及是否需要回退重计算。

从落地的角度看,这类工作的现实意义更直接。当前 VLA 模型的部署难点,并不总是模型不够强,更多时候是模型太慢、太重,跑不起来。边缘设备没有足够的显存,机器人没有足够的算力,工厂里的机器臂不能等上三秒才动。把一个 7B 量级的 VLA 模型压缩到可以在端侧稳定运行,是让它从实验室走向车间的必要一步。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人有没有血栓,喝水就知道?体内有血栓的人,喝水常有这 8 个表现

人有没有血栓,喝水就知道?体内有血栓的人,喝水常有这 8 个表现

任医生聊健康
2026-08-11 12:35:07
全欧过人王诞生!皇马 19 岁边锋,每 90 分钟 5.7 次过人!皇马新援登顶五大联赛过人榜

全欧过人王诞生!皇马 19 岁边锋,每 90 分钟 5.7 次过人!皇马新援登顶五大联赛过人榜

福酱的小时光
2026-09-23 10:10:40
赛季0登场!利物浦下达逐客令 28岁玻璃人冬窗面临离队

赛季0登场!利物浦下达逐客令 28岁玻璃人冬窗面临离队

球事百科吖
2026-09-24 04:32:17
伊朗战场越打越清楚,法国老牌媒体终于认了:中国真正的杀手锏压根不是导弹,而是这盘大布局?

伊朗战场越打越清楚,法国老牌媒体终于认了:中国真正的杀手锏压根不是导弹,而是这盘大布局?

回京历史梦
2026-09-22 10:35:42
人月两团圆!2026全国中秋假期天气地图出炉 看看哪里适宜出行

人月两团圆!2026全国中秋假期天气地图出炉 看看哪里适宜出行

北青网-北京青年报
2026-09-23 16:15:07
中方:深感痛心

中方:深感痛心

南方都市报
2026-09-23 10:12:53
怎么到处都是毛毛虫?对人体有害吗?专家:别慌,对人无害

怎么到处都是毛毛虫?对人体有害吗?专家:别慌,对人无害

半岛官网
2026-09-23 16:38:27
俄乌战争开始后,俄罗斯总共扣押了中国多少飞机?

俄乌战争开始后,俄罗斯总共扣押了中国多少飞机?

花仙历史说
2026-09-19 02:18:24
除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

除了性生活,就是打麻将!2000多县城普通人的生活现状只能这样?

流史岁月
2026-07-06 18:00:06
“把白砂糖还给我们”冲上热搜,食品企业为什么开始换糖?

“把白砂糖还给我们”冲上热搜,食品企业为什么开始换糖?

观察者网
2026-09-23 16:36:08
蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

蒙古国政府再次公开拒绝了中方提出的跨境铁路运力扩容方案

果妈聊娱乐
2026-08-23 08:38:03
Here we go!罗马诺:阿拉巴将加盟乌迪内斯,双方签约至2027年6月

Here we go!罗马诺:阿拉巴将加盟乌迪内斯,双方签约至2027年6月

懂球帝
2026-09-24 00:45:06
队报:德尚目前正享受休息时间,可能11月后才重执教鞭

队报:德尚目前正享受休息时间,可能11月后才重执教鞭

懂球帝
2026-09-23 14:33:32
王钰栋暴怒!被撞翻后锁喉对手,主裁连出3黄,7分钟两次冲突

王钰栋暴怒!被撞翻后锁喉对手,主裁连出3黄,7分钟两次冲突

奥拜尔
2026-09-23 14:51:15
603328,封死涨停!供需偏紧,铜板块5股绩优低估值

603328,封死涨停!供需偏紧,铜板块5股绩优低估值

数据宝
2026-09-23 21:46:19
亚运会|举重综合:朝鲜包揽首日两金 中国队赵金兰首秀摘银

亚运会|举重综合:朝鲜包揽首日两金 中国队赵金兰首秀摘银

新华社
2026-09-23 21:28:25
战略人才从何而来?“双一流”将扩招7.6万人,向AI等学科倾斜

战略人才从何而来?“双一流”将扩招7.6万人,向AI等学科倾斜

21世纪经济报道
2026-09-23 18:02:05
汪涛:全球呈现K型分化,外部失衡是内部结构的表象

汪涛:全球呈现K型分化,外部失衡是内部结构的表象

创作者_uYkl
2026-09-23 10:13:20
能开油车还是开油车吧!车管所真话:油车没坏,真别急着换

能开油车还是开油车吧!车管所真话:油车没坏,真别急着换

周哥一影视
2026-09-23 15:54:03
奉劝大家:冰箱再大,也别放“这8样”东西,不保鲜,危险太大了

奉劝大家:冰箱再大,也别放“这8样”东西,不保鲜,危险太大了

Home范
2026-08-18 12:29:17
2026-09-24 05:00:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7669文章数 20785关注度
往期回顾 全部

科技要闻

网易未来大会圆满落幕 硅基智能跨越临界点

头条要闻

肺癌女性中98%从不吸烟 钟南山团队回应

头条要闻

肺癌女性中98%从不吸烟 钟南山团队回应

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

电池的权力游戏

汽车要闻

宾利首款纯电SUV 托卡尔正式发布 国内售价198.8万起

态度原创

家居
房产
健康
教育
数码

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

痘痘没成熟,千万别硬挤!

教育要闻

2027高考为什么被称作最难一届?4个核心压力,一个比一个狠

数码要闻

小米18 Pro系列发布:售5999元起 首发第六代骁龙8至尊版芯片

无障碍浏览 进入关怀版