网易首页 > 网易号 > 正文 申请入驻

IJCAI 2026 专访:动作指挥计算,VLA 加速不降准 | GAIR Paper 125

0
分享至


将动作从输出端搬到调度端,推理速度提升1.79倍。

作者丨邓哲敏

编辑丨齐铖湧

机器人想要真正走进千行百业、千家万户,有一道绕不开的坎:它得足够快。

不说快到能打羽毛球那,至少得快到让人觉得这玩意儿能用。一个机械臂每动一下都要停顿两三秒,哪怕成功率再高,在工业场景里算下来的投入产出比也很难说服人。

VLA 模型是当前具身智能领域最受关注的技术路线之一。它把视觉感知、语言理解和动作生成整合进一套模型,让机器人能够依据语言指令完成复杂操作任务。但 VLA 模型有一个部署层面的老大难问题:推理太慢。

每个控制时刻,模型都要把一个庞大的视觉语言骨干网络跑一遍,计算量极大,导致延迟居高不下,实时控制频率难以保证。

这个问题并不新鲜,学界已经有不少人在尝试解决。今年 IJCAI 收录的一篇论文认为,现有的大多数方案都走偏了一步。AI科技评论联系到一作于闻达,围绕高效 VLA 方法进行交流。


论文原文:https://arxiv.org/abs/2601.19634

01


大家都在剪视觉,

但问题真的在这儿吗

现有的高效 VLA 方法,主流路线是在视觉侧做文章,剪掉“不重要”的视觉 token,跳过一些 Transformer 层,或者直接复用上一帧的计算结果。逻辑上听起来合理:视觉信息最占计算,减掉多余的视觉计算,自然就快了。

但这里有一个被忽视的矛盾。

在机械臂执行任务的过程中,视觉上的复杂程度和操作上需要的精度,并不总是同步的。机械臂接近目标的阶段,画面可能非常简单,但这时候恰好需要全力计算,因为精细的夹取动作容不得误差;反过来,大幅移动阶段画面变化激烈,但其实不需要太多计算资源。

换句话说,视觉复杂度不等于控制难度以视觉信号来决定这一帧算多少,天然就抓错了对象。

AC²-VLA 一作于闻达告诉AI科技评论,团队在调研文献时发现了这个矛盾,并意识到 VLA 模型闭环控制过程中,真正能反映当前时刻需要多少计算的,是机器人的动作状态,而不是视觉画面。


这个判断很直观,和 VLA 的逻辑也很吻合——V是视觉,L是语言,A是动作,既然VLA的最终产出是动作序列,那用动作来指导计算分配,才是真正贴近这类模型本质的做法。

基于这个出发点,他们提出了 AC²-VLA,全称是Action-Context-Aware Adaptive Computation for VLA models,即动作上下文感知的自适应计算框架。两个 AC,一个代表Action Context(动作上下文),一个代表Adaptive Computation(自适应计算),名字里藏着双关。

02


让动作来“拍板”

AC²-VLA 的框架主图展示了整体架构:视觉观测经过视觉编码器,语言指令经过 embedding,加上上一时刻的动作信息,三者共同构成一个动作先验条件向量,输入进一个统一的路由器(router)。这个 router 的输出,决定了当前时刻的计算策略。


具体来说,router控制三件事:

一、cognition caching(认知缓存复用)

如果当前动作状态比较稳定,router 认为可以尝试复用上一步的 VLM 骨干网络输出,就会发起复用请求。但这个请求不等于直接复用,还需要看缓存是否能命中,综合判断运动状态是否连续、视觉状态是否匹配。两个条件都满足,才会跳过整个 VLM 骨干的计算,直接将缓存中的特征向量送入 action head 生成动作序列。

二、token pruning(视觉token剪枝)

router 会为每个视觉 token 打分,判断它与当前操作阶段的相关程度。不相关的 token 被直接丢掉,缩短序列长度,减少计算量。这一步的依据同样来自动作上下文,机械臂正在接近夹取目标时,夹爪附近区域的 token 更重要;大范围移动时,这些区域的权重会相对下降。

三、layer skipping(层跳过)

并非每一层 Transformer 都需要每次执行。router 根据动作上下文判断当前需要多深的计算,对不需要的层直接跳过。有意思的是,不同任务阶段跳过的不一定是同样的层,同样保留28层,接触阶段和移动阶段调用的层序号可能完全不同,模型学会了在不同阶段调用最合适的网络深度。

这三个机制由同一个 router 统一调度,而不是各自用不同的启发式规则来判断。这也是 AC²-VLA 和此前工作最核心的区别之一,之前的方法即使有类似的机制,也往往相互独立,没有统一的训练过的路由来智能分配。

03


自蒸馏,一个很关键的训练设计

Router 的训练方式值得单独解释。

自然会有人想到,为什么不直接用任务成功率来监督 router 的学习?让它学会成功率高的时候可以少算,成功率低的时候多算?

问题在于,任务成功率是一个非常稀疏、非常离散的信号,而且只有完整跑完任务才能知道结果,没有办法实时反馈到每个时间步的计算决策上。更重要的是,如果以成功率为优化目标,框架的泛化性就会受损,换一个 backbone,成功率分布完全不同,原来学到的计算策略就失效了。

AC²-VLA 的解法是自蒸馏(self-distillation):用稠密策略(dense policy,即原始未稀疏化的模型)作为teacher,让稀疏化之后的 student 模型去模仿 teacher 的动作输出和骨干网络特征表示。

稠密模型已经在 Open X-Embodiment 数据集上训练过,对这些任务有一定的成功能力,用它作为 teacher,就能在尽量少算的约束下,让稀疏策略保持接近稠密策略的表现。

这个设计让 AC²-VLA 的高效框架有了可迁移性,换一个 VLA 骨干,只需要重新走一遍蒸馏流程,不需要为每个任务单独调参。

04


推理速度快了多少

AC²-VLA 基于 CogACT 构建,在 SIMPLER 仿真基准上进行了评测。SIMPLER 是当前具身智能领域常用的高保真仿真基准,旨在缩小真实世界与仿真的迁移差距。

在 Google Robot 的 Visual Matching 设定下,AC²-VLA 在四个任务上的平均成功率达到 76.8%,超过稠密基线 CogACT 的 74.8%,也超过了 RT-2-X 的 46.3%。其中 Drawer Opening 任务的成功率从 71.8% 提升到 80.6%,幅度最为明显。


效率数据更直观:计算量降低到原始模型的29.4%(FLOPs),实际推理速度提升 1.79 倍。这个 1.79 倍,在论文发表时是同类方法中的当前最优水平。


值得注意的是,这个加速并没有带来成功率的下降,反而略有提升。论文的解释是,被去掉的那部分计算大量对应于干扰项和冗余特征,移除它们反而让模型的决策更稳定。

FLOPs 降到 29.4% 而实际速度只提升 1.79 倍,两者之间的差距,于闻达解释为理论计算量与实际运行之间不可避免的开销:router 本身的运算、token 剪枝时的内存移动、缓存的查询和命中过程,这些都不完全体现在 FLOPs 里,但在实际运行时都会占用时间。因此,实际端到端加速才是更真实的参考指标。

消融实验进一步验证了三个组件各自的必要性。去掉缓存复用,成功率下降到 70.5%,速度也从 1.79 倍降到 1.66 倍;去掉层跳过,成功率跌至 67.4%;去掉 token 剪枝,速度降至 1.52 倍。三轴同时启用,才能达到最优的速度-精度平衡。


还有一个有趣的发现:在合适的缓存阈值设定下(τcache = 0.2),缓存复用不仅带来速度提升,还把成功率推到了 87.1%,超过稠密基线 12.3 个百分点。论文将这个意外收益归因于时间一致性——逐帧推理容易放大高频视觉噪声,导致动作抖动;而在动作上下文稳定时复用特征,相当于给决策过程加了一层平滑,反而让控制更稳。

05


这套框架的意义

从论文本身看,AC²-VLA 解决的是一个具体的工程问题:让 VLA 模型在不大幅牺牲成功率的前提下,快到可以用。

但它背后有一个更值得关注的思路转变——把动作从“模型输出”变成“模型计算的调度信号”

之前的高效 VLA 工作,把动作当做需要被输出的结果;AC²-VLA 第一次尝试让动作反过来指导模型该看哪里、该想多少、哪些东西可以复用。于闻达提到,这个思路其实和 VLA 模型自身的逻辑一脉相承——既然动作是终点,那用动作上下文来规划通往终点的路径,顺理成章。

团队后续还有一篇工作(Actfovea,尚未发表)沿着相同的逻辑延伸,把动作作为先验信号,往安全性和鲁棒性的方向探索:如果动作序列和视觉状态之间出现了不一致,这种不一致本身就可以用来判断当前的观测和动作是否可信,以及是否需要回退重计算。

从落地的角度看,这类工作的现实意义更直接。当前 VLA 模型的部署难点,并不总是模型不够强,更多时候是模型太慢、太重,跑不起来。边缘设备没有足够的显存,机器人没有足够的算力,工厂里的机器臂不能等上三秒才动。把一个 7B 量级的 VLA 模型压缩到可以在端侧稳定运行,是让它从实验室走向车间的必要一步。

IJCAI 2026 要来了,你还在单打独斗?

为了方便大家抱团交流、互通会议消息,我们专门建了IJCAI 2026 参会群!进群你会解锁这些「福利」

  • 会议情报站投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。

  • 同行茶话会天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。

  • 前沿补给站最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。

  • 现场后援团:(会议期间专属开启):到了会场也不用慌——

    路线导航场馆分布、报告厅怎么走,群里随时问;

    议题共读热门 session、Keynote 现场探讨,错过也能追;

    Poster 汇编现场海报精华整理,一键收藏不遗漏;

    约局广场约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。

进群传送门:扫码进群或添加微信Qvv0909777,备注:IJCAI+ 单位/学校+姓名+方向

搞科研/搞技术,信息差很重要。

来,一起快人一步!

上车,带你看遍全球 AI 顶会精华

可独家畅览:

专家演讲PPT

大会报告全文

热门论文解读

学术新星访谈

未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
冷空气来了!广州今天还有大雨!中秋假期天气→

冷空气来了!广州今天还有大雨!中秋假期天气→

广州交通电台
2026-09-23 13:19:25
经济学家刘元春:居民消费上不去,根子不在老百姓,在分配!

经济学家刘元春:居民消费上不去,根子不在老百姓,在分配!

罗sir财话
2026-09-23 12:25:29
“苹果跳号小米跟不跟”上热搜 网友锐评:雷总别跳了!

“苹果跳号小米跟不跟”上热搜 网友锐评:雷总别跳了!

小柱解说游戏
2026-09-22 12:54:23
亚运战报:再爆大冷世界第2两连败!国羽2-0,韩国1-1

亚运战报:再爆大冷世界第2两连败!国羽2-0,韩国1-1

求球不落谛
2026-09-23 11:27:19
独家揭秘!郭士强为何拒用周琦?媒体人曝出真实原因,球迷炸锅

独家揭秘!郭士强为何拒用周琦?媒体人曝出真实原因,球迷炸锅

桃叶渡春
2026-09-23 15:13:55
全国公安机关视频会议召开,中共中央书记处书记、公安部部长王小洪出席并讲话

全国公安机关视频会议召开,中共中央书记处书记、公安部部长王小洪出席并讲话

政知新媒体
2026-09-23 00:29:59
为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

为何 KFC 要几乎强制手机点单?看网友的吐槽:引起万千共鸣

另子维爱读史
2026-09-17 20:41:04
错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

错换人生再起波澜!郭希宽墓碑刻“长子郭威、次子姚策”,杜新枝证实:全系郭威安排

老猫观点
2026-09-23 07:05:55
62岁阿里董事长蔡崇信回湖州祖宅,乡亲夹道欢迎,风光无限!

62岁阿里董事长蔡崇信回湖州祖宅,乡亲夹道欢迎,风光无限!

大厂财经社
2026-09-23 01:23:03
iPhone 18 Pro Max被曝拍照出现绿斑 苹果客服回应

iPhone 18 Pro Max被曝拍照出现绿斑 苹果客服回应

TechWeb
2026-09-23 15:18:06
13冠!中国队夺得亚运会体操男子团体金牌

13冠!中国队夺得亚运会体操男子团体金牌

界面新闻
2026-09-23 15:05:39
美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

美方在台湾问题上有了新说辞:若中国和平统一,美国不会反对

吕醿极限手工
2026-08-27 14:18:48
央视+爱奇艺首播!40集民国谍战剧首发预告,圆滑秘书VS市侩记者,乱世兄妹演绎信仰觉醒之路!

央视+爱奇艺首播!40集民国谍战剧首发预告,圆滑秘书VS市侩记者,乱世兄妹演绎信仰觉醒之路!

影视快通车
2026-09-23 15:02:52
拆开21个月后,支付宝又合回去了

拆开21个月后,支付宝又合回去了

钛媒体APP
2026-09-23 11:31:34
十二点共识曝光,岛内震动!武器交中央、解放军驻台、台岛裁军?

十二点共识曝光,岛内震动!武器交中央、解放军驻台、台岛裁军?

冰语历史
2026-09-22 13:07:50
俄方:泽连斯基的声明自相矛盾

俄方:泽连斯基的声明自相矛盾

参考消息
2026-09-23 13:29:26
为啥很多娱乐公司不太待见谭松韵?不是演技不行,也不是长相问题,是她太清醒了,清醒到公司算完账发现,那套变现路子在她身上走不通

为啥很多娱乐公司不太待见谭松韵?不是演技不行,也不是长相问题,是她太清醒了,清醒到公司算完账发现,那套变现路子在她身上走不通

黎兜兜
2026-09-22 17:43:12
中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

界面新闻
2026-09-23 15:09:23
平均年龄仅20.5岁!2场比赛进9球丢0球,成U23国足淘汰赛潜在对手

平均年龄仅20.5岁!2场比赛进9球丢0球,成U23国足淘汰赛潜在对手

大卫的篮球故事
2026-09-22 19:49:11
当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

当众拒唱国歌不认中国籍,把两个孩子全送出国,如今报应终于来了

鹤羽说个事
2026-09-02 16:51:59
2026-09-23 17:11:00
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7667文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

游戏
本地
旅游
公开课
军事航空

M站91分!银河城新作外媒满分:永恒经典 没有缺点

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

旅游要闻

“入城就是剧中人”!中秋国庆活动第二波来了——

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国最新型潜艇首次披露

无障碍浏览 进入关怀版