网易首页 > 网易号 > 正文 申请入驻

中大 × MBZUAI重磅开源!A₁:全透明高效 VLA 模型,机器人实时控制成本直降 76% 丨CVPR 2026 Findings

0
分享至

中大 ×MBZUAI 开源 A₁,机器人控制成本大降。

开放世界机器人操作一直被大模型算力成本、推理延迟两大难题卡脖子:千亿级 VLM 骨干 + 迭代扩散 / 流匹配动作头,让普通硬件根本跑不动实时控制。

来自中山大学、MBZUAI、Spatialtemporal AI 与 ATeam 的团队直接给出全开源、全透明、自适应、高效率的解决方案 ——A₁截断式视觉 - 语言 - 动作模型,一套预算感知自适应推理方案,同时加速骨干网络与动作头,推理延迟最高降 72%、骨干计算量砍 76.6%,性能还能打平甚至反超主流基线。

从仿真到真机、从单臂到多平台,A₁凭开源全栈跑出 SOTA,彻底打破VLA 模型 “高性能 = 高成本” 的魔咒。

01


行业痛点:VLA模型很强,

但用不起、跑不动

Vision-Language-Action(VLA)已经成为通用机器人操作的主流范式:大尺度视觉语言模型(VLM)把多模态观测压缩为隐式表示,动作头(扩散 / 流匹配)再映射为连续电机指令,泛化性拉满。

落地代价极其昂贵

▪ 为了保证语义理解与可供性推理,模型必须使用数十亿参数的 VLM 骨干,推理耗时极长;

▪ 为了动作平滑与精准,动作头普遍采用扩散或流匹配架构,需要十数轮迭代去噪,算力开销巨大;

▪ 现有优化大多只针对 VLM 主干,动作头始终是被忽略的瓶颈,即便主干加速,整体延迟依然居高不下;

▪ 最终结果是:能跑 SOTA 的 VLA 模型,必须依赖高端计算集群,普通硬件无法实现实时控制。

团队总结出三个关键观察,直接戳中效率优化核心:

1.轨迹收敛:流匹配轨迹 3 步内就锁定正确模式,后续迭代收益递减;

2.动作冗余:连续控制步动作平滑变化,只需粗更新;

3.层间耦合:VLM 中间层已包含足够空间视觉特征,没必要跑完全层。

一句话:算力只花在会改变动作的地方,A₁就此诞生。

02


核心设计:一套自适应框架,

同时卷性能与效率

A₁没有走 “轻量化重训” 或 “单纯剪枝” 的老路,而是从推理全链路出发,提出一套预算感知、动态退出、层间热启动的协同加速方案,在不损失任务成功率的前提下,实现效率数量级提升。

整体架构

A₁由 VLM 骨干与动作头组成,VLM提供语义与可供性特征,动作头支持流匹配(FM)与MLP两种实现;自适应推理方案同时压缩骨干计算量与动作头迭代次数,兼顾速度与成功率。


图1:A1模型整体架构

1.多出口训练:让每一层都具备动作预测能力

传统 VLA 只在最后一层输出动作,A₁在训练阶段就让 VLM每一层都连接共享动作头,直接监督各层输出的动作序列。这一设计让模型在推理时,可以随时在中间层读取动作结果,为动态早停打下基础。

2.动作一致性早停:算力只花在 “必要的层”

推理时,模型逐层计算动作,并与上一层结果做一致性校验。当动作变化小于阈值时,直接判定 “特征足够”,提前终止主干前向。团队使用余弦相似度、L2 距离等指标衡量动作稳定性,并通过训练集统计得到分层阈值,在 “节省算力” 与 “保持精度” 之间取得最优平衡。

3.层间截断流匹配:解决早停带来的次生瓶颈

动态早停虽然加速了 VLM,但会让流匹配动作头在每一层都重复执行完整去噪步骤,反而拖慢速度。为此,团队提出层间热启动流匹配

▪ 大幅减少单轮去噪步数(从 10 步降至 2 步);

▪ 上一层的动作输出,直接作为下一层去噪的初始值,实现热启动;

▪ 避免从随机噪声重新开始,既保证精度,又把动作头开销压到最低。

4.多机器人泛化训练:开源数据也能练出强迁移模型

A₁采用两阶段训练:第一阶段在大规模开源机器人数据上预训练,学习通用操作先验;第二阶段在真实机器人轨迹上微调,适配不同机型与场景。

团队还融合了 15951 条自研真机数据,进一步缩小仿真到现实的差距,让模型在 Franka、AgiBot、WuJie-Arm等多款机械臂上都能稳定工作。

03


深度解读:

A₁到底解决了VLA的哪些核心痛点?

如果只看加速数字,很容易低估 A₁的价值。它真正的突破,是重新定义了高效VLA的设计范式

1.第一次实现主干与动作头联合加速

过去的加速方案都是 “单边优化”:要么压 VLM,要么简动作头。A₁证明,只有协同优化,才能实现端到端延迟大幅下降。早停降低主干计算,热启动流匹配降低动作头迭代,两者耦合,才把延迟从数十秒压到秒级。

2. 用最小精度损失换取最大效率收益

实验显示,即便减少 76.6% 的主干计算,任务成功率仅小幅下降。这说明:VLA模型存在极端严重的过计算,大量深层特征对机器人操作来说并非必需。A₁用数据证实,动态优化不是 “妥协精度”,而是 “回归合理计算”。

3.开源全栈,打破封闭壁垒

当前顶尖 VLA 大多依赖闭源数据与私有框架,社区难以复现。A₁全程使用开源数据训练,并开放权重、代码、数据处理流程与评估脚本,让小型实验室与普通开发者也能搭建高性能、低成本的机器人控制模型。

04


实验验证:

从仿真到真机,全面超越现有开源方案

A₁在三类标准场景上完成系统验证,结果显示:它在效率上大幅领先,在性能上同样达到SOTA。

仿真环境:高精度与强泛化兼顾

在 LIBERO 长期操作基准上,A₁实现 96.6% 的平均成功率,在物体操作任务上接近满分;在 VLABench 长程推理任务上,A₁超越 π₀.5 等模型,展现出优秀的语言理解与任务规划能力;在分布偏移更大的LIBERO-Plus 上,A₁零射性能达到 75.3%,显著优于对比方法,证明其特征具备强泛化性。


表1:LIBERO、VLABench 主流模型成功率对比,A1取得领先性能。

真实机器人:跨平台稳定执行

在 Franka、AgiBot、WuJie-Arm、Dobot-Arm 四款机械臂上,A₁完成放杯子、摆水果、捡胶水、擦桌子、叠积木等一系列日常操作,平均成功率达到56.7%,明显高于 π₀与 π₀.5。尤其在小样本学习场景下,A₁能快速适应新任务,表现出极强的实用潜力。

表2:真机多平台结果表

RoboChallenge:开源模型登顶

在包含 30 个复杂真机任务的 RoboChallenge 上,A₁在完全开源、无闭源数据的条件下,取得 29.00% 的平均成功率,超过 π₀、X-VLA、RDT-1B 等一众开源模型,证明开源路线同样可以做到顶尖水平。


表3:RoboChallenge 基准结果表

效率表现:延迟与计算量双降

在最优配置下,A₁-FM 单回合推理时间从 37.8 秒降至 10.5 秒,降幅达 72.3%;A₁-MLP最多可减少 76.6% 的主干计算,依旧保持 92% 以上的成功率;在真机 AgiBot 上,模型计算量降低 84.6%,操作精度几乎没有下降,真正实现 “低成本、高可用”。

表4、5:自适应早停效率表



行为可视化:更稳定、更鲁棒

从任务执行视频可以直观看到:对比模型容易出现物体混淆、夹爪提前闭合、抓取偏移等问题;A₁能稳定识别目标,动作连贯,在长程任务中依然保持高可靠性。同时,动态推理可视化显示:简单移动在浅层即可退出,复杂操作才进入深层,算力分配高度智能。


图2:任务执行对比


图3:真机动态推理可视化

05


局限与未来

A₁打开的下一代VLA研究方向

尽管 A₁在效率与性能上取得显著突破,团队仍清晰指出当前方案的改进空间,并为后续研究指明方向。

第一,当前预训练依赖带标注的可供性数据,未来可引入无监督或自监督方法,从海量机器人视频与交互数据中自动挖掘可供性先验,进一步扩大数据来源。

第二,A₁以模仿学习为基础,在长程任务中仍存在累积误差。后续可结合强化学习,通过环境实时反馈修正策略,提升复杂场景下的鲁棒性与成功率。

第三,云边推理与机械臂执行之间的同步延迟,仍会影响操作流畅度。团队计划采用异步执行、预测控制等方式,提升真机运行的顺滑度。

第四,A₁已成功部署在自研双臂移动平台,下一步将重点拓展双臂协同、移动操作、非结构环境适应等能力,向更通用的家庭与工业机器人迈进。

06



A₁第一次把 “高性能、高效率、全开源” 三件事同时做到位,用一套简单优雅的自适应截断方案,把 VLA 模型从 “实验室奢侈品” 拉到 “可落地实用款”。

从仿真到真机、从单臂到双臂、从小样本到泛化,A₁证明:开源透明的研究,完全能打赢闭源方案。

全套代码、权重、数据 pipeline 已开放,机器人底层玩家可以直接冲了。

论文信息

标题:A₁: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model

代码:https://github.com/ATeam

项目页:https://ATeam.com/en/research/68bc2cde8497d7f238dde690

链接:https://arxiv.org/abs/2604.05672

论文作者介绍:

张凯东,中山大学计算机学院2024级硕士,本科毕业于中山大学智能工程学院,师从梁小丹教授。研究方向为具身智能。


张健,穆罕默德·本·扎耶德人工智能大学(MBZUAI)计算机视觉博士生,研究方向为具身智能。分别于2023年和2020年从北京大学和合肥工业大学获得硕士和学士学位。


许镕涛 MBZUAI研究员,无界智慧CTO。中科院自动化所多模态人工智能国重(前模识国重)博士, 在学期间曾获得中科院院长奖、两次IEEE旗舰会议最佳论文提名奖、国奖、北京市和中科院优秀毕业生。华中科技大学数学与计算机双学士学位。研究方向为具身智能与机器人,提出全球首个基于空间可供性操作大模型A0,曾在银河通用共同主导全球首个具身导航大模型NaVid。在顶级学术会议和期刊(RSS,IRCA,IROS,CVPR,ICCV,ECCV,NeurIPS,ICML,ICLR,AAAI,EMNLP,MICCAI,TPAMI,TIP,TNNLS,TII,TIM,TMM,TCSVT,ISPRS)上共发表论文80余篇,其中以第一作者或通讯作者发表论文近40篇,含ESI高被引论文3篇,IEEE Trans封面文章1篇,发表8次Oral论文。拥有10余项发明专利,研究成果应用于YOLO系列,以及无界智慧、银河通用、华为、Momenta等多款产品。


梁小丹是中山大学深圳校区的教授,同时也是穆罕默德·本·扎耶德人工智能大学(MBZUAI)计算机视觉系的副教授。她曾是卡内基梅隆大学的项目科学家,与邢教授合作。

她在视觉语言理解与生成及其在具身人工智能中的应用方面发表了 120 余篇前沿论文,这些论文发表于该领域最负盛名的期刊和会议,谷歌引用量超过 30000 次。

她定期担任 ICCV、CVPR、NeurIPS、ICML、ICLR 和 AAAI 等会议的领域主席,并担任 CVPR 2021 的教程主席、 CVPR 2023 的评审主席。她曾荣获ACM中国最佳博士论文奖、CCF 最佳博士论文奖以及阿里巴巴达摩院青年学者奖。她的研究成果已被应用于多家知名人工智能公司(如 Deepseek、联想、字节跳动和腾讯)的关键产品中。



未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
3-0!中国女排击败日本队夺冠 一人立大功 赢球的最大功臣不是吴梦洁

3-0!中国女排击败日本队夺冠 一人立大功 赢球的最大功臣不是吴梦洁

南海浪花
2026-09-22 21:08:29
痛心!泰国3名中国女子遭4名同胞拘禁性侵,索要高额赎金,靠微信求救成功获救,细节披露

痛心!泰国3名中国女子遭4名同胞拘禁性侵,索要高额赎金,靠微信求救成功获救,细节披露

火山詩话
2026-09-23 15:40:47
“谢广坤”饰演者销售的东北酸菜被检不合格,已售13万袋,宣传视频中本人声称这是他自己的厂子

“谢广坤”饰演者销售的东北酸菜被检不合格,已售13万袋,宣传视频中本人声称这是他自己的厂子

韩小娱
2026-09-23 07:38:57
白瞎了李富真的颜值,儿子长得还是像保镖前夫,肥头肥脑成绩很好

白瞎了李富真的颜值,儿子长得还是像保镖前夫,肥头肥脑成绩很好

照见古今
2026-09-07 17:56:09
中国最诡异的4家平台公司:所有风险留给穷人,所有暴利留给自己

中国最诡异的4家平台公司:所有风险留给穷人,所有暴利留给自己

白浅娱乐聊
2026-09-22 00:31:33
菲弹劾法庭修改计票规则 副总统莎拉定罪门槛下调

菲弹劾法庭修改计票规则 副总统莎拉定罪门槛下调

新华社
2026-09-23 17:18:41
A股:不必等待了,尾盘传来两个信息,明天,周四或要这样走!

A股:不必等待了,尾盘传来两个信息,明天,周四或要这样走!

明心
2026-09-23 15:50:39
苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

苏州一对情侣,谈了7年,女子提了18次分手,分手后在街头痛哭!

川渝视觉
2026-04-17 22:13:14
李月汝队友夜店被捕:拳击安保缴纳1000美金获释 佩奇被电击枪指

李月汝队友夜店被捕:拳击安保缴纳1000美金获释 佩奇被电击枪指

醉卧浮生
2026-09-23 09:01:04
普京发出最后警告,俄军宁和欧洲开战,也要断乌军援兵,代价巨大

普京发出最后警告,俄军宁和欧洲开战,也要断乌军援兵,代价巨大

顾蔡卫
2026-09-22 07:34:17
54岁藤原纪香,从未活在美颜滤镜里

54岁藤原纪香,从未活在美颜滤镜里

草莓解说体育
2026-09-15 06:46:01
这瓜有点大啊!罗永浩当初的合伙人黄斌在微博上开炮,把罗永浩的老底给扒了

这瓜有点大啊!罗永浩当初的合伙人黄斌在微博上开炮,把罗永浩的老底给扒了

西楼知趣杂谈
2026-09-16 06:33:16
恭喜,全红婵正式上任,亮相新岗位,薪酬曝光,新造型惊艳

恭喜,全红婵正式上任,亮相新岗位,薪酬曝光,新造型惊艳

黎兜兜
2026-09-23 08:12:48
哈利:不理解薪水少于我的人竟坐私人飞机 报价看着都肉疼

哈利:不理解薪水少于我的人竟坐私人飞机 报价看着都肉疼

北青网-北京青年报
2026-09-22 19:59:04
彻底待不下去了!哈里一家或将打包撤离英国,永久返回加州定居

彻底待不下去了!哈里一家或将打包撤离英国,永久返回加州定居

阿废冷眼观察所
2026-09-23 01:38:25
非必要不切肠息肉?医生强调:只要切过息肉,患者要多加关注6点

非必要不切肠息肉?医生强调:只要切过息肉,患者要多加关注6点

叙说医疗健康
2026-09-03 09:00:42
何穗生日晒与儿子合照,开心逗娃满眼都是宠溺,手工制作生日物品

何穗生日晒与儿子合照,开心逗娃满眼都是宠溺,手工制作生日物品

扒虾侃娱
2026-09-23 15:31:26
昆明一餐馆门口彩绘遭人用白漆损毁!经调查,损毁壁画的人竟是……

昆明一餐馆门口彩绘遭人用白漆损毁!经调查,损毁壁画的人竟是……

都市条形码
2026-09-22 16:06:06
总统怕是当不成了?海牙法庭传来噩耗,老杜家族迎来绝地反击时刻

总统怕是当不成了?海牙法庭传来噩耗,老杜家族迎来绝地反击时刻

寻墨阁
2026-09-22 22:21:23
将日本记者干沉默!日媒失态:用争议图片报道张博恒 韩美女也遭殃

将日本记者干沉默!日媒失态:用争议图片报道张博恒 韩美女也遭殃

风过乡
2026-09-23 07:16:25
2026-09-23 18:12:49
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7667文章数 20785关注度
往期回顾 全部

科技要闻

2026网易未来大会下午:AI走进现实

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

头条要闻

中国U23亚运会小组头名出线 八强战或避开日本

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

5.1米的启境GX7,底盘凭什么又稳又舒服?

态度原创

房产
本地
手机
亲子
艺术

房产要闻

楼市变天!三亚第一个"接住"新政的楼盘出现了

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

手机要闻

共研旗舰手机新体验,搭载天玑9600 Pro的OPPO Find X10 Pro Max

亲子要闻

媒体:举报“炒菜锅洗拖把”幼师的担心不能成真

艺术要闻

穿浴衣的女子,日本写实画家新作

无障碍浏览 进入关怀版