网易首页 > 网易号 > 正文 申请入驻

中大 × MBZUAI重磅开源!A₁:全透明高效 VLA 模型,机器人实时控制成本直降 76% 丨CVPR 2026 Findings

0
分享至

中大 ×MBZUAI 开源 A₁,机器人控制成本大降。

开放世界机器人操作一直被大模型算力成本、推理延迟两大难题卡脖子:千亿级 VLM 骨干 + 迭代扩散 / 流匹配动作头,让普通硬件根本跑不动实时控制。

来自中山大学、MBZUAI、Spatialtemporal AI 与 ATeam 的团队直接给出全开源、全透明、自适应、高效率的解决方案 ——A₁截断式视觉 - 语言 - 动作模型,一套预算感知自适应推理方案,同时加速骨干网络与动作头,推理延迟最高降 72%、骨干计算量砍 76.6%,性能还能打平甚至反超主流基线。

从仿真到真机、从单臂到多平台,A₁凭开源全栈跑出 SOTA,彻底打破VLA 模型 “高性能 = 高成本” 的魔咒。

01


行业痛点:VLA模型很强,

但用不起、跑不动

Vision-Language-Action(VLA)已经成为通用机器人操作的主流范式:大尺度视觉语言模型(VLM)把多模态观测压缩为隐式表示,动作头(扩散 / 流匹配)再映射为连续电机指令,泛化性拉满。

落地代价极其昂贵

▪ 为了保证语义理解与可供性推理,模型必须使用数十亿参数的 VLM 骨干,推理耗时极长;

▪ 为了动作平滑与精准,动作头普遍采用扩散或流匹配架构,需要十数轮迭代去噪,算力开销巨大;

▪ 现有优化大多只针对 VLM 主干,动作头始终是被忽略的瓶颈,即便主干加速,整体延迟依然居高不下;

▪ 最终结果是:能跑 SOTA 的 VLA 模型,必须依赖高端计算集群,普通硬件无法实现实时控制。

团队总结出三个关键观察,直接戳中效率优化核心:

1.轨迹收敛:流匹配轨迹 3 步内就锁定正确模式,后续迭代收益递减;

2.动作冗余:连续控制步动作平滑变化,只需粗更新;

3.层间耦合:VLM 中间层已包含足够空间视觉特征,没必要跑完全层。

一句话:算力只花在会改变动作的地方,A₁就此诞生。

02


核心设计:一套自适应框架,

同时卷性能与效率

A₁没有走 “轻量化重训” 或 “单纯剪枝” 的老路,而是从推理全链路出发,提出一套预算感知、动态退出、层间热启动的协同加速方案,在不损失任务成功率的前提下,实现效率数量级提升。

整体架构

A₁由 VLM 骨干与动作头组成,VLM提供语义与可供性特征,动作头支持流匹配(FM)与MLP两种实现;自适应推理方案同时压缩骨干计算量与动作头迭代次数,兼顾速度与成功率。


图1:A1模型整体架构

1.多出口训练:让每一层都具备动作预测能力

传统 VLA 只在最后一层输出动作,A₁在训练阶段就让 VLM每一层都连接共享动作头,直接监督各层输出的动作序列。这一设计让模型在推理时,可以随时在中间层读取动作结果,为动态早停打下基础。

2.动作一致性早停:算力只花在 “必要的层”

推理时,模型逐层计算动作,并与上一层结果做一致性校验。当动作变化小于阈值时,直接判定 “特征足够”,提前终止主干前向。团队使用余弦相似度、L2 距离等指标衡量动作稳定性,并通过训练集统计得到分层阈值,在 “节省算力” 与 “保持精度” 之间取得最优平衡。

3.层间截断流匹配:解决早停带来的次生瓶颈

动态早停虽然加速了 VLM,但会让流匹配动作头在每一层都重复执行完整去噪步骤,反而拖慢速度。为此,团队提出层间热启动流匹配

▪ 大幅减少单轮去噪步数(从 10 步降至 2 步);

▪ 上一层的动作输出,直接作为下一层去噪的初始值,实现热启动;

▪ 避免从随机噪声重新开始,既保证精度,又把动作头开销压到最低。

4.多机器人泛化训练:开源数据也能练出强迁移模型

A₁采用两阶段训练:第一阶段在大规模开源机器人数据上预训练,学习通用操作先验;第二阶段在真实机器人轨迹上微调,适配不同机型与场景。

团队还融合了 15951 条自研真机数据,进一步缩小仿真到现实的差距,让模型在 Franka、AgiBot、WuJie-Arm等多款机械臂上都能稳定工作。

03


深度解读:

A₁到底解决了VLA的哪些核心痛点?

如果只看加速数字,很容易低估 A₁的价值。它真正的突破,是重新定义了高效VLA的设计范式

1.第一次实现主干与动作头联合加速

过去的加速方案都是 “单边优化”:要么压 VLM,要么简动作头。A₁证明,只有协同优化,才能实现端到端延迟大幅下降。早停降低主干计算,热启动流匹配降低动作头迭代,两者耦合,才把延迟从数十秒压到秒级。

2. 用最小精度损失换取最大效率收益

实验显示,即便减少 76.6% 的主干计算,任务成功率仅小幅下降。这说明:VLA模型存在极端严重的过计算,大量深层特征对机器人操作来说并非必需。A₁用数据证实,动态优化不是 “妥协精度”,而是 “回归合理计算”。

3.开源全栈,打破封闭壁垒

当前顶尖 VLA 大多依赖闭源数据与私有框架,社区难以复现。A₁全程使用开源数据训练,并开放权重、代码、数据处理流程与评估脚本,让小型实验室与普通开发者也能搭建高性能、低成本的机器人控制模型。

04


实验验证:

从仿真到真机,全面超越现有开源方案

A₁在三类标准场景上完成系统验证,结果显示:它在效率上大幅领先,在性能上同样达到SOTA。

仿真环境:高精度与强泛化兼顾

在 LIBERO 长期操作基准上,A₁实现 96.6% 的平均成功率,在物体操作任务上接近满分;在 VLABench 长程推理任务上,A₁超越 π₀.5 等模型,展现出优秀的语言理解与任务规划能力;在分布偏移更大的LIBERO-Plus 上,A₁零射性能达到 75.3%,显著优于对比方法,证明其特征具备强泛化性。


表1:LIBERO、VLABench 主流模型成功率对比,A1取得领先性能。

真实机器人:跨平台稳定执行

在 Franka、AgiBot、WuJie-Arm、Dobot-Arm 四款机械臂上,A₁完成放杯子、摆水果、捡胶水、擦桌子、叠积木等一系列日常操作,平均成功率达到56.7%,明显高于 π₀与 π₀.5。尤其在小样本学习场景下,A₁能快速适应新任务,表现出极强的实用潜力。

表2:真机多平台结果表

RoboChallenge:开源模型登顶

在包含 30 个复杂真机任务的 RoboChallenge 上,A₁在完全开源、无闭源数据的条件下,取得 29.00% 的平均成功率,超过 π₀、X-VLA、RDT-1B 等一众开源模型,证明开源路线同样可以做到顶尖水平。


表3:RoboChallenge 基准结果表

效率表现:延迟与计算量双降

在最优配置下,A₁-FM 单回合推理时间从 37.8 秒降至 10.5 秒,降幅达 72.3%;A₁-MLP最多可减少 76.6% 的主干计算,依旧保持 92% 以上的成功率;在真机 AgiBot 上,模型计算量降低 84.6%,操作精度几乎没有下降,真正实现 “低成本、高可用”。

表4、5:自适应早停效率表



行为可视化:更稳定、更鲁棒

从任务执行视频可以直观看到:对比模型容易出现物体混淆、夹爪提前闭合、抓取偏移等问题;A₁能稳定识别目标,动作连贯,在长程任务中依然保持高可靠性。同时,动态推理可视化显示:简单移动在浅层即可退出,复杂操作才进入深层,算力分配高度智能。


图2:任务执行对比


图3:真机动态推理可视化

05


局限与未来

A₁打开的下一代VLA研究方向

尽管 A₁在效率与性能上取得显著突破,团队仍清晰指出当前方案的改进空间,并为后续研究指明方向。

第一,当前预训练依赖带标注的可供性数据,未来可引入无监督或自监督方法,从海量机器人视频与交互数据中自动挖掘可供性先验,进一步扩大数据来源。

第二,A₁以模仿学习为基础,在长程任务中仍存在累积误差。后续可结合强化学习,通过环境实时反馈修正策略,提升复杂场景下的鲁棒性与成功率。

第三,云边推理与机械臂执行之间的同步延迟,仍会影响操作流畅度。团队计划采用异步执行、预测控制等方式,提升真机运行的顺滑度。

第四,A₁已成功部署在自研双臂移动平台,下一步将重点拓展双臂协同、移动操作、非结构环境适应等能力,向更通用的家庭与工业机器人迈进。

06



A₁第一次把 “高性能、高效率、全开源” 三件事同时做到位,用一套简单优雅的自适应截断方案,把 VLA 模型从 “实验室奢侈品” 拉到 “可落地实用款”。

从仿真到真机、从单臂到双臂、从小样本到泛化,A₁证明:开源透明的研究,完全能打赢闭源方案。

全套代码、权重、数据 pipeline 已开放,机器人底层玩家可以直接冲了。

论文信息

标题:A₁: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model

代码:https://github.com/ATeam

项目页:https://ATeam.com/en/research/68bc2cde8497d7f238dde690

链接:https://arxiv.org/abs/2604.05672

论文作者介绍:

张凯东,中山大学计算机学院2024级硕士,本科毕业于中山大学智能工程学院,师从梁小丹教授。研究方向为具身智能。


张健,穆罕默德·本·扎耶德人工智能大学(MBZUAI)计算机视觉博士生,研究方向为具身智能。分别于2023年和2020年从北京大学和合肥工业大学获得硕士和学士学位。


许镕涛 MBZUAI研究员,无界智慧CTO。中科院自动化所多模态人工智能国重(前模识国重)博士, 在学期间曾获得中科院院长奖、两次IEEE旗舰会议最佳论文提名奖、国奖、北京市和中科院优秀毕业生。华中科技大学数学与计算机双学士学位。研究方向为具身智能与机器人,提出全球首个基于空间可供性操作大模型A0,曾在银河通用共同主导全球首个具身导航大模型NaVid。在顶级学术会议和期刊(RSS,IRCA,IROS,CVPR,ICCV,ECCV,NeurIPS,ICML,ICLR,AAAI,EMNLP,MICCAI,TPAMI,TIP,TNNLS,TII,TIM,TMM,TCSVT,ISPRS)上共发表论文80余篇,其中以第一作者或通讯作者发表论文近40篇,含ESI高被引论文3篇,IEEE Trans封面文章1篇,发表8次Oral论文。拥有10余项发明专利,研究成果应用于YOLO系列,以及无界智慧、银河通用、华为、Momenta等多款产品。


梁小丹是中山大学深圳校区的教授,同时也是穆罕默德·本·扎耶德人工智能大学(MBZUAI)计算机视觉系的副教授。她曾是卡内基梅隆大学的项目科学家,与邢教授合作。

她在视觉语言理解与生成及其在具身人工智能中的应用方面发表了 120 余篇前沿论文,这些论文发表于该领域最负盛名的期刊和会议,谷歌引用量超过 30000 次。

她定期担任 ICCV、CVPR、NeurIPS、ICML、ICLR 和 AAAI 等会议的领域主席,并担任 CVPR 2021 的教程主席、 CVPR 2023 的评审主席。她曾荣获ACM中国最佳博士论文奖、CCF 最佳博士论文奖以及阿里巴巴达摩院青年学者奖。她的研究成果已被应用于多家知名人工智能公司(如 Deepseek、联想、字节跳动和腾讯)的关键产品中。



未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!

公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
马斯克称只要有时间,就应该尽可能去中国,推荐体验中国高铁:别总盯着手机,一定要往窗外看,中国那种令人难以置信的壮丽无法用言语表达

马斯克称只要有时间,就应该尽可能去中国,推荐体验中国高铁:别总盯着手机,一定要往窗外看,中国那种令人难以置信的壮丽无法用言语表达

极目新闻
2026-09-23 08:02:11
李世民只派他出战一回,便弃之不用,后世却称其为名扬千古的一代名将

李世民只派他出战一回,便弃之不用,后世却称其为名扬千古的一代名将

大运河时空
2026-09-22 17:55:05
北理工女老师开“女权课”冲上热搜:公开叫嚣让男性低人一等,特殊性选修课,扬言修学分自觉退出

北理工女老师开“女权课”冲上热搜:公开叫嚣让男性低人一等,特殊性选修课,扬言修学分自觉退出

李晚书
2026-09-23 14:33:49
曝朝鲜亚运会代表团2人不愿回国!想留在日本+寻求庇护 不去韩国

曝朝鲜亚运会代表团2人不愿回国!想留在日本+寻求庇护 不去韩国

念洲
2026-09-23 07:30:43
欧盟对中国下达最后通牒,20天内中方还不答应,布鲁塞尔就将动手

欧盟对中国下达最后通牒,20天内中方还不答应,布鲁塞尔就将动手

健身狂人
2026-09-23 14:54:55
消费者网购纯牛奶剪开包装竟倒出水,涉事企业:工人分拣失误,误将测试样品混入成品装箱流出

消费者网购纯牛奶剪开包装竟倒出水,涉事企业:工人分拣失误,误将测试样品混入成品装箱流出

极目新闻
2026-09-23 12:57:16
河南郑州一70后大叔近10年没摸电脑,接触AI不到一年后,30分钟手搓工作台,做一条视频只需十几分钟,白天当货车司机,晚上做程序员

河南郑州一70后大叔近10年没摸电脑,接触AI不到一年后,30分钟手搓工作台,做一条视频只需十几分钟,白天当货车司机,晚上做程序员

台州交通广播
2026-09-22 09:51:43
雷军回应“打新宇树挣了100多亿”

雷军回应“打新宇树挣了100多亿”

澎湃新闻
2026-09-22 19:07:44
广东省省长会见刘庆峰、王兴兴

广东省省长会见刘庆峰、王兴兴

极目新闻
2026-09-23 08:00:50
张一鸣:遍地都是赚到百万的项目,但是99%的人选择埋头打工

张一鸣:遍地都是赚到百万的项目,但是99%的人选择埋头打工

一些小事
2026-09-22 06:17:58
28岁女子骑车时被30余厘米长竹棍贯穿脖颈,左侧颈总动脉被戳断,专家团队5小时鏖战创造生命奇迹:大脑缺血近50分钟,没有脑梗瘫痪

28岁女子骑车时被30余厘米长竹棍贯穿脖颈,左侧颈总动脉被戳断,专家团队5小时鏖战创造生命奇迹:大脑缺血近50分钟,没有脑梗瘫痪

都市快报橙柿互动
2026-09-23 13:23:58
中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

中国区独享!苹果出手限制“摇一摇”广告,豆瓣知乎QQ音乐百度网盘或受影响

界面新闻
2026-09-23 15:09:23
2000 多家店背后,老乡鸡的中式快餐范本

2000 多家店背后,老乡鸡的中式快餐范本

晚点LatePost
2026-09-22 18:38:02
央视曝光后,南京立即成立工作组,控制相关人员

央视曝光后,南京立即成立工作组,控制相关人员

新京报政事儿
2026-09-23 12:34:02
特朗普:从“泽连斯基没有牌”到请求乌克兰停火

特朗普:从“泽连斯基没有牌”到请求乌克兰停火

名人苟或
2026-09-23 15:29:18
第4金!亚运会男子200自决赛:张展硕1分43秒49破亚洲纪录夺冠

第4金!亚运会男子200自决赛:张展硕1分43秒49破亚洲纪录夺冠

全景体育V
2026-09-23 16:35:38
城事|迎国庆:天安门花篮主体亮相,南北首次不对称

城事|迎国庆:天安门花篮主体亮相,南北首次不对称

澎湃新闻
2026-09-23 12:36:29
赵探长:郭士强想放假但领导不同意;找个NBA训练师,15分钟就气走了

赵探长:郭士强想放假但领导不同意;找个NBA训练师,15分钟就气走了

懂球帝
2026-09-23 14:00:09
白宫公布接待规格:特朗普到机场迎接,阅兵仪式叠加五架飞机飞越

白宫公布接待规格:特朗普到机场迎接,阅兵仪式叠加五架飞机飞越

光电科技君
2026-09-22 11:47:50
12万亿砸进来了,目标就两个:股市、楼市

12万亿砸进来了,目标就两个:股市、楼市

维纳斯的眼泪
2026-07-02 16:17:52
2026-09-23 19:08:50
AI科技评论 incentive-icons
AI科技评论
点评学术,服务AI
7668文章数 20785关注度
往期回顾 全部

科技要闻

一夜三款新模型,AI价格战再升级

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

头条要闻

33岁黄梅戏女演员确诊癌症 家人公开求助:她想活下去

体育要闻

300万英镑,他们买下了一位队史传奇

娱乐要闻

王玉雯杨玏被曝结婚又离 荒唐一幕出现

财经要闻

全市场都在卷自营

汽车要闻

性能与实用兼得 全新奥迪S5 Avant上市 57.18万元

态度原创

亲子
健康
艺术
家居
旅游

亲子要闻

书法老师分享正确写字姿势,“不要把本子放在正前方 容易趴桌勾腕”,“把本子放在身体右前方,比较舒服”

痘痘没成熟,千万别硬挤!

艺术要闻

《圣教序》原稿震撼展出,再现王羲之笔法真面目,原来我们都练错了!

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

2026年重庆南山精品菊花展即将启幕!

无障碍浏览 进入关怀版