中大 ×MBZUAI 开源 A₁,机器人控制成本大降。
开放世界机器人操作一直被大模型算力成本、推理延迟两大难题卡脖子:千亿级 VLM 骨干 + 迭代扩散 / 流匹配动作头,让普通硬件根本跑不动实时控制。
来自中山大学、MBZUAI、Spatialtemporal AI 与 ATeam 的团队直接给出全开源、全透明、自适应、高效率的解决方案 ——A₁截断式视觉 - 语言 - 动作模型,一套预算感知自适应推理方案,同时加速骨干网络与动作头,推理延迟最高降 72%、骨干计算量砍 76.6%,性能还能打平甚至反超主流基线。
从仿真到真机、从单臂到多平台,A₁凭开源全栈跑出 SOTA,彻底打破VLA 模型 “高性能 = 高成本” 的魔咒。
01
行业痛点:VLA模型很强,
但用不起、跑不动
Vision-Language-Action(VLA)已经成为通用机器人操作的主流范式:大尺度视觉语言模型(VLM)把多模态观测压缩为隐式表示,动作头(扩散 / 流匹配)再映射为连续电机指令,泛化性拉满。
但落地代价极其昂贵:
▪ 为了保证语义理解与可供性推理,模型必须使用数十亿参数的 VLM 骨干,推理耗时极长;
▪ 为了动作平滑与精准,动作头普遍采用扩散或流匹配架构,需要十数轮迭代去噪,算力开销巨大;
▪ 现有优化大多只针对 VLM 主干,动作头始终是被忽略的瓶颈,即便主干加速,整体延迟依然居高不下;
▪ 最终结果是:能跑 SOTA 的 VLA 模型,必须依赖高端计算集群,普通硬件无法实现实时控制。
团队总结出三个关键观察,直接戳中效率优化核心:
1.轨迹收敛:流匹配轨迹 3 步内就锁定正确模式,后续迭代收益递减;
2.动作冗余:连续控制步动作平滑变化,只需粗更新;
3.层间耦合:VLM 中间层已包含足够空间视觉特征,没必要跑完全层。
一句话:算力只花在“会改变动作”的地方,A₁就此诞生。
02
核心设计:一套自适应框架,
同时卷性能与效率
A₁没有走 “轻量化重训” 或 “单纯剪枝” 的老路,而是从推理全链路出发,提出一套预算感知、动态退出、层间热启动的协同加速方案,在不损失任务成功率的前提下,实现效率数量级提升。
整体架构
A₁由 VLM 骨干与动作头组成,VLM提供语义与可供性特征,动作头支持流匹配(FM)与MLP两种实现;自适应推理方案同时压缩骨干计算量与动作头迭代次数,兼顾速度与成功率。
![]()
图1:A1模型整体架构
1.多出口训练:让每一层都具备动作预测能力
传统 VLA 只在最后一层输出动作,A₁在训练阶段就让 VLM每一层都连接共享动作头,直接监督各层输出的动作序列。这一设计让模型在推理时,可以随时在中间层读取动作结果,为动态早停打下基础。
2.动作一致性早停:算力只花在 “必要的层”
推理时,模型逐层计算动作,并与上一层结果做一致性校验。当动作变化小于阈值时,直接判定 “特征足够”,提前终止主干前向。团队使用余弦相似度、L2 距离等指标衡量动作稳定性,并通过训练集统计得到分层阈值,在 “节省算力” 与 “保持精度” 之间取得最优平衡。
3.层间截断流匹配:解决早停带来的次生瓶颈
动态早停虽然加速了 VLM,但会让流匹配动作头在每一层都重复执行完整去噪步骤,反而拖慢速度。为此,团队提出层间热启动流匹配:
▪ 大幅减少单轮去噪步数(从 10 步降至 2 步);
▪ 上一层的动作输出,直接作为下一层去噪的初始值,实现热启动;
▪ 避免从随机噪声重新开始,既保证精度,又把动作头开销压到最低。
4.多机器人泛化训练:开源数据也能练出强迁移模型
A₁采用两阶段训练:第一阶段在大规模开源机器人数据上预训练,学习通用操作先验;第二阶段在真实机器人轨迹上微调,适配不同机型与场景。
团队还融合了 15951 条自研真机数据,进一步缩小仿真到现实的差距,让模型在 Franka、AgiBot、WuJie-Arm等多款机械臂上都能稳定工作。
03
深度解读:
A₁到底解决了VLA的哪些核心痛点?
如果只看加速数字,很容易低估 A₁的价值。它真正的突破,是重新定义了高效VLA的设计范式。
1.第一次实现主干与动作头联合加速
过去的加速方案都是 “单边优化”:要么压 VLM,要么简动作头。A₁证明,只有协同优化,才能实现端到端延迟大幅下降。早停降低主干计算,热启动流匹配降低动作头迭代,两者耦合,才把延迟从数十秒压到秒级。
2. 用最小精度损失换取最大效率收益
实验显示,即便减少 76.6% 的主干计算,任务成功率仅小幅下降。这说明:VLA模型存在极端严重的过计算,大量深层特征对机器人操作来说并非必需。A₁用数据证实,动态优化不是 “妥协精度”,而是 “回归合理计算”。
3.开源全栈,打破封闭壁垒
当前顶尖 VLA 大多依赖闭源数据与私有框架,社区难以复现。A₁全程使用开源数据训练,并开放权重、代码、数据处理流程与评估脚本,让小型实验室与普通开发者也能搭建高性能、低成本的机器人控制模型。
04
实验验证:
从仿真到真机,全面超越现有开源方案
A₁在三类标准场景上完成系统验证,结果显示:它在效率上大幅领先,在性能上同样达到SOTA。
仿真环境:高精度与强泛化兼顾
在 LIBERO 长期操作基准上,A₁实现 96.6% 的平均成功率,在物体操作任务上接近满分;在 VLABench 长程推理任务上,A₁超越 π₀.5 等模型,展现出优秀的语言理解与任务规划能力;在分布偏移更大的LIBERO-Plus 上,A₁零射性能达到 75.3%,显著优于对比方法,证明其特征具备强泛化性。
![]()
表1:LIBERO、VLABench 主流模型成功率对比,A1取得领先性能。
真实机器人:跨平台稳定执行
在 Franka、AgiBot、WuJie-Arm、Dobot-Arm 四款机械臂上,A₁完成放杯子、摆水果、捡胶水、擦桌子、叠积木等一系列日常操作,平均成功率达到56.7%,明显高于 π₀与 π₀.5。尤其在小样本学习场景下,A₁能快速适应新任务,表现出极强的实用潜力。![]()
表2:真机多平台结果表
RoboChallenge:开源模型登顶
在包含 30 个复杂真机任务的 RoboChallenge 上,A₁在完全开源、无闭源数据的条件下,取得 29.00% 的平均成功率,超过 π₀、X-VLA、RDT-1B 等一众开源模型,证明开源路线同样可以做到顶尖水平。
![]()
表3:RoboChallenge 基准结果表
效率表现:延迟与计算量双降
在最优配置下,A₁-FM 单回合推理时间从 37.8 秒降至 10.5 秒,降幅达 72.3%;A₁-MLP最多可减少 76.6% 的主干计算,依旧保持 92% 以上的成功率;在真机 AgiBot 上,模型计算量降低 84.6%,操作精度几乎没有下降,真正实现 “低成本、高可用”。
表4、5:自适应早停效率表
![]()
![]()
行为可视化:更稳定、更鲁棒
从任务执行视频可以直观看到:对比模型容易出现物体混淆、夹爪提前闭合、抓取偏移等问题;A₁能稳定识别目标,动作连贯,在长程任务中依然保持高可靠性。同时,动态推理可视化显示:简单移动在浅层即可退出,复杂操作才进入深层,算力分配高度智能。
![]()
图2:任务执行对比
![]()
图3:真机动态推理可视化
05
局限与未来
A₁打开的下一代VLA研究方向
尽管 A₁在效率与性能上取得显著突破,团队仍清晰指出当前方案的改进空间,并为后续研究指明方向。
第一,当前预训练依赖带标注的可供性数据,未来可引入无监督或自监督方法,从海量机器人视频与交互数据中自动挖掘可供性先验,进一步扩大数据来源。
第二,A₁以模仿学习为基础,在长程任务中仍存在累积误差。后续可结合强化学习,通过环境实时反馈修正策略,提升复杂场景下的鲁棒性与成功率。
第三,云边推理与机械臂执行之间的同步延迟,仍会影响操作流畅度。团队计划采用异步执行、预测控制等方式,提升真机运行的顺滑度。
第四,A₁已成功部署在自研双臂移动平台,下一步将重点拓展双臂协同、移动操作、非结构环境适应等能力,向更通用的家庭与工业机器人迈进。
06
A₁第一次把 “高性能、高效率、全开源” 三件事同时做到位,用一套简单优雅的自适应截断方案,把 VLA 模型从 “实验室奢侈品” 拉到 “可落地实用款”。
从仿真到真机、从单臂到双臂、从小样本到泛化,A₁证明:开源透明的研究,完全能打赢闭源方案。
全套代码、权重、数据 pipeline 已开放,机器人底层玩家可以直接冲了。
论文信息
标题:A₁: A Fully Transparent Open-Source, Adaptive and Efficient Truncated Vision-Language-Action Model
代码:https://github.com/ATeam
项目页:https://ATeam.com/en/research/68bc2cde8497d7f238dde690
链接:https://arxiv.org/abs/2604.05672
论文作者介绍:
张凯东,中山大学计算机学院2024级硕士,本科毕业于中山大学智能工程学院,师从梁小丹教授。研究方向为具身智能。
![]()
张健,穆罕默德·本·扎耶德人工智能大学(MBZUAI)计算机视觉博士生,研究方向为具身智能。分别于2023年和2020年从北京大学和合肥工业大学获得硕士和学士学位。
![]()
许镕涛 MBZUAI研究员,无界智慧CTO。中科院自动化所多模态人工智能国重(前模识国重)博士, 在学期间曾获得中科院院长奖、两次IEEE旗舰会议最佳论文提名奖、国奖、北京市和中科院优秀毕业生。华中科技大学数学与计算机双学士学位。研究方向为具身智能与机器人,提出全球首个基于空间可供性操作大模型A0,曾在银河通用共同主导全球首个具身导航大模型NaVid。在顶级学术会议和期刊(RSS,IRCA,IROS,CVPR,ICCV,ECCV,NeurIPS,ICML,ICLR,AAAI,EMNLP,MICCAI,TPAMI,TIP,TNNLS,TII,TIM,TMM,TCSVT,ISPRS)上共发表论文80余篇,其中以第一作者或通讯作者发表论文近40篇,含ESI高被引论文3篇,IEEE Trans封面文章1篇,发表8次Oral论文。拥有10余项发明专利,研究成果应用于YOLO系列,以及无界智慧、银河通用、华为、Momenta等多款产品。
![]()
梁小丹是中山大学深圳校区的教授,同时也是穆罕默德·本·扎耶德人工智能大学(MBZUAI)计算机视觉系的副教授。她曾是卡内基梅隆大学的项目科学家,与邢教授合作。
她在视觉语言理解与生成及其在具身人工智能中的应用方面发表了 120 余篇前沿论文,这些论文发表于该领域最负盛名的期刊和会议,谷歌引用量超过 30000 次。
她定期担任 ICCV、CVPR、NeurIPS、ICML、ICLR 和 AAAI 等会议的领域主席,并担任 CVPR 2021 的教程主席、 CVPR 2023 的评审主席。她曾荣获ACM中国最佳博士论文奖、CCF 最佳博士论文奖以及阿里巴巴达摩院青年学者奖。她的研究成果已被应用于多家知名人工智能公司(如 Deepseek、联想、字节跳动和腾讯)的关键产品中。
![]()
![]()
未经「AI科技评论」授权,严禁以任何方式在网页、论坛、社区进行转载!
公众号转载请先在「AI科技评论」后台留言取得授权,转载时需标注来源并插入本公众号名片。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.