网易首页 > 网易号 > 正文 申请入驻

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

0
分享至



机器人 VLA 还在疯狂卷数据,StarVLA 团队这次却把目光放到了另一个问题上:除了继续 scale 数据以外,能不能让每一条数据都学得更值?

他们最新发布了面向 VLA 的 VLM 底座VLAct。

VLAct 的整个 continued pre-training 只使用开源数据和16张GPU,但成绩相当能打:RoboTwin 2.0 成功率达到92.5%;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;面对预训练阶段从未见过的 GR-1 机器人,只使用20%的 RoboCasa-GR1 下游数据,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。模型、Checkpoint、训练代码和 Pipeline 也全部开源。



图 1|VLAct 主要结果一览:RoboDojo、RoboTwin 2.0、RoboCasa-GR1,以及 16 GPUs 与全开源。(项目宣传图)

机器人数据

没法像互联网数据一样“爬”

过去几年,大模型已经证明了一条非常有效的路线:数据更多、模型更大、算力更强,能力就不断往上走。VLA 自然也希望复制这条 Scaling 路线。

但机器人领域有一个绕不开的现实:机器人轨迹不是网页数据,不能从互联网直接爬下来。每条数据都需要机器人真正在物理世界里完成操作,背后往往还有遥操作、数据采集和硬件成本。更麻烦的是,机器人最终面对的是几乎无限的场景、物体、任务和机器人形态组合。

所以 VLAct 并不是想否定 Data Scaling,而是补上另一个问题:在同样的数据预算下,能不能让机器人轨迹在 Backbone 里留下更多可以跨任务、跨 Action Head、甚至跨机器人迁移的知识?



图 2|Naive VLA pre-training 容易绑定预训练场景;VLAct 把目标转向更可迁移的 Action-aware Representation。

一个有点反常识的发现:

Action 学得更好,Backbone 不一定更好

VLAct 真正的起点,来自团队前期实验中一个很有意思的现象。现在很多 VLA 都会从一个 VLM 出发,挂上 Action Head,再用机器人数据继续训练。很自然的想法是:Action 预测越准,说明这次 VLA 预训练越成功。

但实验发现,并不一定。以 RoboTwin 为例,使用 OFT Head 做 continued pre-training 后,如果下游继续使用 OFT,成功率可以从 61.7%提高到 75.8%;但把同一个 Backbone 换成 PI Head,下游反而从 60.5%下降到 55.1%;换成 GR00T Head 甚至从 51.2%降到 28.9%。

换句话说:Policy 在原来的 Head 上变强了,不代表 Backbone 真的变得更通用。



图 3|Action supervision 会直接塑造 Backbone:同 Head 性能提升,并不自动转化为 Cross-head 迁移能力。

原因也很直观。Action Head 和 Backbone 是一起训练的,只用一种 Head 时,Backbone 很容易逐渐学会一种“最方便这个 Head 读取”的 Feature Geometry。对于当前 Policy,这当然很好;但换一个 Action Head、任务甚至机器人后,这些 Representation 未必还能继续复用。论文把这种现象称为head-specific representation collapse。

于是 VLAct 把 continued pre-training 的目标重新定义了一遍:不是训练一个已经很会做动作的固定 Policy Initialization,而是训练一个能被不同 Action Head、不同任务、不同机器人继续利用的 VLM Backbone。

那怎么避免 Backbone 被“带偏”?

围绕这个目标,VLAct 没有重新发明复杂的 Policy Architecture,而是在 continued pre-training 阶段做了三件事。

第一,别把 VLM 原来学会的东西忘了。VLAct 保护 Vision Encoder 和较浅的 LLM 层,同时混入 Caption 数据,让模型在学习 Action 时尽量保住原来的视觉语言先验。

第二,别让一种 Action Head 说了算。VLAct 同时挂上 OFT、PI 和 GR00T 三种连续 Action Head,让它们共同读取一个 Backbone、预测同一套动作。这样 Backbone 想同时服务不同 Decoder,就不能只把信息组织成某一种 Head 最喜欢的形式。更重要的是,预训练结束后这些 Head 全部可以丢掉,下游重新初始化自己的 Action Head。

第三,不同机器人之间,该共享的物理语义就共享。例如“打开/关闭夹爪”在不同机器人上的物理意义高度相似,但不同机械臂的自由度和运动学结构又不能粗暴统一。因此 VLAct 只统一真正一致的 Action 维度,其他部分继续保持 Embodiment-specific。



图 4|VLAct 完整训练框架:Preserve VLM Prior、Multi-head Continuous Supervision、Partially Unified Action Space,下游重新初始化 Action Head。(论文 Figure 3 原图裁切)

RoboTwin 92.5%

RoboDojo 超所有 WAM

最终,这种 Representation 能不能迁移,还是得看结果。在 LIBERO-Plus 上,VLAct 达到82.6%;到了双臂操作的 RoboTwin 2.0,Data Scaling 设置下 Clean 成功率进一步达到92.5%,Random 设置也达到90.8%。

在 RoboDojo 上,VLAct 取得10.66Score 和7.60%的 Success Rate,并超过所有明确标注为 WAM 的参赛模型。也就是说,这套预训练并不是只在某一个机器人、某一个 Benchmark 上有效。

论文还在 Franka 真机上覆盖了单臂短时序、长时序、双臂协同,以及 Novel Object 和 Full Substitution 等 OOD 设置。



图 5|真实机器人评测任务:包括 In-domain 与 Out-of-domain、短时序、长时序和双臂操作。(论文 Figure 11 原图裁切)

20%数据

超过 GR00T N1.6 的 100%

最能体现迁移能力的实验来自RoboCasa-GR1。GR-1 这种机器人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机器人,然后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。

结果只使用 20% 的 RoboCasa-GR1 轨迹,VLAct 就达到 49.5%的成功率,已经超过 GR00T N1.6 和 Qwen3VL-OFT 的全量数据基线;当数据提高到 100%时,VLAct 进一步达到 54.0%。



图 6|论文 Figure 5:真机单臂/长时序/双臂结果,以及 RoboCasa-GR1 跨本体迁移;20%下游数据已超过公开 full-data baselines。

Beyond Data Scaling

让每条机器人数据“学得更值”

VLAct 并不是想证明“数据不重要”。机器人数据当然还需要继续 Scale,但由于机器人数据昂贵、稀缺,而且很难完整覆盖真实物理世界,Representation Quality 本身也应该成为 VLA Scaling 的一条独立轴线。

过去大家更常问:“还能收多少机器人数据?”VLAct 希望同时再问一句:“同样这些机器人数据,到底能让模型学到多少可以迁移的东西?”

整个 VLAct continued pre-training 基于 Qwen3-VL-4B,只使用公开机器人数据和 16 张 GPU 完成。目前模型权重、Checkpoint、数据处理及训练 Pipeline 均已开放,希望把一个更适合物理世界、也更 Research-friendly 的 VLM Backbone 交给 VLA 社区。

项目链接





  • 项目主页:https://starvla.github.io/VLAct/
  • 论文标题:Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
  • 论文地址:https://arxiv.org/abs/2608.27550
  • GitHub:https://github.com/starVLA/VLAct
  • Hugging Face:https://huggingface.co/collections/StarVLA/vlact
  • X: https://x.com/YSenqiao/status/2094260526075302194

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
加息突变!美联储,重磅来袭!华尔街巨头重大分歧

加息突变!美联储,重磅来袭!华尔街巨头重大分歧

数据宝
2026-09-06 18:19:52
老板娘问我她屁股翘不翘?我该怎么回答?

老板娘问我她屁股翘不翘?我该怎么回答?

太急张三疯
2026-09-06 10:15:20
奥运会两个笑话:中国反复拒绝再次主办;印度被反复拒绝申办

奥运会两个笑话:中国反复拒绝再次主办;印度被反复拒绝申办

怪味历史连连看
2026-08-13 16:19:26
为什么很多姑姑愿意任劳任怨的当德华?

为什么很多姑姑愿意任劳任怨的当德华?

康富贵碎碎念
2026-09-06 12:23:54
新型杀猪盘,让底层普通人崩溃

新型杀猪盘,让底层普通人崩溃

鸣金网
2026-09-06 11:03:16
国羽3胜3负,香港男单创历史,中国大师赛决赛赛程

国羽3胜3负,香港男单创历史,中国大师赛决赛赛程

佑铭羽球
2026-09-06 07:13:12
他在战争年代的职务高于十大将,为何授衔仅为上将,难道只是因为不具备代表性?

他在战争年代的职务高于十大将,为何授衔仅为上将,难道只是因为不具备代表性?

大运河时空
2026-09-05 15:10:03
景甜确实有天使般的面孔,魔鬼般的身材

景甜确实有天使般的面孔,魔鬼般的身材

小椰的奶奶
2026-09-04 03:46:54
别再说外星人了!三星堆最新发掘,直接实锤“龙的传人”

别再说外星人了!三星堆最新发掘,直接实锤“龙的传人”

中国艺术家
2026-09-06 05:37:30
上世纪50年代,到底杀了多少地主恶霸?公布的数据,让人不敢相信

上世纪50年代,到底杀了多少地主恶霸?公布的数据,让人不敢相信

文史道
2025-11-15 06:45:03
我国成立重要机构,迈进统一关键一步,赖清德无奈,美国罕见沉默

我国成立重要机构,迈进统一关键一步,赖清德无奈,美国罕见沉默

DS北风
2026-09-05 08:34:04
国内第一部AI长剧导演回应:接受差评

国内第一部AI长剧导演回应:接受差评

中国新闻周刊
2026-09-05 15:35:06
贪污上亿、空壳公司、做戏大王54岁的韩红,私生活谣言太荒谬!

贪污上亿、空壳公司、做戏大王54岁的韩红,私生活谣言太荒谬!

一盅情怀
2026-09-06 12:25:00
国羽新星绽放!徐文婧2‑0横扫曼西,拿下印尼大师赛女单冠军

国羽新星绽放!徐文婧2‑0横扫曼西,拿下印尼大师赛女单冠军

小兰看体育
2026-09-06 17:27:59
每晚一片甲钴胺,除了养神经,还有4大神奇作用,医生都在用

每晚一片甲钴胺,除了养神经,还有4大神奇作用,医生都在用

健康科普365
2026-09-05 09:17:33
宏远新大外人选曝光!澳大利亚国手,2.13米巨塔,NBA乐透秀,陈老板砸重本

宏远新大外人选曝光!澳大利亚国手,2.13米巨塔,NBA乐透秀,陈老板砸重本

多特体育说
2026-09-06 11:30:55
四川一考生从211合工大退学,入学才一周,双学位,本人回应:AI也建议复读

四川一考生从211合工大退学,入学才一周,双学位,本人回应:AI也建议复读

育学笔谈
2026-09-06 15:13:23
汤家凤呼吁取消英语主科风波升级!公开喊话胡锡进视频辩论,别再把头缩回去

汤家凤呼吁取消英语主科风波升级!公开喊话胡锡进视频辩论,别再把头缩回去

小徐讲八卦
2026-09-06 08:37:09
1990年,被关押40年的地主出狱,写信给王震:记得那1000担粮食吗

1990年,被关押40年的地主出狱,写信给王震:记得那1000担粮食吗

文史道
2025-09-06 12:53:48
油价跌了!2026年9月06日汽柴油价格,今日油价每升跌多少?

油价跌了!2026年9月06日汽柴油价格,今日油价每升跌多少?

沙雕小琳琳
2026-09-06 12:36:10
2026-09-06 19:11:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
13930文章数 142729关注度
往期回顾 全部

科技要闻

DeepSeek被曝将采购16万颗华为昇腾950DT

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

头条要闻

CHINA GT发生重大撞车起火事故 救援人员因为害怕逃离

体育要闻

本西蒙斯加盟国王,不管怎样,回来就好

娱乐要闻

低调富养!郭富城两女儿入读香港名校

财经要闻

亏损高达200亿,昔日彩电霸主走下巅峰!

汽车要闻

带升降立标MPV 岚图梦想家9预售价42.99万起

态度原创

时尚
旅游
家居
本地
手机

金秋最流行的鞋子,“红色”更时髦!

旅游要闻

2026中国旅博会国际化能级持续提升

家居要闻

2026建博会(广州) 公装联探展交流活动

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

手机要闻

华为Pura X Max阔折叠手机新配色曝光,采用纯色无花纹设计

无障碍浏览 进入关怀版