网易首页 > 网易号 > 正文 申请入驻

七校联合开源OpenWAM:机器人的「世界模拟器」来了

0
分享至



本文中,来自新加坡国立大学、清华大学、北京大学等七所高校的研究团队,最新开源 OpenWAM,面向世界动作模型的开源研究全栈与基座模型。



视频链接:https://mp.weixin.qq.com/s/VhDj6wqrnBoJL4dYFq8eUw

  • ArXiv:https://arxiv.org/abs/2609.07398
  • 项目主页:https://openwam-official.github.io/
  • 代码:https://github.com/OpenWAM-Official/OpenWAM
  • 模型与数据:https://huggingface.co/OpenWAM



图 1 OpenWAM 总览:OpenWAM-Infra 提供模块化基础设施,OpenWAM-Study 提炼设计规律,OpenWAM-α 在大规模人类第一视角与机器人数据上验证方案。

当机器人需要完成一个动作时,仅仅识别眼前的物体还不够。它还要预测环境将如何变化,并判断哪些动作能够让变化发生。视频生成模型擅长学习世界如何随时间演化,机器人轨迹则提供可执行的动作监督。

OpenWAM 的核心思路,是把这两类能力放进同一个世界动作模型中,让模型一边理解可能发生的未来,一边学习如何改变未来。

论文标题为《OpenWAM: An Open, Modular Exploration Towards Systematic World–Action Model Pretraining》。研究团队将问题拆成三个层次:什么知识值得继承,世界建模和动作学习如何协同,以及这种协同如何跨数据域和具身形态扩展。全文的答案分别由 OpenWAM-Infra、OpenWAM-Study 和 OpenWAM-α 给出。

核心结论:OpenWAM 通过模块化基础设施把世界动作模型从紧耦合的单一实现,转化为可控、可复现的实验体系;研究结果表明,充足的生成式世界先验、紧凑且信息丰富的视觉表征、明确的世界到动作信息流,以及跨域具身预训练,是构建高性能 WAM 的关键。

为什么需要世界动作模型

现有机器人策略通常直接从机器人示范中同时学习视觉规律和控制信号。视觉语言动作模型则更多继承图像文本预训练带来的语义和语言知识。世界动作模型选择了另一条路径:从视频生成预训练中继承视觉动态先验,再通过具身经验学习在这个世界中采取行动。

这种路线面临一个现实的数据不对称。描述世界变化的视频很多,带有精确可执行动作标签的机器人轨迹却相对稀缺。世界建模可以补充视觉覆盖和动态知识,动作学习可以把这些知识锚定到控制目标,但二者能否真正形成协同,取决于模型结构、信息流、推理方式和数据配方的共同设计。

论文将问题归纳为三个研究问题:WAM 应该继承什么世界知识;继承的知识如何与动作学习建立有效协同;这种协同如何在不同领域、不同机器人形态之间迁移。

OpenWAM Infra 把研究变量拆开

OpenWAM-Infra 针对现有系统难以扩展、不同模块彼此干扰的问题,定义了四个有明确接口的部分:可组合模型、训练运行时、部署运行时和评测协议。模型由视觉编码器、不同的数据流骨干网络以及可见性注意力掩码组合而成;训练、部署和评测则使用统一的运行方式。这样,研究者可以只替换一个设计变量,观察它对结果的影响。



图 2 OpenWAM-Infra 的模块化设计。视觉编码器、数据流骨干网络和可见性注意力掩码可以独立替换,并组合成单系统、双系统和三系统架构。

在模型层面,OpenWAM-Infra 支持单系统、双系统和三系统三类架构。单系统让视频与动作共享主体网络;双系统为视频和动作分别配置骨干网络,再通过联合自注意力、交叉注意力或逆动力学模型连接;三系统在此基础上加入视觉语言模型理解流。不同架构都由同一套配置和注册机制装配,训练器与策略服务器不需要知道当前运行的是哪一种结构。

统一运行时还解决了实验落地中的细节问题。训练端支持预训练、微调和断点续训,检查点保存完整配置、模块重建信息以及动作归一化统计;部署端用同一个策略服务器承载不同模型,并提供同步或异步推理、不同去噪日程和多种加速方式;评测端通过轻量客户端连接服务器,使仿真环境和真实机器人遵循同一套输入输出接口。

目前的评测协议覆盖八个仿真基准,包括 LIBERO、LIBERO-Plus、VLABench、RoboTwin2.0、RoboDojo、RoboCasa365、EBench 和 RoboCasa-GR1,涵盖单臂、双臂、移动操作和灵巧手等具身形态。

OpenWAM Study 用受控实验回答三个问题

有了统一的实验底座,OpenWAM-Study 在 RoboTwin2.0 上固定训练预算和评测方式,逐步比较世界先验、架构容量、跨模态信息流、去噪日程和具身预训练配方。研究不把结果归因于某个孤立的超参数,而是沿着「继承 — 协同 — 整合」的顺序,将每一步得到的结论带入下一步。

先继承足够强的世界先验

研究首先比较了 1.3B、2B、5B 和 14B 四种视频生成骨干。随着骨干容量提升,WAM 的平均成功率持续提高:Wan2.1-VACE-1.3B 为 90.14%,Cosmos-Predict2.5-2B 为 91.64%,Wan2.2-TI2V-5B 为 92.39%,Wan2.1-I2V-14B 为 93.79%。14B 模型虽然最好,但 5B 模型只低 1.40 个百分点,训练与部署成本更易控制,因此被选为后续研究的默认骨干。论文也提醒,四个模型在结构、数据和目标上并不完全相同,结果说明骨干选择重要,但不能简单把收益全部归因于参数量。



图 3 不同视频生成骨干带来的 WAM 性能变化。容量更大的生成式世界先验通常带来更高的平均成功率。



OpenWAM Study 问题一配图 视觉表征先验比较。表征编码器经过时间压缩和维度收缩后,可以获得接近或超过重建型编码器的 WAM 性能。

视觉表征实验进一步说明,关键不在于编码器属于「重建型」还是「表征型」,而在于潜空间是否紧凑、是否保留丰富的世界信息。DINOv3 和 V-JEPA 2.1 等表征编码器直接产生高维特征时表现较弱,但经过 S-VAE 将维度压缩到适合 DiT 处理的空间后,性能显著提升;DINOv3 加 S-VAE 的结果已接近 Wan2.2-VAE。由此得到第一条原则:WAM 需要足够强的生成式骨干,同时需要在时间维和 token 维都更紧凑、信息密度更高的视觉潜空间。

再让世界信息真正流向动作

仅仅把世界流和动作流放进同一个模型,并不会自动产生协同。架构消融显示,模型容量从单系统增加到双系统、三系统时,平均成功率整体提升;双系统联合自注意力达到 92.36%,三系统联合自注意力达到 92.60%。在兼顾性能、复杂度和变量隔离后,研究选择双系统联合自注意力作为后续实验的基础。





OpenWAM Study 问题二配图 训练阶段的信息流掩码。让动作流看到世界流,是形成有效世界动作协同的必要条件。

信息流实验给出了更直接的答案。在 RoboTwin2.0-Full 上,孤立掩码和「视频看动作」分别只有 87.41% 和 87.63% 的平均成功率;让动作流看见世界流后,平均成功率达到 92.39%;双向互见为 92.15%。动作学习能否访问世界信息,是决定协同是否成立的关键。



OpenWAM Study 问题二配图 推理阶段的去噪规划。同步去噪沿联合噪声平面的对角线推进,在实验中表现最佳。

推理阶段的去噪顺序也被纳入比较。实验测试了同步去噪以及让视频流或动作流领先的异步去噪,结果显示同步去噪表现最好,没有一种异步去噪稳定超过同步方案。由此得到第二条原则:训练时必须建立明确的世界到动作信息流,推理时则应保持世界和动作的同步联合去噪。

具身预训练主要提升分布外泛化

第三组实验把问题从单一任务域扩展到跨域具身预训练。在相同的 600 小时预算下,研究比较了从零开始、仅机器人数据、先人类第一视角再机器人数据,以及人类第一视角与机器人数据单阶段协同训练。结果显示,预训练对域内表现的提升相对有限,却显著改善了 Clean2Random 设置下的分布外表现:从零开始的 OOD 成功率为 14.50%,机器人数据预训练为 23.80%,先人类后机器人为 26.50%,人类与机器人协同训练为 26.62%。



图 4 具身预训练主要改善分布外泛化。域内成功率变化较小,而在未见过的随机化场景中,预训练带来的提升更明显。

两类数据各有作用。机器人轨迹带来可执行的动作 grounding,因此机器人数据预训练的域内表现更强;人类第一视角视频带来更广的视觉和交互分布,因此混合策略的分布外泛化更好。单阶段协同训练与分阶段训练结果接近,但前者略优且省去额外的训练阶段切换,成为最终方案的默认选择。预训练还改变了信息流偏好:从零开始时单向世界到动作略占优势,具身预训练后,双向互见在域内和域外都更稳定。由此得到第三条原则:机器人数据保留动作 grounding,人类第一视角数据扩大世界覆盖,单阶段协同训练能够有效整合两者。



图 5 具身预训练改变信息流偏好。预训练后,双向互见相较于单向世界动作在多个设置下获得提升。

OpenWAM Alpha 把规律扩展到大规模预训练

OpenWAM-α 将上述结论组合成一个可公开研究的基础世界动作模型。模型使用 Wan2.2-VAE 作为冻结视觉编码器,Wan2.2-TI2V-5B 作为视频流骨干,并配置一个 1B 参数的 ActionDiT 处理动作流。两个流通过联合自注意力交互,采用双向互见;语言指令和本体状态通过交叉注意力提供条件。



图 6 OpenWAM-α 的架构、数据与训练推理方案。模型在统一动作空间中联合预测未来视觉状态与动作,并在推理时沿同步对角线去噪。

为了让不同机器人形态共享一个动作头,OpenWAM-α 使用 80 维统一动作空间:两个镜像的 34 维手臂区块分别包含末端位置、6D 旋转、夹爪和灵巧手通道,另有 12 个预留槽位承载移动底盘等具身特定通道。每个数据集把自身的动作与状态映射到固定槽位,未使用的维度通过有效性掩码不参与训练。

预训练数据来自五个来源,包含人类第一视角视频、真实机器人数据和合成机器人数据。原始数据约 13.33 亿帧、约 14,300 小时;经过视觉质量筛选、机器人信号清洗和按来源采样后,实际训练集为 5.185 亿帧、约 6,369 小时。数据构成为:人类第一视角数据约占 30%,合成机器人数据约占 30%,三类真实机器人数据合计约占 40%。人类数据包含 7.16 万段长时第一视角记录,覆盖 3,006 类日常操作任务;真实机器人数据覆盖 17 个物理平台。

部署时,OpenWAM-α 使用同步推理和 10 步联合去噪。通过固定形状编译、CUDA Graph、速度缓存、提示词嵌入缓存以及跳过控制路径中的 VAE 解码,单个动作块在 RTX 5090 上约 170 毫秒完成。

仿真基准上的表现

OpenWAM-α 在八个仿真基准上接受评测,覆盖五类具身形态。论文报告显示,它在 LIBERO、VLABench、RoboTwin2.0-Full、RoboCasa365 和 RoboCasa-GR1 上处于第一梯队;在移动双臂基准 EBench 上达到当前最佳,SR 和 Score 均领先第二名约 4 个百分点;在 RoboTwin2.0-Clean2Random 和 RoboDojo 上,虽然与最佳 VLA 仍有差距,但均为 WAM 方法中表现最强者。



图 7 OpenWAM-α 与代表性 VLA 和 WAM 方法在八个仿真基准上的分数对比。各面板标注实际分数,便于按基准阅读。

LIBERO-Plus 是一个值得单独说明的例外。OpenWAM-α 的下降主要集中在相机和噪声扰动,也波及背景与布局扰动。论文将原因归结为两点:一是预训练数据中与单臂扰动测试接近的数据比例有限,二是像素潜空间上的长时未来预测对视角和噪声变化更敏感。这个结果也说明,模型在某个测试条件下的泛化能力,最终取决于预训练数据是否覆盖相近的具身形态和环境变化。

论文同时比较了 VLA 与 WAM。总体成功率不存在一方全面胜出的结论:WAM 借助未来视频潜变量监督,在分布内任务上更容易贴合训练分布;VLA 不承担长时未来预测,在分布外扰动下通常更稳健。两类不足都与数据有关,足够丰富、覆盖环境变化且带有精确动作标注的预训练数据,能够同时改善拟合与泛化。

真实机器人验证

研究进一步在三种具身形态上进行真实机器人实验:Franka-Research-3 单臂平台、RoboDojo 双臂平台,以及 Wuji 灵巧手与 Tianji 机械臂组成的灵巧操作平台。单臂实验包含堆叠、抓取放置和悬挂三类任务;双臂实验覆盖 ARX X5、Piper 和 Piper X 三种平台、共 18 个任务;灵巧手实验测试双臂交互、长时任务和精细操作。



图 8 三类真实机器人实验设置。上方为 Franka-Research-3 单臂任务,左下为 RoboDojo 双臂平台,右下为 Wuji 灵巧手与 Tianji 机械臂任务。

在单臂实验中,OpenWAM-α 六项任务平均成功率为 82.5%,高于 LingBot-VA 的 77.5% 和 π0.5 的 55.0%。其中「将辣椒放入抽屉」和「将积木放入抽屉」两项达到 100% 成功率。RoboDojo 双臂真实赛道上,OpenWAM-α 的整体平均分数为 37.6、平均成功率为 24.4%,在三种平台和多数任务上达到目前领先水平。

灵巧手实验尤其考验未见过的具身形态。Wuji 灵巧手与 Tianji 机械臂,以及 9 维末端位姿加 21 个灵巧手自由度的动作空间,都没有出现在 OpenWAM-α 的预训练混合数据中。微调后,OpenWAM-α 在玩具塔堆叠、羽毛球收集、衣物收纳和瓶盖旋拧四类任务的域内与域外设置中均明显超过 π0.5,说明统一动作空间和预训练先验可以支持模型适配新的机器人形态。

开放研究栈的意义

OpenWAM 的贡献不只是一组模型分数。OpenWAM-Infra 把模型、训练、部署和评测放入统一接口;OpenWAM-Study 用受控实验把经验判断转化为可检验的设计原则;OpenWAM-α 则把这些原则扩展到多来源、多领域和多具身数据。三者共同构成从研究问题、实验方法到可复用模型的完整链路。

论文发布了基础设施、评测协议、预训练权重和数据配方,旨在为世界动作模型研究提供可复现的共同起点。研究也明确指出,后续仍需要更大规模、更多样且带有精确动作标注的具身数据,更紧凑并且对环境变化更稳健的视觉表征,以及能够融合 WAM 与 VLA 优势的端到端设计。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
30年首次逆转!居民资产负债表彻底重构!

30年首次逆转!居民资产负债表彻底重构!

樱桃大房子
2026-09-24 22:36:43
人已推倒,领导速来......

人已推倒,领导速来......

燕梳楼频道
2026-08-19 21:54:43
万万没想到!
日本赢了中国,太气人了!

万万没想到! 日本赢了中国,太气人了!

有态度网友19ILam
2026-09-25 08:04:38
事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

事业没了、婚也离了,被封5年后赵薇再曝近况,瘦到脱相不敢认

阿讯说天下
2026-08-30 06:10:34
美国万万没想到!早些年,大批逃往境外的中国贪腐和经济犯罪嫌疑人,最终竟在中国这里碰了软钉子

美国万万没想到!早些年,大批逃往境外的中国贪腐和经济犯罪嫌疑人,最终竟在中国这里碰了软钉子

z千年历史老号
2026-09-18 18:17:42
多个省区政府领导班子有调整,两省迎来新任代省长

多个省区政府领导班子有调整,两省迎来新任代省长

上观新闻
2026-09-24 16:07:48
鲁尼炮轰谢什科护腿板太小导致伤缺,损害曼联利益!卢克·肖亦曾因此受伤

鲁尼炮轰谢什科护腿板太小导致伤缺,损害曼联利益!卢克·肖亦曾因此受伤

罗米的曼联博客
2026-09-25 08:18:03
19岁张展硕指向日本对手的那一刻,我看到了中国游泳最缺的东西

19岁张展硕指向日本对手的那一刻,我看到了中国游泳最缺的东西

冷紫葉
2026-09-24 12:10:42
微信官宣,推出全新支付 App!

微信官宣,推出全新支付 App!

花果科技
2026-09-24 15:22:48
中国女篮与韩国的比赛时间确定!杨舒予伤势无碍,央视直播

中国女篮与韩国的比赛时间确定!杨舒予伤势无碍,央视直播

宝哥精彩赛事
2026-09-25 06:37:14
罗永浩回应17000名员工失业问题:你老板让人看得,辟谣精日言论

罗永浩回应17000名员工失业问题:你老板让人看得,辟谣精日言论

蜜桔娱乐
2026-09-22 21:15:04
5.8分全场最低!C罗低迷表现遭球迷狠怼:这水平都进不了威尔士队

5.8分全场最低!C罗低迷表现遭球迷狠怼:这水平都进不了威尔士队

用冷眼洞悉世界
2026-09-25 09:22:58
表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

表姑向我借了85000元,17年没还,我去银行注销旧卡时,柜员看了眼卡说:女士,最后一笔转账留言您要看吗?

品读时刻
2026-09-22 09:04:55
白衫利落短裙干练,还留出遐想的空间!

白衫利落短裙干练,还留出遐想的空间!

穿的像个人样
2026-09-25 08:09:25
924两周年科创涨150%,人均赚5万!今年股民人均都是亏的...

924两周年科创涨150%,人均赚5万!今年股民人均都是亏的...

金石随笔
2026-09-25 07:08:20
超可爱!冯坤儿子成泰国女排“团宠”,被姐姐们搂着亲亲一脸嫌弃

超可爱!冯坤儿子成泰国女排“团宠”,被姐姐们搂着亲亲一脸嫌弃

体坛小二哥
2026-09-23 22:51:40
台湾海军前司令陈永康说过,要是台海真打起来,从头打到尾

台湾海军前司令陈永康说过,要是台海真打起来,从头打到尾

流逝的颜值
2026-09-23 09:46:02
张本兄妹的“双面人生”:赢在球台,更赢在书桌的真相

张本兄妹的“双面人生”:赢在球台,更赢在书桌的真相

雨泽聊体育
2026-09-17 14:27:26
13分钟带帽,王子铭成为国足历史上面对马尔代夫完成带帽第三人

13分钟带帽,王子铭成为国足历史上面对马尔代夫完成带帽第三人

懂球帝
2026-09-24 21:15:20
北京协和医学院博士:逼死一个人最快的方式,凡事往坏处想

北京协和医学院博士:逼死一个人最快的方式,凡事往坏处想

洞见
2026-09-22 10:20:09
2026-09-25 09:59:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14067文章数 142738关注度
往期回顾 全部

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

头条要闻

男子开车门盗窃未果往油箱倒水被拘 车主获8000元赔偿

头条要闻

男子开车门盗窃未果往油箱倒水被拘 车主获8000元赔偿

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

许嵩宣布与冯禧结婚仅2天,不对劲的一幕出现了

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

房产
教育
手机
公开课
军事航空

房产要闻

中秋、国庆小长假来了,但我劝你别离开海口

教育要闻

六年级:使3个4等于15,错了一大片

手机要闻

荣耀掀桌子!5499元买16+512G,友商连夜改PPT的节奏?

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

韩国首架“准隐身”战斗机正式入列

无障碍浏览 进入关怀版