网易首页 > 网易号 > 正文 申请入驻

机器人运动会散场后,自变量给机器人建了一座「虚拟训练场」

0
分享至


我已经被机器人刷屏一周了。

机器人刷新了人类百米纪录、「原地起飞」近三米、「害羞跑」的姿势火到海外、赛博张三丰腾空外摆 540°…….


今年的世界人形机器人运动会更热闹了,来自六大洲 16 个国家的 666 支队伍,带着 2056 台机器人来到北京,比赛也从田径、武术等项目,一路延伸到家庭、酒店、工业和应急救援等真实场景。

不过机器人在赛场上的翻车,大家笑笑就过去了。而机器人真正进入家庭后,可能就是打翻水杯、撞倒家具,或者把刚收好的衣服重新扯到地上,那就笑不出来了。

真实的世界里没有固定的跑道和统一摆放的道具,杯子被人挪了一点,桌面多出一块抹布,原本训练好的动作就可能失效。

把机器人这些试错搬进虚拟世界,正是当下世界模型想做的事。它试图还原一个符合物理规律的环境,让机器人真正在动手前先预演:手往左偏一点会不会抓空,夹爪提前闭合会不会碰倒杯子。

但实际上不少世界模型无法实现可靠的「虚拟测试」。它们可能看懂了画面,却没有真正听从动作。推演时间一长,物体和位置开始漂移。虚拟世界里表现更好的策略,到了真机上也未必奏效。

就在机器人开始从竞技场走向真实场景时,自变量机器人发布了自回归世界模型 WALL-SS。


WALL-SS 构建的这座「虚拟训练场」终于突破了世界模型的瓶颈,动作能否真正改变结果,长任务中能否保持连贯,虚拟成绩能否经得起真机检验,都有了新的解法和答案。

它可以推演持续60秒的倒水和物品整理任务,来测试不同动作的结果:按照不同的方式抓水杯,是抓空、碰倒水杯,还是成功抓起?

研究团队还把多套机器人策略分别放进 WALL-SS 和真实世界测试,在虚拟世界里执行效果很好的动作策略,搬到物理世界往往也有好的结果。

这就有意思了,机器人做的「梦」,开始能够用来练习和筛选真实动作。

相关
项目主页:
http://x2robot.com/pages/ss
论文链接:
https://github.com/X-Square-Robot/wall-ss/blob/main/wall-ss-paper.pdf
Github 链接:
https://github.com/X-Square-Robot/wall-ss

机器人「做梦」的方式,会决定现实里是否翻车

世界模型是目前具身智能最受关注的方向之一。

它可以理解成机器人脑中的预演系统。给它当前画面和一组准备执行的动作,它会预测接下来会发生什么。

机械臂向左移动 1 厘米,杯子会被抓住还是被碰倒?抽屉已经打开,下一步应该继续取东西,还是先调整手腕角度?机器人可以比较多个未来,再决定采用哪条动作路径。


机器人公司也可以把不同版本的动作策略放进世界模型测试。表现更好的版本再上真机,省下在真实世界测试动作效果的昂贵成本。

问题是,很多世界模型很多时候更像一位过分乐观的导演。

机器人训练数据通常以成功示范为主。如果模型看到的大部分夹爪闭合动作,后面都跟着物体被拿起,它就容易走捷径:只要夹爪闭合,物体就应该被抓起来。

即使夹爪与物体之间还有明显空隙,生成画面里的物体也可能主动贴进夹爪。论文把这类现象称为类似「磁铁式抓取」的错误。


这类偏差在跑步、跳舞等大动作里未必显眼,到了精细操作中却会直接决定成败。夹爪与杯把差几毫米,机器人可能抓空。插头角度偏了一点,也很难顺利插入接口。

机器人从「会做」走到「做成」,往往就卡在最后几毫米。

世界模型如果直接把这几毫米抹平,给出的未来越流畅,机器人越容易高估一套动作的可靠性。

推演时间一长,还会出现新的麻烦。

世界模型生成完一段画面后,还要把它作为下一段预测的依据。前面一点小误差,会在后续不断累积。物体可能慢慢偏离原位,夹爪与杯子的接触关系也会发生变化。

只保留最近几帧,模型会忘记之前做过什么,但要是保留全部历史,计算量和显存占用又会持续增长。

视频看起来逼真,不代表模型选出的策略真的更好。机器人研发需要知道,虚拟测试里的优胜者,到了真机上能不能继续领先。

世界模型需要让不同动作确实通向不同结果,流畅画面只完成了最表面的一步。

机器人怎么动,未来就该怎么变

WALL-SS 预测接下来几秒的画面时,会先搭出一版「低清预览」。

在这版预览里,模型先确定大方向:机械臂往哪里走,物体大概会怎么移动。随后,它把同一段画面一层层调清,补上物体轮廓、夹爪开合和接触位置。

论文把这种从大轮廓到小细节的层级叫做「尺度」。已经生成的画面和发生过的动作,会成为下一段预测的历史,这就是「下一尺度自回归」。

画面每清晰一些,动作也会再影响一次未来。

手臂往左还是往右,会先改变低清画面里的运动方向。夹爪何时闭合,会继续影响清晰画面里有没有碰到杯子。

一小段未来生成完成后,它会连同已经发生的动作一起进入记忆,成为模型继续往后推演的依据。

过去一些世界模型更像在开拍前看一眼动作要求,但后面它还是容易依赖任务描述和视觉经验,把剩下的剧情把剧情自己脑补出来。

WALL-SS 把动作和画面放在同一条时间线上。哪只夹爪在什么时候移动到哪里,头部相机和腕部相机应该看到什么变化,都要相互对得上。


同一张初始画面配上不同动作后,模型会生成不同未来。夹爪偏离物体时,它需要表现抓空。路径碰到障碍物时,它也不能直接跳到任务成功的结局。

结果怎么验证呢,WALL-SS 会固定初始画面,只换一条动作轨迹,看未来有没有跟着改变。模型如果只改变画面细节、始终生成同一个成功结局,很难在这项测试中获得高分。

WALL-SS 在这项评测中得到 0.290,Cosmos3 为 0.044,其他模型则是0分。这项指标衡量模型对动作变化的敏感程度。两者之间的差距表明,WALL-SS 更愿意按照输入动作改变后续画面。

模型愿意随着动作改变画面还不够。生成画面里的机械臂,也要真正走在给定路线上。

在衡量这件事的「轨迹精度」上,WALL-SS 得到 0.539,是全部对比模型中的最高分。它的视觉骨干 InfinityStar 得分为 0.251。换成人话,虚拟机械臂既「听见」了动作指令,也更能沿着指令指定的路线移动。


▲固定初始画面,只改变动作条件,三组分支会生成不同轨迹和不同未来。蓝线是给定动作,橙线是生成画面中实际出现的轨迹.

这些能力也来自一批过去容易被丢掉的数据。

研究团队保留了抓空、滑落、碰撞、重新抓取、人工接管和失败恢复等过程。其中一种采集方式,是先保留机器人发生错误的动作,再回到接近出错前的状态,由操作员执行一套纠正动作。

如果训练数据里没有失败,世界模型很容易把「任务目标」误当成「必然结局」。

做一分钟家务,机器人怎么才能不「断片」

上面说的这些,只能保证机器人没有从第一步开始跑偏。

而家庭任务往往包含多个连续步骤,打开抽屉、拿起物品、放进抽屉、再把抽屉关上,可能持续几十秒。机器人还要记住抽屉是否已经打开,物品目前在桌面还是手里。

WALL-SS 没有让模型把每一帧都永远背下来。它会让记忆随着时间自动变得“模糊”。

刚刚发生的动作保留更多细节:机器人几秒前有没有碰到杯子,夹爪是否已经闭合,都需要精确记住。


更早的历史会被压缩。模型不必一直保存几十秒前每一帧的细节,只要记住桌上有哪些物体、它们大致在哪里、任务已经进行到哪一步。

最初的观察画面会被保留下来,作为场景和物体身份的锚点。视觉历史被压缩时,对应的动作历史也会一起压缩。

这就是「尺度压缩的长时间跨度记忆」,它像一份会自动整理的工作记录,刚刚发生的事情才保留详尽细节,更久以前的事情只留下摘要。

模型不需要记住过去的每个像素,它只要了解哪些变化还会影响下一步。

即便如此,预测画面的过程中仍不可避免地积累小的误差。机器人需要学会自己纠正误差。为此 WALL-SS 拿出了「逐尺度梦境强迫」的大招。训练时,研究团队会给历史信息加入扰动,要求基于有误差的信息,预测正确的未来。

这相当于让机器人平时就在「有小错误的梦」里继续往下走,学会别把一个小错滚成整段任务崩溃。

在长时测试中,WALL-SS 连续推演了 60 秒,轨迹误差、片段衔接、物体状态和视觉质量,都比对照模型更稳定。

其中倒水任务包含接近水瓶、抓握、抬起、倾倒和放回等阶段。在 60 秒推演中,机械臂逐帧轨迹误差保持在画面对角线的 0.5% 以下。


▲上方记录从接近水瓶、抓取、倒水到放回的连续过程,下方比较生成轨迹与给定轨迹

只保留最近片段的版本,在 20 至 30 秒后开始明显恶化。去掉梦境强迫后,长期状态一致性也会持续下降。

这就能验证一项持续 1 分钟的操作里,机器人仍能记得自己做过什么,能够稳定地推演未来。

虚拟成绩,能不能替真机筛策略

不过就算动作对了,记忆也没断片,虚拟世界仍然可能和现实存在偏差。

你想如果一个机师只做过模拟飞行,你敢坐他的飞机吗?

而 WALL-SS 则想了一个办法,是给自己的预测安排两位长期在线的「裁判」。

在相同动作条件下,模型会生成多条未来支线。一个裁判会检查动作,比如画面里的机械臂是否按照给定方向移动,物体是否产生了对应变化。

另一个裁判负责审核长期一致性,看机器人和物体的状态有没有漂移,前后片段能否接上,多个摄像头看到的世界是否一致。

最后模型会根据评分调整下一次生成不同未来的概率,这套过程叫「视觉动力学的在线策略对齐」。


简单来说就是用来专门优化视觉世界的变化规律。机器人控制器不会收到任务成功率奖励。参考模型约束和真实轨迹回放也会同时加入,防止模型为了获得高分而牺牲原有画面质量。

对齐之后,动作跟随从 0.264 提升至 0.290,轨迹精度从 0.512 提升至 0.539,跨片段边界误差从 0.118 降至 0.104。动作与轨迹更贴近指令,前后视频也更容易接上,画面质量基本没有变化。

我们直接看看论文里虚拟测试和真机测试的对比。

研究团队选取 5 个不同训练阶段的 WALL-WM 策略,在 6 项任务、20 组匹配初始状态下,分别进入 WALL-SS 和真实机器人执行,共得到 600 对闭环结果。

600 对实验中,有 527 对的最终成败一致。WALL-SS 在虚拟世界里选出的较好版本,有 89% 的优劣关系与真机测试相同。

如果把 30 个「任务与策略版本」组合的成功率放在一起比较,虚拟结果和真机结果的相关系数为 0.926,平均绝对误差为 0.062。

这个 0.926 衡量虚拟与真实结果的整体变化趋势,不能理解成单次预测有 92.6% 的命中率。


▲左图比较虚拟与真机成功率,数据越接近对角线,代表两者越一致。右图比较 6 项任务中 5 个策略版本的虚拟与真机成.

世界模型无需彻底取代真机测试,它只要能先筛掉较差的版本,就已经可以省下大量现实试错。

WALL-SS 还在同一套系统中加入了动作专家。

外部动作给定时,视觉生成器负责预测「这样做会发生什么」。需要模型自主行动时,动作专家可以根据当前状态生成下一段控制指令。两个部分共享已经确认的世界状态和动作接口。

动作专家可以直接控制真实机器人。在论文的桌面双臂任务中,WALL-SS 的平均任务进度得分为 69.1。作为对比,π 0.5 为 49.6,DreamZero 为 44.1,LingBot-VA 为 34.0。

模拟器负责预演,动作专家负责执行。两者在同一份世界状态上来回接力,形成「提出动作—预演结果—继续行动」的闭环。

WALL-SS 主要作用在机器人认知和训练这一侧:怎样预演动作、记住长任务、评测策略。真正拧紧一颗螺丝、把插头稳定送进接口,还依赖关节精度、灵巧手、触觉和力控。

世界模型可以提前发现哪条动作更可能失败,也能减少较差策略直接上真机的次数。末端执行器能否稳定落位,仍取决于整套软硬件的配合。

具身智能的「ChatGPT 时刻」,看谁能更快走进现实

前几年,人们还在关注机器人能不能站稳、跑起来。今年的赛场开始把衣物整理、家庭清洁、酒店服务和应急救援放进长流程任务。

当机器人从舞台演示走向真实服务,行业判断技术的方式也会改变。一个成功 Demo 只是一张入场券。机器人能否重复完成任务,换个环境是否还能工作,模型每次更新要花多少真机成本,都会变得更重要。

下一轮具身智能竞争,会看谁能让机器人学得更便宜、测得更可靠,并走进更多陌生环境。


WALL-SS 给我们提供了一种具体的解法:动作必须真正改变预测结果,长任务中不能轻易失忆,虚拟策略排名还要接受真机验证。

当世界模型能预测真机策略的相对优劣,它就开始从内容生成能力变成研发系统的一部分。

这会改变世界模型在机器人公司里的位置。失败和纠正数据先帮助模型认识现实的边界。随后,虚拟环境批量筛选策略,少量真机结果再回来检查和修正这个虚拟世界。

虚拟训练场由此兼任练习场、考场和校准台。真机数量决定数据入口,每一小时真机数据能换来多少轮模型迭代,也会影响研发速度。

真机需要占用设备、布置场景,还要有人处理失败后的复位。涉及碰撞、液体或易碎物品时,测试本身也有风险。

世界模型可以先承担大规模初筛。真机只需要验证虚拟考场里更有希望的候选策略。

这有点像汽车碰撞仿真。它不会取消最后的实车测试,却能减少为了筛选设计而撞掉的真车。

世界模型与 VLA 可以分工协作。VLA 负责根据视觉和语言生成动作,世界模型负责提前演一遍「这样做会发生什么」。一个负责出主意,一个负责看后果。

真机产生的成功、失败和人工接管数据,还能继续回流。世界模型变得更准后,又可以测试更多策略,再把更好的版本送回真机。

前段时间,自变量在一次物流分拣直播中,让搭载 WALL-B 的双臂机器人使用标准夹爪,处理纸箱、软袋、圆柱形快件和泡沫封装生鲜件等随机包裹。它完成了 1911 件有效分拣,准确率超过 98%。


以后 WALL-SS 会让机器人走向工位之前准备更充分,它先在虚拟世界里检查它会不会抓空、碰撞,或者在连续作业中逐渐跑偏。对按吞吐量和停机时间计算成本的仓库,这类虚拟筛选有机会减少设备占用和现场复位。

这样一来,用户或者企业就可以尽量避免成为最早一轮试错的「小白鼠」,倒水、递物和收纳等动作,也有机会在执行前先比较不同后果。

王兴兴最近谈到他理解的具身智能「ChatGPT 时刻」:机器人能够在约 80% 的陌生场景中,只靠语言或文字指令,完成约 80% 的任务。对于这个时刻,他判断快则 2 至 3 年,慢则 5 年甚至 10 年。

当然 WALL-SS 还没有把机器人直接带到这个阶段,这篇论文的真机实验主要集中在桌面双臂任务,验证的连续推演时长为 60 秒,但自变量至少提供了一个抵达「ChatGPT 时刻」更现实的方向。

等到机器人真正走进家门,少摔一次杯子,比多拿一块金牌要重要得多。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
任正非:中国很多老百姓还很贫困,让贫穷的老百姓让利来救一个有钱的华为,良心上过不去!网友:那还涨价1000?

任正非:中国很多老百姓还很贫困,让贫穷的老百姓让利来救一个有钱的华为,良心上过不去!网友:那还涨价1000?

大白聊IT
2026-09-06 23:35:54
OpenAI首席科学家:我们已造出异星心智!全人类都要刹车了

OpenAI首席科学家:我们已造出异星心智!全人类都要刹车了

新智元
2026-09-07 07:01:21
女篮世界杯出线形势已明朗!中美韩8队提前晋级:日本或被淘汰?

女篮世界杯出线形势已明朗!中美韩8队提前晋级:日本或被淘汰?

篮球快餐车
2026-09-07 16:00:07
郭德纲唱红歌事件后续:处罚通报公布,罚款数额巨大,以后真要管住嘴了

郭德纲唱红歌事件后续:处罚通报公布,罚款数额巨大,以后真要管住嘴了

李晚书
2026-09-07 19:10:28
左帅被澳门地头蛇张永安打成残废,加代杀过去报仇,大快人心

左帅被澳门地头蛇张永安打成残废,加代杀过去报仇,大快人心

红豆讲堂
2024-10-10 11:33:24
冒死救人的车手年仅23岁!催泪回应:从未犹豫 很庆幸我恰好在那里

冒死救人的车手年仅23岁!催泪回应:从未犹豫 很庆幸我恰好在那里

社会日日鲜
2026-09-07 10:59:38
天塌了!全是上亿细菌!家家户户天天在用,别不知道了!快看看!

天塌了!全是上亿细菌!家家户户天天在用,别不知道了!快看看!

三农老历
2026-09-07 15:59:35
精神病院改名,为什么全国各地“不约而同”改名了

精神病院改名,为什么全国各地“不约而同”改名了

南传
2026-09-06 00:10:06
一场3-1验出国足失意人真成色 邵佳一最大发现 国足中场又添新核心

一场3-1验出国足失意人真成色 邵佳一最大发现 国足中场又添新核心

零度眼看球
2026-09-07 07:09:14
字母哥怒批中国球员,含金量仍在上升

字母哥怒批中国球员,含金量仍在上升

野球帝
2026-09-07 11:31:18
王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

王晶爆张国荣跳楼内幕!抑郁症只是一方面,受内地金主影响最大

可乐谈情感
2026-08-30 07:27:10
星宇事件再起争端!网友:星宇股份二次“罚”了所有人,却没一个人真疼——这波操作,把打工人当傻子

星宇事件再起争端!网友:星宇股份二次“罚”了所有人,却没一个人真疼——这波操作,把打工人当傻子

火山詩话
2026-09-07 12:46:48
拉什福德重焕新生:曼联省下1亿英镑,战术升级成进攻利刃

拉什福德重焕新生:曼联省下1亿英镑,战术升级成进攻利刃

星耀国际足坛
2026-09-07 22:08:52
不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

周哥一影视
2026-09-07 11:04:02
离谱!皇马头号水货现形!昔日巨星彻底跌下神坛!

离谱!皇马头号水货现形!昔日巨星彻底跌下神坛!

澜归序
2026-09-07 08:07:44
世界杯-韩国女篮负匈牙利列小组第三 朴智贤21分姜怡瑟6中0

世界杯-韩国女篮负匈牙利列小组第三 朴智贤21分姜怡瑟6中0

醉卧浮生
2026-09-07 22:36:03
击毙了,伊朗军方宣布重大战果!

击毙了,伊朗军方宣布重大战果!

故事终将光明磊落
2026-09-07 08:12:28
直线暴拉!万亿巨头,重大利好来袭!目标价:3267港元/股

直线暴拉!万亿巨头,重大利好来袭!目标价:3267港元/股

证券时报
2026-09-07 18:59:02
朝鲜用 "教科书式" 的手段,让全世界都领教到了,这个小国的厉害

朝鲜用 "教科书式" 的手段,让全世界都领教到了,这个小国的厉害

李砍柴
2026-09-06 23:47:28
菜单上爬满甲虫的AI食物图,为何让美国食客集体反胃?

菜单上爬满甲虫的AI食物图,为何让美国食客集体反胃?

灰度测试中
2026-09-06 22:52:18
2026-09-08 00:44:49
爱范儿 incentive-icons
爱范儿
消费科技第一媒体
39385文章数 2602480关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

家居
旅游
亲子
教育
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

走进合川涞滩古镇 探寻三江之畔的人文底蕴

亲子要闻

低精力的妈妈,务必主动戒掉这个习惯

教育要闻

最新!清华附、十一学校大动作!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版