网易首页 > 网易号 > 正文 申请入驻

深度|四张榜单,四种真相:WAIC 之后,世界模型到底该看哪个排名?

0
分享至



7 月的上海,世博展览馆 H3 馆的过道比往年拥挤许多。

入口处停着宇树的载人变形机甲 GD01,观众排队坐进驾驶舱拍照。往里走,300 多台机器人真机散在 200 多家具身智能企业的展台之间,具身智能无疑是这届 WAIC 最具象的展品。而视频生成公司的展台就设在机器人公司隔壁,播放演示片的屏幕连成片:机械臂倒水,无人机穿林,虚拟角色转身。

不同公司的讲解员说着高度趋同的话:都在讲具身智能,都在讲世界模型。


图:WAIC 2026 现场,宇树科技展台(来源:新蓝网)

穿梭在展台之间的投资人,面对诸多公司同样问着高度趋同的一套问题,核心聚焦在模型到底什么水平。但得到的答案却分别指向不同的东西。有人打开手机展示 VBench 排名,有人调出 RoboTwin 2.0 的任务成功率曲线,有人谈仿真到真机的迁移数据。同一个词,在不同的展台上被不同的数字定义。

当具身智能与世界模型成为显学,榜单便不再只是技术社区的内部排名,而成了行业理解技术路线的入口,在某种程度上,更成了话语权本身。


一张拼图,三个榜单

2026 年以来,具身智能和世界模型几乎成了 AI 圈最热的两个词。

技术圈在讨论,视频模型到底能不能成为机器理解物理世界的路径。资本圈在讨论,下一代 AI 公司,能不能从“会说话的模型”走向“会理解、会预测、会行动的模型”。媒体圈的问题则更清晰、直白,当“世界模型公司”越来越多,到底该怎么看谁更强?

然而时至今日,世界模型依旧没有一个统一的定义和衡量标准。

落到具体的评测上,世界模型目前还不是一种单一分数就能概括的能力,它更像一张尚未完成的拼图:视频质量、指令理解、时序一致性、物理规律、机器人执行、动作预测,每一项能力背后都站着一张榜单和一群拥趸。

那么,具身智能和世界模型到底该看哪些榜单?把这张拼图拆开,有三块版图绕不开:一张回答"像不像",一张回答"懂不懂",一张回答"动不动得了"。看懂它们,比看懂任何一场发布会都更接近行业的真实进度。还有一块回答"准不准",它是整张拼图的底座,值得单独一章。

VBench:回答"像不像"

VBench 是目前视频生成领域最常用的评测体系之一,由南洋理工大学 S-Lab、上海人工智能实验室 OpenGVLab 等机构推出。它从主体一致性、背景一致性、运动流畅度、美学质量等 16 个维度评价生成视频。

它回答的问题很直接:模型生成的视频,像不像真实世界,是否符合用户输入。

在 VBench 1.0 认证榜中,头部模型集中在 84 分到 88 分之间,差距已经很小。于是 VBench 在 2025 年推出 2.0 版本,将评测范围扩展到人类保真、物理、可控性、常识等维度,开始关注那些决定真实感、却容易被忽略的问题。

根据其 HuggingFace 官方榜单的认证视图,主要名次如下:


图:VBench-2.0 榜单:Veo 3 以 66.72% 居首(来源:HuggingFace Vchitect/VBench_Leaderboard,2026 年 7 月截图)

但 VBench 仍主要评价视频结果。画面可以逼真,模型却未必理解画面背后的规律。

WorldModelBench:回答"懂不懂"

如果视频生成模型被称为“世界模型”,它就需要接受更严格的检验。

2025 年,来自 UC Berkeley、UC San Diego、NVIDIA 和 MIT 的研究者推出 WorldModelBench,把模型放进物理和常识环境中测试。

该评测覆盖机器人、驾驶、工业、人类活动等 7 大领域,包含 350 条提示词和 6.7 万条人工标注,从指令遵循、物理规律、常识三个维度打分。其中物理遵循占总分一半。原因很简单:世界模型最重要的能力之一,是预测物体在真实世界中会如何变化。

结果显示,即使表现最好的模型,也只有 61% 的视频正确完成指令;12% 的视频违反质量守恒,11% 出现物体互相穿透。

模型能生成一个看起来合理的世界,但距离真正理解世界,还有明显距离。


图:WorldModelBench 官网榜单(来源:worldmodelbench-team.github.io,2026 年 7 月截图)

RoboTwin 2.0:回答"动不动得了"

世界模型终究要服务于行动,再往拼图下游走一格,机器人能否干活便成了一个很重要的维度。

RoboTwin 2.0 由上海交大 ScaleLab 与港大 MMLab 主导、上海人工智能实验室参与。它包含 50 个双臂协同操作任务,抓取交接、工具使用、可形变物体操作,跑在 SAPIEN 仿真器上,支持 Aloha-AgileX、ARX-X5、Piper、Franka、UR5 共 5 种双臂本体,配套一个 731 个实例、147 个类别的物体库,通过 Easy 和 Hard 两种环境,测试机器人能否从仿真走向更复杂的真实世界。

早期结果显示,在 Hard 设定下,多数方法成功率仍低于 20%。机器人能够完成特定任务,但距离稳定、泛化地完成任务还有很长距离。


图:RoboTwin 2.0 官方榜单(来源:robotwin-platform.github.io,2026 年 7 月截图)

三张榜单,三种能力,各自有发布机构和评分体系。没有一张榜单能独自定义世界模型,放在一起,他们才勾勒出一条从生成、理解到行动的能力链。但这个链条还缺少一个最关键的环节。

Physics-IQ:回答"准不准"

人类做很多动作时,会下意识在脑中预演结果。推一下杯子,它会滑多远,会不会翻倒;倾斜水壶,水会从哪里流出来;把两块磁铁靠近,它们会吸住还是弹开。

机器人也需要这种能力。它必须根据眼前的状态,预测几秒后会发生什么,再决定下一步动作。视频世界模型经常在这里犯错。这类预测如果不准,后面的规划和执行都无从谈起。

测量这一底座能力的基准叫 Physics-IQ,由 Google DeepMind 与 INSAIT 联合推出,论文发表于 WACV 2026。

2026 年 6 月,原团队联合 Anates Labs 发布修正版 Physics-IQ Verified,修正了 57.6% 的样本标注问题,改用逐样本加权计分。


它的设计与前述榜单都不同:研究者真实拍摄了 66 个物理实验,覆盖固体力学、流体、光学、热力学、磁学五大类,每个实验 3 个机位、实拍 2 次,共 396 段 8 秒视频。模型只看前 3 秒,预测后 5 秒会发生什么,再与真实拍到的后续画面比对。4 项指标合成一个 0 到 100 的 Physics-IQ 分数,并用同一场景两次实拍之间的差异做归一化:真实世界自己重拍一次都不会完全相同,模型的预测就被拿来和这种自然波动比较。

Physics-IQ 考察的是更底层的问题,即这个模型是否真的理解物理。这也正是图灵奖得主 Yann LeCun 多年来反复主张的观点,“AI 需要建立关于世界的内部模型,而不是只会生成内容”。他担任 Meta 首席科学家期间, Meta FAIR 便把 Physics-IQ 当作核心评测基准。

然而翻开 Physics-IQ 的官方榜单,排在第一的却并非 Meta 的模型,也不是英伟达投入重金的Cosmos,而是一个中国的视频生成模型。

2025 年 4 月 21 日,Sand.ai 的 Magi-1 以 56.0% 的得分上榜登顶。当时的榜首、Google 的 VideoPoet 只有 29.5%,Magi-1 几乎把这个数字翻了一倍。从那天算起,Magi-1 系在第一名的位置上坐了约 13 个月,中间只离开过三周。

这张表有三种读法。

  • 看裸模型:前三名里有两个建立在 Magi-1 之上,Magi-1 的 56.0% 是 v2v 设定下的裸模型最高分,远高于 Sora 2 裸模型的 42.3%,Cosmos3-Super 裸模型的 59.7% 出自不同设定,两者不直接可比。

  • 看增强系统:2026 年 5 月,英伟达最新发布的旗舰世界模型 Cosmos3-Super 加持 WMReward 后冲到 63.4%,短暂登顶约三周;6 月 17 日,基于 Magi-1 的增强系统以 64.5% 重回第一。


图:Physics-IQ 官方榜单:Magi-1 系居首,Sora 2 裸模型 42.3%(来源:physics-iq.github.io,2026 年 7 月截图)

  • 再看修正后的新榜:2026 年 6 月发布的 Verified 版本上,Magi-1 24B 增强版 58.2 分排第一、裸模型 48.4 分排第二,Cosmos3-Super i2v 39.5 分,Sora 2 只有 26.5 分。


图:Physics-IQ Verified 修正榜(来源:physics-iq-verified.anates.ai,2026 年 7 月截图)

把两张榜单放在一起看,会出现一个反常识的画面。OpenAI 的 Sora 在 VBench 这类回答"像不像"的榜单上名次并不难看,到了 Physics-IQ 上,Sora 2 裸模型只有 42.3%,不足榜首 64.5% 的三分之二;Verified 新榜上只有 26.5 分,不及榜首 58.2 分的一半。

生成得逼真,和预测得准确,被证明是两回事。


把视频生成做成"预测下一个词"

Magi-1 赢在哪里?论文给出的答案是架构选择。

当下主流的视频生成模型,Sora、Kling 等,走的都是扩散路线:一次性生成整段视频,所有帧同时去噪,彼此之间没有严格的时间先后。

而Magi-1 的做法更像语言模型预测下一个词:按时间顺序逐块生成,每块 24 帧,块内部用扩散去噪保证画质,块与块之间自回归衔接。通过 block-causal attention,后来的帧不会影响过去的帧,过去一旦被写下,就不再被影响。


图:Magi-1 逐块自回归生成与块因果注意力示意(来源:SandAI-org/MAGI-1,arXiv:2505.13211)

这个架构天然更接近世界模型该做的事:根据世界的此刻,推演下一秒。它还带来几个工程上的特征:支持流式生成,视频可以边生成边播放;理论上可以无限长地续写下去。对世界模型而言,这意味着推演的时间跨度不受窗口限制,仿真可以一直进行,还可以逐块更换提示词,控制后续走向。

如果把关键词从“生成”换成“预测”,Magi-1 和 LeCun 主张的 JEPA 路线便有了一种理念上的深层呼应。LeCun 在 2022 年发表立场论文《A Path Towards Autonomous Machine Intelligence》,提出 JEPA 架构:不在像素空间预测世界,而在表征空间预测,主动忽略那些不可预测的细节。这条路线后来长成一个家族:I-JEPA、V-JEPA,再到 2025 年的 V-JEPA 2,用百万小时视频训练,其衍生版本可以做零样本的机器人规划。


图:Yann LeCun 在 2026 年 6 月巴黎 VivaTech 演讲(来源:La Ecuación Digital)

一个在像素世界里逐块自回归,一个在表征空间里做预测,虽技术方案完全不同,但都指向同一个判断,即能够预测物理世界变化是世界模型的必要条件。


尺子一旦出现,叙事便有了边界

在WAIC 的论坛上,"世界模型"被反复提起。7 月 19 日的一场人形机器人与具身智能论坛,主题之一正是"标准体系不统一"。开幕当天有观察文章写道:通用世界模型正在成为人形机器人的新竞争壁垒。

竞争的坐标系确实在平移。过去几年,视频模型的发布会比的是"像不像":分辨率、时长、美学分。Physics-IQ 这类榜单的出现,把问题换成了"物理世界变化预测的准不准"。它的价值不在于新添了一张榜单,而在于把世界模型从一个抽象概念,拉回到具象的物理世界:杯子会怎么倒,水会怎么流,光会怎么折。这些东西没法靠话术修饰。坐标系的变化不会写在任何一场发布会的邀请函上,但它会决定下一年资本流向哪里、人才流向哪里。

榜单会迭代,名次会更替。但标准一旦确立,理解行业的方式必然会被改写,模糊的叙事也就有了相对清晰的边界。

尺子一旦有了,量出什么,就是什么。





特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

美国为何没有贪官?不是没有,是因为美国从制度上消灭了贪官,就连贪污都是合法的

扶苏聊历史
2026-09-12 17:43:57
事实证明,现在大部分男性,单靠自己的工资收入,根本养不起家

事实证明,现在大部分男性,单靠自己的工资收入,根本养不起家

舒山有鹿
2026-09-25 14:42:19
中秋利好,欧美大涨

中秋利好,欧美大涨

中国基金报
2026-09-25 16:42:37
樊振东,再创历史!前无古人!

樊振东,再创历史!前无古人!

乒乓网国球汇
2026-08-21 00:36:10
浙江58岁阿姨在景区扮“野人”,日薪200元:“就图一乐,工资多少无所谓”;本人坦言:纯因在家无聊,此前从未上过班

浙江58岁阿姨在景区扮“野人”,日薪200元:“就图一乐,工资多少无所谓”;本人坦言:纯因在家无聊,此前从未上过班

极目新闻
2026-09-25 15:50:38
从 7999 跌到 600 元!21:9 无黑边 4K 带鱼屏,床头追剧神机

从 7999 跌到 600 元!21:9 无黑边 4K 带鱼屏,床头追剧神机

小柱解说游戏
2026-09-25 05:01:26
世界第二联赛?上海41分惨败扯下遮羞布 CBA开放程度已难比日韩

世界第二联赛?上海41分惨败扯下遮羞布 CBA开放程度已难比日韩

大嘴爵爷侃球
2026-09-25 15:42:43
俄罗斯选举结束,普京再赢五年,中方送上祝贺!欧情报局发出警告

俄罗斯选举结束,普京再赢五年,中方送上祝贺!欧情报局发出警告

青青衫书生
2026-09-24 15:32:00
游本昌儿子表示:父亲未留下遗产,生前已全部捐赠

游本昌儿子表示:父亲未留下遗产,生前已全部捐赠

陈博世财经
2026-09-24 17:29:31
女篮主帅宫鲁鸣曾表示会吸取男篮经验,今日与男篮一样无缘决赛

女篮主帅宫鲁鸣曾表示会吸取男篮经验,今日与男篮一样无缘决赛

懂球帝
2026-09-25 17:16:07
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
美媒评巅峰统治力TOP7:乔丹无悬念登顶,库里仅排第6引争议

美媒评巅峰统治力TOP7:乔丹无悬念登顶,库里仅排第6引争议

麦子的篮球故事
2026-09-24 18:00:15
“双一流”,迎来新党委书记

“双一流”,迎来新党委书记

TOP大学来了
2026-09-25 13:02:45
4金1铜收官!亚运会男子200仰决赛:徐嘉余0.31秒之差获铜牌

4金1铜收官!亚运会男子200仰决赛:徐嘉余0.31秒之差获铜牌

全景体育V
2026-09-25 16:39:44
张本智和:以后每次交手都要赢中国队!要包揽所有金牌,包括奥运会

张本智和:以后每次交手都要赢中国队!要包揽所有金牌,包括奥运会

风过乡
2026-09-25 07:05:34
价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

价格太夸张了,小米正式发布 18 Pro/18 Pro Max!

XCiOS俱乐部
2026-09-23 20:44:19
耻辱!女篮输韩国5分无缘决赛,三分13中0 ,王思雨10中1遭驱逐,另有1罪人

耻辱!女篮输韩国5分无缘决赛,三分13中0 ,王思雨10中1遭驱逐,另有1罪人

萌兰聊个球
2026-09-25 16:59:39
穆帅与助教赫迪拉希望姆巴佩、维尼修斯能够在比赛中,参考贝林厄姆、迪奥曼德,兼顾攻防!

穆帅与助教赫迪拉希望姆巴佩、维尼修斯能够在比赛中,参考贝林厄姆、迪奥曼德,兼顾攻防!

福酱的小时光
2026-09-25 17:27:59
特朗普会中文的外孙女阿拉贝拉出席欢迎宴会

特朗普会中文的外孙女阿拉贝拉出席欢迎宴会

观察者网
2026-09-25 11:10:13
住建部定调:楼龄满25年的老房子,统统按新规处理!老小区有福了

住建部定调:楼龄满25年的老房子,统统按新规处理!老小区有福了

职场资深秘书
2026-09-24 09:27:27
2026-09-25 19:00:49
ZFinance
ZFinance
Z世代的一站式AI、科技和财经资讯
275文章数 22关注度
往期回顾 全部

科技要闻

华为赛力斯,一次声势浩大的权、利再分配

头条要闻

中国博士生枪杀北卡华人导师 因精神失常被判无罪

头条要闻

中国博士生枪杀北卡华人导师 因精神失常被判无罪

体育要闻

这场青春风暴,中国足球等了太久

娱乐要闻

肖战因拍《十日终焉》连续做半个月梦

财经要闻

月饼卖不动了...

汽车要闻

全新第四代博越L 上市限时价9.29万元起

态度原创

手机
亲子
家居
房产
艺术

手机要闻

苹果公布全产品线端侧AI能力矩阵:iPhone 18 Pro最高跑14B激活模型

亲子要闻

过中秋节了,4岁女儿去买东西看望爷爷奶奶,小家伙还挺懂事的

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

全年霸榜TOP1!南海・叁號院周年官宣:新作即将登场

艺术要闻

美国发现一幅南宋真迹,字字尽善尽美,启功:这么好的书法我只见过一次!

无障碍浏览 进入关怀版