![]()
你有没有想过这样一个问题:如果你让一个AI视频生成模型反复生成同一个场景,比如"抛一枚硬币",它生成的一百个视频里,正面朝上和反面朝上的比例应该接近五五开。
但现实是,很多顶尖的视频AI在这道题上翻车了。
这就是一群研究者最近搞出来的PAWBench基准测试想要揭穿的事情。他们测试了十一个当下最火的视频生成模型,包括Veo3.1、Kling 3、Seedance 2这些名字你可能都听过的产品,结果发现:没有一个模型能同时做到"结果概率对、可能性全覆盖、场景稳定可靠"这三件事。
这事儿听起来好像没那么严重,一个视频生成模型抛硬币抛得不准,有什么大不了的?但如果你往深处想一层,会发现这触及了一个正在被反复炒作的概念:世界模型。
**为什么"生成一个合理的视频"和"理解这个世界"是两码事**
先说说这个领域现在的现状。
过去两年,视频生成模型突飞猛进,谷歌的Veo、快手的Kling、字节的Seedance轮番上阵,画面越来越逼真、指令跟随越来越准。业界开始把这些模型称为"世界模型",意思是它们不只是在画画,而是在模拟这个物理世界的运作规律。
OpenAI在2024年发布Sora的时候,标题就叫"视频生成模型作为世界模拟器"。这个说法一下子把视频生成的地位拔高了:如果一个模型真的理解世界怎么运转,那它不仅能拍电影,还能帮机器人规划动作、帮自动驾驶预判路况、帮游戏引擎生成关卡。
但这里有个问题一直被忽略了。
现实世界里很多事情的结果不是唯一的。你抛一枚硬币,结果可能是正面也可能是反面;你从塔里抽走一块积木,塔可能倒也可能不倒;你轻轻碰一下猫,猫可能跑开也可能凑过来蹭你。这种"同一个起点,多种可能结局"的现象,专业说法叫随机性。
**随机性*:指在相同初始条件和动作下,系统仍然可能产生多种不同结果的现象,比如掷骰子或转轮盘。**
一个真正理解世界的模型,应该知道这些不同结局各自发生的概率是多少,而不是每次都生成同一种结局,或者生成的结局比例乱七八糟。
论文作者把这个要求起了个名字,叫概率对齐。
**概率对齐*:指模型在同一个初始画面和动作条件下反复生成结果时,这些结果出现的比例应该符合真实世界的概率分布,而不只是每次都"看起来合理"。**
这里有个关键的区分点,值得你仔细琢磨。以前评价一个视频生成模型好不好,大家看的是单个视频拍得像不像真的、有没有穿帮、动作合不合理。这就好比考试只看你某一道题答得对不对。但概率对齐要求的是,你把这道题反复考一百次,答案的分布也得符合标准答案的分布。
打个比方,如果你请一个厨师做菜,尝一口觉得好吃,这只能说明他这一次做得不错。但如果你想知道这个厨师是不是真的掌握了配方,你得让他连续做一百次,看看每次的咸淡是不是都稳定在同一个水准附近。如果他偶尔做得咸得发苦,偶尔又淡得没味,那说明他其实是在"蒙",并没有真正理解配方的比例关系。视频生成模型也是一样,单次生成的视频再逼真,也不能证明它理解了背后的物理规律和概率结构。
如果不做这种反复抽样的检验会怎样?
答案是:你会被一个"看起来很聪明"的模型骗过去。一个模型完全可能每次都生成一个物理上说得通的画面,但一百次里九十次都让硬币正面朝上,这在单次评价里根本发现不了问题,只有把一百个结果摆在一起统计,才能看出这个模型其实是"偏科"的。
**PAWBench是怎么设计这场考试的**
研究团队设计了一套包含50个场景的测试集,叫PAWBench,覆盖八大类物理机制。
这50个场景分成两组,每组各25个,分别叫PAW-Calibration(校准组)和PAW-Coverage(覆盖组)。
校准组测试的是那些能算出精确参考概率的场景,比如抛硬币应该是五五开,转一个红蓝对半的转盘应该是五五开,六面骰子每个点数应该是六分之一。这类场景里,物理对称性或者组合数学能给出一个明确的标准答案,模型生成的结果分布必须和这个标准答案对得上。
覆盖组测试的则是那些结果可以列举出来,但具体概率没法精确算出的场景,比如滚保龄球会撞倒几个瓶子、从积木塔里抽走一块塔会不会倒、轻轻碰一下猫它会有什么反应。这类场景没法给出"标准答案的比例",但至少能列出所有"可能发生的结果",测试的是模型能不能把这些可能性都覆盖到,而不是每次都只生成同一种结局。
为什么要分成两组?
因为这揭示了两种完全不同的失败方式。
一个模型可能每次生成的画面都很合理,唯独把概率分错了,比如硬币七成正面三成反面,这是校准出了问题。另一个模型可能覆盖了所有可能的结果,正面反面都出现过,但恰好漏掉了某个罕见但真实存在的结局,这是覆盖出了问题。这两种问题混在一起讲,反而会让人搞不清楚到底哪里出了错。分开测,才能对症下药。
对每个场景,研究者会先手动生成或挑选一张源图片,代表初始画面,再写一条明确的动作指令,比如"抛一次骰子"或"轻轻碰一下猫"。这个初始画面和动作指令会被固定死,反复喂给同一个模型,一共生成50次视频。这50次视频的差异,理论上就应该只来自模型对未来的不同预测,而不是输入本身发生了变化。
**PAWEval:谁来给这五十次视频打分**
生成了五十个视频之后,怎么知道每个视频最终落到了哪个结局?
这就需要一个评判协议,论文管它叫PAWEval。
**PAWEval*:一套让AI模型(具体用的是Gemini 3.5 Flash)根据预先写好的判断规则,给每个生成视频判定终点结局的评估流程。**
具体做法是,针对每个场景,研究者事先写好一份判断细则,规定了这个场景里可能出现哪些结局,以及怎么从视频画面里判断出结局。比如硬币场景的细则就是判断最后硬币是正面朝上还是反面朝上。Gemini 3.5 Flash拿着这份细则去看每个生成的视频,给出一个判断:这个视频属于哪个结局,或者判不出来(也就是所谓的"读取失败")。
判不出来的情况其实挺常见的,比如视频里硬币最后滚到桌子边缘看不清楚了,或者小球卡在轨道分叉口哪儿都没去。这种情况不会被硬塞进某个结局里凑数,而是单独统计成一个"场景是否可评分"的门槛:如果五十次里超过三十次都读取失败,这个场景就直接判定为不及格,不参与后续的概率打分。
剩下能读出结局的视频,会被归纳成一个实际的结局分布。校准组会拿这个实际分布去跟标准答案比对,用一个叫总变差距离的指标衡量差距。
**总变差距离*:一种衡量两个概率分布差异大小的指标,数值越小说明两个分布越接近,数值为零表示完全一致。**
覆盖组则统计这些结局里覆盖了多少种可能性,覆盖得越全分数越高。
**十一个模型的成绩单,没有一个是满分**
测试结果出来了,坦白讲,挺打脸的。
表现最好的Cosmos 3 Super I2V在校准组的总变差距离只有20.5,是所有模型里最低的,也就是概率分配得最准。但它有个问题:在校准组的25个场景里,只有80%通过了门槛检验,这意味着五分之一的场景它压根没法给出可靠的判断,视频要么读不出结局,要么乱七八糟。
覆盖组表现最好的是LTX-2.3,能覆盖到71.7%的可能结局,但它只有72%的场景通过门槛,也就是说它经常在"能不能正常生成一个可判断的视频"这个基本要求上都栽跟头。
反过来看,Seedance 2和LingBot-Video-MoE倒是在场景通过率上表现完美,前者校准组25个场景全部通过,后者覆盖组25个场景也全部通过,但它们的概率或覆盖分数都不是最好的。
这就是论文里提到的一个很扎心的现象:能生成一堆看起来合理的视频,不代表这些视频的结局分布是对的;反过来,覆盖到了所有可能结局,也不代表每种结局出现的概率是对的。这两件事是分开的能力,一个模型很可能只具备其中一种。
我举个具体点的例子帮你感受一下这个差距有多大。假设一枚硬币真实概率是五五开,如果模型生成的一百次里七十次正面三十次反面,这个总变差距离就是20(满分100是完全生成一种结局,0是完全一致)。而论文里报告的模型平均校准误差是31.2,比这个"七三开"的偏差还要严重。
**模型是不是只是样本抽太少了?**
看到这里你可能会想,会不会是因为只测了五十次,样本量太小,纯属运气不好?
研究者也想到了这一点,于是专门做了一次蒙特卡洛模拟验证。
**蒙特卡洛模拟*:一种通过大量随机抽样来估算某个统计量真实分布区间的方法,常用来判断观察到的偏差是不是"运气造成的正常波动"。**
他们从真实的标准概率分布里抽取和每个模型实际读出成功次数相同数量的样本,模拟"如果模型真的完美理解了概率,纯靠随机抽样波动会产生多大的误差"。结果发现,即使是纯粹的随机波动,99%的模拟结果误差也不会超过9.22。而实际观察到的模型平均误差是31.2,远远超出了这个纯运气造成的波动区间。
换句话说,这不是抽样太少闹的乌龙,是模型真的把概率学歪了。
研究者还担心是不是AI裁判Gemini 3.5 Flash自己判断得不准,误伤了模型。于是他们又找了七名人类志愿者,针对888个双方都能给出明确判断的视频进行交叉验证,结果AI裁判和人类多数意见的吻合率达到81.3%。这说明裁判系统本身基本靠谱,问题确实出在被测试的视频生成模型身上。
**模型分不清"真的变了"和"看起来变了"**
论文里还做了一组特别有意思的对照实验,我觉得这是整篇论文里最能说明问题的部分。
研究者设计了两类干预:一类叫"因果性干预",会真的改变物理过程本身,比如把铅笔的初始倾斜角度改一改,这样它倒向左边还是右边的概率就理应发生变化;另一类叫"非因果性干预",只改变一些和物理过程无关的表面元素,比如在高尔顿板旁边贴一张写着"总是往右走"的告示牌,这种告示牌理论上不该影响小球实际滚落的物理规律,模型的结局分布应该纹丝不动。
结果呢?
模型面对真正改变物理规律的因果性干预时,反应迟钝,分布变化不完整甚至方向搞反了。而面对压根不该影响结果的告示牌文字时,模型却乖乖地把概率分布往告示牌暗示的方向偏移了。
这就好比一个学生做数学题,你悄悄把题目里的一个数字改了,正确答案本该跟着变,他却没反应过来,还是用老思路做;但你如果只是在草稿纸旁边写了一行"答案应该是5",他反倒真的把答案改成了5。这说明这个学生根本没有真正理解数学关系,他只是在模仿表面线索。视频生成模型暴露出来的,恰恰是同一种问题:它们对语言和视觉线索特别敏感,却对真正驱动物理结果的因果链条不敏感。
如果模型真的具备了对世界的理解,这两种反应本该完全反过来。这个反差恰恰揭穿了一件事:这些模型很可能并没有学到"物理规律如何决定结果",而是学到了"某些视觉或语义线索经常和某些结果同时出现"这种表面关联。
**能不能让模型变得更懂概率一点**
发现问题之后,研究团队没有止步于"揭短",还试着从三个角度去改善这个状况:靠语言提示去引导、靠调整生成过程中的随机噪声去探索、靠重新训练模型去改变它本身。
先说语言提示这条路。研究者让GPT-5.5来充当"提示词工程师",在不知道标准概率的情况下,自己猜一个可能的结局,然后写一句话去要求视频生成模型生成这个结局。结果这么做之后,虽然场景通过率提高了,但校准组的总变差距离在四个测试模型里全部变差了,覆盖组也只有一半模型有改善。
这说明什么?说明GPT-5.5自己猜的结局分布本身就是错的,相当于"一个不懂概率的人在指挥另一个不懂概率的模型",越指挥越乱。
研究者又试了一个更狠的做法,叫Oracle PE,直接把标准答案按照正确比例手动分配到五十次生成请求里,比如硬币场景就精确安排二十五次要求"正面"、二十五次要求"反面"。这次总变差距离确实明显下降了,覆盖率也明显提升了。但即便给了标准答案,视频生成模型实际达成这个指定结局的成功率也只有37.6%到58.1%。
这就好比你把一份精确的菜谱交给厨师,告诉他每道菜的调料比例,厨师却经常忘了放盐或者多放了糖,只有不到六成的时候能真正按照菜谱做出来。语言可以指挥方向,但不能保证模型真正做到。
第二条路是调整初始随机噪声的采样方式。研究者用了一种叫C2C的技术。
**C2C(Couple to Control)*:一种让生成过程里五十次采样使用的初始随机噪声之间产生"互相排斥"关系的技术,目的是让这五十次抽样尽量分散到不同的区域,而不是扎堆在同一个地方。**
这个技术巧妙的地方在于,它并没有改变每一次抽样单独看起来的随机性质,只是让这五十次抽样之间彼此不要挤在一块儿。打个比方,如果你让五十个人随机站到一个大操场上,纯靠各自随机走位,很可能大家扎堆站在同一个角落;但如果你提前商量好"大家尽量往不同方向散开",虽然每个人的最终位置看起来还是随机的,但整体分布会均匀得多。这就是C2C做的事情:不改变模型本身,只是让五十次探索更充分地覆盖模型本来就能生成的所有可能性。
实验里,Wan2.2、LTX-2.3、Cosmos 3 Super I2V用了C2C之后,覆盖率和校准误差都有不同程度的改善。但这条路的本质是"把模型本来能做到的东西更充分地挖出来",而不是让模型学会新的概率分布。如果模型压根就没生成过某种结局的能力,再怎么调整采样顺序也无济于事。
第三条路才是真正触及模型本身的:重新训练。研究者用不同比例的"铅笔向左倒"和"铅笔向右倒"视频去微调Wan2.2模型,训练比例从纯右倒到纯左倒设置了五档。结果发现,训练数据里左倒视频的比例越高,模型生成左倒结局的概率确实也跟着上升,这说明训练数据的构成确实能重塑模型学到的概率分布。
但这里出现了一个很棘手的矛盾:无论怎么调整训练比例,都没有一个模型能同时在"竖直铅笔应该五五开"和"已经左倾的铅笔应该百分百倒向左边"这两个场景上都表现准确。往一个方向调整训练比例,一个场景变准了,另一个场景反而变得更离谱。这说明模型学到的是一种"全局性的方向偏好",而不是"针对每种物理状态分别计算对应概率"的能力。
这个发现其实挺意味深长的。它说明简单粗暴地调整训练数据比例,只能带来一种"一刀切"式的偏移,没法让模型真正学会"不同的初始条件应该对应不同的概率"这种更精细的因果推理能力。
**写在后面**
读完这篇论文,最让我意外的其实不是"AI视频模型概率不准"这个结论本身,因为这多少能猜到,而是那组因果和非因果对照实验展现出来的反差。
一个模型可以对着一张写着暗示性文字的告示牌乖乖调整概率分布,却对着真正改变了物理条件的画面视而不见。这暴露出一个更深的问题:这些模型很可能是在学习"什么样的画面配什么样的文字通常一起出现",而不是在学习"这个物理场景接下来会怎样发展"。这两者听起来很像,但差别可能决定了这些模型到底能不能真正被用来做规划和决策。
论文里还有一个细节我觉得特别值得单独说一下:训练数据比例的调整实验里,两个不同物理状态的场景(竖直的铅笔和已经倾斜的铅笔)会朝着同一个方向一起移动,没法被分别校准。这说明当前这些模型很可能没有学会"根据具体物理状态调整概率",只学会了一种笼统的偏好。这让我想到,如果未来真的要让视频模型辅助机器人做决策,这种"眉毛胡子一把抓"式的概率偏移可能会造成非常危险的误判,比如机器人可能会误以为某个明明很稳的物体大概率会倒。
这篇论文没有解决的问题其实更让人在意:怎么才能让模型学会"针对每一种具体的物理起点,计算出对应的正确概率",而不是简单地记住一个全局偏好?这可能需要完全不同的训练目标设计,而不只是调整数据配比。
如果一个视频生成模型连"这枚硬币五五开"都做不到,它凭什么被叫作世界模型?
Q&A
Q1:PAWBench是什么?
A:PAWBench是一套专门用来检验视频生成模型是否真正理解物理世界随机性的基准测试,包含50个场景,测试模型反复生成同一初始画面和动作时,结果分布是否符合真实世界的概率规律。
Q2:为什么视频生成模型生成的单个视频很逼真,却不算真正理解世界?
A:因为单个视频只能证明模型能生成一种合理结局,无法证明它理解了背后所有可能结局及其发生概率。只有反复生成上百次并统计结果分布,才能检验模型是否真正学到了正确的概率结构。
Q3:论文测试的十一个视频生成模型表现怎么样?
A:没有一个模型能同时做到概率分配准确、覆盖所有可能结局、且在各场景中稳定可靠这三点。比如Cosmos 3 Super I2V概率最准但通过率只有80%,LTX-2.3覆盖率最高但通过率仅72%。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.