网易首页 > 网易号 > 正文 申请入驻

虚幻引擎CEO围观最新世界模型:代码驱动,视频模型生成画面

0
分享至


新智元报道


近年来,视频生成模型在清晰度、时序一致性和可控性上快速进步。给定文本、图像、相机轨迹或玩家动作,模型已经能够合成连贯的后续画面,也让「可交互视频世界」逐渐从概念走向可观看、可操作的原型。

但会延续画面,并不等于会运行一个世界。镜头中的位移和碰撞只是交互最直观的一层;在更复杂的环境里,角色还有目标、身份与关系,事件受到规则约束,也会留下跨越较长时间的因果后果。许多状态甚至发生在镜头之外,却仍会改变之后的剧情与行动。仅凭局部像素预测下一段观察,很难显式维护这些高层语义。

复杂世界首先需要「理解为什么」。目标、规则、记忆和因果链条通常无法从当前一帧直接读出,却决定了世界下一步应该怎样变化。语言模型具备的知识调用、推理、规划与编程能力,适合处理这类低频但高复杂度的决策,并将决策进一步落实为可执行规则。

另一个常被忽略的事实是:游戏视频并非世界本身,而是程序执行结果被渲染后的像素投影。现阶段,游戏与模拟器仍构成视频世界模型最主要的可交互数据来源。若只保留动作与像素,再让视频模型直接学习二者之间的映射,就等于绕过原本存在的程序、规则和显式 world state,转而要求模型从视觉结果中反向拟合整套程序行为。这样的学习路径不仅低效,也把「世界如何推演」和「世界如何呈现」耦合进了同一个模型。

基于这一观察,西湖大学AGI Lab与南洋理工大学的研究团队提出了Code World Model,一种以语言模型为「大脑」的新型世界模型范式。其核心思路是让coding agent通过持续编写、调用和修改code,维护并更新可执行的 world state;与当前观察相关的状态再被转换为proxy,用来指导video model生成精细的视觉画面。


论文链接:https://arxiv.org/abs/2608.25927

项目主页:https://buaacyw.github.io/cwm/

代码仓库https://github.com/buaacyw/code-world-model

这里的语言模型并不取代视频模型。Code World Model重新划分了两者的职责:知识、目标、规则与长期因果由 coding agent 和 code 负责,外观、运动细节、光照与纹理由 video model 负责。换句话说,前者决定世界中发生什么,后者决定这一切看起来如何。


图 1 Code World Model的核心分工:coding agent通过code演化world state,proxy将相关状态转换为视觉条件,video model生成最终画面。

方法概述

围绕上述分工,Code World Model 将世界的运行过程拆成三个彼此衔接的部分。

coding agent:理解玩家意图与新事件,调用世界知识,推理潜在后果,并决定需要执行、组合或修改哪些机制。

code:以更高频率执行位置、属性、碰撞、冷却和事件触发等确定性更新,把高层决策变成可检查、可复用、可持续运行的规则。

video model:读取演化后的状态条件,利用大规模视觉数据中学到的外观、运动与交互先验,生成带有丰富纹理、光照和局部动态的视觉观察。

这种分工也对应不同的计算频率。coding agent 只需在出现新目标、复杂事件,或现有机制不足时进行稀疏决策;一旦决策被写入 code,程序便可持续执行密集的状态更新。

更重要的是,coding agent 改写的不只是某一时刻的数值,还可以改变世界此后遵循的运行方式。


图 2 Code World Model 总体框架。完整构想包含视觉反馈;当前原型重点验证 coding agent / code → world state → proxy → video model 的前向链路。

proxy连接可执行状态与视频生成

完成职责拆分后,还剩下一个关键的接口问题:coding agent 与 code 维护的是可执行状态,video model 接收的却是文本、图像或视频 token。二者之间需要一种既容易由程序构造,又能够提供逐帧空间约束的共同语言。

结构化文本足够灵活,却很难稳定描述每一帧的实体位置、相对关系、运动轨迹和精确相机变化;完整构建并渲染 3D 世界虽然控制更强,又会重新引入资产、几何、材质、动画和渲染管线的高昂成本。

为此,这项工作引入了 proxy。它从 world state 中提取当前观察真正需要遵循的信息,并将其组织成粗粒度的视觉表示。轻量、确定性的编译器把 proxy 渲染为 proxy video,再与结构化文本一同送入 video model。

文本负责说明「是谁、是什么、要做什么」,proxy 则规定「在哪里、怎样移动、镜头怎样拍」。

proxy 可以表达相机与视角、实体位置和朝向、尺度与轨迹、场景布局和遮挡,以及当前交互所需的粗粒度状态;纹理、材质、精细光照和完整局部运动则有意留给 video model。文章将这一设计原则概括为:只保留当前观察所需的最小充分状态,在控制能力与状态编码成本之间取得平衡。

当前实现中的 proxy 在宽和高上都只有目标视频的四分之一,像素量约为目标的 1/16。它由简单、可复用的几何 primitive 组合而成,不需要 production-quality 资产,却能提供逐帧、可编辑的时空骨架。

从游戏运行时记录中获得严格对齐的数据

要让 video model 学会理解 proxy,训练样本需要同时包含 proxy video、结构化文本与目标 RGB 视频,而且 proxy 与 RGB 必须在时间、相机和实体身份上严格对齐。

游戏的运行时记录天然保留了这种对应关系。研究团队从同一次 gameplay execution 中同步记录 RGB、相机状态、实体身份、位置与朝向、近似尺度、场景布局和交互状态,再通过 code 离线编译 proxy。由于两者来自同一次执行,每一帧都能建立一一对应,跨帧身份也可以稳定映射。



图 3a 游戏数据中的目标 RGB(上)与同帧 proxy(下)。



图 3b 真实视频中的目标 RGB(上),以及利用相机标定、3D 重建和物体标注离线构造的 proxy(下)。

论文使用的 gameplay 数据包含157段录制,总计约5.6小时源视频。研究团队以2秒间隔采样,得到9,420个5秒训练片段;每个RGB目标包含124 帧,分辨率为1344×768、帧率为24FPS,对应的proxy同样包含124帧,分辨率为336×192,并结合 fixed-log depth 与 categorical semantic-ID map。

同一份运行时记录还可以被重新编译成覆盖范围和信息粒度不同的 proxy,无需重新录制RGB。

论文还在KITTI-360上展示了真实视频proxy-observation pair的离线构造流程,以说明这一接口向真实数据扩展的可能性;当前video model的适配仍只使用配对的gameplay数据。

原型系统如何运行?

当前原型采用MiniMax-H3的Ref2VA backbone作为video model,对全部50个transformer block进行rank-128 LoRA适配,可训练参数约为 5.96 亿。训练使用8张NVIDIA H800 GPU,共完成3个 epoch、3,534个优化步骤。

推理阶段由 GPT-5.6 Sol 担任 coding agent。系统向其提供基础玩家控制、碰撞处理、运行时更新循环、现有 game-engine scene 与 gameplay logic 模板,以及训练阶段使用的 proxy primitive。coding agent 可以组合、扩展和改写这些 code,构造简单、可执行、可由玩家控制的世界;其中的粗粒度 3D 几何只用于表达 proxy,并不直接充当最终画面。

对于每个 5 秒片段,GPT Image 2 根据首帧 proxy 与文本生成 appearance anchor;MiniMax-H3 再结合首帧、完整 proxy sequence 和文本,生成 124 帧、1344×768、24 FPS 的 RGB 视频。

较长视频通过带有 34 帧重叠的滑动窗口生成:后一个窗口继承前一窗口末尾的 RGB context,并复用同一 appearance anchor,以维持局部连续性和整体身份外观。

实验结果

定性结果显示,即使只使用约5.6小时gameplay source video进行LoRA适配,模型仍能在角色、环境和风格明显偏离训练外观时,遵循proxy指定的人物位置、动作轨迹、场景布局与相机运动,同时补充丰富的纹理、光照和局部动态。


图 4 proxy提供人物位置与动作轨迹,video model将同一粗粒度骨架呈现为不同身份和画风的角色。上:proxy;下:生成结果。


图 5 简单几何primitive对复杂物体与相机运动施加约束。上:proxy;下:生成结果。

例如,同一种coarse human primitive可以被呈现为身份和艺术风格完全不同的角色;wireframe或box可以约束车辆、船只及其他复杂物体的位置与大致运动;同一套proxy interface还能够表达奔跑、舞蹈、游泳、坠落和相机环绕。

由此可以看到,proxy固定的是当前观察必须遵循的时空骨架,而不是训练游戏的资产和画风。

项目主页还给出了与 action-或 camera-conditioned video world model 的视频对比。

该比较关注的是控制粒度与视觉结果:proxy 直接提供逐帧实体运动和视角变化,因此能施加更细粒度、更直接的时空约束;论文并未把这组结果表述为 inference latency 对比。


网友评论到,「虚幻引擎6会是最后一个用传统3D方法创造游戏的引擎吗?或许虚幻引擎7就会用类似的技术方案了。只有虚幻引擎CEO Tim知道答案」

随后Tim也来围观道,「我也不知道!」

结语:先决定世界发生什么,再生成它看起来如何

过去的video world model主要学习「观察如何继续」。Code World Model则把问题向前推进了一步:在生成下一段观察之前,先维护世界当前是什么、遵循哪些规则,以及一次事件的后果为何会持续。

一个真正开放的生成世界,既需要视频模型的视觉想象力,也需要能够维护知识、目标、规则、关系与因果后果的执行机制。Code World Model的核心可以浓缩为一句话:让code决定世界中发生什么,让video model决定这一切看起来如何。

参考资料:

https://arxiv.org/abs/2608.25927

编辑:LRST

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
日本企业募资10亿,推进猪肾脏移植人体临床试验,接力美国拯救人类

日本企业募资10亿,推进猪肾脏移植人体临床试验,接力美国拯救人类

爆角追踪
2026-09-07 08:03:47
300308,成交额A股第一!两大板块,集体飙升

300308,成交额A股第一!两大板块,集体飙升

证券时报
2026-09-07 13:14:03
“41个学生请假”,问题都这么严重了,可某些人却还在狡辩!

“41个学生请假”,问题都这么严重了,可某些人却还在狡辩!

走读新生
2026-09-04 12:10:20
罗马诺一生之敌!罗马诺曾3次HWG报道齐耶赫翻车

罗马诺一生之敌!罗马诺曾3次HWG报道齐耶赫翻车

懂球帝
2026-09-07 11:45:29
周星驰为23亿票房大戏宴请旧搭档,饭桌之上,竟无一人举起手机

周星驰为23亿票房大戏宴请旧搭档,饭桌之上,竟无一人举起手机

东方不败然多多
2026-09-07 03:29:04
两性心理学:房事上女人不怕肢体接触,怕的是男人这两个“骚操作”

两性心理学:房事上女人不怕肢体接触,怕的是男人这两个“骚操作”

心理观察局
2026-08-17 06:45:11
袁腾飞移民美国的几个细节问题

袁腾飞移民美国的几个细节问题

十柱
2026-09-05 10:15:57
05、07赛季夺冠,志在三连冠的马刺06年为何失利?他们输给了谁

05、07赛季夺冠,志在三连冠的马刺06年为何失利?他们输给了谁

大卫的篮球故事
2026-09-07 21:15:05
亲眼见证藏族少女天葬过程,场面真震撼,颠覆了我对生死的认知

亲眼见证藏族少女天葬过程,场面真震撼,颠覆了我对生死的认知

古怪奇谈录
2025-07-30 15:23:44
云南这个案子,已经不是“恐怖”的问题了

云南这个案子,已经不是“恐怖”的问题了

清书先生
2026-08-06 08:00:16
59岁江珊现状:满头白发步履蹒跚,胖到160斤,无单位也无退休金

59岁江珊现状:满头白发步履蹒跚,胖到160斤,无单位也无退休金

观星赏月
2026-09-06 05:31:21
70万欧!身价第一!“国足弃将”迎爆发,28岁成现役最强中场

70万欧!身价第一!“国足弃将”迎爆发,28岁成现役最强中场

篮球圈里的那些事
2026-09-07 17:26:36
继续停牌!600825,筹划重大资产重组

继续停牌!600825,筹划重大资产重组

新浪财经
2026-09-07 21:28:59
哈佛研究证实:比跑步更开心、比走路更养命!它才是最顶级的抗衰

哈佛研究证实:比跑步更开心、比走路更养命!它才是最顶级的抗衰

解说阿洎
2026-09-06 10:56:53
一个错误决定,使这个全球最幸福的国家,沦落为“强奸第一大国”

一个错误决定,使这个全球最幸福的国家,沦落为“强奸第一大国”

墨策史
2026-09-05 18:28:31
我国更名最失败的2所大学,以前校名很霸气,更名后声名大降!

我国更名最失败的2所大学,以前校名很霸气,更名后声名大降!

高三倒计时
2026-09-07 16:51:56
离谱至极!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

离谱至极!恒大二把手夏海钧在美国的邻居,竟然是另一个逃跑富豪

就一点
2026-08-21 16:35:35
“人民政府”写成“人民币政府”,“新能源”写成“新熊源” 紫金矿业财报现文字乌龙

“人民政府”写成“人民币政府”,“新能源”写成“新熊源” 紫金矿业财报现文字乌龙

政法频道
2026-09-07 11:23:38
埃利奥特·安德森用破纪录传球表现,让健忘的兰帕德记住了他

埃利奥特·安德森用破纪录传球表现,让健忘的兰帕德记住了他

篮坛第一线
2026-09-07 23:16:43
“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

“新型出轨方式”正悄然兴起,不私会不开房,却正在毁掉千万家庭

流史岁月
2026-08-10 10:46:45
2026-09-08 00:08:49
新智元 incentive-icons
新智元
AI产业主平台领航智能+时代
16128文章数 67047关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

中超争冠形势:成都蓉城下轮打平夺冠

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

教育
时尚
亲子
手机
家居

教育要闻

70%比50%大百分之几

夏天裙子不要总穿白色,看看这些深色裙装,显瘦高级又不挑年纪

亲子要闻

低精力的妈妈,务必主动戒掉这个习惯

手机要闻

10999 小米18 Fold发布,新形态中折叠 首发玄戒O3

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版