网易首页 > 网易号 > 正文 申请入驻

Magpie:让游戏引擎管规则,让AI画面板"作画"

0
分享至


你有没有想过,做一个像样的游戏原型,到底要花多少钱?

答案可能会吓到你。建一个能跑起来的游戏场景,光是让它看起来"像样",就得经过建模、贴图、材质校准、绑骨、动画、打光、特效、性能优化十几道工序,每一道都得有专门的美术或技术人员来做。很多独立开发者甚至整个团队,能把玩法逻辑做对,却始终卡在"画面不够好看"这一关,眼睁睁看着好点子因为差钱、差人、差时间而胎死腹中。

这几年视频生成模型突然火了起来,Wan、Seedance这些大模型已经能生成非常逼真的影像。电影行业已经开始琢磨怎么用它们省钱省时间了。那游戏行业呢?能不能干脆让AI来画游戏画面,把建模贴图这些活儿全省了?

这事听起来很美好,但落地起来有个致命问题。游戏和电影根本不是一回事。

电影是线性的,拍完剪完就定型了,观众只能看,不能碰。游戏不一样,玩家会撞墙、会捡道具、会触发隐藏机关、会存档读档反复试验同一个操作。如果一个纯AI生成的游戏画面,今天你撞墙弹开了,明天同样的操作却穿墙而过,这游戏就废了。设计师没法调试,玩家也没法信任这个世界的规则。视频生成模型再逼真,它本质上是在"猜"接下来该画什么,而猜测是靠不住的地基。

这就是Magpie要解决的问题。它是由Mogo AI和南京大学等机构联合搞出来的一套实时生成式游戏渲染系统,思路简单粗暴又很聪明:游戏规则和世界状态,继续交给靠谱的老办法,也就是游戏引擎来管;画面好不好看这件事,才交给AI生成模型去操心。

两件事分开干,谁靠谱谁负责谁

游戏引擎*:负责执行游戏规则、判定碰撞、记录物体状态的软件系统,比如Unreal Engine、Unity,是传统游戏开发的核心工具。

传统思路是让引擎既管规则又管画面,一肩挑两担。Magpie把这副担子拆成了两半。

游戏引擎依然是那个说了算的"法官"。玩家按下前进键,是不是撞墙了、能不能爬上台阶、车子会不会打滑,这些判定全部在引擎里完成,输出的是一个粗糙的白模场景,也就是没有材质没有光影,只有基本几何形状和碰撞边界的画面。

白模渲染*:去掉最终材质、复杂光照和精细几何细节,只保留空间占位、碰撞边界和主要轮廓的简化渲染画面,类似游戏开发早期的灰模测试版本。

而这个白模画面,会被传给一台独立的渲染服务器,由生成式AI模型把它"翻译"成一帧逼真炫酷的最终画面。

这里有个特别关键的设计:AI模型接收到的,只有白模视频和摄像机位置,玩家到底按了什么键、触发了什么隐藏剧情、角色血量剩多少,这些游戏状态信息统统不告诉AI。

这个设计乍一看有点反直觉,你可能会想,AI要是知道玩家在攻击,画面不是能配合得更好吗?但你换个角度想:如果把游戏状态也喂给AI去决定画面,那AI就有可能在生成过程中"自由发挥",画出一个跟引擎判定不一致的结果,比如引擎说没撞墙,AI却画出撞墙的效果,这就乱套了。只让AI看白模,相当于给它戴上了眼罩,只能"照葫芦画瓢",没法自己编故事。

这就好比一家餐厅后厨和前台的分工。后厨大厨(游戏引擎)决定这道菜用什么食材、火候多大、什么时候出锅,这些是菜品成败的核心;摆盘师傅(AI渲染)只负责把做好的菜摆得好看,他不会去决定食材配比。如果让摆盘师傅同时兼职决定菜怎么做,那这道菜的口味就没法稳定复现了,你今天点的宫保鸡丁和明天点的可能完全不是一个味。分开之后,菜的味道(游戏规则)永远可控,摆盘风格(视觉呈现)却可以随时换。

三百个小时,人肉打出来的训练数据

要教会AI"看白模画面,脑补精致画面",光有设计思路不够,还得有海量的配对数据来训练模型。

Magpie团队没有走"写脚本自动生成数据"的捷径,而是真人上手在Unreal Engine里录了将近300个小时的互动视频,覆盖了30多个场景。

为什么非要真人录不可?因为脚本控制的角色动作太规整了,而真实玩家会做出各种意料之外的操作:反复试探边界、卡在某个角落纠结要不要跳、开车漂移过弯、突然停下来发呆看风景。这些"人味十足"的操作,恰恰是AI要学会应对的真实场景。

这个思路让我想起自动驾驶数据采集的逻辑。早期很多自动驾驶公司只用规规矩矩的正常驾驶数据训练模型,结果车辆一遇到加塞、逆行、乱穿马路的极端情况就懵了。后来大家才意识到,必须专门去采集这些"边缘案例",模型才能应对真实世界的混乱。Magpie团队显然吸取了类似的教训,特意让操作员反复去撞墙角、反复切换视角、故意站着发呆不动,就是要让AI见过足够多的"人类真实操作",而不是只学会应付教科书式的标准动作。

每一段视频都同时录了两条流:一条是高精度的最终画面,一条是同步的白模画面,俩画面像素级对齐,连摄像机位置和角色状态都完全一致。此外还记录了玩家的按键、碰撞发生的时刻、状态切换、事件触发这些结构化数据,不过目前这些数据只是存着备用,还没真正喂给模型训练。

数据里专门标注了两类文字信息,一个是场景风格,一个是角色外观。这些标注是用Qwen3.6-27B这个大语言模型自动生成的。

Qwen3.6-27B*:阿里巴巴通义千问团队推出的一款270亿参数级大语言模型,这里被用来自动生成场景和角色的文字描述。

标注的时候特意排除了游戏机制、物理规则、动作和事件结果这些内容,只描述"这是什么风格的场景""这个角色长什么样",因为这些视觉身份信息才是AI在画面生成之初需要知道的,规则性的东西一律不掺和。

四步压榨算力,把生成速度榨到极限

光有思路和数据还不够,真正的硬骨头在于怎么让AI在游戏运行时实时生成画面,这对速度的要求极其苛刻。玩家按下按钮,画面必须几乎同时跟上,慢一拍都会让人觉得"卡"。

Magpie的解决方案建立在Wan2.2-TI2V-5B这个50亿参数的视频生成模型基座上,叠加了四层加速手段。

第一层是分块自回归生成。把长时间的视频拆成一个个只有5帧潜在表示的小块,一块一块地生成,而不是等整段视频攒齐了再处理。这样做的好处是,不管游戏玩多久,每次生成的计算量都是固定的,不会随着游戏时长增加而越来越卡。

如果不这样分块会怎样?你可以想象一下,如果非要等攒够一整段剧情才开始渲染,那你玩十分钟的游戏,可能要先傻等好几分钟画面才刷出来,这在实时交互场景里是完全不能接受的。分块处理,相当于把一顿大餐拆成小碟连续上桌,你吃第一碟的时候,厨房已经在准备下一碟了,不用等全席做完才能动筷子。

第二层是把多步去噪压缩成3步蒸馏。传统的扩散模型生成一张图或一帧视频,往往需要几十甚至上百步的迭代去噪才能出图,这个过程慢得没法忍。Magpie借鉴了Helios这项研究的技术路线,把老师模型的多步生成经验"教"给一个只需要3步就能出图的学生模型。

扩散模型*:一种通过逐步去除随机噪声来生成图像或视频的AI模型架构,是当前主流视频生成技术的基础。

蒸馏*:让一个复杂的教师模型把知识和能力压缩传授给一个更简单更快的学生模型的训练方法。

第三层是用轻量级的自编码器LightTAE替换掉更笨重的时空自编码器,专门优化视频编解码这个环节。因为编解码操作在每个数据块边界都要重复执行,拖慢速度的往往就是这些看似不起眼的重复环节。

第四层是FP8混合精度计算,也就是让神经网络里那些对精度不太敏感的运算部分,比如线性投影、注意力计算,用更省资源的低精度数字来跑,而对精度敏感的部分,比如归一化处理,依然保留高精度。

FP8*:一种只用8个比特存储数字的低精度计算格式,相比传统的16位或32位精度,能大幅降低显存占用和计算耗时,但会牺牲一点数值精确度。

这套组合拳打下来,最终效果如何?在一块英伟达H100显卡上,系统达到了每秒32.2帧的计算吞吐量,峰值显存占用34GB。但这只是"算得快",真正决定玩家体感的是端到端延迟,也就是从你按下按键到画面真正显示出来,总共要等1.55秒左右。这个数字放在游戏行业里,说实话,还是偏慢的,团队自己也在论文里坦承这个延迟"对需要即时反馈的交互来说还是太高"。

记忆机制:AI要怎么记住"刚才发生了什么"

游戏世界很大,玩家会走来走去,可能十分钟前路过的场景,现在又绕回来了。AI总不能每次都从零开始画,得有个机制让它"记得"之前画过什么样子。

Context-as-Memory*:一种通过比较摄像机视野重叠范围来检索历史画面的记忆机制,让生成模型能够"回忆"起之前在同一个位置看到过的场景。

Magpie的记忆系统由三部分拼起来:一是早期锚点块,牢牢记住游戏刚开始时确定的风格和场景基调,防止玩得越久画风跑偏越远;二是通过摄像机位置检索出来的相关历史画面,你回到某个之前来过的地方,系统能调出当时的记忆片段来保持一致性;三是最近生成的几个片段,负责保证画面在短时间内动作连贯不跳跃。

这三层拼起来,构成了一个不会无限膨胀的"有界记忆"。

这让我想到人类自己回忆事情的方式。你不会把一辈子经历的每个细节都同等清晰地记住,你会牢牢记得几个关键的人生节点,比如高考那天(相当于锚点),你会在需要的时候努力回想起某个具体场合的细节,比如回到母校门口突然想起当年的样子,而对昨天中午吃了什么这种琐事,记忆很快就会淡去。如果非要把所有细节都无差别地存下来,那大脑早就爆炸了。Magpie的记忆机制正是在做类似的取舍,不是记住全部,而是有策略地留住重要的、还可能用得上的部分。

不过论文里也坦率承认,这套记忆机制目前还只是二维层面的历史画面拼接,没有一个真正的三维世界模型撑腰。这意味着当玩家做出大幅度转身或者长时间离开某个区域再回来时,画面细节可能会出现漂移走样,因为AI只能靠不完整的历史画面去猜测,而不是有一份完整的立体地图可以直接查阅。

条件注入怎么选:三种方案里选出折中的那个

技术团队还做了一个很实在的对比实验,来决定白模画面到底该怎么"喂"给生成网络。他们试了三种方式。

第一种是直接把白模信息硬塞进带噪声的隐变量里,这样做计算量最小,画面结构跟白模贴合度也最高,但代价是画面细节被压得死死的,渲染质量明显下降,说白了就是"听话但不好看"。

第二种是用AdaLN自适应层归一化来调制中间特征。

AdaLN*:一种通过条件信息动态调整神经网络内部特征归一化参数的技术,常用于让生成模型根据外部条件改变生成内容的风格或结构。

这种方式在单个数据块内部效果不错,但块与块衔接的地方会出现明显的画面跳跃,好比说话说到一半突然卡壳,一顿一顿的。

第三种是通过交叉注意力机制,把编码后的白模信息放进历史条件序列里,让生成网络自己去"注意"该参考哪部分白模信息。这种方式综合下来质量最好,虽然不是最省算力的,却是团队最终选定的方案。

这个取舍很像装修房子时选水管材料。最便宜的PVC管道,施工快、成本低,但用久了容易老化开裂;最贵的铜管,耐用又好用,但预算爆表;折中的PPR管,性价比最合适,大多数家庭装修最终都会选它。三种方案各有各的优缺点,团队最后没选最快的,也没选最贵的,而是选了综合表现最均衡的那一个。

现实很骨感:这套系统还差得远

Magpie团队在论文里花了大量篇幅坦诚地列出了系统当前的短板,这份坦诚本身就值得说道说道。

首当其冲的问题是延迟。前面提到的1.55秒响应延迟,对于需要瞬间反馈的游戏交互来说确实太慢了。团队分析发现,主要卡在"引擎录完一整块白模视频才开始生成"这个环节,光是攒够20帧白模画面就要花830毫秒。团队自己也提出,未来需要改成"边录边传边生成"的流式架构,而不是等一整块攒齐了再处理。

第二个问题是深度信息的模糊性。白模画面只是一张普通的二维RGB图像,它没法明确告诉AI某个物体离摄像机到底有多远,两个颜色相近的区域到底谁在前谁在后。这可能导致生成的画面出现违反空间逻辑的诡异效果,比如本该在墙后面的东西却画到了墙前面。团队认为,如果能给白模数据额外补充深度图、法线图这些几何信息,应该能大幅缓解这个问题。

第三个问题是生成画面对白模条件的服从度不够稳定。在快速移动、大幅度转向、复杂遮挡这些"高难度"场景下,生成出来的画面有时候会和白模指定的结构对不上,角色的位置边界会漂移走样。

第四是训练数据的天花板问题。目前的高精度画面素材虽然对齐得很精准,但覆盖的材质、光照、天气、人物动作种类还远不够丰富,这限制了整个系统能画出的画面质感上限。团队设想未来要把真实世界拍摄的视频、以及更高质量的离线渲染素材,一并混进训练数据里。

第五个问题很容易被忽略,就是声音。目前Magpie只管画面,不管声音,音效、配乐、对白怎么和生成的画面对上时间点,这是一个完全没触及的空白区域。

第六是三维持久记忆的缺失,前面记忆机制那部分已经提到过。

第七是算力门槛太高。目前这套系统跑在一块34GB显存的顶级服务器GPU上,普通玩家的电脑或者手机根本扛不住,离真正走进千家万户还有很长的路要走。

这些坦诚列出来的问题清单,其实比论文里那些漂亮的实验数字更有价值,它告诉我们这不是一个已经能商用的成熟产品,而是一条被验证可行、但还需要继续打磨的技术路径。

写在后面

读完这篇论文,最让我意外的一点是,团队并没有试图证明"AI能完全取代游戏引擎",相反,他们花了大量篇幅去论证"为什么必须保留游戏引擎",这个态度本身挺值得玩味。

现在很多AI相关的论文喜欢讲一个"颠覆性叙事",仿佛新技术出现就意味着旧工具要被扫进历史垃圾堆。但Magpie这篇论文选择了一条更保守、也更务实的路,它承认视频生成模型确实在画面表现力上有独特优势,但同时明确指出,靠一个"猜测下一帧该长什么样"的概率模型,来承担游戏规则判定这种要求百分之百确定性的工作,目前是不现实的。这种边界意识,在一堆鼓吹"生成式AI万能"的论文里,显得挺清醒的。

另外一个让我反复琢磨的细节是,团队专门强调"操作员要像真实玩家一样去玩,而不是执行孤立的动作"。这句话背后其实藏着一个很朴素的道理:数据的真实性,往往比数据的规模更重要。300小时听起来不算特别多,但如果这300小时里全是刻意设计的标准动作,可能训练出来的模型反而更脆弱,因为它没见过真实世界里那种"人类会犹豫、会试探、会做出奇怪操作"的混乱。

这套系统目前还远没到能装进普通玩家电脑的程度,1.55秒的延迟放在真实游戏体验里也依然明显。但它提供了一个挺有意思的思考框架:也许AI在很多领域该扮演的角色,不是替代那些已经被验证过很可靠的旧系统,而是去补足旧系统做不到的那部分,把两者的边界划清楚,让专业的归专业的。

那么下一个问题来了,当有一天延迟真的降到几十毫秒、显存需求降到手机也能承受的时候,我们玩到的游戏,还会是我们熟悉的那种"游戏"吗?

Q&A

Q1:Magpie是什么?

A:Magpie是由Mogo AI等机构联合研发的实时生成式游戏渲染系统,它让游戏引擎继续负责规则判定和状态管理,同时用AI生成模型把粗糙的白模画面实时转化成逼真的最终画面。

Q2:Magpie的画面生成延迟有多久?

A:从玩家按下按键到对应生成画面显示出来,大约需要1.55秒,团队自己也承认这个延迟对需要即时反馈的游戏交互来说还是偏高,后续需要改成流式架构来优化。

Q3:Magpie会不会取代传统游戏建模和美术制作?

A:目前不会完全取代。Magpie主要面向游戏原型阶段,能减少开发者对完整视觉资产的依赖,让粗糙的白模场景更早呈现出接近最终效果的视觉体验,但游戏规则和状态判定仍完全由游戏引擎负责。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
心理学:你不主动联系别人,别人也不会找你,已经说明了这些问题

心理学:你不主动联系别人,别人也不会找你,已经说明了这些问题

心理观察局
2026-09-05 07:02:40
关凌回娘家看爸妈,44岁的她也老花眼了,父母在北京住的房子真大

关凌回娘家看爸妈,44岁的她也老花眼了,父母在北京住的房子真大

柒佰娱
2026-09-07 08:59:47
月烧360亿Token、单次失控533美元!AI一天写4.4万行代码却没合并,程序员:AI Coding 真正的瓶颈来了

月烧360亿Token、单次失控533美元!AI一天写4.4万行代码却没合并,程序员:AI Coding 真正的瓶颈来了

CSDN
2026-09-07 16:01:28
今年,没有金九银十了。。。

今年,没有金九银十了。。。

雷斯林
2026-09-07 12:20:06
哪个瞬间,你突然就释怀了?网友:有时候老天爷也会给你征兆,再三阻止你走向命运的另一边

哪个瞬间,你突然就释怀了?网友:有时候老天爷也会给你征兆,再三阻止你走向命运的另一边

带你感受人间冷暖
2026-09-02 00:11:31
钱穆之子钱行逝世

钱穆之子钱行逝世

新浪财经
2026-09-07 11:18:27
瑞士给冰川盖上羊毛毯,效果出乎意料

瑞士给冰川盖上羊毛毯,效果出乎意料

观察者网
2026-09-07 07:15:36
手握原始股定居加州富人区,42岁阿里前员工死在车里,失踪15天只有游戏网友在找他

手握原始股定居加州富人区,42岁阿里前员工死在车里,失踪15天只有游戏网友在找他

户外钓鱼哥阿旱
2026-09-08 01:13:17
中国女篮提前出线!附加赛对手4选1,世界杯8强定2席,2队已出局

中国女篮提前出线!附加赛对手4选1,世界杯8强定2席,2队已出局

球场没跑道
2026-09-07 09:10:31
抵抗之弧最强一环褪色:没给钱,怎么打大仗又怎么能打胜仗呢?

抵抗之弧最强一环褪色:没给钱,怎么打大仗又怎么能打胜仗呢?

寰球经纬所
2026-09-06 13:34:55
1989年,已犯案的铁道部副部长张辛泰在协助中央办案期间仍继续犯案

1989年,已犯案的铁道部副部长张辛泰在协助中央办案期间仍继续犯案

历史甄有趣
2026-09-07 08:10:38
7.8%还是0.5%?西方媒体亲自算账后,开始质疑印度GDP增速

7.8%还是0.5%?西方媒体亲自算账后,开始质疑印度GDP增速

北海史记
2026-09-07 17:23:49
女子需求大约男网友开房,缠绵后被男网友抛尸,2015年丈夫得知妻子被杀很痛心

女子需求大约男网友开房,缠绵后被男网友抛尸,2015年丈夫得知妻子被杀很痛心

汉史趣闻
2026-09-07 09:30:22
这下轮到马科斯难受了!莎拉发声明,马科斯政府陷入公众信任危机

这下轮到马科斯难受了!莎拉发声明,马科斯政府陷入公众信任危机

小樾说历史
2026-09-07 02:41:03
1949年上海给予贺子珍12级行政待遇,毛主席却不满:会不会太高了?

1949年上海给予贺子珍12级行政待遇,毛主席却不满:会不会太高了?

壁炉公子
2026-09-08 06:00:12
莆田“八卦村”古建筑大面积坍塌,村书记哽咽:好怕几百年文脉断掉,希望重建恢复原貌

莆田“八卦村”古建筑大面积坍塌,村书记哽咽:好怕几百年文脉断掉,希望重建恢复原貌

潇湘晨报
2026-09-06 22:26:15
内娱最憋屈顶流曝光!肖战爆红那几年拼命扛热度大头收益资本拿走

内娱最憋屈顶流曝光!肖战爆红那几年拼命扛热度大头收益资本拿走

老吴教育课堂
2026-09-07 15:04:34
印度要拆掉华为和中兴!想学美国封杀中国:发现30亿账单付不起!

印度要拆掉华为和中兴!想学美国封杀中国:发现30亿账单付不起!

普陀动物世界
2026-09-06 14:00:03
医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

医生呼吁:马上停用3种调味酱,它是肠癌催化剂!再下饭也别沾

观星赏月
2026-09-07 00:44:10
“高速公路收费期限届满后由政府统一管理,可收取车辆通行费”

“高速公路收费期限届满后由政府统一管理,可收取车辆通行费”

观察者网
2026-09-07 18:03:38
2026-09-08 07:08:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9772文章数 568关注度
往期回顾 全部

游戏要闻

国产游戏《零境·入侵》试玩上线 超10小时游玩体验

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

世界杯-中国女篮20分大胜意大利锁D组第二 韩旭19+10杨舒予15分

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

科技要闻

小米澎程N90 Max定价26.99万元

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

本地
旅游
亲子
数码
公开课

本地新闻

扒完小作文,富豪们私藏的度假胜地有多绝

旅游要闻

红色热土续写新时代长征故事(文化中国行·红色旅游)

亲子要闻

爱给孩子贴标签这一点我一定要改!!! 杨雪呀

数码要闻

烤箱标配摄像头!今年IFA厨电除了卷AI,还在回归功能本质

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版