这两个月测AI视频,测得我简直昏天黑地。
模型迭代真的太快了,前前后后,我也给大家总结了好多玩法。人物一致性、镜头控制、音画同步、电影感运镜,每隔几天就会冒出来一点新东西。
大家现在最熟悉的这条路线,就是输入提示语和素材,让模型生成一段固定内容的视频。
这条路正在飞速发展,玩法还远远没有被挖完。
但是隔壁的世界模型也有新版本了,玩起来跟AI视频完全不一样。
能理解实时输出的提示语,然后在持续运行的世界中做出实时变化,并对后续的世界有持续的影响。
这是AI 视频还有另外一个发展方向,它走的是另一类应用。
生成画面能一直运行,用户可以随时说话,也可以直接做出操作的世界,模型理解用户实时的输入,让后面的场景、角色和故事跟着变化。
也就是说,视频慢慢变成一个可以当场进入、不断影响的世界。
这就是我们之前说过几次的世界模型。
我觉得在这种强调互动性的体验中,清晰度、时长和运镜已经不够用了,我们还得看它回应得够不够快,刚才发生的事能不能记住,跑上几十分钟以后,角色和场景还在不在原来的世界里。
最近,这条路线又出现了一个新的突破,
PixVerse R2。
刚刚看到的视频就是R2做出的效果,
PixVerse在1月发布R1时,是首个能把固定时长的视频改成了连续、可交互的视频流,4 月的更新又加入个性化Avatar和 Shared Worlds,多个人可以持续向同一条公共视频流输入提示。
当时的R1解决的是,用户能不能实时改变眼前的画面。
R2又往前走了一步。
我们能做到的事情不仅是进入这个世界正在运行的状态里,还能继续影响后面的场景、故事、角色、任务和关系。同时,R2接入更多数据、任务和控制信号以后,这些能力还会继续扩展,不用每增加一种玩法就重新再做一套模型,只用在同一套上做迭代就可以。
这就是我觉得R2最关键的突破点。
它关注的除了响应,还有改变带来的后果。
用人话解释一下就是,假如你在一个场景里,从桌上拿走了一把钥匙,那后面的门就不能凭空自己打开,而是需要你用钥匙打开。你在对话里惹恼了一个角色,下一次见面时,他得记得你们之间的关系发生过变化。你完成了一个任务,世界也要呈现这个结果,不能镜头一切就全部刷新。
也就是说,重要的是记忆和影响带来的合理化互动,沿着这个方向往下想,产品形态已经很有意思了。
目前看官方给到的case,有三种很实用的应用方向。
第一个是World,
我们可以通过WASD控制行进,用方向键调整镜头,也可以通过语音和文字改变场景,角色,视觉风格与互动方式。地图做得大会特别好玩,随着世界运行时间变长,我们一路做出的变化能保留下来,创造出专属于自己的世界。
第二个是Story,
这种就更像互动影游,我们可以做选择,可以直接对角色说话,也可以在关键时刻触发QTE。R2会根据我们的选择让世界做出对应的变化,又能保住人物设定和故事原来的边界,让分支出现差异以后,故事还能继续合理的往下走。
那我觉得,以后的AI创作者想要做互动影游这方面的作品,可能要多学一门手艺,就是除了安排镜头和台词,还要设计世界规则,想清楚角色想要什么,用户的一次行动会留下怎样的后果。
因为和传统影视不同,之前是把故事发展的选择权交给导演和编剧,而互动世界会把一部分选择交给观众,所以在构建这样的世界时还要想好不同的选择最终会导致几种不同的世界走向。
第三个是 Character,
更偏数字人方向,角色站在屏幕里,能听见你说话,也能被你打断。语音、口型、表情和动作要同时跟上,人设、记忆与关系还得在一次次交流里保持连贯。
比如说电商场景下,可以做数字人的带货直播,能对观众做出的提问做出实时解答,动态表情和卖点表述都挺自然的。
或者也可以应用到博物馆这种知识类场景中,给文物设计一种性格进行拟人化,然后对大家好奇的问题做出实时科普和解答,增加娱乐性和互动性,还是很有意思的。而且AI嘛,你获得知识的多少取决于你提问的多少和深度,也就是能让每个人根据自己的需求获取到对应的知识,比直接看一块只有固定内容的纯文字展板有趣多了。
再或者也可以用到实时互动拟人游戏中,可以做一个能实时对话的虚拟闺蜜,倾述一下烦恼什么的。
我自己的感受是,实时数字人可能会最先让普通用户感到技术的变化。
因为一个数字人坐在你面前,回应慢三秒,口型和声音错开,之前聊过的事今天全忘了,那种伪人感就会冒出来。
真人质感和实时语音只是让大家会对这种形式感兴趣,一个角色能不能长期保持人设,聊过的事情会怎样改变关系,这些才决定用户愿不愿意再用。
看到这些世界模型的新应用,我是挺好奇一个模型怎样一边生成,一边听指挥,还能记得前面发生过什么,而且这一整套东西还足够快,用户输入玩不用等半天,角色也不用想三秒才开口。
所以我把PixVerse R2的技术报告从头啃了一遍。
第一个重点,是 R2 把原来很长的训练流程收成了两层。
底下的Omni Causal AR 负责学习一个世界怎样持续往前运行,上面的 Real-Time Acceleration 再把这些能力加速到实时区间。
你可以想象成培养一个厨师。传统路线是这样的,先在双向模型里学做菜,然后转成AR单向模型重新适应,再单独训练一个Teacher模型当师傅,接着做DMD蒸馏把师傅的本事浓缩一遍,最后还要self-rollout修正来查漏补缺。能力来回搬家,训练目标容易越来越散,每搬一次还可能掉一点东西。就像这个厨师先在法餐厨房学了三年,又被丢到中餐厨房重新适应,好不容易上手了再被拉去做快餐出品。每换一次环境,之前练出来的手感就丢一点。
R2的思路不一样。先让这个厨师在一个完整的厨房里把所有菜系、所有技法从头到尾学透,学到他闭着眼睛都能做出一桌席面。然后第二步,不换厨房,不换菜谱,只训练他出菜的速度。
![]()
第二个重点,是它怎么get到不同节奏的输入。
Omni Causal AR 会持续接收 Text,Reference,Audio 和 Action,再输出时间同步的Video与Audio。每一次生成,都根据已经发生的历史和此刻的输入,预测下一段世界状态。
R2面对的就是这个问题。
![]()
按一下W键,画面应该马上往前走,即时响应,说一句完整的话,角色可能要花几秒做完动作再把台词说完,如果每段都切得很短,动作和语义容易被拦腰截断,如果每段都留得很长,用户按完键又要等半天。
所以R2做了一个叫Dynamic Chunk的机制。短操作匹配短Chunk,完整事件可以获得更长的生成时间。模型顺着控制信号的语义边界切分音视频。
第三个重点,是世界跑久以后怎样少一点漂移。
这个是我觉得整篇报告里最有意思的部分。
模型长时间读取自己生成的历史,如果前面一点小偏差,就会不断往后传。比如人物的手歪了一点,后面可能越歪越多。短视频里几秒可能看不出来问题,放到世界里持续跑上几百轮就会变成大型歪楼现场。
这个现象在机器学习里叫exposure bias,但你不用记这个词。你只要想象一个场景就行。
假设你在玩传话游戏。第一个人说「今晚吃火锅」,传到第五个人可能变成「今晚去活佛」。每一次传递都只偏一点点,但误差会累积。如果这个游戏不是五个人而是五百个人,最后传出来的东西跟原话可能已经毫无关系了。
世界模型的长程生成就是在玩一个几百轮的传话游戏,每一轮都在读上一轮自己写的东西。
R2怎么解决这个问题?用了两招配合。
第一招叫Hybrid Teacher Forcing加Diffusion Forcing。名字听着唬人,道理其实不复杂。训练的时候,模型同时学两种历史,一种是干净的、完全正确的历史,另一种是故意加了噪声的、带错误的历史。
干净历史保证模型知道什么是对的,带噪历史让模型提前适应运行时一定会遇到的小错误。
想象你在教一个新手司机。如果你只让他在完美路况下练车,晴天、空旷、没有行人,他开得会很漂亮。但第一次遇到雨天或者前车急刹,他就慌了。好的教练会故意在训练里加入各种不完美的情况,让学员在安全环境里提前踩过坑,上路的时候就能稳住了。
第二招是时间层面的限制。Causal Attention Mask规定当前这一段只能读取之前发生的事,不能偷看未来。Relative Temporal RoPE把时间位置控制在有限的记忆窗口里。
这个更好理解。你在写一篇连载小说,写到第200章的时候,你不可能翻回去把第1章到第200章全部重读一遍再写下一段。你的记忆窗口是有限的,你只记得最近几章的剧情走向,加上角色设定和主线这些长期信息。
R2做的事情类似,真实时间可以一直往前走,但模型眼里的时间坐标不会无限增长。它始终在一个有限的窗口里工作,跨段衔接也会更稳。
![]()
再往下就是记忆。
Multi-Timescale Memory,直译就是多时间尺度记忆。它把历史分给了三个不同的通道。
第一个叫Sink Memory,保存角色、场景和世界规则。这是最长期的记忆,类似于你知道自己叫什么名字,住在哪个城市,地球有重力。不管发生什么事,这些东西不会变。
第二个叫Rolling History,管最近的动作和镜头变化。这是中期记忆,类似于你记得今天早上吃了什么,刚才跟谁说了什么话,十分钟前在做什么。它会随着时间往前滚动,旧的被新的顶掉。
第三个叫Object KV Cache,留住会继续影响后面演化的重要对象状态。这是一种选择性记忆,类似于你出门前记得炉子上还烧着水。你不需要记住今天摸过的每一个门把手,但那壶烧着的水,你会一直记着,因为它会影响接下来发生的事。
一条完整历史不可能永远全部塞进模型。R2把身份、近期变化和重要对象分开保存。就算世界跑得再远,也得知道自己从哪里出发,刚才又发生了什么,以及有哪些东西不能忘。
坦率的讲,人类大脑的记忆系统其实也差不多是这么分层的。心理学把它分成语义记忆、情景记忆和工作记忆。R2这三个通道几乎是对着人脑的记忆架构做了一版工程实现。
最后一个点,已经跑偏了怎么办。
前面说的那些方法都是预防性的,训练时候做的准备工作。但再好的预防也不能保证运行时百分之百不出错。所以R2还建了一个东西叫Error Bank。
Error Bank干的事情是,把有代表性的错误历史收集起来,放回训练集里,让模型反复练习怎样从已经偏掉的状态里继续生成合理的下一步。
看完整份技术报告,能感受到他们一直做取舍。
世界要更大跑得更久,用户还要求它马上回应,任何一边多吃一点计算,另一边都会跟着紧张。
R2目前也没有越过这条限制。在严格的实时预算下,它的单次生成质量是低于前沿离线视频模型的,这我们都能看出来。复杂细节,运动自然度和长时间稳定都要继续提高,少步实时生成也一定会带来加速损失。
所以现在谈一个成熟的无限世界,还太早。
但我依然看好爱诗科技做的R2这类世界模型。
因为它正在给AI视频增加一种以前没有的产品能力,就是影响是持续存在的。
视频不再只能被生成、播放和看完,它还能成为一个应用的画面,角色和现场。
实时数字人会先进入更多日常场景,它可能是一个会观察屏幕现场讲解的老师,也可能是一个记得用户习惯的游戏角色、品牌角色或者长期陪伴者。
到那时候,一张真人质感的脸远远不够,
记忆、人设、关系和回应速度会一起决定它有没有活人感。
互动影视和实时生成游戏会把创作方式改得更彻底,
创作者提前写下的,不再只有镜头与分支,还会有世界规则,角色设定和边界。玩家的行动进入系统以后,下一幕在运行时长出来,每个人经历的故事都可能留下不同的痕迹。
Shared Worlds这样的方向再往前走,生成世界甚至会变成一种新的社交空间。
刀剑神域还是快要实现了,几个人共同生活在一条持续生成的世界里,一个人做出的决定,会成为其他人下一次进入时必须面对的现实。我就好奇持续影响的情况下遇到不能通过的死关情况会有时间回溯嘛。
如果真的有的话,我只能说无限流要成为版本之子了。
想想看,以后有些AI视频产品可能不会把导出放在最重要的位置。
你只需要直接退出,系统保存进度,
第二天再回来,角色还记得你烧掉了那座桥,
朋友晚一点进入同一个世界,
会发现河对岸已经换了一条路,
故事没有按照某一份完整剧本播放,
它是在你们的行动里,
一点点构建出来的。
想想就觉得兴奋。
@ 作者 / 卡尔 & yc星辰
最后,感谢你看到这里如果喜欢这篇文章,不妨顺手给我们点赞|在看|转发|评论
如果想要第一时间收到推送,不妨给我个星标
如果你有更有趣的玩法,欢迎在评论区聊聊
更多的内容正在不断填坑中……
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.