网易首页 > 网易号 > 正文 申请入驻

当AI导演能记住三十个镜头前的那张脸,视频生成还差什么?

0
分享至


你有没有想过这样一个问题:如果让AI给你拍一部十分钟的电影,它能记住主角三分钟前穿的衣服吗?

这听起来像个很简单的要求。但现实是,绝大多数视频生成模型压根做不到。它们擅长生成一个十秒钟的漂亮片段,却像患了严重的健忘症,镜头一切换,人物的脸就变了,声音也换了个人。这不是个小毛病,这是整个长视频生成领域一直没解决的核心问题。

京东的Joy Future Academy团队最近发布了一套叫JoyAI-Echo-1.5的系统,试图正面回答这个问题。它做了两件事:一是让AI拍故事片的时候能"记住"角色,二是让AI生成的世界能被用户实时操控着走来走去。这两件事看似不相关,其实背后是同一个难题的两面:怎么让生成式AI摆脱"金鱼记忆",在长时间尺度上保持一致性。

为什么这事这么难

先说说困难在哪。

传统的视频生成模型,不管是文字生成视频还是图片生成视频,本质上都是在一个固定的时间窗口里工作的。你给它一段文字描述,它输出几秒钟的画面,任务就结束了。这套逻辑放在生成单个短视频上没什么问题,但只要你想把很多个镜头拼接成一个完整的故事,麻烦就来了。

**上一个镜头里那个穿军装的中年男人,到了下一个镜头,可能就变成了另一张脸。**

这背后的原因不难理解。模型在训练的时候,看到的样本大多是孤立的短片段,它从来没有被要求"记住"过去发生了什么。就像一个只练习过短跑的运动员,你突然让他跑马拉松,他当然会在半路就体力透支,而且他的动作还会因为疲劳越跑越变形。

除了角色一致性,还有一个更棘手的问题:如果视频模型是靠自己生成的历史内容来继续生成后续内容(这在长视频生成和世界模型里是必须的),那么早期的一点点误差,会不会像滚雪球一样越滚越大?

引用块:自回归生成——指模型根据自己之前生成的内容来预测接下来该生成什么,而不是每次都从零开始。这种方式效率高,但风险也高,因为错误会累积。

这就是JoyAI-Echo-1.5要解决的核心矛盾:怎么在保持生成效率的同时,让模型对自己的历史保持"记忆",而且这份记忆经得起长时间的考验。

给AI装一个"角色记忆库"

团队给出的第一个方案,是在长视频生成这条线上,设计了一套跨镜头的音视频记忆机制。

具体怎么做的呢?简单说,就是让模型在生成新镜头之前,先去"翻相册"。这个相册里存的不是随便什么画面,而是同一个角色在不同场景、不同穿着、不同表情下的历史镜头。模型每次生成新内容,都会参考这些记忆,从中提炼出这个角色"不变的部分"是什么。

这里有个设计上的巧思值得展开讲讲。团队在构造训练数据的时候,故意让"记忆镜头"和"目标镜头"来自完全不同的场景,而不是紧挨着的相邻帧。

**如果记忆和目标是同一场戏里的相邻帧,模型很可能会偷懒,直接照抄画面内容,而不是真正学会识别角色的核心特征。**

这就好比你想让一个新员工记住老板长什么样,你不会只给他看老板在同一个会议室里连续拍的十张照片,那样他记住的可能只是那个会议室的背景。你会给他看老板在不同场合、不同穿着、不同角度下的照片,这样他才能真正抓住这张脸的关键特征,而不是被背景信息带偏。如果不这么做,模型学到的所谓"记忆"其实是场景记忆,而不是身份记忆,换个场景立刻就认不出人了。

在声音这一块,团队也做了一个类似的调整。之前的版本(JoyAI-Echo-1.0)选取声音记忆的方式,是找音量最大的那个片段。但问题是,音量最大的地方经常是背景音乐或者环境音效,不是人物说话的部分。

**用能量最大的窗口当作声音记忆,相当于在嘈杂的酒吧里,录一段"最响的声音"来记住某个人的嗓音,结果录到的全是背景音乐。**

新版本改成了先用语音分离技术,把背景音乐和环境音效滤掉,只留下纯粹的说话声音,再拿这段干净的语音去做记忆编码。这个改动听起来简单,但意义很大,因为在自回归生成里,如果这一步的记忆本身就不准,后面每一次生成都会把这个错误继续放大。

引用块:RoPE(旋转位置编码)——一种让模型理解"谁在什么时间点"的技术。JoyAI-Echo-1.5给当前要生成的内容、历史记忆、以及用户预先提供的记忆,分别设置了不同的时间坐标区间,让它们互不干扰又能同时参与运算。

团队还把之前版本里那些限制记忆和目标之间怎么互动的强制规则给去掉了,让所有的信息可以自由地相互关注。这个改动初听有点反直觉,规则少了不是更容易出错吗?但实际上,靠位置编码来区分角色,比靠硬性遮罩规则更灵活,也更符合模型自身学习到的规律。

这套记忆系统支持四种组合方式:纯文字生成、图片加文字生成、带记忆的文字生成、以及记忆加图片加文字一起生成。这种灵活性意味着创作者不需要每次都提供全部信息,系统能根据手头有什么就用什么。

给视频装上方向盘

如果说记忆解决的是"故事怎么讲得连贯",那另一条线,世界模型,解决的是"用户怎么才能真正操控这个虚拟世界"。

这里的挑战完全不同。想让用户用键盘、手柄,或者别的什么设备去控制一个AI生成的场景往前走、往左转,首先得解决一个基础问题:这些五花八门的操控信号,怎么统一成一种模型能理解的语言?

游戏引擎里的操作是一套逻辑,手柄摇杆是另一套,人类玩游戏录下来的视频又是完全没有明确"操作指令"的。这就像三个人分别用中文、英文和手语在描述同一个动作,你得先把这三种表达方式都翻译成同一种通用语言,模型才能学习。

团队的做法是把所有输入都转换成"相对6自由度相机轨迹"。

引用块:6自由度(6-DoF)——描述一个物体在三维空间里全部的运动可能性,包括前后、左右、上下三个方向的移动,以及三个方向的旋转。相机轨迹就是记录镜头在这六个维度上是怎么随时间变化的。

这个统一的度量标准解决了"语言不通"的问题,但还有一个更隐蔽的坑:不同数据源里,物体移动的"步幅"完全不是一个量级。虚幻引擎里渲染出来的场景,单位是精确的米制;而从网络视频里通过算法反推出来的轨迹,可能因为算法本身的误差,产生的移动幅度忽大忽小。

**如果不校准这个尺度,就好比你同时收集了公制和英制的尺子测量数据,却不做单位换算直接拿来训练,模型学到的"往前走一步"在不同数据源里可能是完全不同的距离。**

团队用了一个全局的、基于统计分位数的缩放系数,把所有数据源的位移都校准到同一个尺度上。这一步看起来简单,却是让模型在训练时不至于精神分裂的关键。

在训练顺序上,团队也没有把所有目标一股脑塞给模型,而是设计了三个阶段。第一阶段先让模型适应游戏和交互场景的视觉风格和声音特点,完全不涉及轨迹控制。第二阶段专门训练轨迹跟随能力,把整个主干网络冻结住,只训练负责相机控制的那部分参数,同时故意去掉文本描述里所有和动作相关的信息,逼着模型必须靠轨迹条件来决定怎么运动。第三阶段再把所有部分解冻,一起进行精细调整。

**这就像先教一个演员学会怎么表演情绪(第一阶段),再单独训练他对导演口令的反应速度(第二阶段,而且故意不让剧本告诉他该做什么动作,只能靠导演的手势),最后再让演戏和听指挥这两件事融合到一起(第三阶段)。**

如果一开始就把演技训练和听指挥训练混在一起,演员很可能会靠猜剧本里的字面意思来行动,而不是真正学会看手势。这也是为什么团队要在第二阶段刻意抹去文本里的动作描述,就是为了防止模型抄近路。

让AI学会"边生成边纠错"

前面说的两套系统,记忆机制和轨迹控制,都还只是解决了"生成什么"的问题。接下来还有一个绕不开的坎:怎么让生成过程本身又快又稳。

传统的扩散模型生成一段视频,往往需要几十步甚至上百步的迭代计算,每一步都是一次完整的网络推理。这个计算量放在几秒钟的短视频上还能忍,但要支撑几分钟甚至更长的连续生成,这个成本就变得不现实了。

于是团队引入了一种叫蒸馏的技术,把原来需要几十步的生成过程压缩成几步就能完成。但这里有个陷阱:如果只是简单地用标准答案(也就是真实视频)来训练这个压缩后的模型,它在实际使用时表现会很差。

原因在于,真实使用场景里,模型是靠自己之前生成的内容作为历史,而不是靠真实数据。如果训练时只见过"完美的历史",一旦部署后遇到自己生成的、带着各种小瑕疵的历史,模型就会不知所措,误差会越滚越大。

团队提出的解决办法叫自梯度强制(Self-Gradient Forcing),简称SGF。这个方法的核心思路是,先让模型完整地跑一遍自己生成的全过程(不计算梯度,纯粹让它"自由发挥"),记录下这个过程里每一步的状态,然后再用这些记录下来的、带着真实瑕疵的状态,重新构建一次可以计算梯度的前向过程,用这个结果去指导模型怎么修正。

**这就像让一个新手司机先自己开一趟完整的路(不打分,只录像),然后教练拿着这段录像回放,指出"你在第几分钟压线了,应该怎么调整方向盘",而不是让教练凭空想象一条理想路线来教他。**

如果不这样做,而是只用理想路线来训练,司机上路后遇到真实的、带偏差的路况就会完全懵掉,因为他从没在训练中见过带偏差的情况。这也是为什么团队要专门设计出"重构历史轨迹再计算梯度"这一步,而不是直接对着完整的自回归过程做反向传播,后者的计算代价会大到无法承受。

团队还把这套方法从短时间尺度扩展到了长时间尺度,让模型能够连续生成长达数十秒甚至更长的内容而不崩溃。为了控制计算量不随时间无限增长,他们采用了一种"哨兵加先进先出"的缓存策略,只保留最早的一小段固定内容和最近的一小段滑动窗口内容,中间被淘汰的部分就不再直接参与计算了。

引用块:注意力机制中的"哨兵+先进先出缓存"——模型在生成新内容时,只能直接看到两类历史信息,一是最开头固定保留的一小段(哨兵),二是最近生成的一小段(先进先出的滑动窗口),中间被挤出窗口的内容就不再被直接访问。

有意思的是,团队发现即便某个历史片段已经被挤出了这个滑动窗口,它的信息并没有完全消失,而是可能通过层与层之间的传递,间接影响到当前的生成。这个发现意味着,哪怕表面上看起来"记不住"的内容,深层网络结构里可能还留有痕迹,这也是为什么团队后来又加了一个专门的、独立于滑动窗口之外的循环记忆模块,用来存放那些应该被长期记住、但又不会随时间自然衰减掉的关键信息。

从导演到剪辑师,一整套自动化流程

光有好的生成模型还不够,一部完整的电影需要有人来"导演"。团队为此设计了一个叫Director Agent(导演智能体)的系统。

这个智能体解决的问题是:用户给的需求往往很简单,比如"给我拍一个关于战争年代逃亡的故事",但视频生成模型需要的是极其具体的分镜描述,谁在什么时候做了什么动作,说了什么台词,镜头怎么运动。

导演智能体做的事情,是把这个模糊的想法,先扩展成一个完整的剧本,再细化成一系列可执行的分镜头指令,同时管理着一个不断增长的角色和场景记忆库。整个流程可以完全自动运行,也可以随时插入人工审核和修改。

引用块:Prompt Enhancement(提示词增强)——把简短模糊的用户需求,自动扩写成包含角色、动作、镜头、声音等具体细节的完整描述,这样视频生成模型才能准确执行。

这个系统还有一个细节设计,就是区分了"持久属性"和"临时属性"。比如一个角色的外套颜色和说话声音是持久的,应该在整部影片里保持一致;而他袖子被打湿了,或者某个瞬间的表情,只属于当前这一个镜头,不需要传递到下一个镜头。这种区分很关键,如果所有细节都被无差别地当成需要长期保持的信息,记忆库很快就会被无关紧要的细节塞满,反而干扰了真正重要的身份信息。

结尾还有一道超分辨率的工序,用来把生成器输出的720分辨率画面,恢复到更精细的交付分辨率。这一步用到了一种叫MeanFlow的技术,让同一套模型权重可以支持任意步数的采样,不需要针对不同的速度需求重新训练。

数据说话:到底提升了多少

理论说了这么多,实际效果如何?

在一个包含100个故事、3000个镜头的测试集上,JoyAI-Echo-1.5在跨镜头一致性、视频质量、文本对齐、语音还原这四个维度里的七项指标中,拿到了六项第一。

跨镜头视觉一致性得分达到0.8264,相比上一代提升了0.0238;角色身份一致性得分0.7937,声音一致性得分0.8524,后者比上一代提升了近0.04。这些提升听起来数字不大,但放在长视频生成这个特别容易累积误差的场景里,每一点提升都意味着观众更不容易在观看过程中出戏。

在世界模型这条线上,JoyAI-Echo-1.5在WBench这个公开测试集的导航类别里拿到了81.7分的平均分,排名第一。它的压缩加速版本(四步生成)拿到81.0分,排名第二,而且在交互响应这一项指标上甚至反超了未压缩版本,达到87.9分。这说明压缩并没有让模型变笨,反而在某些方面因为经过了针对性的鲁棒性训练变得更擅长听指令。

在另一个专门测试长时间世界建模的基准SANA-WM-Bench上,团队用了一个特别能说明问题的对比。很多压缩后的快速模型,在长达60秒的连续生成里,虽然画质衰减看起来不明显,但那是因为它们从一开始画质就不高,没什么可衰减的空间。JoyAI-Echo-1.5-Causal的画质在整个过程中的平均值和最低值都明显高于对比方法,证明它是真正保住了高质量,而不是靠"起点低"来显得掉得少。

人类评审员的判断同样支持了这些数字。在长视频生成的对比测试里,JoyAI-Echo-1.5在音视频同步这一项上,有48.4%的评审认为它更好,只有20.3%认为对比系统更好。在世界模型的对比测试里,时空一致性这一项的优势更加悬殊,57.7%对10.4%。

写在后面

读完这套系统的设计,我脑子里一直在打转的一个问题是:所谓的"记忆",在生成式模型里到底应该是什么形态?

这篇论文里提出的两种记忆机制,长视频里的角色记忆库,和世界模型里那个循环状态更新的模块,本质上走的是两条不同的路。前者更像是"翻档案",每次都主动去查历史里有没有相关记录;后者更像是"活体记忆",随着时间推移不断被压缩和更新进一个固定大小的状态向量里。这两种方式各有各的成本,档案式的记忆检索起来精确,但需要额外的存储和检索逻辑;活体记忆更新起来轻量,但信息会不可避免地被压缩损耗。

论文里提到一个让我印象很深的细节,团队在做超分辨率蒸馏的时候,发现前向模式的雅可比向量积在他们的训练框架里根本用不了,融合注意力算子不支持,非重入式的激活检查点也不支持梯度反向传播这条路。他们最后用的是中心有限差分去近似估计这个量,而且专门校准了步长,让截断误差和舍入误差刚好互相抵消。这种"工程条件不允许,只能用数值近似去凑"的处理方式,让我想起做实验的时候经常遇到的情况,理论上最优的方案往往受限于现实的工具链,最后拼出来的解法带着明显的妥协痕迹,但依然管用。

另一个值得单独拎出来说的地方是,团队在文中坦承"旋转累积误差在困难的长时间轨迹上仍然是一个关键限制"。这不是那种放在结论里走个过场的谦虚,而是实实在在写在了实验数据里,越是复杂的轨迹,角度误差涨得越快。这提醒我,所谓的"世界模型"距离真正稳定地模拟一个可探索的世界,还有相当长的路要走,尤其是在需要长时间保持空间几何一致性的场景里。

如果一个AI能记住三十个镜头之前那张脸,它离真正"理解"一个故事,还差多远?

Q&A

Q1:JoyAI-Echo-1.5是什么?

A:JoyAI-Echo-1.5是京东Joy Future Academy团队开发的统一音视频生成系统,包含长视频生成和交互世界建模两个变体,核心能力是让AI在生成长时间内容时保持角色身份、声音和场景的一致性。

Q2:JoyAI-Echo-1.5如何解决长视频里角色变脸的问题?

A:它引入了跨镜头音视频记忆机制,从多个历史镜头里提取角色的视觉和声音特征,并用语音分离技术滤除背景音乐,只保留纯净的说话声音作为身份线索,再通过独立的时间编码把记忆和当前生成内容区分开。

Q3:JoyAI-Echo-1.5的世界模型变体能做什么?

A:它能把键盘、手柄等各种不同来源的操控信号,统一转换成校准过的三维相机运动轨迹,让用户可以像操控游戏一样在AI生成的世界里自由行走和转向,并且在WBench公开测试中排名第一。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
莱巴金娜:登顶世界第一是我的目标,下轮将沿用相同比赛思路

莱巴金娜:登顶世界第一是我的目标,下轮将沿用相同比赛思路

懂球帝
2026-09-08 06:12:06
钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

钾是香蕉28倍!入秋隔天吃这菜,腿脚有劲精神足!

美食店主
2026-09-05 08:18:38
官方通报低保女孩追星 有限资源得给真困难的人

官方通报低保女孩追星 有限资源得给真困难的人

看看新闻Knews
2026-09-07 23:08:28
小米上演“价格两极” 雷军通吃“性价比”和“高端化”

小米上演“价格两极” 雷军通吃“性价比”和“高端化”

新京报
2026-09-08 10:18:16
毛主席曾预言道:这两个国家将来对中国的威胁最大,如今果然应验

毛主席曾预言道:这两个国家将来对中国的威胁最大,如今果然应验

DELIXI
2024-12-01 18:32:46
如何消化这次经历?斯瓦泰克:什么意思?你觉得这很疯狂吗?

如何消化这次经历?斯瓦泰克:什么意思?你觉得这很疯狂吗?

懂球帝
2026-09-08 02:53:09
美国终于意识到不对劲:解放军可能不会武力收台,中国另有杀招?

美国终于意识到不对劲:解放军可能不会武力收台,中国另有杀招?

军机Nova
2026-08-30 00:34:10
China GT赛场燃起大火!车手49秒火海救人,吴彦祖:赛事方太丢人

China GT赛场燃起大火!车手49秒火海救人,吴彦祖:赛事方太丢人

娱圈办事处
2026-09-07 18:45:22
争议!37岁福原爱剪去长发再度亮相,球迷:干净清纯的形象还是选石川佳纯

争议!37岁福原爱剪去长发再度亮相,球迷:干净清纯的形象还是选石川佳纯

可乐谈情感
2026-09-06 13:48:19
最新进展:景甜“屏蔽消除”,孙宇晨再发长文太羞耻!

最新进展:景甜“屏蔽消除”,孙宇晨再发长文太羞耻!

默默有话说
2026-09-05 17:15:36
正式告别机顶盒,全国开始部署

正式告别机顶盒,全国开始部署

鲁中晨报
2026-09-05 17:14:04
一旦出现“红皇后效应”,说明公司就要凉了

一旦出现“红皇后效应”,说明公司就要凉了

互联网早读课
2026-08-28 08:11:31
扎心了!印度教授撕开莫迪大国幻觉:中印之间产业差距高达十倍

扎心了!印度教授撕开莫迪大国幻觉:中印之间产业差距高达十倍

Hi科普啦
2026-09-07 15:36:36
不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

不怕秋老虎,就怕晚白露!今年是晚白露,接下来2个月,是热是冷

周哥一影视
2026-09-07 11:04:02
71-51赢球后,韩旭低调回应,意大利主帅表态,日本媒体发声!

71-51赢球后,韩旭低调回应,意大利主帅表态,日本媒体发声!

隐于山海
2026-09-08 09:29:26
16GB+2TB!华为发布会汇总:9月7日,新品正式首发!

16GB+2TB!华为发布会汇总:9月7日,新品正式首发!

科技堡垒
2026-09-07 11:35:30
中国目前面临的最大问题:或许已经不是如何发展、如何致富了?

中国目前面临的最大问题:或许已经不是如何发展、如何致富了?

生活新鲜市
2026-09-08 07:03:02
单场56分!地表最强175,还没有放弃梦想!

单场56分!地表最强175,还没有放弃梦想!

篮球实录
2026-09-08 16:07:45
雷军发布小米迄今最贵手机,售价10999元起

雷军发布小米迄今最贵手机,售价10999元起

极目新闻
2026-09-07 20:38:42
网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网友们这几天都在吃著名毛巾集团洁丽雅的瓜,讽刺其家族“丑闻”

网络易不易
2026-05-17 12:29:12
2026-09-08 16:36:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9772文章数 568关注度
往期回顾 全部

科技要闻

小米再次背水一战

头条要闻

"粥饼伦"新店开业推出8元套餐现场排起长队 本人回应

头条要闻

"粥饼伦"新店开业推出8元套餐现场排起长队 本人回应

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲乱改抗战歌曲被重罚!

财经要闻

全球黄金“回家”

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

游戏
数码
旅游
公开课
军事航空

《湮灭之潮》科隆试玩口碑大爆!外媒:战斗系统太顶

数码要闻

百度小度智能屏X9 Ultra发布:AI主动看护,首销限时价629元

旅游要闻

9月10日至9月13日!广元:45个A级景区对全国教师免门票,共4天...

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

胡塞武装用自行生产的导弹袭击沙特军车

无障碍浏览 进入关怀版