IT之家 3 月 16 日消息,今日,阿里通义实验室宣布发布并开源首个支持影视级多场景配音的多模态大模型Fun-CineForge。此外,还配套开放了高质量数据集的构建方法。官方称,通过“数据 + 模型”的一体化设计,Fun-CineForge 正尝试解决影视级 AI 配音长期面临的关键问题。
IT之家附官方介绍如下:
![]()
在真实影视制作场景中,一段高质量的配音,需要同时通过四大严苛考验:
- 口型同步:合成的语音需要和画面中人物唇部运动高度同步;
- 情绪表达:依赖角色面部形象和指令描述,实现情感和语气的拟人化呈现和自由控制;
- 音色一致:在多角色配音的复杂场景下要保持每个角色音色的相似度和一致性;
- 时间对齐:即便画面中说话人被遮挡或不存在,语音也必须在正确的时间区间内合成;
然而,现有 AI 配音方法普遍面临两大瓶颈:
01、高质量多模态数据集稀缺。
高质量的配音数据集依赖多种模态的信息,现有的配音数据集数据量过小、标注类型有限,难以满足大模型的有效训练;高度依赖人工标注成本较高,难以大规模生产;缺乏对话和多人场景的长视频数据使大模型难以应对复杂配音场景。
02、模型能力不足。
传统配音模型在方法上,仅依赖视频画面中清晰可见的唇部区域来学习音画同步。但真实影视配音制作中,存在大量复杂场景,如多人对话、频繁镜头切换、人脸遮挡、面部模糊,现有技术难以在说话人面部缺失的场景实现音画同步。
![]()
为了解决上述问题,通义实验室提出了 Fun-CineForge 。本次开源内容核心包含两部分,旨在打通影视配音的“数据 - 模型”闭环:
1️⃣ 模型侧:面向复杂影视场景的多模态配音大模型
2️⃣ 数据侧:大规模多模态配音数据集构建流程(CineDub)
在数据基础之上,Fun-CineForge 基于 CosyVoice3 强大的语音合成底层能力,构建了一个面向复杂影视场景的配音大模型,完成视频 + 文本 → 语音的任务。
输入包括:
- 无声视频片段
- 配音文本
- 角色属性和情感线索
- 时间信息
- 参考语音
模型即可以参考语音的音色来合成与时间和视频信息高度对齐的语音。
Fun-CineForge 首先构建了一套自动化的数据集生产流程,可以将原始影视素材转化为结构化多模态数据。
该流程包括人声分离、文本转录、长视频分段、音视频联合说话人分离等,其中,基于通用大模型思维链的双向矫正机制,大幅降低了转录文本和说话人分离结果的错误率。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.