网易首页 > 网易号 > 正文 申请入驻

淘宝TaoMate-H3开源:三步生成「分钟级」音视频连续创作

0
分享至



TaoMate-H3 是由阿里巴巴 TaoLive AIGC 团队研发的音视频联合流式生成模型。基于 MiniMax H3,TaoMate-H3 将三步 LoRA 推理与自回归生成相结合,能够根据文本描述,连续生成包含人物对白、歌声或环境音的视频,支持分钟级续写,以及 480p、768p、1080p 级横竖屏输出。

与整段视频反复去噪的生成方式相比,TaoMate-H3 以小片段为单位推进,每个片段仅需三步去噪,无需等待整段视频完成生成。这一方式显著缩短了首段内容的产出时间,也为直播讲解、虚拟角色表演和交互式视频应用提供了新的技术基础。

目前,TaoMate-H3 推理代码与 LoRA 权重已正式开放。开发者可通过 GitHub 和 Hugging Face 下载体验,在此基础上开展应用开发与流式生成研究。以下是本次发布的演示效果。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

  • 开源代码: github.com/TaoLiveAIGC/TaoMate-H3
  • 模型权重: huggingface.co/TaoLiveAIGC/TaoMate-H3

什么是 TaoMate-H3?

TaoMate-H3 面向需要持续生成声音与画面的创作场景。用户可以用一条提示词描述完整场景,也可以按段安排台词、动作和情节;模型在保留历史上下文的基础上继续生成,使相邻段落共享人物、声音和场景信息。

这次发布主要围绕三个核心能力展开。

  • 三步流式生成,降低等待时间

通过少步 LoRA,TaoMate-H3 将每个小片段的去噪过程压缩为三步。模型优先完成当前片段,再生成后续内容,无需等待整个视频完成去噪。对于需要及时反馈的内容生产,这种逐段产出方式有助于缩短等待,并为边生成边播放提供基础。

  • 音视频联合生成,丰富人物与场景表现

TaoMate-H3 在同一生成过程中处理声音与画面,既支持人物讲话、歌唱和角色对白,也支持海浪、车辆运动、爆炸等环境与动作音效。声音参与模型的生成过程,为口型、表情和动作提供时间上的配合。

  • 分钟级连续续写,支持分段内容编排

借助持续更新的音视频 KV 缓存和分段音频引导,模型能够跨越提示词边界延续前面的内容。创作者可以逐段调整讲解重点或表演内容,组织更完整的商品介绍和角色叙事。

应用效果

  • 电商讲解:从商品展示到完整介绍

商品介绍通常包含外观展示、功能细节和使用场景等多个环节。TaoMate-H3 支持用分段提示词编排这些内容,在连续镜头中推进讲解,适用于商品短视频、选品介绍和品牌内容制作。

本次展示包含一分钟的竖屏背包介绍,以及横屏木梳讲解。两组案例呈现了不同画幅下的人物口播与商品展示效果,其中背包视频保留了完整的一分钟生成结果。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

背包讲解



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

木梳讲解

围绕同一件商品,创作者还可以针对不同人群调整讲解内容,例如突出通勤收纳、旅行携带或日常使用等需求。分段编排让卖点顺序与台词节奏更容易控制,也便于制作不同版本的商品内容。

  • 演唱与角色表演:声音、表情和动作共同呈现

除了商品口播,TaoMate-H3 还支持包含歌声与音乐的表演场景。窗边演唱案例展示了写实人物的歌唱过程,将旋律、口型和身体动作组织在同一段视频中。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

窗边演唱

  • 动漫对白:拓展风格化角色创作

音视频联合生成同样适用于动漫内容。在月夜少女与白狐的案例中,风格化的人物、场景与角色对白共同构成了一个短剧情片段。创作者可以通过提示词设定角色形象、环境氛围与台词,再逐段推进故事情节。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

月夜少女与白狐

  • 环境与特效:让场景拥有自己的声音

TaoMate-H3 的生成范围还包括没有人物对白的场景。日落海岸案例以海浪和环境原声表现空间氛围;电影爆炸案例则将人物运动、建筑爆炸与冲击音效结合起来,呈现更强烈的视听节奏。



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

日落海岸与海蚀拱门



视频链接:https://mp.weixin.qq.com/s/mUH1ltRoiNzs2FbJ2xIsnA

人物向前,身后建筑爆炸

这些案例覆盖了商品讲解、人物演唱、动漫对白、风景与电影特效等不同内容类型。模型提供横竖画幅和多档分辨率,便于适配移动端内容与横屏展示。

TaoMate-H3 整体流程

从提示词到最终视频,TaoMate-H3 的推理流程主要包含四个环节:

  • 分段组织内容:根据目标时长读取提示词序列,确定每个段落的场景、动作和声音描述。
  • 准备音频引导:为当前段落生成音频去噪轨迹,并利用上一段尾部的声音信息衔接音色与语气。
  • 联合流式生成:将段落拆成小片段,每个片段执行三步音视频去噪,并持续更新历史 KV 缓存。
  • 解码输出:生成的 latent 通过 VAE 解码为画面与声音,完成媒体输出。公开推理入口会自动运行整套流程并保存最终视频。

其中,latent 是模型生成过程中使用的音视频压缩表示。模型先在这一表示空间中完成生成,再通过解码得到可观看、可收听的内容。

TaoMate-H3 关键技术

  • 三步 LoRA:减少每个片段的生成开销

TaoMate-H3 通过少步 LoRA 适配,将流式推理压缩到三个去噪区间。在当前五秒提示词配置下,每个段落分为四个 chunk,主体 chunk 约为 1.4 秒,尾部片段较短。模型依次完成这些片段,并利用历史上下文继续生成。

三步更新沿 0→16→33→49 的时间状态推进。每个片段完成后,模型基于最终生成的音视频状态更新 KV 缓存,供下一片段使用。少步生成减少了反复迭代的计算量,分块处理则使模型能够更早产出第一段内容。

Self Forcing:面向连续续写的自回归训练

在训练阶段,TaoMate-H3 采用 Self Forcing 的自回归训练思路,让模型以自身生成的历史片段为条件,继续生成后续内容。这使训练过程能够接触实际续写中的历史状态,缓解仅依赖真实历史训练所带来的训练与推理分布差异。



https://arxiv.org/pdf/2506.08009

这一训练方式与少步推理、KV 缓存共同构成了流式续写的基础:模型既学习当前片段的生成,也学习如何利用此前的输出延续人物、动作和场景。

  • 音视频 KV 缓存:支持长视频连续记忆

为维持长视频的一致性,TaoMate-H3 持续复用音视频 KV 缓存,将已生成内容的上下文传递给后续片段。人物状态、近期动作和声音信息因此能够随时间延续,在切换提示词时仍参与后续生成。

缓存采用「起始视觉参照 + 近期音视频上下文」的组织方式。起始参照保留人物与场景的初始信息,近期上下文随生成进度滚动更新,使模型能够跟随最新的动作与声音继续创作。

这种方式将历史缓存控制在固定规模内,避免其占用随视频时长不断增长,为分钟级连续生成提供了稳定的上下文支持。

  • 连续时间编码:改善跨提示词衔接

在长视频中,提示词可以变化,媒体时间线仍需连续。TaoMate-H3 使用全局连续的 RoPE 位置编码,随音视频进度移动当前文本的时间坐标,并将文本右边界对齐到当前媒体的起点,使新提示词对应正在生成的内容。

切换提示词时,系统保留已有音视频 KV,同时区分新生成内容与编解码所需的尾部上下文。历史内容仅用于衔接,不重复生成。针对长时间续写中的亮度和色调变化,模型还以首个片段的视觉统计为参照,对后续视频 latent 进行均值与方差对齐,减轻画面观感的漂移。

  • 音频轨迹引导:稳定台词节奏与音色

流式生成将视频拆成了短片段,但一句台词的停顿、语速和结束位置需要在完整段落内安排。TaoMate-H3 在内部先准备覆盖当前提示词段落的音频去噪轨迹,再将对应时间位置的音频 latent 用于引导各个小片段,使局部生成始终具有段落级的声音参照。

三次去噪更新分别对齐音频轨迹中的三个状态,最终音频 latent 与引导轨迹的干净终点保持一致。音频引导贯穿生成过程,有助于稳定台词的展开节奏,减少短片段续写时的重复起句。

为衔接不同段落的音色与语气,系统将上一段最后约一秒的干净音频作为只读参考。新音频在这一参考下继续生成,参考本身保持不变;最后统一解码各段音频 latent,得到连续的声音输出。

性能表现

在同一台 8 × NVIDIA H20 96 GB 机器上,我们对原版 MiniMax H3 与 TaoMate-H3 进行了测试,输出均为 480 × 864、十秒视频。

TaoMate-H3 的纯 DiT 计算耗时由 169.572 秒降至 14.810 秒,加速 11.45 倍;首段最终 latent 的就绪时间由 170.052 秒缩短至 6.148 秒,加速 27.66 倍。首段 latent 就绪对应模型完成第一段生成、可交给 VAE 解码的时间。



在上述十秒配置下,TaoMate-H3 共生成八个小片段,执行 24 次生成前向和 8 次 KV 更新。单机八卡采用 TP2 × Ulysses4 并行,并结合高效注意力、算子融合及部分线性层的选择性低精度计算,降低推理开销。

这些优化既提升了整段内容的生成效率,也缩短了首段内容的产出时间,为分块解码、播放和交互应用开发提供了基础。

快速体验

  • 环境与硬件

项目支持 Linux、Python 3.10/3.11、CUDA 12.8 与 PyTorch 2.8,提供单机 4 卡或 8 卡推理入口。已验证的运行配置为 8 × H20 96 GB,完整安装步骤见仓库 README。

  • 运行示例
  • 获取代码:git clone https://github.com/TaoLiveAIGC/TaoMate-H3.git cd TaoMate-H3

按照 README 完成环境安装和 MiniMax H3 基础权重下载后,即可运行仓库内的十秒示例。TaoMate-H3 LoRA 权重会在首次使用时自动下载:



结果保存在 outputs/demo_10s/video.mp4 。替换提示词文件即可修改场景、台词与动作;通过时长和分辨率参数,可以进一步生成更长的视频或切换横竖画幅。

  • 开源与后续计划

本次发布包含推理代码、LoRA 权重及示例提示词,欢迎开发者下载体验,也欢迎围绕流式推理、音视频生成和应用集成与我们交流。

项目基于 MiniMax H3,遵循 MiniMax H3 Community License。感谢 MiniMax H3 及相关开源工具的贡献者。

团队仍在持续优化推理速度,进一步缩短首段内容与后续响应的等待时间。我们也计划在不久的将来陆续发布并开源新的 FL2AV 流式模型,进一步拓展到 Ref2AV,并同步开放相应权重,支持更丰富的音视频创作方式。

期待与社区一起推进音视频流式生成,让这项技术走进更多实际的创作场景。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
吓一跳!电和天然气烧水,差距居然能擦出一个月菜钱!

吓一跳!电和天然气烧水,差距居然能擦出一个月菜钱!

阿离家居
2026-09-24 02:00:05
英媒:曼城不会退出英超,高层打算低价出售球队

英媒:曼城不会退出英超,高层打算低价出售球队

足球观察1
2026-10-06 18:57:06
性出轨率最高的5个职业,不是人品差,是环境放大人性弱点

性出轨率最高的5个职业,不是人品差,是环境放大人性弱点

艺鉴在线
2026-09-30 14:57:44
“我看到了她这个地方”,女生吐槽校服袖口不友好,想想就尴尬

“我看到了她这个地方”,女生吐槽校服袖口不友好,想想就尴尬

番外行
2026-10-07 09:28:01
接触的人多了,你就会发现:吃饭慢,走路稳,脾气好,性格内向,说话少,有这些特点的人,办事都特别细心,特别可靠

接触的人多了,你就会发现:吃饭慢,走路稳,脾气好,性格内向,说话少,有这些特点的人,办事都特别细心,特别可靠

犀利强哥
2026-10-07 07:00:15
马克龙支持巴勒斯坦,法国成巴勒斯坦,以色列还是以色列

马克龙支持巴勒斯坦,法国成巴勒斯坦,以色列还是以色列

移光幻影
2026-10-07 12:47:29
WTT中国大满贯捷报:男单爆冷!日乒主力遭4连杀!亚运冠军一轮游

WTT中国大满贯捷报:男单爆冷!日乒主力遭4连杀!亚运冠军一轮游

北纬的咖啡豆
2026-10-07 09:32:12
我和保姆搭伙过26年,临终给她800块给儿子1套房,保姆取钱时愣住

我和保姆搭伙过26年,临终给她800块给儿子1套房,保姆取钱时愣住

温情邮局
2025-09-10 15:09:12
四川曾有老虎,为什么没吃大熊猫?护林员说:80%的人不知道,老虎就算“饿疯了”,也不会将大熊猫当作美餐

四川曾有老虎,为什么没吃大熊猫?护林员说:80%的人不知道,老虎就算“饿疯了”,也不会将大熊猫当作美餐

回京历史梦
2026-10-04 02:50:05
一个男人最大的愚蠢,就是五六十岁了,还在到处吐槽妻子的不好

一个男人最大的愚蠢,就是五六十岁了,还在到处吐槽妻子的不好

风起见你
2026-10-07 01:02:04
中国再次让步:拒绝2400万美元赔偿后,送泰国S-26T潜艇超长质保

中国再次让步:拒绝2400万美元赔偿后,送泰国S-26T潜艇超长质保

铁锤侃侃而谈
2026-10-06 09:50:02
不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

不查不知道一查吓一跳!44岁一家人住北京豪宅的陈婷,私下有多壕

冷紫葉
2026-09-19 12:41:16
中国不接招,美国自己耗死!全世界等中美开战,会晤却顺利完成了

中国不接招,美国自己耗死!全世界等中美开战,会晤却顺利完成了

潋滟晴方DAY
2026-10-07 16:28:47
红薯立大功!研究发现:糖尿病人吃红薯,或缓解4个并发症

红薯立大功!研究发现:糖尿病人吃红薯,或缓解4个并发症

任医生聊健康
2026-10-07 12:05:11
悲催!重庆22岁女孩柬埔寨失联20余天,母亲苦苦寻女,网友却恶意调侃,“吸毒史、纹身”成舆论焦点

悲催!重庆22岁女孩柬埔寨失联20余天,母亲苦苦寻女,网友却恶意调侃,“吸毒史、纹身”成舆论焦点

火山詩话
2026-10-07 10:37:19
大案纪实:京承高速焚尸案:畸形父爱纵容变态孽恋 一对父子的双向沉沦

大案纪实:京承高速焚尸案:畸形父爱纵容变态孽恋 一对父子的双向沉沦

大案纪实故事
2026-10-06 14:10:14
薛其坤痛失物理学诺奖,哈尔岑凭冰立方折桂,中国的诺奖何时爆发?

薛其坤痛失物理学诺奖,哈尔岑凭冰立方折桂,中国的诺奖何时爆发?

麓谷隐士
2026-10-06 21:33:03
“爷爷黄毛,奶奶满背!”一家五口火了,网友:孩子小学毕业就算高学历!

“爷爷黄毛,奶奶满背!”一家五口火了,网友:孩子小学毕业就算高学历!

林林先生
2026-09-12 12:25:03
乐基儿年轻时真漂亮,看曾志伟的眼神就知道了

乐基儿年轻时真漂亮,看曾志伟的眼神就知道了

娱你同欢
2026-09-13 20:22:17
弗格离开后,CBA新赛季最强5外援基本如下,上海男篮2人上榜

弗格离开后,CBA新赛季最强5外援基本如下,上海男篮2人上榜

男足的小球童
2026-10-07 14:45:56
2026-10-07 17:07:00
机器之心Pro incentive-icons
机器之心Pro
专业的人工智能媒体
14135文章数 142744关注度
往期回顾 全部

科技要闻

万亿砸向高速充电桩,排队为何仍是无解?

头条要闻

女生买3条总价不到80元"次抛衣"出国游 回程直接扔掉

头条要闻

女生买3条总价不到80元"次抛衣"出国游 回程直接扔掉

体育要闻

从骑马舞到开口全中文 德约在北京不止七冠

娱乐要闻

吴奇隆举旗活动取消,不赚钱也守立场

财经要闻

谷歌签下科技史上最大核能协议

汽车要闻

智能化再提升 2027款东风标致、东风雪铁龙新车更人性化了

态度原创

艺术
家居
旅游
时尚
军事航空

艺术要闻

29幅 当代画家油画作品欣赏

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

赏秋正当时 枣庄尖山云顶景区粉黛乱子草盛放

3天 “捡” 到 130 个娃,假期的家长,已急疯

军事要闻

外舰跟监遵义舰 结果自己先"趴窝"了

无障碍浏览 进入关怀版