网易首页 > 网易号 > 正文 申请入驻

MiniMax H3:打破任务和模态边界的开放模型

0
分享至

今天,我们正式发布 MiniMax H3。这是一款通用的全模态生成模型,支持对文本、图像、视频、声音组成的多模态上下文的统一理解能力、能够输出具备原生双声道的音视频,最高可支持 15s 2K 分辨率。

根据前期的邀测反馈,MiniMax H3 具备商用级的多场景内容生成能力,在指令遵循、文字与品牌信息呈现、V2V Motion Transfer(视频到视频动作迁移)等方面表现出色,可实现精准、可控的多模态内容编辑与生成,广泛适用于广告、品牌、电商、产品设计、UI/UX、游戏等商业场景。

同时,得益于 Contextual Omni Representation、H3-VAE、H3-Omni Transformer、In-context Regeneration 等多项技术,我们有能力提供行业内最优的性价比。我们默认提供 2K 的分辨率,模型在 2K 分辨率下每秒价格不到主流模型的 1/3, 768P 分辨率下不到 1/2。

长期以来,闭源模型一直占据视频生成领域的主导地位,迭代速度和生态开放性落后于大语言模型等领域。为了推动开源社区的发展、加速国产芯片适配(H3 设计初期就考虑了多款现有国产芯片的兼容性),以及方便有需要的用户定制自己的版本。我们计划在未来几天内,在符合相关法律法规的前提下,开放模型权重。

H3 的模型特色

多模态上下文理解:

真实创作需要融合不同模态的复杂信息,同时引入图片、声音、视频等多模态信息源。如下面这个镜头 Prompt 为“参考视频1的希区柯克镜头运动,让图2中的人物唱歌,歌声参考音频3”。通过语言描述清楚上下文和目标视频的关系,复杂的全模态理解工作 H3 会自己完成。

输入参考视频、图片和音频:


H3 生成视频:

2K 表现:

原生双声道:

H3 的应用案例

电影片头:

游戏UI:

动态海报:

广告电商:

H3 的设计理念

打破任务的边界:从专用迈向通用

我们之前研发过两代模型:Hailuo 01 从 0 到 1 构建系统、Hailuo 02 专注于架构效率、数据质量和规模等核心组件的提升。

在 H3 的设计过程中,我们意识到过往生成模型在任务上的局限性:图片生成往往分为独立的 T2I、Editing、主体参考、动作参考、风格参考等为独立的专家模型,声音生成中的人声、音效、音乐也多作为独立的领域被研究,视频生成更是分为文生视频、图生视频、首尾帧、主体参考、动作参考、音色参考、视频编辑等细分功能;图像、视频、音频之间也有着清晰的边界。

这些任务、能力、模态的隔离限制了使用上的自由度,也从训练范式上限定了模型的泛化能力。这两点对应着应用范式和训练范式的巨大变革空间。因此,H3 构建过程的第一纲领,即是任务的统一和泛化。

基于此,简要概括一下 H3 的预训练范式 ——

数据和任务

  • 文生图

  • 文生视频

    · 带有联合的音频生成,所有的音频输出都是原生的双声道模式

    · 原生的多镜头建模

  • 文生音频

    · 不区分人声、音效、音乐,统一联合建模

  • 广义的参考和编辑

    · 图片到图片的参考和编辑

    · 图片到视频的参考和编辑

    · 音频到音频的参考和编辑

    · 音视频到音视频的参考和编辑

    · 广义的参考和编辑在我们的设计中是指:

    a.完全由真实自然数据构成,从而具备较好的数据扩展性;

    b.由自然语言表述参考和编辑关系,不局限于有限任务;语言(或者说广义的智力结构)是泛化的桥梁

架构选择

  • 尽可能简洁、通用、高效的架构,一切为了任务泛化服务

训练策略

  • 尽可能早融合各种类型的数据和任务,合适的配比是关键

这些选择导向同一个目标:让 H3 在预训练阶段就具备广泛的多模态上下文理解和生成能力。

前面我们讨论了训练范式的变化,视频模型的应用形态正在发生怎样的变化呢?

我们看到,创作者可以直接用自然语言描述任务,而不仅是输入一段简单的画面提示词。随着多模态理解、指令遵循和复杂任务执行能力持续提升,视频模型将能够理解更完整的创作意图,处理更复杂的内容需求,并逐步从“生成一段视频”,走向真正参与内容生产的全过程。

H3 的技术选择

简单分享一些 H3 的核心技术:

Contextual Omni Representation

在训练 H3 的工程中,我们最重要的一件事情是增加 Caption 能力。

  • 多模态上下文的引入使得 Caption 的定义被进一步泛化,我们不止需要描述目标视频,还需要描述上下文和目标视频之间的关系,甚至是上下文内元素之间的关系。

  • 我们需要联合描述视频和音频,而多镜头下的音视频关联又更加复杂。

  • 这本质上是一种 Contextual Omni Representation。语言在其中起到了可泛化的连结和解释作用,并让“任务”以一种开放描述的形式得到统一,这是 H3 广泛的指令理解能力的根源。

  • 为了达到上述目标,我们定制了专门的模型和全模态理解管线,大部分素材需要消耗 100K Token 的推理,最终得到平均约 4K 的 Token。

H3-VAE,架构效率的大幅优化

  • H 系列模型一直在 tokenizer 技术上保持着持续的探索。H3 一代我们彻底革新了前代的 tokenizer 技术,在重建和易学性上取得全面的提升,使得 H3 在效率上可以取得有竞争力的效果,同时其高压缩率带来了 4 倍的序列长度收益,大幅降低了训练和推理成本,这也是支持我们提供原生 2K 分辨率的关键技术。

H3-Omni Transformer,面向任务泛化的架构选择

  • 基于 H3“架构应服务于任务”的设计理念,通用和高效是唯二的目标。值得一提的是,我们抛弃了曾经给我们带来显著架构优势的 Hailuo-02 架构,因为它在以任务泛化为核心的模型定义中会带来额外的复杂性,而我们相信“任务泛化”是不可逆转的趋势,架构技巧应为模型定义让路。

  • 在 H3 中,由于多模态上下文的引入,序列长度方差大了 3 倍,理解与生成部分的计算 workload 也开始显著的异质化。我们采用了理解与生成异构的训练架构,精细调优不同 workload 下的硬件利用率,并联合考虑每样本异构计算×样本间的负载均衡,端到端提升了近 30%的训练吞吐。

In-context Regeneration

  • 对于 H3 的 2K 分辨率输出,我们没有选择常规的专用超分模块,而是用 H3 基模对自己的低分辨率结果进行 in-context 的重新生成。

  • 这样做带来了两方面优势:① Regeneration 过程可以最大程度的复用 H3 基模已经具备的生成能力;② In-context 的形式可以再次利用原有的多模态上下文信息进行高分辨率输出,从而超越了传统超分方案靠“猜”无法还原的信息,例如一些小文字和细节。

  • In-contect Regeneration 也是任务泛化的一种体现。

后续我们会发布更加详细的 H3 Tech Report,欢迎更多的朋友们交流。

Vision & What's Next

语言、图片、视频、音频是广泛存在的自然模态,它们紧密交织在一起,是人与世界交互的基本媒介。由它们构成的多模态上下文,可以高效的表达广泛的信息,而信息的表达和传递本身就是一种生产力。

对于多模理解和生成来说,我们可以把语言看作一套可泛化可 Scaling 的计算系统,因此我们认为多模态应该紧密关联语言。

H3 目前还存在一些局限性,以下是我们后续版本会提升的方向:

  • 生成能力的最重要基础是多模态上下文的理解能力,这里有巨大的提升空间,我们后续会推动 H 系列的下一个版本与 M 系列模型能力的融合。

  • 模型规模的限制使得 H3 在一些能力的完成度上仍有一些提升空间,Scaling 是明确的方向,我们相信任务的泛化会给模型 Scaling 带来充分的发挥空间。

  • H3 在部分场景下的画面精细度仍需提升,我们会持续追求更高分辨率和更精细的画面表现。

Intelligence with Everyone.

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
宋雨琦休假归来自曝胖了5斤,此前体重跌破90斤瘦成“纸片人”引关注

宋雨琦休假归来自曝胖了5斤,此前体重跌破90斤瘦成“纸片人”引关注

韩小娱
2026-09-09 08:51:19
63-84!世界杯首支亚洲队出局 8强已定5席 中国女篮利好 保送晋级

63-84!世界杯首支亚洲队出局 8强已定5席 中国女篮利好 保送晋级

侃球熊弟
2026-09-09 01:31:26
女人见面的最高礼仪,就是穿裙子,这是对你的重视,对约会的重视

女人见面的最高礼仪,就是穿裙子,这是对你的重视,对约会的重视

加油丁小文
2026-09-01 07:09:58
小米18 Fold首发评测:合上是「护照」,展开是平板,几乎没短板

小米18 Fold首发评测:合上是「护照」,展开是平板,几乎没短板

雷科技
2026-09-08 11:34:42
又倒下一个!网传合肥庐州公园,一年轻小伙子跑得太拼倒下,疑似心梗,跑友们立即伸手施救,并及时拨打急救电话

又倒下一个!网传合肥庐州公园,一年轻小伙子跑得太拼倒下,疑似心梗,跑友们立即伸手施救,并及时拨打急救电话

火山詩话
2026-09-07 11:43:30
99%观众都猜错,《交锋》蒋在珍不可能假死,吴越和编剧回应了

99%观众都猜错,《交锋》蒋在珍不可能假死,吴越和编剧回应了

陈述影视
2026-09-08 23:58:37
4年1.07亿!总决赛中锋!最快速度交易

4年1.07亿!总决赛中锋!最快速度交易

篮球教学论坛
2026-09-08 17:44:04
泰国方面总结5天战果:憋了200多天的林肯号水兵,人均花了4300块

泰国方面总结5天战果:憋了200多天的林肯号水兵,人均花了4300块

影孖看世界
2026-09-08 23:25:40
英国宣布制裁,以色列迅速报复

英国宣布制裁,以色列迅速报复

澎湃新闻
2026-09-09 08:49:09
百万粉丝吃播网红“干饭莹莹猝然离世,年仅24岁!从发文提醒到去世仅3天…

百万粉丝吃播网红“干饭莹莹猝然离世,年仅24岁!从发文提醒到去世仅3天…

大风新闻
2026-09-08 08:59:07
乌媒曝光美国所提俄乌和平新计划

乌媒曝光美国所提俄乌和平新计划

参考消息
2026-09-08 19:31:33
立刻停止审判!菲参议员逼宫:豁免权马科斯有萨拉也要有

立刻停止审判!菲参议员逼宫:豁免权马科斯有萨拉也要有

麓谷隐士
2026-09-09 00:05:03
涉嫌严重违纪违法,邓国全主动投案

涉嫌严重违纪违法,邓国全主动投案

中国基金报
2026-09-08 21:29:30
郑丽文称愿推动两岸和解和平

郑丽文称愿推动两岸和解和平

参考消息
2026-09-08 16:09:08
国米球迷意难平!不止因为欧冠1‑2惜败皇马,更在于以下这五点!

国米球迷意难平!不止因为欧冠1‑2惜败皇马,更在于以下这五点!

田先生篮球
2026-09-09 05:56:26
疑暗讽河南人“偷井盖”后遭追加处罚,韦世豪不满:明明我被网暴最严重

疑暗讽河南人“偷井盖”后遭追加处罚,韦世豪不满:明明我被网暴最严重

观察者网
2026-09-08 18:23:11
“小女孩阳光自信就够了,穿这样是想干嘛!”小学过度打扮照片火了

“小女孩阳光自信就够了,穿这样是想干嘛!”小学过度打扮照片火了

泽泽先生
2026-09-08 13:16:09
中国“捡钱”时代或将来临:如果手中只有10万,试试死啃这两条线

中国“捡钱”时代或将来临:如果手中只有10万,试试死啃这两条线

花小猫的美食日常
2026-09-09 06:11:40
幼童无意触碰闹上热搜!胡锡进精准预判,这场官司注定零胜率

幼童无意触碰闹上热搜!胡锡进精准预判,这场官司注定零胜率

一口娱乐
2026-09-09 08:23:18
不再忍让!李在明一意孤行对华强硬施压,中国大使馆作出回应

不再忍让!李在明一意孤行对华强硬施压,中国大使馆作出回应

奇怪的鲨鱼们
2026-09-09 01:03:21
2026-09-09 09:56:49
赛博禅心
赛博禅心
拜AI古佛,修赛博禅心
551文章数 58关注度
往期回顾 全部

科技要闻

DeepSeek V4 Flash明日降价,V4.1 Flash已内测

头条要闻

学生质疑学校收空调使用维护费不缴费就上锁 校方回应

头条要闻

学生质疑学校收空调使用维护费不缴费就上锁 校方回应

体育要闻

韩旭:我一定会再次走出去

娱乐要闻

郭德纲被处罚,郭麒麟被曝恋情瓜

财经要闻

美国“虹吸”全球铜库存,伦铜再创新高

汽车要闻

领克20 领克的纯电小钢炮这次更运动了

态度原创

亲子
本地
家居
数码
公开课

亲子要闻

紧急接生!列车秒变“临时产房”,多方协力护母婴平安

本地新闻

宁波,中国制造的隐藏大佬

家居要闻

2026建博会(广州) 公装联探展交流活动

数码要闻

产品尚未发布,苹果已为Beats 360耳机推送新固件

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版