MiniMax H3 凭借视频音频一体化生成的能力,在本地 AI 圈子热度很高,生成效果足够出彩,但显存开销一直是普通玩家绕不开的门槛。
![]()
很多人在 ComfyUI 折腾过后都会发现,模型本身表现很不错,但内置的 Qwen3‑VL‑32B 文本编码器,就要吃掉 15.7GB 显存。手里只有 8G、12G 显存显卡的用户,基本很难直接跑起来,过去想要本地部署,只能建议准备 16GB 以上显存的显卡。
ComfyUI 是本地 AI 生成很常用的模块化工具,把各个功能拆成节点,拼接节点就能搭建完整生成流程。而文本编码器就相当于模型的翻译官,我们输入的自然提示词,会由它转换成模型可以识别的数字向量,H3 原版用的 32B 大编码器翻译效果好,但硬件代价十分高昂。
![]()
ComfyUI‑ClipProj 这个自定义插件的出现,直接改变了现状。它的核心思路,就是把这个庞大的 32B “翻译官” 替换成体量更小的 4B 或者 8B 版本,再搭配一份几百兆大小的投影矩阵,把小模型输出的结果,换算成大编码器对应的格式。整套改动不会触碰视频扩散模型、解码器、采样器这些核心部分,原有工作流大部分都可以继续沿用。
实测几组显存占用差距十分明显,原版 32B 编码器占用 15.7GB;4B 搭配插件 bf16 精度为 8.3GB;切换到 fp8 精度后仅 5.2GB;int8 量化模式最低可以压到 4.5GB,直接砍掉三分之二以上显存开销。
之所以这套方案能够生效,是因为 4B 和 32B 版本共用同一套分词器,解析提示词的基础逻辑一致。这份投影矩阵并不是训练出来的,而是开发者用数千条提示词分别跑两个模型计算得出,完整的测试文档也一并公开。
![]()
我们实际安装测试下来,最直观的感受就是加载阶段的变化。原版大编码器载入瞬间显存直接拉满,显卡风扇高速运转;换成插件方案之后,编码阶段显存基本维持在 5GB 上下,跑模型的同时还能保留一部分资源做别的操作。
实际生成测试,普通短句提示词、多镜头复杂指令都能够正常输出。当然对比原版 32B 编码器,画质会存在细微差距,但用很小的画质损耗,换取十几 GB 显存的释放,对于小显存用户来说性价比很高。
需要注意,该项目目前属于概念验证性质,效果可用,但并非官方正式方案,版本迭代更新比较频繁,安装尽量选择 0.1.4 及以上版本,避免旧版本存在的各类 bug。
![]()
安装步骤可以手动操作,也可以直接复制提示词丢给 AI 助手,让 AI 一步步指导完成部署。
![]()
如果手动安装遇到报错,优先检查文件夹路径不要带中文符号,矩阵文件版本和显卡显存规格匹配,ComfyUI 版本不要过于老旧。
几百 MB 的矩阵文件,实实在在降低了 MiniMax H3 本地运行的门槛。从前想都不敢想的 8G、12G 显卡,现在也能体验音视频一体生成,省下的十余 GB 显存,给普通玩家打开了本地跑 H3 的大门。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.