个人电脑玩AI-15让5060 Ti给你打工——MiniMax H3 本地部署实录:一个自带录音棚的视频模型,和它的 NVFP4 瘦身奇遇

0 阅读7分钟

by 雪隐_上班了 from juejin.cn/user/143341… 欢迎分享与聚合,全文转载就不必了,尊重版权,圈子就这么大,若急用可联系授权。

专栏主旨:用我那台 RTX 5060 Ti 16G + 64GB 内存 的"丐帮战车",做点不枉费电费的新奇事情。

上一章我们搞定了"谁在说话"(Whisper + pyannote),这一章来玩点更猛的——AI 视频模型,而且自带声音的那种。

MiniMax H3 是什么

2026 年 8 月 3 日,MiniMax 开源了 H3——一个全模态视频生成模型

翻译成人话:以前的 AI 视频模型是默片演员——画面演完了,配音另请高明,对口型再找个模型,音效靠缘分。你让 A 模型生视频,B 模型配音,C 模型对口型,D 模型加音效,最后拼在一起,像弗兰肯斯坦的怪物,各个零件都能看,凑一起就不是人。

H3 是整个剧组打包上岗:文本、图像、视频、音频在同一个上下文里联合理解,生成的视频自带原生立体声——对白、音效、配乐和视频在同一次扩散过程中一起"长"出来,不是后期贴上去的。

硬参数:最高 2K 分辨率、24fps、最长约 15 秒、33B 参数。33B 什么概念?你拿 16G 显卡跑它,就像开着一辆 QQ 去拉集装箱。 但别急,有人已经帮我们解决了这个问题。

它有两个分工不同的权重变体,下错了不会爆炸,只会怀疑人生:

变体用途
fl2va(first/last-frame)文生视频、图生视频、首尾帧插值;还能用上一段的尾帧接下一段,无限续集——拍连续剧的福音
ref2va(reference)参考生视频:最多 9 张参考图 + 3 段参考视频 + 3 段参考音频,锁角色、锁风格、锁运镜、锁嗓音

做角色一致性的朋友直接看 ref2va——以前靠 LoRA 训练求爷爷告奶奶解决的"每张图不是同一个人",现在是官方功能,开箱即用。不用再对着生成的几张图崩溃:"这 TM 是同一个角色?"

模型从哪下:NVFP4 社区量化版

官方权重(MiniMaxAI/MiniMax-H3)全精度要 120G+ 显存,普通家庭直接告辞——这相当于让你用家用插座去充一辆特斯拉,插头都塞不进去。

ComfyUI 官方整理版(Comfy-Org/MiniMax-H3)做了 int8 量化,把门槛降到了 20G。而我们这次用的是社区大佬的 NVFP4 版,进一步瘦身到了 12.5G

lilcheaty/MiniMax-H3-NVFP4

这个仓库值得说道说道。它不是无脑压缩——Comfy-Org 的 pruned 版本本身就做了一次精妙手术:发现模型里负责 AdaLN 调制的 13B 参数(占全模型 39.4%)其实只跟时间步有关,于是一刀切成 8 维查表,130 亿参数塌缩成 4 千万,压缩了约 326 倍

为什么这很重要?因为 AdaLN 恰恰是最不敢量化的部分——它给每一条残差流发缩放系数,那里的误差会乘法累积到全部 50 层。这就好比你把心脏起搏器的精度从 99.9% 降到 90%,多出来的 9.9% 误差会通过血管传到全身。手术做完,AdaLN 小到可以免费保持全精度,剩下的 attn+mlp 放心量化。

NVFP4 版再在此基础上把 200 层压进 4bit:

int8_convrotnvfp4
文件大小21.0 GB12.5 GB
采样显存20.0 GB11.9 GB
速度(s/it)2.171.90

更小、更快、更省——量化界的三好学生。注意:NVFP4 需要 Blackwell 架构(RTX 50 系) ,更老的卡请用 int8 版。40 系用户此刻的心情:💔

仓库里要下的文件:

  • minimax_h3_ref2va_pruned_nvfp4.safetensors(12.5G,参考生视频)
  • minimax_h3_fl2va_pruned_nvfp4.safetensors(12.5G,文生/图生视频)
  • qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(15G,文本编码器,Comfy-Org 原版镜像)
  • minimax_h3_video_vae_fp16.safetensors + minimax_h3_audio_vae_fp32.safetensors(VAE 故意不量化——它们每次生成只跑一遍,误差直接可见,这里省不了)

工作流从哪来

Comfy-Org/MiniMax-H3 页面里给了三个官方模板,直接下载 JSON 拖进 ComfyUI:

模板里默认引用的是 int8 模型名,加载后把 UNETLoader 的下拉框换成你的 nvfp4 文件即可,一个节点的事,不需要全改。

本地部署步骤

1. 升级 ComfyUI 到 0.30.0+

H3 是核心原生节点,低版本没有。整合包用户用启动器升级,别手动 git pull——除非你想体验"报错三小时,回滚两秒钟"的极限运动。

2. 模型归位

ComfyUI/models/
├── diffusion_models/
│   ├── minimax_h3_ref2va_pruned_nvfp4.safetensors   # R2V 用
│   └── minimax_h3_fl2va_pruned_nvfp4.safetensors    # T2V/I2V 用
├── text_encoders/
│   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
    ├── minimax_h3_video_vae_fp16.safetensors
    └── minimax_h3_audio_vae_fp32.safetensors

全套约 34G。如果你是 1T 硬盘党,现在开始慌了。 没事,4T 用户表示淡定——也就是本专栏那个"硬盘进化史"的主人公。

3. 加载模板工作流,检查三处

  • UNETLoader 选对变体(t2v/i2v 用 fl2va,r2v 用 ref2va——它俩权重不通用,选错了你会发现生成的视频像打了码)
  • CLIPLoader 类型是 minimax
  • 采样器 res_multistep

4. 先低分辨率试水

官方建议 0.4 百万像素(864×480)预览,帧数必须满足 17n+5(比如 5 秒=125 帧)。全质量 1344×768 留给正式出片。

我第一次跑的时候没看帧数要求,随手填了个 100 帧,然后报错。改到 102 帧,又报错。最后发现公式是 17n+5——这哪是帧数要求,这是高考数学题。

16G 显存 + 64G 内存实测能跑,靠动态卸载。慢是慢点,但它在跑——家用轿车拉集装箱,时速 20 公里,货在动。

提示词:它是导演,不是许愿池

最后也是最容易翻车的:H3 的提示词要写结构,不要写散文。它训练时吃的是结构化分镜脚本(官方叫 H3-Context-IR),"一个美女在雨中,大师作品"这种许愿文学会得到一锅粥——可能是美女,可能是雨,也可能是大师的抽象画。

有人说"提示词不重要,反正模型理解自然语言"——说这话的人一定没跑过 H3。你给导演一个故事,他拍电影。你给导演一句话,他拍广告——还是那种三秒钟的。

要点:

  • 分镜用 [Shot 1][Shot 2] At 00:03.000 打时间戳
  • 对白必须写原文,否则你会得到口型完美、内容乱码的表演。说话人、动作、语气写外面,<d>[English] 台词原文 </d> 里只放语言标签和台词本体
  • 镜头运动写"类型+幅度+速度"
  • 参考图按连接顺序用 <Picture 1> 标签引用
  • 正文目标 350–500 词

官方示例长这样:

[Shot 1] Live-action, cinematic, the young woman shown in <Picture 1>
remains beside the rain-covered train window... The quiet young woman (S1) says:
<d>[English] I get off at the next station.</d>

overall_soundscape: The train wheels produce a steady metallic rhythm...
non_diegetic_music: Sustained cello notes at a slow tempo...

是的,连环境音和配乐都有专门的段落——人家有原生音频,不写声音就像买了环绕音响只听个响。

我第一次写提示词的时候,光声音段落就写了 150 词。结果生成的视频里,雨声、车轮声、大提琴声分层清晰——比我之前用三个模型拼出来的"音画不同步"版本不知道高到哪里去了。

结语

声画一体、官方级角色一致性、22B 塞进消费级显卡——这三件事单独哪个都够写一篇,H3 一天全干了。

默片时代结束了。以前你是一个提示词工程师,现在你是一个导演——虽然你手头的设备只有一台 5060 Ti 和一颗想拍大片的心。

各位导演,开机。🎬


如果这篇文章让你成功跑通了第一个带声音的 AI 视频,或者让你避开了"帧数公式"这个数学陷阱,点赞、评论、转发都行。

谢谢大家 🙏 祝你们的分镜清晰,对白准确,音画同步,人物不崩。