从硬件判断、ComfyUI 0.30.0 安装、四个基础模型下载,到 T2V/I2V/R2V 工作流、5 秒验收、提示词和 OOM 排错,这是一篇可以照着完成的 MiniMax H3 本地部署指南。
MiniMax H3 开放权重后,AI 视频终于多了一条“把模型放进自己电脑”的路线。本地运行不再按生成条数支付 API 费用,但显卡、内存、磁盘、电费、下载时间和维护成本仍然需要自己承担。
本文结合多份安装教程重新梳理,并以当前官方仓库和 ComfyUI 文档为准。你会看到最稳妥的安装顺序,也会知道哪些是官方能力、哪些只是社区硬件实测。

一、MiniMax H3 是什么?本地版能做什么?
MiniMax H3 是一个开放权重的全模态视频生成系统,可以在同一个上下文中理解文字、图片、视频和音频,并联合生成视频画面、对白、环境声、音效和音乐。官方完整系统支持最长约 15 秒、最高 2K 和原生立体声音频。

这里必须区分完整系统和本地开放权重:当前本地部署的核心是 H3-Base,原生画布短边约 768 像素;Context-IR 与 Regenerate-2K 并没有以同样方式完整开放。因此,“H3 系统最高支持 2K”不等于“下载本地权重后可以直接跑完整 2K 链路”。本地生成后需要更高分辨率时,可以再使用放大、补帧或云端能力。
三种常用工作流
- T2V(文生视频):根据文字提示生成带声音的视频,最适合第一次做环境验收。
- I2V / FL2V(图生视频 / 首尾帧):用首帧或首尾关键帧控制人物、服装、构图和画面风格,更适合正式创作。
- R2V(参考生视频):同时引用图片、视频和音频,用来锁定人物身份、风格、动作、运镜或声音。


二、先看硬件:你的电脑适合本地部署吗?
官方没有承诺“某张显卡一定流畅”。ComfyUI 的 Pruned INT8 扩散模型配合 NVFP4 文本编码器降低了本地门槛,社区已有 RTX 4080 16GB 等消费显卡运行记录,但速度、分辨率和稳定性会受 CUDA、PyTorch、内存卸载、驱动及工作流影响。

| 硬件 | 建议 | 说明 |
|---|---|---|
| GPU | NVIDIA 16GB 显存作为社区可行起点 | 更高显存更省卸载时间;不是官方最低保证 |
| 系统内存 | 32GB 可尝试,推荐 64GB | 显存不足时需要向内存卸载,Windows 还应保留页面文件 |
| 磁盘 | 至少预留 60GB | T2V/I2V 四文件约 39.5GiB(约 42.5GB),还要留缓存与输出空间 |
| 系统 | Windows 或 Linux | 确保 NVIDIA 驱动、PyTorch 与 CUDA 环境匹配 |
如果你只是偶尔生成几条视频,云端 API 往往更省事;已经拥有高显存显卡、需要频繁生成,或素材必须留在本机时,本地部署更有价值。
三、安装或升级 ComfyUI 0.30.0+
MiniMax H3 节点已进入 ComfyUI 核心,要求 ComfyUI 0.30.0 或更高版本。使用原生模板时,不需要先安装同名第三方 H3 节点。
- 从 ComfyUI 官网下载桌面版或可移植版(秋叶版),安装到空间充足的 SSD。
- 打开 ComfyUI,在版本或更新页面确认核心版本。
- 版本低于 0.30.0 时,选择 GitHub 最新版通道更新,然后完全重启软件。
- 如果更新后仍找不到 H3 节点,同时更新 ComfyUI 依赖,不要急着混装旧版自定义节点。


四、加载官方模板并下载 H3 模型
最省事的入口是 ComfyUI 官方模板库:
- 打开左侧 Template Library(模板);
- 进入 Video 分类;
- 搜索 MiniMax H3;
- 第一次建议选择 MiniMax H3 T2V 做环境测试;
- 模板提示缺少模型时,按弹窗下载对应文件。

T2V 和 I2V 需要的四个基础文件
minimax_h3_fl2va_pruned_int8_convrot.safetensors,约 21GB;qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors,约 15.7GB;minimax_h3_video_vae_fp16.safetensors,约 5.21GB;minimax_h3_audio_vae_fp32.safetensors,约 605MB。
模型可从 Comfy-Org/MiniMax-H3 获取。仓库还包含 BF16、FP8、INT8 和 R2V 等不同权重,不要“一次下载全部”,也不要随意混用名字相近的版本。

手动下载时的模型目录
ComfyUI/
└── models/
├── diffusion_models/
│ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
├── text_encoders/
│ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
└── vae/
├── minimax_h3_video_vae_fp16.safetensors
└── minimax_h3_audio_vae_fp32.safetensors使用 R2V 时,再额外下载并放入 models/diffusion_models/:
minimax_h3_ref2va_pruned_int8_convrot.safetensors
四个文件齐全后重启或刷新 ComfyUI。如果节点仍显示模型缺失,逐项核对文件名、扩展名和目录,不要凭“看起来差不多”选 BF16、FP8 或其他 Ref2VA 权重。
五、第一次运行:只做 5 秒 smoke test
第一次运行的目标不是追求画质,而是确认完整链路能跑通。建议保留官方 T2V 模板默认节点,只调整以下项目:
- 比例:16:9;
- 像素量:先使用快速预览,约 0.4-0.5MP;
- 分辨率参考:约 832×480;
- 时长:约 5 秒,实际帧数会按模型网格取整;
- Multiple:保持 32;
- 提示词:一个主体、一个动作、一个简单声音。
雨后的城市街道,一辆红色自行车从左向右驶过,镜头缓慢跟随。地面有积水倒影,环境中能听到轮胎压过水面的声音和轻微风声。

通过标准
- 扩散模型、文本编码器和两个 VAE 都能成功加载;
- 运行过程中没有因显存不足直接退出;
- SaveVideo 节点成功生成 MP4;
- 视频可以播放,并包含同步音轨;
- 输出比例、尺寸和时长与工作流设置一致。
第一条成功后,再按“0.5MP → 1024×576 → 更长时长 → 约 1.0MP → 增加参考素材”的顺序逐步提高难度。官方建议 16:9 高质量输出约 1.0MP,对应大约 1344×768。
六、正式创作:T2V、I2V 和 R2V 怎么选?
T2V:验证环境和快速探索
T2V 不需要输入图,最适合测试模型与声画链路,也适合探索场景与镜头创意。但人物外观、服装和构图的一致性不如关键帧控制稳定。
I2V:正式短镜头的推荐入口
先制作目标比例的角色或场景首帧,再连接 MiniMaxH3ImageToVideo 节点。需要控制结束构图时可以同时连接尾帧。最终视频是 16:9,首帧也应是真正的 16:9 横图,不要依赖模型自动纠正竖图。
更稳定的制作流程是:人物设定图 → 目标比例关键帧 → I2V 生成 3-5 秒镜头 → 挑选有效片段 → 剪辑、放大、补帧与混音。
R2V:用参考素材锁定人物、风格和声音
R2V 使用独立的 ref2va 扩散权重。把参考素材按连接顺序写成 <Picture 1>、<Video 1>、<Audio 1>,并明确说明每个参考负责身份、风格、动作、运镜还是声音。任务分配越明确,模型越容易理解。
七、H3 提示词怎么写?同时交代画面、镜头和声音
一个可复用的结构是:
整体场景:人物 + 地点 + 时间 + 光线 + 视觉风格
0-3 秒:景别 + 人物动作 + 摄像机运动
3-5 秒:切镜 + 表情/动作变化 + 场景变化
声音:环境声 + 动作音效 + 对白 + 音乐示例:
黄昏时分,一名穿红色夹克的年轻女孩站在海边公路上,暖橙色夕阳照亮侧脸,写实电影风格。0-3 秒,中景,摄像机缓慢向前推进,女孩望向远处海面,海风吹动头发和衣角。3-5 秒,切换到面部近景,她转头看向镜头并轻轻微笑。声音包含海浪、微风和远处海鸟声,背景音乐是舒缓克制的钢琴旋律。
指定中文台词在本地模型中可能出现发音不准、内容变化或中英文混合。正式项目更稳妥的做法是让 H3 生成画面、动作和环境声,再使用中文 TTS 单独生成对白,最后混音并在需要时做口型同步。
八、16GB 显存 OOM、模型缺失和速度慢怎么处理?
1. 16GB 显存 OOM
- 先降低 Megapixels,再缩短时长;
- 关闭浏览器硬件加速、游戏和其他占用 GPU 的程序;
- 确认使用的是 Pruned INT8 扩散模型与 NVFP4 文本编码器;
- Windows 保持页面文件开启,并确保系统盘有足够空间;
- 重启 ComfyUI 后只加载 H3 工作流,不要同时打开多个大模型。
2. 找不到 H3 节点
升级 ComfyUI 至 0.30.0 或更高版本并更新依赖。H3 节点属于 ComfyUI 核心,优先修复版本问题。
3. 文本编码器 shape mismatch
通常是混用了错误版本。重新选择 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors 和对应的 Pruned INT8 权重。
4. 使用 Sage Attention 加速
基础工作流跑通后,可尝试安装与当前 PyTorch/CUDA 匹配的 SageAttention,并通过 KJNodes 的 Patch Sage Attention KJ 节点接入,或使用启动参数:
--use-sage-attention官方文档称 Sage Attention 可显著加速,部分层因数据类型不同仍会回退到标准 PyTorch attention,这是正常现象。不要在第一次安装时同时加入多个缓存、Turbo 或实验节点,否则出问题时很难定位。
九、本地部署不等于“无条件免费商用”
开放权重意味着可以下载并在本地运行,不代表模型采用 Apache 2.0 或 MIT。MiniMax H3 使用 MiniMax H3 Community License Agreement,包含适用地区、商业使用、托管服务、分发与品牌标识等条款。
当前许可文本把美国、欧盟、英国和韩国列为排除地区,并对在这些地区使用、展示模型及输出设置限制。准备对外提供付费服务、重新分发模型或用于商业产品前,应直接阅读 最新官方许可协议,必要时咨询法务。
本地路线真正降低的是高频调用时的按次费用,不是把视频生成变成没有成本、没有限制的免费资源。
十、最终推荐路线
- 确认显卡、内存和磁盘是否适合本地部署;
- 安装或更新 ComfyUI 0.30.0+;
- 从官方模板库加载 MiniMax H3 T2V;
- 下载四个低显存基础模型并核对目录;
- 用 832×480、约 5 秒完成第一次 smoke test;
- 正式创作切换 I2V,用关键帧固定人物和构图;
- 需要人物、动作、运镜或声音参考时再安装 R2V 权重;
- 基础链路稳定后,再测试 Sage Attention、分辨率和更长时长。
MiniMax H3 目前更适合按 3-5 秒镜头反复生成,再通过剪辑与后期组成完整作品。按这条顺序部署,出现问题时更容易判断是模型文件、环境、显存还是工作流设置造成的。






