暂无菜单项

开源免费的MiniMax H3 本地部署与使用教程

发布于 更新于
7

从硬件判断、ComfyUI 0.30.0 安装、四个基础模型下载,到 T2V/I2V/R2V 工作流、5 秒验收、提示词和 OOM 排错,这是一篇可以照着完成的 MiniMax H3 本地部署指南。

MiniMax H3 开放权重后,AI 视频终于多了一条“把模型放进自己电脑”的路线。本地运行不再按生成条数支付 API 费用,但显卡、内存、磁盘、电费、下载时间和维护成本仍然需要自己承担。

本文结合多份安装教程重新梳理,并以当前官方仓库和 ComfyUI 文档为准。你会看到最稳妥的安装顺序,也会知道哪些是官方能力、哪些只是社区硬件实测。

MiniMax H3本地部署与ComfyUI安装教程

一、MiniMax H3 是什么?本地版能做什么?

MiniMax H3 是一个开放权重的全模态视频生成系统,可以在同一个上下文中理解文字、图片、视频和音频,并联合生成视频画面、对白、环境声、音效和音乐。官方完整系统支持最长约 15 秒、最高 2K 和原生立体声音频。

这里必须区分完整系统和本地开放权重:当前本地部署的核心是 H3-Base,原生画布短边约 768 像素;Context-IR 与 Regenerate-2K 并没有以同样方式完整开放。因此,“H3 系统最高支持 2K”不等于“下载本地权重后可以直接跑完整 2K 链路”。本地生成后需要更高分辨率时,可以再使用放大、补帧或云端能力。

三种常用工作流

  • T2V(文生视频):根据文字提示生成带声音的视频,最适合第一次做环境验收。
  • I2V / FL2V(图生视频 / 首尾帧):用首帧或首尾关键帧控制人物、服装、构图和画面风格,更适合正式创作。
  • R2V(参考生视频):同时引用图片、视频和音频,用来锁定人物身份、风格、动作、运镜或声音。

二、先看硬件:你的电脑适合本地部署吗?

官方没有承诺“某张显卡一定流畅”。ComfyUI 的 Pruned INT8 扩散模型配合 NVFP4 文本编码器降低了本地门槛,社区已有 RTX 4080 16GB 等消费显卡运行记录,但速度、分辨率和稳定性会受 CUDA、PyTorch、内存卸载、驱动及工作流影响。

MiniMax H3本地部署显卡内存硬盘参考配置
硬件 建议 说明
GPU NVIDIA 16GB 显存作为社区可行起点 更高显存更省卸载时间;不是官方最低保证
系统内存 32GB 可尝试,推荐 64GB 显存不足时需要向内存卸载,Windows 还应保留页面文件
磁盘 至少预留 60GB T2V/I2V 四文件约 39.5GiB(约 42.5GB),还要留缓存与输出空间
系统 Windows 或 Linux 确保 NVIDIA 驱动、PyTorch 与 CUDA 环境匹配

如果你只是偶尔生成几条视频,云端 API 往往更省事;已经拥有高显存显卡、需要频繁生成,或素材必须留在本机时,本地部署更有价值。

三、安装或升级 ComfyUI 0.30.0+

MiniMax H3 节点已进入 ComfyUI 核心,要求 ComfyUI 0.30.0 或更高版本。使用原生模板时,不需要先安装同名第三方 H3 节点。

  1. ComfyUI 官网下载桌面版或可移植版(秋叶版),安装到空间充足的 SSD。
  2. 打开 ComfyUI,在版本或更新页面确认核心版本。
  3. 版本低于 0.30.0 时,选择 GitHub 最新版通道更新,然后完全重启软件。
  4. 如果更新后仍找不到 H3 节点,同时更新 ComfyUI 依赖,不要急着混装旧版自定义节点。
在ComfyUI桌面版检查核心版本号
通过GitHub最新版通道更新ComfyUI

四、加载官方模板并下载 H3 模型

最省事的入口是 ComfyUI 官方模板库:

  1. 打开左侧 Template Library(模板)
  2. 进入 Video 分类;
  3. 搜索 MiniMax H3;
  4. 第一次建议选择 MiniMax H3 T2V 做环境测试;
  5. 模板提示缺少模型时,按弹窗下载对应文件。
ComfyUI模板库中的MiniMax H3 T2V I2V和R2V工作流

T2V 和 I2V 需要的四个基础文件

  1. minimax_h3_fl2va_pruned_int8_convrot.safetensors,约 21GB;
  2. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors,约 15.7GB;
  3. minimax_h3_video_vae_fp16.safetensors,约 5.21GB;
  4. minimax_h3_audio_vae_fp32.safetensors,约 605MB。

模型可从 Comfy-Org/MiniMax-H3 获取。仓库还包含 BF16、FP8、INT8 和 R2V 等不同权重,不要“一次下载全部”,也不要随意混用名字相近的版本。

ComfyUI工作流提示下载MiniMax H3缺失模型

手动下载时的模型目录

ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
    ├── text_encoders/
    │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
    └── vae/
        ├── minimax_h3_video_vae_fp16.safetensors
        └── minimax_h3_audio_vae_fp32.safetensors

使用 R2V 时,再额外下载并放入 models/diffusion_models/

minimax_h3_ref2va_pruned_int8_convrot.safetensors
MiniMax H3四个模型文件放入三个ComfyUI目录

四个文件齐全后重启或刷新 ComfyUI。如果节点仍显示模型缺失,逐项核对文件名、扩展名和目录,不要凭“看起来差不多”选 BF16、FP8 或其他 Ref2VA 权重。

五、第一次运行:只做 5 秒 smoke test

第一次运行的目标不是追求画质,而是确认完整链路能跑通。建议保留官方 T2V 模板默认节点,只调整以下项目:

  • 比例:16:9;
  • 像素量:先使用快速预览,约 0.4-0.5MP;
  • 分辨率参考:约 832×480;
  • 时长:约 5 秒,实际帧数会按模型网格取整;
  • Multiple:保持 32;
  • 提示词:一个主体、一个动作、一个简单声音。

雨后的城市街道,一辆红色自行车从左向右驶过,镜头缓慢跟随。地面有积水倒影,环境中能听到轮胎压过水面的声音和轻微风声。

MiniMax H3第一次本地五秒smoke test验收标准

通过标准

  • 扩散模型、文本编码器和两个 VAE 都能成功加载;
  • 运行过程中没有因显存不足直接退出;
  • SaveVideo 节点成功生成 MP4;
  • 视频可以播放,并包含同步音轨;
  • 输出比例、尺寸和时长与工作流设置一致。

第一条成功后,再按“0.5MP → 1024×576 → 更长时长 → 约 1.0MP → 增加参考素材”的顺序逐步提高难度。官方建议 16:9 高质量输出约 1.0MP,对应大约 1344×768。

六、正式创作:T2V、I2V 和 R2V 怎么选?

T2V:验证环境和快速探索

T2V 不需要输入图,最适合测试模型与声画链路,也适合探索场景与镜头创意。但人物外观、服装和构图的一致性不如关键帧控制稳定。

I2V:正式短镜头的推荐入口

先制作目标比例的角色或场景首帧,再连接 MiniMaxH3ImageToVideo 节点。需要控制结束构图时可以同时连接尾帧。最终视频是 16:9,首帧也应是真正的 16:9 横图,不要依赖模型自动纠正竖图。

更稳定的制作流程是:人物设定图 → 目标比例关键帧 → I2V 生成 3-5 秒镜头 → 挑选有效片段 → 剪辑、放大、补帧与混音。

R2V:用参考素材锁定人物、风格和声音

R2V 使用独立的 ref2va 扩散权重。把参考素材按连接顺序写成 <Picture 1><Video 1><Audio 1>,并明确说明每个参考负责身份、风格、动作、运镜还是声音。任务分配越明确,模型越容易理解。

七、H3 提示词怎么写?同时交代画面、镜头和声音

一个可复用的结构是:

整体场景:人物 + 地点 + 时间 + 光线 + 视觉风格
0-3 秒:景别 + 人物动作 + 摄像机运动
3-5 秒:切镜 + 表情/动作变化 + 场景变化
声音:环境声 + 动作音效 + 对白 + 音乐

示例:

黄昏时分,一名穿红色夹克的年轻女孩站在海边公路上,暖橙色夕阳照亮侧脸,写实电影风格。0-3 秒,中景,摄像机缓慢向前推进,女孩望向远处海面,海风吹动头发和衣角。3-5 秒,切换到面部近景,她转头看向镜头并轻轻微笑。声音包含海浪、微风和远处海鸟声,背景音乐是舒缓克制的钢琴旋律。

指定中文台词在本地模型中可能出现发音不准、内容变化或中英文混合。正式项目更稳妥的做法是让 H3 生成画面、动作和环境声,再使用中文 TTS 单独生成对白,最后混音并在需要时做口型同步。

八、16GB 显存 OOM、模型缺失和速度慢怎么处理?

1. 16GB 显存 OOM

  • 先降低 Megapixels,再缩短时长;
  • 关闭浏览器硬件加速、游戏和其他占用 GPU 的程序;
  • 确认使用的是 Pruned INT8 扩散模型与 NVFP4 文本编码器;
  • Windows 保持页面文件开启,并确保系统盘有足够空间;
  • 重启 ComfyUI 后只加载 H3 工作流,不要同时打开多个大模型。

2. 找不到 H3 节点

升级 ComfyUI 至 0.30.0 或更高版本并更新依赖。H3 节点属于 ComfyUI 核心,优先修复版本问题。

3. 文本编码器 shape mismatch

通常是混用了错误版本。重新选择 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors 和对应的 Pruned INT8 权重。

4. 使用 Sage Attention 加速

基础工作流跑通后,可尝试安装与当前 PyTorch/CUDA 匹配的 SageAttention,并通过 KJNodes 的 Patch Sage Attention KJ 节点接入,或使用启动参数:

--use-sage-attention

官方文档称 Sage Attention 可显著加速,部分层因数据类型不同仍会回退到标准 PyTorch attention,这是正常现象。不要在第一次安装时同时加入多个缓存、Turbo 或实验节点,否则出问题时很难定位。

九、本地部署不等于“无条件免费商用”

开放权重意味着可以下载并在本地运行,不代表模型采用 Apache 2.0 或 MIT。MiniMax H3 使用 MiniMax H3 Community License Agreement,包含适用地区、商业使用、托管服务、分发与品牌标识等条款。

当前许可文本把美国、欧盟、英国和韩国列为排除地区,并对在这些地区使用、展示模型及输出设置限制。准备对外提供付费服务、重新分发模型或用于商业产品前,应直接阅读 最新官方许可协议,必要时咨询法务。

本地路线真正降低的是高频调用时的按次费用,不是把视频生成变成没有成本、没有限制的免费资源。

十、最终推荐路线

  1. 确认显卡、内存和磁盘是否适合本地部署;
  2. 安装或更新 ComfyUI 0.30.0+;
  3. 从官方模板库加载 MiniMax H3 T2V;
  4. 下载四个低显存基础模型并核对目录;
  5. 用 832×480、约 5 秒完成第一次 smoke test;
  6. 正式创作切换 I2V,用关键帧固定人物和构图;
  7. 需要人物、动作、运镜或声音参考时再安装 R2V 权重;
  8. 基础链路稳定后,再测试 Sage Attention、分辨率和更长时长。

MiniMax H3 目前更适合按 3-5 秒镜头反复生成,再通过剪辑与后期组成完整作品。按这条顺序部署,出现问题时更容易判断是模型文件、环境、显存还是工作流设置造成的。

常见问题(FAQ)

MiniMax H3 本地部署需要多大显存?
官方没有统一最低显存承诺。社区已有 RTX 4080 16GB 等消费卡运行 Pruned INT8 + NVFP4 组合的记录,建议至少准备 32GB 系统内存并优先使用低分辨率短时长测试。
MiniMax H3 本地需要下载哪些模型?
T2V/I2V 需要 Pruned INT8 FL2VA 扩散模型、NVFP4 Qwen3-VL 文本编码器、FP16 视频 VAE 和 FP32 音频 VAE;R2V 还需额外下载 Ref2VA 扩散模型。
为什么 ComfyUI 找不到 MiniMax H3 节点?
MiniMax H3 需要 ComfyUI 0.30.0 或更高版本。先更新 ComfyUI 核心及依赖并重启,不要优先混装旧版第三方节点。
本地 MiniMax H3 可以直接生成 2K 视频吗?
完整 H3 系统最高支持 2K,但当前本地开放权重的核心是 H3-Base,原生画布短边约 768 像素;完整 2K 链路还涉及未以相同方式开放的模块或云端能力。
MiniMax H3 开放权重后可以免费商用吗?
不能仅凭开放权重判断。H3 使用专门的 Community License,包含地区与商业条款,商用、托管或分发前必须阅读最新官方协议。
0 点赞
0 收藏
分享
0 讨论
反馈
0 讨论
热门最新
总结
暂无总结
0 / 600
嗨,下午好!
所有的成功,都源自一个勇敢的开始
近期热门