开源免费的MiniMax H3 本地部署与使用教程

从硬件判断、ComfyUI 0.30.0 安装、四个基础模型下载,到 T2V/I2V/R2V 工作流、5 秒验收、提示词和 OOM 排错,这是一篇可以照着完成的 MiniMax H3 本地部署指南。

MiniMax H3 开放权重后,AI 视频终于多了一条"把模型放进自己电脑"的路线。本地运行不再按生成条数支付 API 费用,但显卡、内存、磁盘、电费、下载时间和维护成本仍然需要自己承担。

本文结合多份安装教程重新梳理,并以当前官方仓库和 ComfyUI 文档为准。你会看到最稳妥的安装顺序,也会知道哪些是官方能力、哪些只是社区硬件实测。

一、MiniMax H3 是什么?本地版能做什么?

MiniMax H3 是一个开放权重的全模态视频生成系统,可以在同一个上下文中理解文字、图片、视频和音频,并联合生成视频画面、对白、环境声、音效和音乐。官方完整系统支持最长约 15 秒、最高 2K 和原生立体声音频。

**这里必须区分完整系统和本地开放权重:**当前本地部署的核心是 H3-Base,原生画布短边约 768 像素;Context-IR 与 Regenerate-2K 并没有以同样方式完整开放。因此,"H3 系统最高支持 2K"不等于"下载本地权重后可以直接跑完整 2K 链路"。本地生成后需要更高分辨率时,可以再使用放大、补帧或云端能力。

三种常用工作流

  • **T2V(文生视频):**根据文字提示生成带声音的视频,最适合第一次做环境验收。
  • **I2V / FL2V(图生视频 / 首尾帧):**用首帧或首尾关键帧控制人物、服装、构图和画面风格,更适合正式创作。
  • **R2V(参考生视频):**同时引用图片、视频和音频,用来锁定人物身份、风格、动作、运镜或声音。

二、先看硬件:你的电脑适合本地部署吗?

官方没有承诺"某张显卡一定流畅"。ComfyUI 的 Pruned INT8 扩散模型配合 NVFP4 文本编码器降低了本地门槛,社区已有 RTX 4080 16GB 等消费显卡运行记录,但速度、分辨率和稳定性会受 CUDA、PyTorch、内存卸载、驱动及工作流影响。

硬件 建议 说明
GPU NVIDIA 16GB 显存作为社区可行起点 更高显存更省卸载时间;不是官方最低保证
系统内存 32GB 可尝试,推荐 64GB 显存不足时需要向内存卸载,Windows 还应保留页面文件
磁盘 至少预留 60GB T2V/I2V 四文件约 39.5GiB(约 42.5GB),还要留缓存与输出空间
系统 Windows 或 Linux 确保 NVIDIA 驱动、PyTorch 与 CUDA 环境匹配

如果你只是偶尔生成几条视频,云端 API 往往更省事;已经拥有高显存显卡、需要频繁生成,或素材必须留在本机时,本地部署更有价值。

三、安装或升级 ComfyUI 0.30.0+

MiniMax H3 节点已进入 ComfyUI 核心,要求 ComfyUI 0.30.0 或更高版本。使用原生模板时,不需要先安装同名第三方 H3 节点。

  1. 从 ComfyUI 官网下载桌面版或可移植版(秋叶版),安装到空间充足的 SSD。
  2. 打开 ComfyUI,在版本或更新页面确认核心版本。
  3. 版本低于 0.30.0 时,选择 GitHub 最新版通道更新,然后完全重启软件。
  4. 如果更新后仍找不到 H3 节点,同时更新 ComfyUI 依赖,不要急着混装旧版自定义节点。

四、加载官方模板并下载 H3 模型

最省事的入口是 ComfyUI 官方模板库:

  1. 打开左侧 Template Library(模板);
  2. 进入 Video 分类;
  3. 搜索 MiniMax H3;
  4. 第一次建议选择 MiniMax H3 T2V 做环境测试;
  5. 模板提示缺少模型时,按弹窗下载对应文件。

T2V 和 I2V 需要的四个基础文件

  1. minimax_h3_fl2va_pruned_int8_convrot.safetensors,约 21GB;
  2. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors,约 15.7GB;
  3. minimax_h3_video_vae_fp16.safetensors,约 5.21GB;
  4. minimax_h3_audio_vae_fp32.safetensors,约 605MB。

模型可从 Comfy-Org/MiniMax-H3 获取。仓库还包含 BF16、FP8、INT8 和 R2V 等不同权重,不要"一次下载全部",也不要随意混用名字相近的版本。

手动下载时的模型目录

bash 复制代码
ComfyUI/
└── models/
    ├── diffusion_models/
    │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors
    ├── text_encoders/
    │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
    └── vae/
        ├── minimax_h3_video_vae_fp16.safetensors
        └── minimax_h3_audio_vae_fp32.safetensors

使用 R2V 时,再额外下载并放入 models/diffusion_models/:

bash 复制代码
minimax_h3_ref2va_pruned_int8_convrot.safetensors

四个文件齐全后重启或刷新 ComfyUI。如果节点仍显示模型缺失,逐项核对文件名、扩展名和目录,不要凭"看起来差不多"选 BF16、FP8 或其他 Ref2VA 权重。

五、第一次运行:只做 5 秒 smoke test

第一次运行的目标不是追求画质,而是确认完整链路能跑通。建议保留官方 T2V 模板默认节点,只调整以下项目:

  • **比例:**16:9;
  • **像素量:**先使用快速预览,约 0.4-0.5MP;
  • **分辨率参考:**约 832×480;
  • **时长:**约 5 秒,实际帧数会按模型网格取整;
  • **Multiple:**保持 32;
  • **提示词:**一个主体、一个动作、一个简单声音。

雨后的城市街道,一辆红色自行车从左向右驶过,镜头缓慢跟随。地面有积水倒影,环境中能听到轮胎压过水面的声音和轻微风声。

通过标准

  • 扩散模型、文本编码器和两个 VAE 都能成功加载;
  • 运行过程中没有因显存不足直接退出;
  • SaveVideo 节点成功生成 MP4;
  • 视频可以播放,并包含同步音轨;
  • 输出比例、尺寸和时长与工作流设置一致。

第一条成功后,再按"0.5MP → 1024×576 → 更长时长 → 约 1.0MP → 增加参考素材"的顺序逐步提高难度。官方建议 16:9 高质量输出约 1.0MP,对应大约 1344×768。

六、正式创作:T2V、I2V 和 R2V 怎么选?

T2V:验证环境和快速探索

T2V 不需要输入图,最适合测试模型与声画链路,也适合探索场景与镜头创意。但人物外观、服装和构图的一致性不如关键帧控制稳定。

I2V:正式短镜头的推荐入口

先制作目标比例的角色或场景首帧,再连接 MiniMaxH3ImageToVideo 节点。需要控制结束构图时可以同时连接尾帧。最终视频是 16:9,首帧也应是真正的 16:9 横图,不要依赖模型自动纠正竖图。

更稳定的制作流程是:人物设定图 → 目标比例关键帧 → I2V 生成 3-5 秒镜头 → 挑选有效片段 → 剪辑、放大、补帧与混音。

R2V:用参考素材锁定人物、风格和声音

R2V 使用独立的 ref2va 扩散权重。把参考素材按连接顺序写成 <Picture 1>、<Video 1>、<Audio 1>,并明确说明每个参考负责身份、风格、动作、运镜还是声音。任务分配越明确,模型越容易理解。

七、H3 提示词怎么写?同时交代画面、镜头和声音

一个可复用的结构是:

bash 复制代码
整体场景:人物 + 地点 + 时间 + 光线 + 视觉风格
0-3 秒:景别 + 人物动作 + 摄像机运动
3-5 秒:切镜 + 表情/动作变化 + 场景变化
声音:环境声 + 动作音效 + 对白 + 音乐

示例:

黄昏时分,一名穿红色夹克的年轻女孩站在海边公路上,暖橙色夕阳照亮侧脸,写实电影风格。0-3 秒,中景,摄像机缓慢向前推进,女孩望向远处海面,海风吹动头发和衣角。3-5 秒,切换到面部近景,她转头看向镜头并轻轻微笑。声音包含海浪、微风和远处海鸟声,背景音乐是舒缓克制的钢琴旋律。

指定中文台词在本地模型中可能出现发音不准、内容变化或中英文混合。正式项目更稳妥的做法是让 H3 生成画面、动作和环境声,再使用中文 TTS 单独生成对白,最后混音并在需要时做口型同步。

八、16GB 显存 OOM、模型缺失和速度慢怎么处理?

1. 16GB 显存 OOM

  • 先降低 Megapixels,再缩短时长;
  • 关闭浏览器硬件加速、游戏和其他占用 GPU 的程序;
  • 确认使用的是 Pruned INT8 扩散模型与 NVFP4 文本编码器;
  • Windows 保持页面文件开启,并确保系统盘有足够空间;
  • 重启 ComfyUI 后只加载 H3 工作流,不要同时打开多个大模型。

2. 找不到 H3 节点

升级 ComfyUI 至 0.30.0 或更高版本并更新依赖。H3 节点属于 ComfyUI 核心,优先修复版本问题。

3. 文本编码器 shape mismatch

通常是混用了错误版本。重新选择 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors 和对应的 Pruned INT8 权重。

4. 使用 Sage Attention 加速

基础工作流跑通后,可尝试安装与当前 PyTorch/CUDA 匹配的 SageAttention,并通过 KJNodes 的 Patch Sage Attention KJ 节点接入,或使用启动参数:

bash 复制代码
--use-sage-attention

官方文档称 Sage Attention 可显著加速,部分层因数据类型不同仍会回退到标准 PyTorch attention,这是正常现象。不要在第一次安装时同时加入多个缓存、Turbo 或实验节点,否则出问题时很难定位。

九、本地部署不等于"无条件免费商用"

开放权重意味着可以下载并在本地运行,不代表模型采用 Apache 2.0 或 MIT。MiniMax H3 使用 MiniMax H3 Community License Agreement,包含适用地区、商业使用、托管服务、分发与品牌标识等条款。

当前许可文本把美国、欧盟、英国和韩国列为排除地区,并对在这些地区使用、展示模型及输出设置限制。准备对外提供付费服务、重新分发模型或用于商业产品前,应直接阅读 最新官方许可协议,必要时咨询法务。

本地路线真正降低的是高频调用时的按次费用,不是把视频生成变成没有成本、没有限制的免费资源。

十、最终推荐路线

  1. 确认显卡、内存和磁盘是否适合本地部署;
  2. 安装或更新 ComfyUI 0.30.0+;
  3. 从官方模板库加载 MiniMax H3 T2V;
  4. 下载四个低显存基础模型并核对目录;
  5. 用 832×480、约 5 秒完成第一次 smoke test;
  6. 正式创作切换 I2V,用关键帧固定人物和构图;
  7. 需要人物、动作、运镜或声音参考时再安装 R2V 权重;
  8. 基础链路稳定后,再测试 Sage Attention、分辨率和更长时长。

MiniMax H3 目前更适合按 3-5 秒镜头反复生成,再通过剪辑与后期组成完整作品。按这条顺序部署,出现问题时更容易判断是模型文件、环境、显存还是工作流设置造成的。

常见问题(FAQ)

MiniMax H3 本地部署需要多大显存?

官方没有统一最低显存承诺。社区已有 RTX 4080 16GB 等消费卡运行 Pruned INT8 + NVFP4 组合的记录,建议至少准备 32GB 系统内存并优先使用低分辨率短时长测试。

MiniMax H3 本地需要下载哪些模型?

T2V/I2V 需要 Pruned INT8 FL2VA 扩散模型、NVFP4 Qwen3-VL 文本编码器、FP16 视频 VAE 和 FP32 音频 VAE;R2V 还需额外下载 Ref2VA 扩散模型。

为什么 ComfyUI 找不到 MiniMax H3 节点?

MiniMax H3 需要 ComfyUI 0.30.0 或更高版本。先更新 ComfyUI 核心及依赖并重启,不要优先混装旧版第三方节点。

本地 MiniMax H3 可以直接生成 2K 视频吗?

完整 H3 系统最高支持 2K,但当前本地开放权重的核心是 H3-Base,原生画布短边约 768 像素;完整 2K 链路还涉及未以相同方式开放的模块或云端能力。

MiniMax H3 开放权重后可以免费商用吗?

不能仅凭开放权重判断。H3 使用专门的 Community License,包含地区与商业条款,商用、托管或分发前必须阅读最新官方协议。

相关推荐
小白跃升坊17 小时前
AI 助手终于能“回家”了:腾讯开源 Octop,1Panel 点几下就装好
开源·私有化部署·1panel·ai助手·octop
m4Rk_20 小时前
【论文阅读】Agent 记忆机制(86):Skill-Pro——用 Non-Parametric PPO 将交互经验演化为可复用技能
论文阅读·人工智能·学习·开源·github
对象存储与RustFS21 小时前
升级 RustFS 二进制不停机:一条一条换,留一条退路
后端·rust·开源
分布式存储与RustFS1 天前
升级 RustFS 二进制不停机:一条一条换,留一条退路
运维·云原生·开源·对象存储·分布式存储·s3·性能基准
resh_people1 天前
开源鸿蒙平台 KMP_CMP 三方库「AtomicFU」适配全流程
华为·开源·harmonyos
蚂蚁背大象1 天前
RocketMQ-Rust 1.0.0 发布:用 Rust 做消息队列,这次有哪些变化?
rust·开源·rocketmq
miofly1 天前
GitHub 今日推荐|company-brain:在 Slack 里给团队装个会主动干活的 AI
开源·github
鬓戈1 天前
Jev 技术(System One Model)开源模型调研
人工智能·开源
小雨爱测1 天前
DeepSeek Harness 开源贡献手记:从提 Issue 到合入主干的完整旅程
开源·issue
喵个咪1 天前
RushWind Admin — 用 Rust 写的企业级中后台,开源了
后端·rust·开源