发布日期:2026-08-10 | 适用版本:ComfyUI 0.30.0+ | 话题:MiniMax H3 · ComfyUI 视频生成 · AI 视频工作流
MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的全模态视频生成模型,开放权重,能在同一上下文中同时接收文本、最多 9 张图片、3 段视频和 3 段音频作为输入,输出最高 2K 分辨率、最长 15 秒的带原生立体声音频视频,人声、音效和音乐在单次前向传播中一并生成,无需后期叠加;在 ComfyUI 中有两条接入路径------通过七牛云 MaaS 调 API(无需本地 GPU)或下载开放权重本地运行,覆盖文生视频、图生视频、参考生视频三种工作流模式。

MiniMax H3 能生成什么
在视频生成模型里,H3 的差异点在于真正的全模态输入------不是单纯的"文生视频"或"图生视频",而是能把图片、视频片段、音频素材混合给进去,让模型理解它们之间的关系后再生成。
几个关键参数:
- 输出规格:最高 2K 分辨率,24fps,单次最长 15 秒
- 原生音频:不是后期配音,是模型生成视频时直接合成立体声(对白 + 音效 + 背景音乐)
- 文本编码器:Qwen3VL 32B(量化为 nvfp4_awq),具备强大的多语言和视觉理解能力
- 三种生成模式:文生视频(T2V)、首尾帧生视频(FLF2V)、参考生视频(R2V)
模型以 int8 量化权重(pruned_int8_convrot 格式)开放,本地部署显存要求较高;如果不想买 GPU,走 API 调用是更省心的选择。
两条接入路径对比
| 维度 | API 模式(推荐) | 本地权重模式 |
|---|---|---|
| 硬件要求 | 无,计算在云端 | 高显存 GPU(Qwen3VL 32B 编码器体量大) |
| 上手难度 | 低,导入工作流模板即可 | 需下载多个权重文件并手动配置节点 |
| 费用结构 | 按视频秒数计费 | 一次下载,本地电费 |
| 网络依赖 | 是 | 下载后离线可运行 |
| 适合场景 | 快速验证、小批量生成 | 大批量生产、需要完全控制 |
方式一:API 模式(零 GPU,七牛云 MaaS 接入)
第一步:获取 API Key
在七牛云 MaaS 平台(sufy.com)注册账户,进入 AI 推理服务,找到 MiniMax-H3 模型(模型 ID:minimax/minimax-h3),在账户中生成 API Key。
平台价格(人民币计费):
| 计费类型 | 单价 |
|---|---|
| 视频输出(2K) | ¥0.80 / 秒 |
| 视频输入(2K 输出) | ¥0.80 / 秒 |
| 视频输出(768P) | ¥0.50 / 秒 |
| 视频输入(768P 输出) | ¥0.50 / 秒 |
| 图片输入 | ¥0.20 / 张 |
以一条 10 秒 768P 视频为例,视频输出费用约 ¥5。
第二步:在 ComfyUI 中导入工作流模板
打开 ComfyUI(确保版本 ≥ 0.30.0),在模板库搜索以下关键词,导入对应 JSON:
| 生成模式 | 模板搜索词 |
|---|---|
| 文生视频 | MiniMax H3 T2V |
| 首尾帧生视频 | MiniMax H3 FLF2V |
| 参考生视频 | MiniMax H3 R2V |
也可直接从 Comfy-Org 的 GitHub 仓库下载对应 JSON 文件拖入导入。
第三步:填入 API Key,运行生成
在工作流的 API Key 节点填入从 sufy.com 获取的 Key,配置提示词和参数,点击运行即可。生成在云端完成,本地只收返回的视频文件。
方式二:本地权重模式
本地模式要求 ComfyUI 最低 0.30.0 版本,否则 MiniMax H3 的原生节点不可用。
需要下载的权重文件
从 Hugging Face Comfy-Org/MiniMax-H3 仓库下载,放入对应目录:
ComfyUI/
├── models/
│ ├── diffusion_models/
│ │ └── minimax_h3_fl2va_pruned_int8_convrot.safetensors # T2V/I2V 用
│ │ └── minimax_h3_ref2va_pruned_int8_convrot.safetensors # R2V 用(与上面二选一)
│ ├── text_encoders/
│ │ └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│ └── vae/
│ ├── minimax_h3_video_vae_fp16.safetensors
│ └── minimax_h3_audio_vae_fp32.safetensors
注意:R2V 模式(参考生视频)使用 ref2va 扩散模型,与 T2V/I2V 使用的 fl2va 不同,需单独下载;文本编码器和 VAE 两种模式共用。
核心节点说明
| ComfyUI 节点名 | 对应功能 |
|---|---|
MiniMaxH3TextToVideo |
文生视频 |
MiniMaxH3ImageToVideo |
图生视频(支持首帧 / 尾帧输入) |
MiniMaxH3ReferenceToVideo |
参考驱动生成 |
Resolution Selector |
选择宽高比和分辨率 |
Patch Sage Attention KJ |
可选,需 KJNodes 插件,加速推理 |

三种生成模式详解
文生视频(T2V)
最简单的模式,一段提示词出一段视频。提示词建议按"整体场景 → 分镜头描述 → 音频期望"的结构写,H3 会根据对音频的描述自动合成立体声。
宽高比预设:16:9(横屏)、9:16(竖屏)、1:1,时长 5--15 秒可调,分辨率最高 2K。
首尾帧生视频(FLF2V)
给定首帧图片(必填)和尾帧图片(可选),让模型补全中间的运动过程。
图片尺寸限制:宽高均在 256--5760 px 之间,宽高比在 2:5 到 5:2 之间;两帧需保持一致的宽高比,否则会强制裁切。
参考生视频(R2V)
最强大也最复杂的模式,可以混合多个视觉和音频参考源,让模型理解它们之间的关系后生成新视频。
输入上限:
- 参考图片:最多 9 张
- 参考视频:最多 3 段(每段 2--15 秒,总长 ≤15 秒,帧率需在 23.976--60 FPS 之间)
- 参考音频:最多 3 段(总长 ≤15 秒,至少需要搭配一张图片或一段视频)
提示词中引用参考素材的格式:
<Picture 1> 是主角,穿蓝色上衣,表情自然。
<Video 1> 展示她的走路姿态,需要保持这个运动节奏。
<Audio 1> 是背景音乐,整个视频延续这个风格。
镜头从她的正面缓慢推进,伴随轻微脚步声。
编号严格对应节点连接顺序,从 1 开始,不可跳号。
提示词写作要点
H3 的音频生成质量高度依赖提示词中对声音的描述,很多人忽略这一点导致输出音频平淡。建议每段视频的提示词包含三类声音描述:
- 对白或人声:说了什么、语气、情绪
- 环境音效:场景中应有的自然声音
- 背景音乐:风格、节奏、情绪基调
分辨率设置:短边建议 768px,推荐全质量设置在 16:9 比例下约 100 万像素(1344×768),分辨率数值须为 32 的倍数。
时长注意:H3 的时长参数会吸附到模型内部的帧块网格(24fps 下每块 17 帧),填入的秒数会自动取最近的有效值,不是所有整数秒都有效。
常见问题
Q:ComfyUI 用了 API 模式,生成结果保存在哪里?
API 模式下生成在 MiniMax 的云端服务器执行,结果以视频文件形式返回到本地 ComfyUI 的输出目录,与本地生成结果存放路径相同。
Q:本地模式至少需要多大显存?
官方文档未给出明确数值,但文本编码器 Qwen3VL 32B(量化为 nvfp4_awq)体量较大,加上扩散模型和两个 VAE,建议至少 24GB 显存,实际需求以社区测试为准。目前已有 RTX 4080(16GB)搭配 int8 量化权重运行的案例,但需要启用显存优化选项。
Q:通过七牛云 MaaS 调 API,模型 ID 怎么填?
在 API 请求中,model 字段填 minimax/minimax-h3,接口端点参考 sufy.com 的接入文档(apidocs.qnaigc.com)。
Q:R2V 模式的参考视频需要什么格式?
帧率在 23.976--60 FPS 之间,单段时长 2--15 秒,三段合计不超过 15 秒。格式建议 mp4,分辨率建议与目标输出分辨率接近。
小结
MiniMax H3 是目前少数真正实现"输入什么模态都能理解、输出带原生音频"的开放权重视频生成模型。ComfyUI 提供了两条接入路径:API 模式适合快速出片,不需要本地 GPU,通过七牛云 MaaS 按秒计费,门槛极低;本地权重模式适合需要完全控制的场景,但对硬件要求较高。三种生成模式中,R2V 的多参考融合能力是 H3 最有价值的差异化功能,值得重点探索。
本文数据基于 MiniMax 2026 年 7 月 31 日发布的模型权重和 ComfyUI 0.30.0 版本,如遇界面差异以官方最新文档为准。
延伸阅读
- ComfyUI 官方 MiniMax H3 工作流文档:https://docs.comfy.org/zh/tutorials/video/minimax/minimax-h3
- MiniMax H3 官方发布博客:https://www.minimaxi.com/blog/minimax-h3
- MaaS 模型广场(含 MiniMax-H3 接入信息):https://sufy.com/zh-CN/services/ai-inference/models
- ComfyUI 节点权重下载仓库:https://huggingface.co/Comfy-Org/MiniMax-H3