ComfyUI + MiniMax H3 实战教程:全模态视频生成,API 和本地两种玩法

发布日期:2026-08-10 | 适用版本:ComfyUI 0.30.0+ | 话题:MiniMax H3 · ComfyUI 视频生成 · AI 视频工作流

MiniMax H3 是 MiniMax 于 2026 年 7 月 31 日发布的全模态视频生成模型,开放权重,能在同一上下文中同时接收文本、最多 9 张图片、3 段视频和 3 段音频作为输入,输出最高 2K 分辨率、最长 15 秒的带原生立体声音频视频,人声、音效和音乐在单次前向传播中一并生成,无需后期叠加;在 ComfyUI 中有两条接入路径------通过七牛云 MaaS 调 API(无需本地 GPU)或下载开放权重本地运行,覆盖文生视频、图生视频、参考生视频三种工作流模式。


MiniMax H3 能生成什么

在视频生成模型里,H3 的差异点在于真正的全模态输入------不是单纯的"文生视频"或"图生视频",而是能把图片、视频片段、音频素材混合给进去,让模型理解它们之间的关系后再生成。

几个关键参数:

  • 输出规格:最高 2K 分辨率,24fps,单次最长 15 秒
  • 原生音频:不是后期配音,是模型生成视频时直接合成立体声(对白 + 音效 + 背景音乐)
  • 文本编码器:Qwen3VL 32B(量化为 nvfp4_awq),具备强大的多语言和视觉理解能力
  • 三种生成模式:文生视频(T2V)、首尾帧生视频(FLF2V)、参考生视频(R2V)

模型以 int8 量化权重(pruned_int8_convrot 格式)开放,本地部署显存要求较高;如果不想买 GPU,走 API 调用是更省心的选择。


两条接入路径对比

维度 API 模式(推荐) 本地权重模式
硬件要求 无,计算在云端 高显存 GPU(Qwen3VL 32B 编码器体量大)
上手难度 低,导入工作流模板即可 需下载多个权重文件并手动配置节点
费用结构 按视频秒数计费 一次下载,本地电费
网络依赖 下载后离线可运行
适合场景 快速验证、小批量生成 大批量生产、需要完全控制

方式一:API 模式(零 GPU,七牛云 MaaS 接入)

第一步:获取 API Key

在七牛云 MaaS 平台(sufy.com)注册账户,进入 AI 推理服务,找到 MiniMax-H3 模型(模型 ID:minimax/minimax-h3),在账户中生成 API Key。

平台价格(人民币计费):

计费类型 单价
视频输出(2K) ¥0.80 / 秒
视频输入(2K 输出) ¥0.80 / 秒
视频输出(768P) ¥0.50 / 秒
视频输入(768P 输出) ¥0.50 / 秒
图片输入 ¥0.20 / 张

以一条 10 秒 768P 视频为例,视频输出费用约 ¥5。

第二步:在 ComfyUI 中导入工作流模板

打开 ComfyUI(确保版本 ≥ 0.30.0),在模板库搜索以下关键词,导入对应 JSON:

生成模式 模板搜索词
文生视频 MiniMax H3 T2V
首尾帧生视频 MiniMax H3 FLF2V
参考生视频 MiniMax H3 R2V

也可直接从 Comfy-Org 的 GitHub 仓库下载对应 JSON 文件拖入导入。

第三步:填入 API Key,运行生成

在工作流的 API Key 节点填入从 sufy.com 获取的 Key,配置提示词和参数,点击运行即可。生成在云端完成,本地只收返回的视频文件。


方式二:本地权重模式

本地模式要求 ComfyUI 最低 0.30.0 版本,否则 MiniMax H3 的原生节点不可用。

需要下载的权重文件

从 Hugging Face Comfy-Org/MiniMax-H3 仓库下载,放入对应目录:

复制代码
ComfyUI/
├── models/
│   ├── diffusion_models/
│   │   └── minimax_h3_fl2va_pruned_int8_convrot.safetensors   # T2V/I2V 用
│   │   └── minimax_h3_ref2va_pruned_int8_convrot.safetensors  # R2V 用(与上面二选一)
│   ├── text_encoders/
│   │   └── qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
│   └── vae/
│       ├── minimax_h3_video_vae_fp16.safetensors
│       └── minimax_h3_audio_vae_fp32.safetensors

注意:R2V 模式(参考生视频)使用 ref2va 扩散模型,与 T2V/I2V 使用的 fl2va 不同,需单独下载;文本编码器和 VAE 两种模式共用。

核心节点说明

ComfyUI 节点名 对应功能
MiniMaxH3TextToVideo 文生视频
MiniMaxH3ImageToVideo 图生视频(支持首帧 / 尾帧输入)
MiniMaxH3ReferenceToVideo 参考驱动生成
Resolution Selector 选择宽高比和分辨率
Patch Sage Attention KJ 可选,需 KJNodes 插件,加速推理

三种生成模式详解

文生视频(T2V)

最简单的模式,一段提示词出一段视频。提示词建议按"整体场景 → 分镜头描述 → 音频期望"的结构写,H3 会根据对音频的描述自动合成立体声。

宽高比预设:16:9(横屏)、9:16(竖屏)、1:1,时长 5--15 秒可调,分辨率最高 2K。

首尾帧生视频(FLF2V)

给定首帧图片(必填)和尾帧图片(可选),让模型补全中间的运动过程。

图片尺寸限制:宽高均在 256--5760 px 之间,宽高比在 2:5 到 5:2 之间;两帧需保持一致的宽高比,否则会强制裁切。

参考生视频(R2V)

最强大也最复杂的模式,可以混合多个视觉和音频参考源,让模型理解它们之间的关系后生成新视频。

输入上限:

  • 参考图片:最多 9 张
  • 参考视频:最多 3 段(每段 2--15 秒,总长 ≤15 秒,帧率需在 23.976--60 FPS 之间)
  • 参考音频:最多 3 段(总长 ≤15 秒,至少需要搭配一张图片或一段视频)

提示词中引用参考素材的格式:

复制代码
<Picture 1> 是主角,穿蓝色上衣,表情自然。
<Video 1> 展示她的走路姿态,需要保持这个运动节奏。
<Audio 1> 是背景音乐,整个视频延续这个风格。
镜头从她的正面缓慢推进,伴随轻微脚步声。

编号严格对应节点连接顺序,从 1 开始,不可跳号。


提示词写作要点

H3 的音频生成质量高度依赖提示词中对声音的描述,很多人忽略这一点导致输出音频平淡。建议每段视频的提示词包含三类声音描述:

  1. 对白或人声:说了什么、语气、情绪
  2. 环境音效:场景中应有的自然声音
  3. 背景音乐:风格、节奏、情绪基调

分辨率设置:短边建议 768px,推荐全质量设置在 16:9 比例下约 100 万像素(1344×768),分辨率数值须为 32 的倍数。

时长注意:H3 的时长参数会吸附到模型内部的帧块网格(24fps 下每块 17 帧),填入的秒数会自动取最近的有效值,不是所有整数秒都有效。


常见问题

Q:ComfyUI 用了 API 模式,生成结果保存在哪里?

API 模式下生成在 MiniMax 的云端服务器执行,结果以视频文件形式返回到本地 ComfyUI 的输出目录,与本地生成结果存放路径相同。

Q:本地模式至少需要多大显存?

官方文档未给出明确数值,但文本编码器 Qwen3VL 32B(量化为 nvfp4_awq)体量较大,加上扩散模型和两个 VAE,建议至少 24GB 显存,实际需求以社区测试为准。目前已有 RTX 4080(16GB)搭配 int8 量化权重运行的案例,但需要启用显存优化选项。

Q:通过七牛云 MaaS 调 API,模型 ID 怎么填?

在 API 请求中,model 字段填 minimax/minimax-h3,接口端点参考 sufy.com 的接入文档(apidocs.qnaigc.com)。

Q:R2V 模式的参考视频需要什么格式?

帧率在 23.976--60 FPS 之间,单段时长 2--15 秒,三段合计不超过 15 秒。格式建议 mp4,分辨率建议与目标输出分辨率接近。


小结

MiniMax H3 是目前少数真正实现"输入什么模态都能理解、输出带原生音频"的开放权重视频生成模型。ComfyUI 提供了两条接入路径:API 模式适合快速出片,不需要本地 GPU,通过七牛云 MaaS 按秒计费,门槛极低;本地权重模式适合需要完全控制的场景,但对硬件要求较高。三种生成模式中,R2V 的多参考融合能力是 H3 最有价值的差异化功能,值得重点探索。

本文数据基于 MiniMax 2026 年 7 月 31 日发布的模型权重和 ComfyUI 0.30.0 版本,如遇界面差异以官方最新文档为准。


延伸阅读

相关推荐
资深电气设计1 小时前
800V直流断路器选型指南:ABB电气产品技术解析
人工智能·科技·创业创新·业界资讯
梦想的旅途21 小时前
企业微信API二次开发:接入 AI 大模型实现外部群智能问答
人工智能·自动化·二次开发·企业微信
碧口科技1 小时前
湿地鸟类监测设备选型指南:复杂环境下的智能识别系统怎么选?
人工智能
2601_949499941 小时前
硬件工程师实操:芯瑞科技两款 400G 高速互联方案参数、场景、选型全解析
大数据·运维·人工智能·科技·光模块
极昆仑智慧1 小时前
智能问数五级成熟度模型:从“能问“到“能协作“的演进路径
人工智能·语言模型·数据分析
火云牌神1 小时前
如何用项目规则给 AI 划定编码边界
人工智能·系统架构·ai编程·vibecoding
优氙费控1 小时前
报销审核效率低?AI费用审核正在改变财务工作方式
大数据·人工智能
云边云科技_云网融合2 小时前
金融医疗混合云组网如何满足数据安全与合规要求?
大数据·人工智能·物联网
开开心心就好2 小时前
视频播放器完美解码集成三款播放器切换使用
前端·人工智能·智能手机·电脑·音视频·virtualenv·pygame
hzcj8882 小时前
汇正财经:出海数据向好,创新药热度高
大数据·人工智能