MiniMax H3 是由稀宇科技(MiniMax)于2026年7月31日正式发布,并于8月3日全面开源的一款通用全模态视频生成模型。它打破了传统单一模态的处理框架,能够统一理解文本、图像、视频及音频输入,并输出具备原生双声道立体声的高清音视频内容。
MiniMax H3 的核心优势:
业界顶尖的生成与编辑性能
H3 是首个综合能力达到闭源头部水准的开源视频模型。在权威的 Artificial Analysis 视频模型榜单中,H3 的视频编辑能力以 1130 的 Elo 评分位列全球第一,超越了此前的榜首;在带音文生视频和图生视频榜单中均位居全球第二,与闭源旗舰模型处于同一梯队。
原生音视频联合生成
H3 支持原生双声道立体声(32kHz采样率)输出,最长可连续生成15秒的高清视频。其音画联合生成能力极佳,角色口型能与台词严丝合缝地对齐,环境音效与背景音乐也会根据提示词自动匹配,省去了繁琐的后期配音与校准步骤。
1.极致的性价比与成本优势
通过自研的高压缩率 Tokenizer(H3-VAE)及异构训练优化,H3 大幅降低了推理成本。其 2K 分辨率视频生成价格仅为 0.8元/秒,不到业内同类旗舰模型价格的三分之一;768P 分辨率的成本优势更为显著。
2.强大的全模态参考与精细编辑
H3 提供了极其丰富的输入模式,支持最多 12 个多模态素材混合输入(如9张图、3段视频、3段音频)。创作者可以通过自然语言描述复杂关系,实现参考图生视频、视频续写、动作迁移(V2V Motion Transfer)以及视频精细编辑。在指令遵循、文字与品牌信息呈现上表现尤为精准。
3. 极低的本地部署门槛与广泛的生态适配
H3 开源后迅速获得了国内外生态的广泛支持。在算力层,开源24小时内即完成了对华为昇腾、AMD、Intel等主流芯片的适配。在本地部署方面,社区实测仅需 12GB 显存的消费级显卡(如 RTX 3060)即可运行 480P 到 720P 的视频生成。此外,H3 已全面接入 ComfyUI、Hugging Face 等主流开发社区和工作流。
4.原生支持超长视频拼接
虽然单次生成上限为15秒,但社区已摸索出成熟的滑动窗口续写方案。通过将上一段视频的尾部帧作为参考回传,并绑定同一目标主体参考图,可以将原生窗口无缝拼接延长至 60秒以上,且能保持人物和场景的高度一致性。
实操步骤
一、登录矩池云AI功能岛,一键启动"MiniMax H3",如果在市场选择镜像的话,请选择17区A100显卡

二、复制UI链接,进入comfyUI界面
三、点击模版页面,进入视频模板选择,可以看到"MiniMax H3"的三个功能,图生视频,文生视频,参考视频

四、以文生视频为例

参数解析:
4.1 核心生成节点:Image to Video (MiniMax H3)
输入参数
-
first_frame (首帧): 视频生成的起始图像接口。
-
last_frame (尾帧): 视频生成的结束图像接口(当前未连接,意味着模型主要根据首帧和提示词自由发挥后续内容)。
-
width / height (宽/高): 决定输出视频的分辨率,这两个端口连接到了左侧的"分辨率选择器"。
提示词区域
这是该节点最关键的部分,输入了一段非常专业、结构化的导演级提示词。这种写法比简单的关键词堆砌更能控制长视频的叙事节奏。
-
风格定义:
Realistic live-action cinematic look(写实真人电影感),anamorphic lens(变形宽银幕镜头),shallow depth of field(浅景深),film grain(胶片颗粒)。这奠定了视频的视觉基调。 -
场景概述: 描述了黄昏时分,主角在摩天大楼屋顶被追逐、跳跃逃生的动作场面。
-
分镜脚本: 规划了5秒内的4个镜头:
-
[0s-1.5s] Shot 1: 高角度侧拍,主角冲刺。 -
[1s-2.5s] Shot 2: 跨越楼宇间隙的跳跃,带有轻微慢动作。 -
[2.5s-4s] Shot 3: 落地翻滚起身,低角度拍摄。 -
[4s-5s] Shot 4: 再次起跳前的剪影定格。
-
-
运镜与音频: 明确要求硬切,无溶解转场;音频需包含风声、脚步声和城市环境音。
技术参数
-
duration:
5.0,设定生成视频时长为5秒。 -
noise_seed:
1119071711421241,随机种子,用于固定生成结果以便复现。 -
模型文件:
-
unet_name:minimax_h3_f12va_pruned_int8_convrot.safetensors(经过量化优化的主模型)。 -
clip_name:qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(负责理解文本的视觉语言模型)。 -
vae_name:minimax_h3_video_vae_fp16.safetensors(视频解码器)。 -
audio_vae:minimax_h3_audio_vae_fp32.safetensors(音频解码器,说明该工作流会同时生成配套音效)。
-
4.2 辅助控制节点:分辨率选择器
位于中间左侧的节点,用于动态控制输出尺寸。
-
宽高比: 设置为
16:9 (Widescreen)。 -
百万像素: 设置为
0.4。这意味着目标分辨率约为40万像素。 -
倍数:
32。这是为了保证输出的宽高能被32整除,符合模型计算的数学要求。 -
输出: 该节点计算出的具体宽度和高度数值,通过连线传输给了主节点的
width和height端口。
4.3 参考信息节点:Note: Size Settings Reference
左下角的黑色表格节点,这是一个纯文本备注,不参与运算,但为"分辨率选择器"的设置提供了依据。
-
它列出了不同百万像素数对应的具体分辨率(例如 0.4 MP 对应 864 x 480)。
-
在设置上方的选择器时,参考了这个表格来决定具体的清晰度档位。
生成结果:
MiniMax_H3_00011

