MiniMax H3 开源视频模型实操:ComfyUI 文生视频工作流详解

MiniMax H3 是由稀宇科技(MiniMax)于2026年7月31日正式发布,并于8月3日全面开源的一款通用全模态视频生成模型。它打破了传统单一模态的处理框架,能够统一理解文本、图像、视频及音频输入,并输出具备原生双声道立体声的高清音视频内容。

MiniMax H3 的核心优势:

业界顶尖的生成与编辑性能

H3 是首个综合能力达到闭源头部水准的开源视频模型。在权威的 Artificial Analysis 视频模型榜单中,H3 的视频编辑能力以 1130 的 Elo 评分位列全球第一,超越了此前的榜首;在带音文生视频和图生视频榜单中均位居全球第二,与闭源旗舰模型处于同一梯队。

原生音视频联合生成

H3 支持原生双声道立体声(32kHz采样率)输出,最长可连续生成15秒的高清视频。其音画联合生成能力极佳,角色口型能与台词严丝合缝地对齐,环境音效与背景音乐也会根据提示词自动匹配,省去了繁琐的后期配音与校准步骤。

1.极致的性价比与成本优势

通过自研的高压缩率 Tokenizer(H3-VAE)及异构训练优化,H3 大幅降低了推理成本。其 2K 分辨率视频生成价格仅为 0.8元/秒,不到业内同类旗舰模型价格的三分之一;768P 分辨率的成本优势更为显著。

2.强大的全模态参考与精细编辑

H3 提供了极其丰富的输入模式,支持最多 12 个多模态素材混合输入(如9张图、3段视频、3段音频)。创作者可以通过自然语言描述复杂关系,实现参考图生视频、视频续写、动作迁移(V2V Motion Transfer)以及视频精细编辑。在指令遵循、文字与品牌信息呈现上表现尤为精准。

3. 极低的本地部署门槛与广泛的生态适配

H3 开源后迅速获得了国内外生态的广泛支持。在算力层,开源24小时内即完成了对华为昇腾、AMD、Intel等主流芯片的适配。在本地部署方面,社区实测仅需 12GB 显存的消费级显卡(如 RTX 3060)即可运行 480P 到 720P 的视频生成。此外,H3 已全面接入 ComfyUI、Hugging Face 等主流开发社区和工作流。

4.原生支持超长视频拼接

虽然单次生成上限为15秒,但社区已摸索出成熟的滑动窗口续写方案。通过将上一段视频的尾部帧作为参考回传,并绑定同一目标主体参考图,可以将原生窗口无缝拼接延长至 60秒以上,且能保持人物和场景的高度一致性。

实操步骤

一、登录矩池云AI功能岛,一键启动"MiniMax H3",如果在市场选择镜像的话,请选择17区A100显卡
二、复制UI链接,进入comfyUI界面
三、点击模版页面,进入视频模板选择,可以看到"MiniMax H3"的三个功能,图生视频,文生视频,参考视频
四、以文生视频为例

参数解析:

4.1 核心生成节点:Image to Video (MiniMax H3)

输入参数

  • first_frame (首帧): 视频生成的起始图像接口。

  • last_frame (尾帧): 视频生成的结束图像接口(当前未连接,意味着模型主要根据首帧和提示词自由发挥后续内容)。

  • width / height (宽/高): 决定输出视频的分辨率,这两个端口连接到了左侧的"分辨率选择器"。

提示词区域

这是该节点最关键的部分,输入了一段非常专业、结构化的导演级提示词。这种写法比简单的关键词堆砌更能控制长视频的叙事节奏。

  • 风格定义: Realistic live-action cinematic look(写实真人电影感), anamorphic lens(变形宽银幕镜头), shallow depth of field(浅景深), film grain(胶片颗粒)。这奠定了视频的视觉基调。

  • 场景概述: 描述了黄昏时分,主角在摩天大楼屋顶被追逐、跳跃逃生的动作场面。

  • 分镜脚本: 规划了5秒内的4个镜头:

    • [0s-1.5s] Shot 1: 高角度侧拍,主角冲刺。

    • [1s-2.5s] Shot 2: 跨越楼宇间隙的跳跃,带有轻微慢动作。

    • [2.5s-4s] Shot 3: 落地翻滚起身,低角度拍摄。

    • [4s-5s] Shot 4: 再次起跳前的剪影定格。

  • 运镜与音频: 明确要求硬切,无溶解转场;音频需包含风声、脚步声和城市环境音。

技术参数

  • duration: 5.0,设定生成视频时长为5秒。

  • noise_seed: 1119071711421241,随机种子,用于固定生成结果以便复现。

  • 模型文件:

    • unet_name: minimax_h3_f12va_pruned_int8_convrot.safetensors(经过量化优化的主模型)。

    • clip_name: qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(负责理解文本的视觉语言模型)。

    • vae_name: minimax_h3_video_vae_fp16.safetensors(视频解码器)。

    • audio_vae: minimax_h3_audio_vae_fp32.safetensors(音频解码器,说明该工作流会同时生成配套音效)。

4.2 辅助控制节点:分辨率选择器

位于中间左侧的节点,用于动态控制输出尺寸。

  • 宽高比: 设置为 16:9 (Widescreen)

  • 百万像素: 设置为 0.4。这意味着目标分辨率约为40万像素。

  • 倍数: 32。这是为了保证输出的宽高能被32整除,符合模型计算的数学要求。

  • 输出: 该节点计算出的具体宽度和高度数值,通过连线传输给了主节点的 widthheight 端口。

4.3 参考信息节点:Note: Size Settings Reference

左下角的黑色表格节点,这是一个纯文本备注,不参与运算,但为"分辨率选择器"的设置提供了依据。

  • 它列出了不同百万像素数对应的具体分辨率(例如 0.4 MP 对应 864 x 480)。

  • 在设置上方的选择器时,参考了这个表格来决定具体的清晰度档位。

生成结果:

MiniMax_H3_00011

相关推荐
thesky1234563 天前
智能体面试准备(二十五):多模态 Agent——图文、语音、视频输入的感知融合与决策
视频·语音·智能体·视觉理解·多模态agent·跨模态对齐·具身
桐桐桐7 天前
视频画面裁剪与尺寸压缩实战:ffmpeg crop/scale 用法与在线替代
ffmpeg·音视频·视频
星花月8 天前
视频压缩为什么会变糊?从码率、分辨率到 H.264/H.265 的参数选择指南
ffmpeg·音视频·h.265·视频编解码·视频
dongge1013 天前
018 ADAT接口
网络·音视频·硬件工程·视频
机器学习是魔鬼14 天前
TRL微调实战教程
云计算·矩池云
MindUp15 天前
基于AI语义解析与多维特征检索的视频素材管理方案对比
人工智能·视频
Yeauty16 天前
2026 年在 Rust 里处理音视频,该走哪条路?
rust·ffmpeg·音视频·视频
Yeauty21 天前
用 Whisper 转录前,你不用再离开 Rust
开发语言·rust·ffmpeg·音视频·视频
蝉蜕日记25 天前
视频压缩 v1.1.31:高效压缩,无损画质,释放存储空间
音视频·生活·视频编解码·视频·软件需求