2026 年 8 月 3 日,MiniMax 正式开源新一代通用视频模型 MiniMax H3。这是一款面向"开放通用智能"的全模态生成系统:统一理解文本、图像、视频、音频组成的多模态上下文,直接生成最高 2K 分辨率、最长 15 秒、自带原生立体声音频的视频。本文从架构、能力、上手方式三个角度快速拆解。
一、它到底是什么?
MiniMax H3 不是传统的"文生视频模型",而是一个"全模态"生成系统。它接收的输入可以是:纯文本(文生视频)、一张首帧图、一张尾帧图、首尾帧组合,甚至最多 9 张参考图 + 3 段参考视频 + 3 段参考音频的混合输入。
输出规格同样硬核:
-
时长 4~15 秒
-
宽高比覆盖 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16
-
默认 768p,配合 H3-Regenerate-2K 可生成 2K 分辨率
-
24 FPS,32 kHz 原生立体声音频
-
稳定支持 11 种语言
二、系统由三块拼成
完整的 H3 系统包含三个模块:
-
H3-Context-IR:一套托管式预处理编排系统,负责把复杂的多模态输入"翻译"成模型更容易理解的结构化表示。由于依赖多阶段工作流和多个托管模型,这部分不开源,但官方提供了 API,也给出了提示词指南供开发者自建。
-
H3-Base:真正开源的生成核心,一个 33B 参数的 dense single-stream Transformer,直接联合预测视频 latent 和音频 latent,再分别解码成画面与立体声。
-
H3-Regenerate-2K:不走传统超分模块,而是用 H3 基础模型对 768p 结果"in-context 再生成",从而复用原始上下文里的小文字、精细细节等信息。目前尚未开源,官方 API 可复现完整流程。
三、架构上几个亮点
-
统一编码:文本用 H3-Encoder(基于 Qwen3-VL-32B 预训练权重)、视觉用 H3-Encoder + H3-VisualVAE(f16t4d24,空间压缩 16 倍、时间压缩 4 倍)、音频用 H3-AudioVAE(32kHz 压到 40Hz latent),全部拼成一个 packed multimodal sequence 喂给 Transformer。
-
三维位置编码:使用 MM-RoPE 表达 (t, h, w) 时间与空间位置关系,没有 modality-specific 的 attention/FFN 结构,模态差异只体现在 input/output 层和 AdaLN 分支,这让模型更简洁、可扩展。
-
原生稀疏注意力:训练末期引入,能显著降低长序列计算开销(首版开源仅提供全注意力推理,稀疏版本后续更新发布)。
四、怎么上手?
H3-Base 以 task-specific checkpoint 形式发布(FL2VA 与 Ref2VA),每个都是 self-contained 的 Hugging Face 模型仓库,含 processor、tokenizer、text encoder、Omni Transformer、Visual VAE、Audio VAE。支持 SGLang、vLLM、diffusers、ComfyUI 等主流推理框架,官方还提供了 T2VA / FL2VA / Ref2VA 三类可复现的 768p 音视频生成案例。
五、一个不得不说的趋势
MiniMax H3 的发布,标志着视频生成正从"文生视频"走向"全模态生成"。而且它背后体现的"以任务泛化为导向"的设计哲学,恰好和 AI 编程领域的新一代 Agent 思路殊途同归------把复杂的真实需求交给一个能统一理解上下文的系统去完成,而不是让它死板地执行单一指令。