MiniMax H3 正式开源!统一全模态视频生成,2K+15秒+原生立体声,一文看懂架构与玩法

2026 年 8 月 3 日,MiniMax 正式开源新一代通用视频模型 MiniMax H3。这是一款面向"开放通用智能"的全模态生成系统:统一理解文本、图像、视频、音频组成的多模态上下文,直接生成最高 2K 分辨率、最长 15 秒、自带原生立体声音频的视频。本文从架构、能力、上手方式三个角度快速拆解。

一、它到底是什么?

MiniMax H3 不是传统的"文生视频模型",而是一个"全模态"生成系统。它接收的输入可以是:纯文本(文生视频)、一张首帧图、一张尾帧图、首尾帧组合,甚至最多 9 张参考图 + 3 段参考视频 + 3 段参考音频的混合输入。

输出规格同样硬核:

  • 时长 4~15 秒

  • 宽高比覆盖 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16

  • 默认 768p,配合 H3-Regenerate-2K 可生成 2K 分辨率

  • 24 FPS,32 kHz 原生立体声音频

  • 稳定支持 11 种语言

二、系统由三块拼成

完整的 H3 系统包含三个模块:

  1. H3-Context-IR:一套托管式预处理编排系统,负责把复杂的多模态输入"翻译"成模型更容易理解的结构化表示。由于依赖多阶段工作流和多个托管模型,这部分不开源,但官方提供了 API,也给出了提示词指南供开发者自建。

  2. H3-Base:真正开源的生成核心,一个 33B 参数的 dense single-stream Transformer,直接联合预测视频 latent 和音频 latent,再分别解码成画面与立体声。

  3. H3-Regenerate-2K:不走传统超分模块,而是用 H3 基础模型对 768p 结果"in-context 再生成",从而复用原始上下文里的小文字、精细细节等信息。目前尚未开源,官方 API 可复现完整流程。

三、架构上几个亮点

  • 统一编码:文本用 H3-Encoder(基于 Qwen3-VL-32B 预训练权重)、视觉用 H3-Encoder + H3-VisualVAE(f16t4d24,空间压缩 16 倍、时间压缩 4 倍)、音频用 H3-AudioVAE(32kHz 压到 40Hz latent),全部拼成一个 packed multimodal sequence 喂给 Transformer。

  • 三维位置编码:使用 MM-RoPE 表达 (t, h, w) 时间与空间位置关系,没有 modality-specific 的 attention/FFN 结构,模态差异只体现在 input/output 层和 AdaLN 分支,这让模型更简洁、可扩展。

  • 原生稀疏注意力:训练末期引入,能显著降低长序列计算开销(首版开源仅提供全注意力推理,稀疏版本后续更新发布)。

四、怎么上手?

H3-Base 以 task-specific checkpoint 形式发布(FL2VA 与 Ref2VA),每个都是 self-contained 的 Hugging Face 模型仓库,含 processor、tokenizer、text encoder、Omni Transformer、Visual VAE、Audio VAE。支持 SGLang、vLLM、diffusers、ComfyUI 等主流推理框架,官方还提供了 T2VA / FL2VA / Ref2VA 三类可复现的 768p 音视频生成案例。

五、一个不得不说的趋势

MiniMax H3 的发布,标志着视频生成正从"文生视频"走向"全模态生成"。而且它背后体现的"以任务泛化为导向"的设计哲学,恰好和 AI 编程领域的新一代 Agent 思路殊途同归------把复杂的真实需求交给一个能统一理解上下文的系统去完成,而不是让它死板地执行单一指令。

相关推荐
m0_6145235520 小时前
完整教程|输入一句描述,能不能直接生成一段可以继续剪辑的视频:写结构化描述到生成短样片
人工智能·音视频
揽秀亭长1 天前
视频转文字工具对比:从字幕生成到文本整理
人工智能·音视频
cuijiecheng20181 天前
ZLMediaKit 已返回 SDP,浏览器仍然无视频画面问题排查记录
音视频
YWamy1 天前
远程医疗音视频系统技术选型与全场景落地架构
架构·音视频
Agudamu11611 天前
B站学习视频怎么变笔记:用 Ai好记 + Obsidian 搭建个人知识库的完整教程
人工智能·笔记·学习·音视频
2601_962304911 天前
2026年健康科普视频怎么制作:一条开源工具链从全手动到半自动的工程复盘
开源·音视频
举个栗子。1 天前
OpenMontage:首个开源的 Agent 化视频制作系统,用自然语言一键出品影片
开源·音视频
小柯南敲键盘1 天前
跨马翻译批量图片视频字幕翻译,跨境电商AI智能抠图一站式工具
人工智能·python·音视频·xcode
searchforAI1 天前
AI自动总结YouTube视频:英文内容一键总结、智能时间戳、视频重点快速看
人工智能·ai·音视频
martindelophy1 天前
开源 AI 视频编辑器实战:用 Manifest + Adapter 构建可扩展的生成插件系统
人工智能·开源·音视频