MiniMax H3 正式开源!统一全模态视频生成,2K+15秒+原生立体声,一文看懂架构与玩法

2026 年 8 月 3 日,MiniMax 正式开源新一代通用视频模型 MiniMax H3。这是一款面向"开放通用智能"的全模态生成系统:统一理解文本、图像、视频、音频组成的多模态上下文,直接生成最高 2K 分辨率、最长 15 秒、自带原生立体声音频的视频。本文从架构、能力、上手方式三个角度快速拆解。

一、它到底是什么?

MiniMax H3 不是传统的"文生视频模型",而是一个"全模态"生成系统。它接收的输入可以是:纯文本(文生视频)、一张首帧图、一张尾帧图、首尾帧组合,甚至最多 9 张参考图 + 3 段参考视频 + 3 段参考音频的混合输入。

输出规格同样硬核:

  • 时长 4~15 秒

  • 宽高比覆盖 21:9 / 16:9 / 4:3 / 1:1 / 3:4 / 9:16

  • 默认 768p,配合 H3-Regenerate-2K 可生成 2K 分辨率

  • 24 FPS,32 kHz 原生立体声音频

  • 稳定支持 11 种语言

二、系统由三块拼成

完整的 H3 系统包含三个模块:

  1. H3-Context-IR:一套托管式预处理编排系统,负责把复杂的多模态输入"翻译"成模型更容易理解的结构化表示。由于依赖多阶段工作流和多个托管模型,这部分不开源,但官方提供了 API,也给出了提示词指南供开发者自建。

  2. H3-Base:真正开源的生成核心,一个 33B 参数的 dense single-stream Transformer,直接联合预测视频 latent 和音频 latent,再分别解码成画面与立体声。

  3. H3-Regenerate-2K:不走传统超分模块,而是用 H3 基础模型对 768p 结果"in-context 再生成",从而复用原始上下文里的小文字、精细细节等信息。目前尚未开源,官方 API 可复现完整流程。

三、架构上几个亮点

  • 统一编码:文本用 H3-Encoder(基于 Qwen3-VL-32B 预训练权重)、视觉用 H3-Encoder + H3-VisualVAE(f16t4d24,空间压缩 16 倍、时间压缩 4 倍)、音频用 H3-AudioVAE(32kHz 压到 40Hz latent),全部拼成一个 packed multimodal sequence 喂给 Transformer。

  • 三维位置编码:使用 MM-RoPE 表达 (t, h, w) 时间与空间位置关系,没有 modality-specific 的 attention/FFN 结构,模态差异只体现在 input/output 层和 AdaLN 分支,这让模型更简洁、可扩展。

  • 原生稀疏注意力:训练末期引入,能显著降低长序列计算开销(首版开源仅提供全注意力推理,稀疏版本后续更新发布)。

四、怎么上手?

H3-Base 以 task-specific checkpoint 形式发布(FL2VA 与 Ref2VA),每个都是 self-contained 的 Hugging Face 模型仓库,含 processor、tokenizer、text encoder、Omni Transformer、Visual VAE、Audio VAE。支持 SGLang、vLLM、diffusers、ComfyUI 等主流推理框架,官方还提供了 T2VA / FL2VA / Ref2VA 三类可复现的 768p 音视频生成案例。

五、一个不得不说的趋势

MiniMax H3 的发布,标志着视频生成正从"文生视频"走向"全模态生成"。而且它背后体现的"以任务泛化为导向"的设计哲学,恰好和 AI 编程领域的新一代 Agent 思路殊途同归------把复杂的真实需求交给一个能统一理解上下文的系统去完成,而不是让它死板地执行单一指令。

相关推荐
AI服务老曹8 小时前
边云协同视频分析性能优化指南:多站点部署下的资源瓶颈突破与调优实战
性能优化·音视频
wxson728210 小时前
【Android视频监控系统技术总结】
android·音视频
程序员老陆12 小时前
FFmpeg6操作 RTMP参数详解
ffmpeg·音视频·rtmp
DogDaoDao13 小时前
H.266/VVC 双雄对决:VTM vs VVenC 深度对比分析
音视频·视频编解码·vvc·vtm·h.266·视频压缩·vvenc
无线视频解决方案17 小时前
HDMI直出vsMIPI转接对比:AM8360D为何能省2颗芯片
音视频·无线图传·炬力北方
ai产品老杨17 小时前
边云协同视频分析性能优化指南:多站点部署下的参数配置与排查清单(边缘推理+云端管理)
性能优化·音视频
程序员老陆19 小时前
OpenGL 在视频渲染里的角色:它到底加速了什么?
音视频·gpu·opengl
≮傷£≯√19 小时前
FFmpeg + qt 音频播放
qt·ffmpeg·音视频
熊猫钓鱼>_>19 小时前
Seedance 2.0 技术深度解析:重构AI视频生成的世界模型新范式
人工智能·笔记·ai·重构·音视频·变革·sedence2.0
弈语道破AI19 小时前
3D渲染不再熬时间!即梦 Seedance 2.5 具备3D白模渲染功能的AI视频生成工具
人工智能·3d·音视频