
在线 API
直接通过 API 使用 MiniMax-H3。
在线应用
直接通过应用使用 MiniMax-H3。
- WebApp 全球:hailuoai.video | 中国:hailuoai.com
- 桌面端 全球:hub.minimax.io | 中国:hub.minimaxi.com
系统概述
MiniMax H3 是一个通用的全模态生成系统。它支持对由文本、图像、视频和音频组成的多模态上下文进行统一理解,并能生成分辨率高达 2K、时长最长 15 秒、带有原生立体声的视频。得益于其面向任务泛化的系统设计,H3 在预训练阶段就已具备广泛的多模态上下文理解和生成能力,在遵循复杂多模态指令方面表现出色。
H3 支持以下输入和输出规格:
| 类别 | 规格 |
|---|---|
| 输出时长 | 4--15 秒 |
| 输出宽高比 | 支持多种宽高比,包括但不限于 21:9、16:9、4:3、1:1、3:4 和 9:16 |
| 输出分辨率 | 支持多种分辨率尺寸。默认短边设为 768 像素。通过 H3-Regenerate-2K 可实现 2K 生成 |
| 输出帧率 | 24 FPS |
| 输出音频 | 32 kHz 立体声 |
| 支持对话语言 | 稳定支持 11 种语言:阿拉伯语、中文、英语、法语、德语、意大利语、日语、韩语、葡萄牙语、俄语和西班牙语。其他语言也提供不同程度的支持 |
模型变体与输入规格
| 模型变体 | 输入模式 | 规格 |
|---|---|---|
| H3-Base-FL2VA | 首尾帧模式 | 支持零张、一张或两张输入图像。 - 无图像输入:文生视频模式 - 一张图像输入:首帧生视频或尾帧生视频 - 两张图像输入:首尾帧生视频 |
| H3-Base-Ref2VA | 全参考模式 | 支持多模态参考输入: - 图像: ≤ 9 张图像 - 视频: ≤ 3 个片段;每个片段时长 2--15 秒;总时长 ≤ 15 秒 - 音频: ≤ 3 个片段;音频必须与图像或视频输入一起使用,不能作为唯一输入;每个片段时长 2--15 秒;总时长 ≤ 15 秒 - 混合输入: 所有输入类型的文件总数上限为 12 个 |

完整的 H3 系统由以下三个模块组成:
- H3-Context-IR:随着输入日益复杂,我们构建了一个专用系统来深入理解和优化输入的多模态指令,然后将其转换为 H3 易于理解的形式------上下文中间表示------用于生成。H3-Context-IR 对最终输出质量至关重要,因此我们强烈建议将其纳入您的生成流程,或按照"提示指南"构建您自己的上下文处理系统。
- H3-Base:基于 H3-Context-IR 的输出生成音频和视频,产生 768p 分辨率的结果。
- H3-Regenerate-2K:将 768p 结果与原始上下文一起反馈给 H3,以 2K 分辨率重新生成输出。此过程同时利用了 H3 强大的生成能力和原始上下文中包含的丰富信息,使其能够生成具有更准确细节和更高视觉保真度的高分辨率输出。
模型架构
H3-Context-IR
H3-Context-IR 是一个托管的预处理和编排系统,专为自由形式的多模态输入而设计。
它解释文本、图像、音频和参考视频之间的关系,以及这些素材与预期生成输出之间的关联。其内部工作流程包括指令解析、跨模态关联、时间理解和复杂逻辑推理。
H3-Context-IR 将其对上下文的理解序列化为 H3-Base 可接受的结构化表示。在不偏离用户原始意图的前提下,它还可以在适当的地方补充缺失或未充分指定的语义细节。
由于 H3-Context-IR 依赖于多阶段工作流和多个托管模型及服务,因此未包含在此次开源发布中。我们提供了一个 API,使用户能够复现官方工作流的行为。我们还提供了详细的教程,开发者可以按照提示指南构建自己的预处理系统。
有关详细使用说明,请参见推荐工作流 --- 完整 2K 工作流。
安全护栏
用户提交的文本、图像和视频以及增强后的提示词均需经过自动审核。涉嫌违法、色情或侵犯第三方权利的内容可能会被屏蔽。我们使用行业标准的过滤措施,但无法消除误报或漏报。这些护栏不影响被许可方在 MiniMax H3 社区许可下的义务,特别是与合法使用和使用限制相关的义务。
H3-Base

架构概述
- H3-Base 使用相应的编码器或 VAE 对不同模态进行编码,并将编码后的表示组织成统一的打包多模态序列。使用 RoPE 来捕获 token 之间必要的空间和时间关系,然后将整个序列传递给 H3-Omni-Transformer。
- 具体来说,文本由 H3-Encoder 编码;视觉输入由 H3-Encoder 和 H3-VisualVAE 共同编码;音频仅由 H3-AudioVAE 编码。
- H3-Omni-Transformer 联合预测视频和音频潜变量,然后分别解码为视频和立体声音频。
- 为了降低长多模态序列的计算成本,H3 原生支持稀疏注意力训练和推理。初始开源版本仅提供全注意力的推理。我们的稀疏注意力实现将在未来的更新中发布。
H3-Encoder
- H3-Encoder 使用 Qwen3-VL-32B 的完整预训练权重,并将其第 50 层的隐藏状态提供给 H3-Omni-Transformer。
- 我们在分词器配置中添加了几个特殊 token,例如
<d>。使用 H3 时,需要使用 H3 仓库中提供的分词器和相关配置文件。
H3-VAE
H3 使用独立的视觉和音频潜变量来表示各自的模态。
H3-VisualVAE
- H3-VisualVAE 是一个时间因果视频自编码器,空间压缩因子为 16 倍,时间压缩因子为 4 倍,具有 24 个潜变量通道,记为 f16t4d24。我们应用了多种潜变量空间优化技术,以共同提高重建质量和潜变量可学习性。
- 在传递给 H3-Omni-Transformer 之前,视觉潜变量会进一步沿
(时间, 高度, 宽度)维度以1 × 2 × 2的 patch 大小进行分块。因此,进入 Transformer 的视觉 token 的有效空间下采样因子为 32 倍,而时间下采样因子保持 4 倍。 - H3-VisualVAE 的潜变量空间针对重建质量和生成模型的学习易用性进行了优化。在训练其编码器之后,我们还额外训练了一个基于 ViT 的解码器,以降低解码成本并进一步提高重建质量。
H3-AudioVAE
- H3-AudioVAE 对左右两个音频通道使用相同的编码器和解码器,同时独立处理每个通道。解码后的通道再重新组合,从而实现立体声音频的输入和输出。
- 对于每个通道,H3-AudioVAE 将 32 kHz 音频压缩为时间速率为 40 Hz 的潜变量 token 序列。
- 受 VA-VAE 启发,我们优化了潜变量空间,以在保持音频重建质量的同时,使生成模型更易于学习。
H3-Omni-Transformer
- 为了可扩展性和泛化能力,我们采用了相对简单的 Transformer 块设计。H3-Omni-Transformer 是一个 33B 参数的密集单流 Transformer,其中约 13B 参数位于 AdaLN 相关分支中。由于 AdaLN 调制输出可以预计算和缓存,这些参数在仅推理部署时无需加载。我们发布完整的模型权重以支持进一步的开发,包括微调。
- 注意力层和 FFN 层均不包含模态特定结构。模态特定参数仅限于输入/输出层和 AdaLN 分支。特别是,模态特定的 AdaLN 以相对较低的额外训练和推理成本提高了生成质量。
- 该模型使用三维多模态旋转位置嵌入(MM-RoPE)来表示时间维度和两个空间维度
(t, h, w)上的位置关系。 - 在训练的最后阶段,我们引入了原生稀疏注意力以降低长序列的计算成本。稀疏注意力实现未包含在初始开源版本中,将在未来的更新中单独发布。
H3-Regenerate-2K
- 对于 H3 的 2K 分辨率输出,我们没有使用传统的专用超分辨率模块,而是通过上下文内方式使用 H3 基础模型重新生成其自身的低分辨率结果。
- 这种方法有两个优点:(1) 重新生成过程可以最大程度地重用 H3 基础模型的生成能力;(2) 上下文内格式可以在生成高分辨率输出时重用原始多模态上下文,使其能够恢复传统超分辨率方法必须"猜测"的信息,例如小文本和精细细节。
- 上下文内重新生成也是任务泛化的一个示例。
- 由于系统复杂性,该模块尚未开源。我们将在准备就绪后发布。 我们提供了一个用于验证官方结果的 API;请参见下面的"完整 2K 工作流"。
推荐工作流
为了帮助社区正确部署 MiniMax H3,我们提供了两种验证方法。
由于完整的 H3 系统由三个模块组成------H3-Context-IR、H3-Base 和 H3-Regenerate-2K------"完整 2K 工作流"提供了一个端到端的 2K 输出验证流程,结合了开放平台 API 和本地部署的 H3-Base。"H3-Base 本地部署"部分提供了一种仅使用本地部署的 H3-Base 验证 768p 输出的方法。
此外,"提示指南"部分提供了详细的教程,帮助社区开发自己的提示系统。
H3-Base 本地部署
MiniMax H3 以两个任务特定检查点的形式发布。每个检查点包含一个专门的 Omni Transformer 模型以及所需的处理器、分词器、文本编码器、Visual VAE 和独立的 Audio VAE 组件。
| 检查点 | 支持的任务 | 输入条件 | 输出 | 精度 |
|---|---|---|---|---|
| MiniMax-H3 Base FL2VA | 文生音视频 (t2va)、首/尾帧生音视频 (fl2va) |
文本;可选首帧、尾帧或两者 | 视频和音频 | BF16 |
| MiniMax-H3 Base Ref2VA | 参考生音视频 (ref2va) |
文本及参考图像、视频和/或音频 | 视频和音频 | BF16 |
发布的检查点是 CFG 蒸馏后的 Omni Transformer 模型权重。
每个检查点以自包含的 Hugging Face 风格仓库形式分发,包含以下组件:
text
<TASK>/
├── model_index.json
├── processor/
├── tokenizer/
├── text_encoder/
├── transformer/
├── visual_vae/
└── audio_vae/
下载模型。仓库同时托管原始检查点(FL2VA/、Ref2VA/)和 diffusers 格式,因此请将下载范围限定为您的框架所需的内容:
model_index.json 是仓库级别的模块化索引。任务系列特定的 diffusers 索引分别位于 FL2VA/model_index.json 和 Ref2VA/model_index.json。
bash
# 原始检查点,两个任务系列(SGLang、vLLM):
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "modular_model_index.json" "FL2VA/*" "Ref2VA/*" --local-dir MiniMax-H3
# 或单个任务系列:
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "modular_model_index.json" "FL2VA/*" --local-dir MiniMax-H3
diffusers 用户无需手动下载:ModularPipeline.from_pretrained("MiniMaxAI/MiniMax-H3") 会精确获取所需的组件。有关加载方法,请参阅 diffusers 文档。
我们推荐以下推理框架来服务模型:
- SGLang - 参见 cookbook
- vLLM - 参见 vllm recipes
- diffusers - 参见 diffusers docs
- ComfyUI - 参见 Comfy 教程;使用 R2V 模板 / T2V 模板
Sglang 部署
这里以 sglang 作为部署示例。有关其他部署配置,请参见 MiniMax-H3 部署指南。
FL2VA:
bash
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30010 \
--model-variant fl2va
Ref2VA:
bash
sglang serve \
--model-path MiniMaxAI/MiniMax-H3 \
--num-gpus 4 \
--ulysses-degree 4 \
--performance-mode speed \
--host 0.0.0.0 \
--port 30011 \
--model-variant ref2va
可复现的 768p 案例
以下三个用例 T2VA、FL2VA 和 Ref2VA 演示了如何复现 MiniMax-H3 视频-音频生成。
| 用例 | 请求 | 结果 |
|---|---|---|
| T2VA | 查看脚本 | t2va.mp4 |
| FL2VA | 查看脚本 | fl2va.mp4 |
| Ref2VA | 查看脚本 | ref2va.mp4 |
完整 2K 工作流
本节说明如何将本地部署的 SGLang 服务与官方的 H3-Context-IR API 和 H3-Regenerate-2K API 结合,以复现 2K 输出。
bash
# 您的 SGLang 部署 URL
SGLANG_DEPLOYMENT_URL="<sglang-deployment-url>"
# MiniMax 开放平台 API 密钥
MINIMAX_API_KEY="<your-minimax-api-key>"
MiniMax 平台:
API 文档:
- 创建 H3-2K:使用 /video-generation-v2-create 英文文档 | 中文文档
- 查询任务结果:使用 /query/video-generation-v2 英文文档 | 中文文档
以下示例将本地 H3-Base 输出文件编码为 Base64 数据 URL。对于生产环境,我们建议使用文件上传 API 以获得更好的性能。
对于下面的每个案例,我们提供了通过开放平台 API 直接生成的 2K 和 768p 参考输出,以及通过完整工作流生成的 2K 输出,供您比较。
case-T2VA
- 类型:文生视频
- 时长:10 秒
- 宽高比:16:9
| 阶段 | 请求 | 结果 |
|---|---|---|
| H3-Context-IR | 查看脚本 | json { "task": { "id": "<task_id>", "model": "MiniMax-H3", "status": "succeeded", "created_at": "<created_at>", "updated_at": "<updated_at>", "content": { "prompt": "对于目标视频,在 0.00 秒时,<Picture 1>(来自 [Shot 1])被完全参考。\n\nintegrated_multimodal_description:[Shot 1] 这是一个实拍电影感镜头,景深较浅。摄像机在整个八秒时长内保持完全静止的镜头,捕捉传统日式餐厅中温馨的家庭聚餐场景。画面以近景中一个大型、图案复杂的蓝白陶瓷拉面碗开始,呈现清晰锐利的焦点。碗放在光滑抛光的木质长桌上。碗内,金黄色的浓郁油亮汤底包裹着黄色波浪面条,上面放着两片厚切、圆形的叉烧肉,带有可见的脂肪纹理和独特的螺旋肉纹。中央是一大堆刚切好的鲜绿色葱花,右侧边缘夹着一片脆爽的深绿色矩形海苔。碗的左侧,一双浅棕色木筷水平搁在一个小的深色矩形筷托上,旁边是一个带有蓝色图案的小圆柱形陶瓷茶杯。桌子右侧,一个带有竹编框架的球形纸灯笼放在黑色木质底座上。背景中,一个七口之家围坐在桌旁,最初呈现为柔和的模糊存在。他们身后,带有木质格栅的传统日式推拉障子门敞开着,露出外面明亮的景色和茂密的绿树。在片段早期,从热拉面汤中升起的浓密白色蒸汽立即加剧,以浓密的旋转云团在碗上方不断翻腾。随着片段进入中间秒数,摄像机保持静止位置,同时焦点开始有意识地平滑移向房间深处。前景的拉面碗、其鲜艳的配料和升起的蒸汽逐渐变得模糊、失焦。同时,背景中的家庭成员变得清晰锐利。浓重的蒸汽继续从前景升起,在镜头和家庭之间形成动态的半透明面纱。随着焦点现在牢牢锁定在背景上,充满活力的家庭晚餐变得生动起来。左边穿着深海军蓝长袖衬衫的男人向前倾身,嘴巴生动地动着,进行无声的交流。他旁边穿着清爽白色短袖T恤的小女孩灿烂地笑着,看向桌子中央。最左边穿着柔和浅蓝色长袖衬衫的女人微微转头,温柔地微笑。桌子对面,穿着浅灰色纽扣衬衫的女人咧嘴大笑,眼睛眯起,双手放在盘子附近。穿着深灰色上衣、位置更靠后的女人用木筷从一个装满鲜红色腌菜的中央陶瓷盘中夹起一小块食物。中间后方穿着浅灰色毛衣的女人温柔地微笑,双手轻轻交握在身前,观察着互动。在片段的剩余时间里,家人继续他们生动的肢体互动,嘴巴不停地动着,进行着无声的对话,而前景模糊拉面碗中升起的浓密白色蒸汽从未停止,为温暖的聚会增添了舒适的氛围。\n\noverall_soundscape:音景始于安静的房间环境音,混合着前景热拉面碗中升起的浓密蒸汽的微弱、空灵的沙沙声,伴随着浓郁汤底微弱的持续嘶嘶声和冒泡声。随着视觉焦点移向房间深处,热闹家庭晚餐的物理声音在前景中变得突出。清晰、清脆的陶瓷碗碰撞声和木筷触碰盘子的声音清晰可闻,因为家人们伸手取食物。随后是杯子放在光滑木桌上的微弱、沉闷的砰的一声,以及家人前倾和做手势时棉质和羊毛衣物微妙的、有节奏的沙沙声,完美捕捉了共享餐食的生动、物理氛围。\n\nnon_diegetic_music:轻柔、暖心的原声吉他旋律在背景中柔和地演奏,伴随着传统日本筝微妙的、共鸣的音符。音乐保持缓慢、舒适的速度,增强了家庭聚会的温馨、怀旧和欢乐氛围。" }, "duration": 10, "usage": { "total_tokens": 8565, "prompt_tokens": 5650, "completion_tokens": 2915 }, "ratio": "16:9", "task_type": "h3_context_ir", "modality": "text" } } |
| H3-Base | 查看脚本 | t2va.mp4 |
| H3-Regenerate-2K | 查看脚本 | t2va_2k.mp4 |
| 直接调用开放平台 API 的参考 2K 结果 | 查看脚本 | h3_direct_2k.mp4 |
| 直接调用开放平台 API 的参考 768P 结果 | 查看脚本 | h3_direct_768p.mp4 |
case-I2VA
- 类型:首帧图像生视频
- 时长:8 秒
- 宽高比:自适应
| 阶段 | 请求 | 结果 |
|---|---|---|
| H3-Context-IR | 查看脚本 | json { "task": { "id": "<task_id>", "model": "MiniMax-H3", "status": "succeeded", "created_at": "<created_at>", "updated_at": "<updated_at>", "content": { "prompt": "对于目标视频,在 0.00 秒时,<Picture 1>(来自 [Shot 1])被完全参考。\n\nintegrated_multimodal_description:[Shot 1] 这是一个实拍电影感镜头,景深较浅。摄像机在整个八秒时长内保持完全静止的镜头,捕捉传统日式餐厅中温馨的家庭聚餐场景。画面以近景中一个大型、图案复杂的蓝白陶瓷拉面碗开始,呈现清晰锐利的焦点。碗放在光滑抛光的木质长桌上。碗内,金黄色的浓郁油亮汤底包裹着黄色波浪面条,上面放着两片厚切、圆形的叉烧肉,带有可见的脂肪纹理和独特的螺旋肉纹。中央是一大堆刚切好的鲜绿色葱花,右侧边缘夹着一片脆爽的深绿色矩形海苔。碗的左侧,一双浅棕色木筷水平搁在一个小的深色矩形筷托上,旁边是一个带有蓝色图案的小圆柱形陶瓷茶杯。桌子右侧,一个带有竹编框架的球形纸灯笼放在黑色木质底座上。背景中,一个七口之家围坐在桌旁,最初呈现为柔和的模糊存在。他们身后,带有木质格栅的传统日式推拉障子门敞开着,露出外面明亮的景色和茂密的绿树。在片段早期,从热拉面汤中升起的浓密白色蒸汽立即加剧,以浓密的旋转云团在碗上方不断翻腾。随着片段进入中间秒数,摄像机保持静止位置,同时焦点开始有意识地平滑移向房间深处。前景的拉面碗、其鲜艳的配料和升起的蒸汽逐渐变得模糊、失焦。同时,背景中的家庭成员变得清晰锐利。浓重的蒸汽继续从前景升起,在镜头和家庭之间形成动态的半透明面纱。随着焦点现在牢牢锁定在背景上,充满活力的家庭晚餐变得生动起来。左边穿着深海军蓝长袖衬衫的男人向前倾身,嘴巴生动地动着,进行无声的交流。他旁边穿着清爽白色短袖T恤的小女孩灿烂地笑着,看向桌子中央。最左边穿着柔和浅蓝色长袖衬衫的女人微微转头,温柔地微笑。桌子对面,穿着浅灰色纽扣衬衫的女人咧嘴大笑,眼睛眯起,双手放在盘子附近。穿着深灰色上衣、位置更靠后的女人用木筷从一个装满鲜红色腌菜的中央陶瓷盘中夹起一小块食物。中间后方穿着浅灰色毛衣的女人温柔地微笑,双手轻轻交握在身前,观察着互动。在片段的剩余时间里,家人继续他们生动的肢体互动,嘴巴不停地动着,进行着无声的对话,而前景模糊拉面碗中升起的浓密白色蒸汽从未停止,为温暖的聚会增添了舒适的氛围。\n\noverall_soundscape:音景始于安静的房间环境音,混合着前景热拉面碗中升起的浓密蒸汽的微弱、空灵的沙沙声,伴随着浓郁汤底微弱的持续嘶嘶声和冒泡声。随着视觉焦点移向房间深处,热闹家庭晚餐的物理声音在前景中变得突出。清晰、清脆的陶瓷碗碰撞声和木筷触碰盘子的声音清晰可闻,因为家人们伸手取食物。随后是杯子放在光滑木桌上的微弱、沉闷的砰的一声,以及家人前倾和做手势时棉质和羊毛衣物微妙的、有节奏的沙沙声,完美捕捉了共享餐食的生动、物理氛围。\n\nnon_diegetic_music:轻柔、暖心的原声吉他旋律在背景中柔和地演奏,伴随着传统日本筝微妙的、共鸣的音符。音乐保持缓慢、舒适的速度,增强了家庭聚会的温馨、怀旧和欢乐氛围。" }, "duration": 8, "usage": { "total_tokens": 22822, "prompt_tokens": 12800, "completion_tokens": 10022 }, "ratio": "16:9", "task_type": "h3_context_ir", "modality": "text" } } |
| H3-Base | 查看脚本 | i2va.mp4 |
| H3-Regenerate-2K | 查看脚本 | i2va_2k.mp4 |
| 直接调用开放平台 API 的参考 2K 结果 | 查看脚本 | i2va_direct_2k.mp4 |
| 直接调用开放平台 API 的参考 768P 结果 | 查看脚本 | i2va_direct_768p.mp4 |
case-Ref2VA
- 类型:多模态参考生视频(视频 + 音频)
- 时长:5 秒
- 宽高比:自适应
| 阶段 | 请求 | 结果 |
|---|---|---|
| H3-Context-IR | 查看脚本 | json { "task": { "id": "<task_id>", "model": "MiniMax-H3", "status": "succeeded", "created_at": "<created_at>", "updated_at": "<updated_at>", "content": { "prompt": "subject_definitions:\n<Subject 1> 是 <Video 1> 中留着金色短卷发、穿着亮粉色西装外套、配套粉色长裤、未扣纽扣的白衬衫、戴着银戒指、怀里抱着一只小黑羊的年轻男子。\n<Video 1> 是剪辑任务的源视频。\n<Audio 1> 是 <Video 1> 的同步音轨,提供背景音乐。\n<Audio 2> 是 <Subject 1> 声音的音色参考,包含一段男性画外音。\n\nsummary:\n[视频剪辑 + 音频参考 + 音频复用] 目标视频是 <Video 1> 的剪辑版本。<Subject 1> 穿着亮粉色西装、抱着一只黑羊,站在草地上,背景中有其他白羊。剪辑动画化了 <Subject 1> 的面部,使其说出用户提供的对话。<Audio 1> 部分被复用为连续的背景音乐,而目标视频参考 <Audio 2> 中平静的男性音色用于 <Subject 1> 的台词。\n\nretention_analysis:\n<Subject 1>(出现在 [Shot 1] 中):完全保留 - 该男子保留其身份、金色卷发、粉色西装、白衬衫、配饰和他抱着的黑羊,嘴巴被新动画化以说话。\n<Video 1>(源视频剪辑):完全保留 - 原始镜头构图、温暖的金色时刻光线、草地山坡环境和背景中的白羊得以保持,同时中心角色被剪辑。\n<Audio 1>:部分复制 - <Audio 1> 中的氛围背景音乐在目标视频中被复用,混合在新添加的对话下方。\n<Audio 2>:参考 - 目标音频参考 <Audio 2> 中的男性音色来生成 <Subject 1> 的对话。\n\ndetailed_description:\n目标视频采用写实摄影风格。\n[Shot 1] 镜头从源 <Video 1> 开始,显示 <Subject 1>,一个留着金色短卷发的年轻男子,穿着亮粉色西装外套、配套粉色长裤和随意敞开的白衬衫。他自信地站在阳光明媚的绿色牧场上,轻轻地将一只小黑羊稳稳抱在怀里。温暖的金色时刻光线在他脸上和亮粉色西装面料上投下柔和的阴影。在他身后,几只白羊在起伏的草地上吃草,背景是清澈的淡蓝色天空。来自 <Audio 1> 的氛围背景音乐在整个场景中持续播放。<Subject 1> 实际说话,他的嘴巴动作自然地与新对话同步,他的音色参考了 <Audio 2> 中平静的男性表达。<Subject 1> (S1) 若有所思地向前看,轻声说道,<d>[English] Follow the wind, live free.</d> 在说出这句台词时,他微妙地转移重心,轻轻抱着休息中的黑羊,同时摄像机缓慢推进。<Subject 1> (S1) 继续他的思绪,<d>[English] Leave worries behind, enjoy the moment.</d> 就在他的声音停止时,他的嘴唇合拢,露出放松、平静的微笑,下巴停止说话动作。然后他将目光微微转向地平线,手指轻轻抚摸黑羊的羊毛,摄像机保持在这个宁静、阳光明媚的状态直到视频结束。\n\noverall_soundscape:\n音景由来自 <Audio 1> 的连续氛围背景音乐组成,叠加了主角清晰、平静的男性对话,参考了 <Audio 2> 的音色。\n\nnon_diegetic_music:\n来自 <Audio 1> 的氛围、持续的背景音乐被复用为连续的配乐,在对话下方安静地播放。" }, "duration": 5, "usage": { "total_tokens": 39299, "prompt_tokens": 33323, "completion_tokens": 5976 }, "ratio": "16:9", "task_type": "h3_context_ir", "modality": "text" } } |
| H3-Base | 查看脚本 | r2va.mp4 |
| 直接调用开放平台 API 的参考 2K 结果 | 查看脚本 | r2va_2k.mp4 |
| 开放平台中 H3 API 2K 供参考 | 查看脚本 | r2va_direct_2k.mp4 |
| 直接调用开放平台 API 的参考 768P 结果 | 查看脚本 | r2va_direct_768p.mp4 |
提示指南
许可协议
MiniMax H3 根据 MiniMax H3 社区许可协议 发布。许可协议问答
联系我们
通过 model@minimax.io 联系我们。