发布日期: 2026 年 9 月 18 日
测试设备: Apple Mac Studio,M3 Ultra,80 核 GPU,512GB 统一内存
测试任务: MiniMax H3 本地视频生成
端脑科技本次公开 MiniMax H3 在 Apple Silicon 平台上的本地运行测试结果。在搭载 M3 Ultra 的 Mac Studio 上,测试团队完成了从模型加载、采样、视频与音频解码、编码到文件写出的完整视频生成链路,所有环节均在同一套本地工作流中运行。
固定短任务的最好成绩从 78.97 秒缩短至 37.73 秒,速度达到参考路径的 2.09 倍。在另一项 864 x 480 分辨率的端到端任务中,优化路径将实际总耗时从 232.15 秒降至 204.20 秒,减少 12.04%。系统还成功完成了 1344 x 768 分辨率下的 120 帧和 360 帧生成任务。
这些结果说明,高统一内存的 Apple Silicon 设备已经能够承载 MiniMax H3 的完整本地视频生成流程。需要强调的是,2.09 倍加速来自特定固定任务和预览档位,不能直接理解为所有 H3 工作负载都能获得同等提升;本次测试也不代表实时视频生成。
核心结论
-
MiniMax H3 已在 M3 Ultra 上完成完整本地生成闭环。 测试范围包括模型加载、采样、解码、编码和文件落盘,而不是只统计去噪或采样阶段。
-
固定短任务最高达到 2.09 倍速度。 在 512 x 512、22 帧、20 步任务中,耗时由 78.97 秒降至 37.73 秒。
-
端到端任务总耗时下降 12.04%。 864 x 480、124 帧、4 步、Turbo8 任务由 232.15 秒缩短至 204.20 秒。
-
1344 x 768 高分辨率任务成功跑通。 120 帧和 360 帧任务均在不加载 LoRA 的条件下完成。
-
生成文件通过交付验收。 输出视频完成完整解码、黑屏检测和音视频格式检查,交付格式为 H.264 24 fps、AAC 32 kHz 双声道。
MiniMax H3 在 M3 Ultra 上的实测数据
下表耗时为端脑科技技术团队记录的实际经过时间,单位为秒。
| 任务 | 测试配置 | 执行档位或路径 | 耗时 | 结果 |
|---|---|---|---|---|
| 固定短任务 | 512 x 512,22 帧,20 步 | Native 参考档 | 78.97 秒 | 1.00 倍 |
| 固定短任务 | 512 x 512,22 帧,20 步 | Balanced 平衡档 | 46.14 秒 | 1.71 倍 |
| 固定短任务 | 512 x 512,22 帧,20 步 | Draft-token 预览档 | 37.73 秒 | 2.09 倍 |
| 端到端短片 | 864 x 480,124 帧,4 步,Turbo8 | 基线路径 | 232.15 秒 | 1.00 倍 |
| 端到端短片 | 864 x 480,124 帧,4 步,Turbo8 | 优化路径 | 204.20 秒 | 1.14 倍 |
| 高分辨率短片 | 1344 x 768,120 帧,15 步 | 不加载 LoRA | 1,802.97 秒 | 已完成 |
| 高分辨率长片 | 1344 x 768,360 帧,15 步 | 不加载 LoRA | 8,959.88 秒 | 已完成 |
三个固定任务档位对应不同使用目的。Native 是质量参考档,Balanced 适合日常预览,Draft-token 用于快速试错。由于三种档位在速度与质量取向上并不相同,2.09 倍应被理解为预览型任务的性能提升,而不是完全相同画质条件下的横向对比。
测试方法
本次测试使用了两条计时路径。
原生性能路径固定 BF16 精度、分辨率、帧数和采样步数,并计时至视频文件写出,主要用于识别采样阶段和 Metal 计算环节的性能热点。
端到端路径覆盖采样、解码、编码和文件落盘,用于判断最终视频能否完整生成并作为可交付文件通过检查。两条路径解决的问题不同,因此测试数据被分别记录,不能混为同一组基准成绩。
1344 x 768 的测试使用节点式 MPS 端到端工作流,具体配置如下。
| 模型或组件 | 测试配置 |
|---|---|
| 主 DiT 模型 | minimax_h3_fl2va_pruned_bf16.safetensors |
| 主 DiT 精度 | BF16,未量化 |
| 文本编码器 | qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors |
| 文本编码器精度 | NVFP4/AWQ 量化 |
| 视频 VAE | FP16 |
| 音频 VAE | FP32 |
| LoRA | 未加载 |
| 采样步数 | 15 步 |
| 注意力路径 | 启用自定义 QK/PV int8 路径 |
这套混合精度方案保留了主扩散模型的 BF16 精度,同时通过 NVFP4/AWQ 文本编码器和自定义 int8 注意力路径降低部分计算与内存压力。
输出视频验收
如果生成结果不能稳定解码或存在黑屏,仅有采样速度并不能说明系统已经具备完整的视频生产能力。因此,本次测试在生成完成后继续执行媒体文件验收。
输出文件通过了以下检查:
-
完整文件解码;
-
H.264、24 fps 视频格式检查;
-
AAC、32 kHz、双声道音频检查;
-
黑屏检测;
-
运行记录、结果文件与输出视频对应检查。
这意味着端到端成绩包含了生成最终媒体文件所需的关键环节,而不是只统计模型采样时间。
这些数据对本地 AI 视频生成意味着什么
本次测试首先证明,搭载 M3 Ultra 和 512GB 统一内存的 Mac Studio 可以完成 MiniMax H3 的完整本地视频生成流程。高容量统一内存使模型组件和中间数据能够在共享内存架构下运行,并持续执行到最终文件输出。
测试同时说明,评价本地视频生成能力不能只看一个"加速倍数"。Draft-token 预览档获得了最大的速度提升,但端到端任务的实际优化幅度为 12.04%。1344 x 768 高分辨率任务能够完成,不过 120 帧任务耗时约 30 分钟,360 帧任务耗时约 149 分钟。
因此,对实际生产场景而言,关键问题已经不只是"MiniMax H3 能否在 Apple Silicon 上运行",而是如何根据用途选择分辨率、帧数、采样步数、计算精度和预览质量,在生成速度与输出质量之间取得合适的平衡。
后续优化方向
下一阶段的优化重点,是让计算量随视频画面内容动态变化。运动、纹理和语义探针可以识别关键帧、高运动区域和稳定背景,将完整计算预算保留给变化明显的部分,减少稳定区域的重复计算。以当前 Balanced 平衡档为基准,工程目标是进一步获得 1.3 至 1.6 倍的有效吞吐提升。该数字是优化目标,不是现有实测成绩。
去噪阶段还可以继续重排矩阵乘、注意力、归一化和权重转换操作,根据不同模型层选择 BF16、低比特权重或混合精度,以减少临时缓冲和数据格式转换。统一内存调度则可以进一步优化权重预取、latent 复用及不同阶段之间的并行重叠。
长期来看,端脑科技希望建立 H3 任务特征、硬件调度方式和输出质量之间的对应关系。提示词、随机种子、分辨率、视频时长、运动程度和质量评分越完整,系统就越有可能针对不同任务自动选择更合适的推理参数。
M5 Ultra 的 GPU 与 Neural Engine 协同设想
以下内容仅基于 M3 Ultra 测试结果的工程预测,并非 M5 Ultra 实测结果。
Apple 当前公布的 Mac Studio 规格显示,M5 Ultra 最高可配置 80 核 GPU、32 核 Neural Engine、1.2 TB/s 统一内存带宽和 512GB 统一内存,GPU 内还包含 Neural Accelerators。这些硬件特征为异构推理提供了基础:GPU 负责 H3 DiT 的主要去噪计算,Apple Neural Engine 并行运行规模更小、延迟要求更高的辅助模型。
Apple 的 Core ML 计算单元接口支持开发者选择可用的计算资源,包括涉及 Neural Engine 的执行配置。不过,具体子图能否在 Neural Engine 上运行,仍取决于算子支持情况和模型导出结果。
端脑科技规划的异构分工如下。
| 协同方向 | Apple Neural Engine 的拟承担任务 | 预期作用 |
|---|---|---|
| 动态计算策略 | 并行运行运动、纹理和语义探针,识别关键区域并分配采样预算 | 减少不必要的去噪计算 |
| VAE 子图 | 承担可导出的卷积模块,GPU 继续处理其他算子 | 缩短部分 VAE 阶段耗时 |
| 质量检查与回退 | 运行冻结帧、亮度、时序和质量判断模型 | 降低失败输出与重复生成概率 |
| 更大模型子图 | 在算子覆盖稳定后逐步扩大 Neural Engine 的工作范围 | 提高异构硬件利用率 |
基于 M3 Ultra 实测基线及上述任务分工,原始技术报告将 M5 Ultra GPU 与 Neural Engine 协同路径的端到端工程目标设定为 2.0 至 2.6 倍。如果 H3 的矩阵计算能够充分利用新加速单元,且 Neural Engine 辅助任务能够与 GPU 并行执行,部分长视频任务可能存在 2.7 至 3.2 倍的进一步提升空间。
这些数字均为前瞻性工程目标,目前没有在 M5 Ultra 上完成实测,待 M5 Ultra 上线后更新实测对比。
测试范围与数据边界
本次测试是针对一台 Apple Silicon 设备和一套特定 H3 部署方案形成的工程基线,不是跨硬件平台性能排行榜。
-
本次测试没有将 M3 Ultra 与 NVIDIA 显卡、云端服务或其他 Apple 芯片进行对比。
-
2.09 倍结果仅适用于指定固定任务和 Draft-token 预览档。
-
原始报告没有提供 Native、Balanced 和 Draft-token 三档之间的同口径感知质量评分。
-
M5 Ultra 相关数据是优化预测,不是实测结果。
-
软件版本、模型版本、提示词、随机种子、设备温度和后台任务变化,都可能影响最终耗时。
常见问题
MiniMax H3 可以在 Apple M3 Ultra 上本地运行吗?
可以。在端脑科技的测试中,搭载 80 核 GPU 和 512GB 统一内存的 M3 Ultra Mac Studio 完成了模型加载、采样、解码、编码和文件落盘组成的完整本地视频生成流程。
MiniMax H3 在 M3 Ultra 上生成速度有多快?
在 512 x 512、22 帧、20 步的固定任务中,Native 参考档耗时 78.97 秒,Balanced 平衡档耗时 46.14 秒,Draft-token 预览档耗时 37.73 秒。最快档位达到 Native 参考档的 2.09 倍速度。
2.09 倍是端到端加速成绩吗?
不是。2.09 倍来自固定短任务测试。另一项 864 x 480 端到端任务从 232.15 秒缩短至 204.20 秒,实际总耗时下降 12.04%。
M3 Ultra 能否完成 1344 x 768 的 MiniMax H3 视频生成?
可以。测试设备完成了 1344 x 768、120 帧和 360 帧任务,两项任务均为 15 个采样步数,并且没有加载 LoRA。
生成的视频是否经过检查?
是。输出文件通过了完整解码、H.264 24 fps、AAC 32 kHz 双声道和黑屏检测,并完成了运行记录与输出文件对应检查。
M5 Ultra 的加速数据是实测结果吗?
不是。M5 Ultra 相关数字是根据 M3 Ultra 基线、硬件规格和 GPU 与 Neural Engine 协同方案提出的工程目标。端脑科技已在文章中将预测数据与 M3 Ultra 实测数据明确分开。
关于端脑科技
端脑科技(Cephalon)成立于2023年5月,专注于人工智能算力与智能体场景应用,面向创作者、AI开发者、科研人员、企业用户及产业合作伙伴,提供软硬件一体化的 AI 解决方案,推动算力普惠与智能普惠。
公司构建"云、边、端"协同的核心业务体系:云端以"端脑云" AIGC 算力与应用平台整合 GPU 资源及图像、音频、视频、大模型与开发工具,支持一键启用和 API 调用;边缘端连接分散设备,为视频生成、大模型推理与智能体运行提供分布式算力;本地端以"脑花 AINPC"系列智能硬件融合大模型、智能体、专业工作流与私有存储,实现本地运行、数据自主掌控、开机即用。
端脑科技致力于让每一台设备成为智能入口、每一个节点成为算力基础设施,让 AI 能力可部署、算力可调用、数据更可控。