MiniMax H3 在 Apple M3 Ultra 上的本地运行实测

发布日期: 2026 年 9 月 18 日

测试设备: Apple Mac Studio,M3 Ultra,80 核 GPU,512GB 统一内存

测试任务: MiniMax H3 本地视频生成

端脑科技本次公开 MiniMax H3 在 Apple Silicon 平台上的本地运行测试结果。在搭载 M3 Ultra 的 Mac Studio 上,测试团队完成了从模型加载、采样、视频与音频解码、编码到文件写出的完整视频生成链路,所有环节均在同一套本地工作流中运行。

固定短任务的最好成绩从 78.97 秒缩短至 37.73 秒,速度达到参考路径的 2.09 倍。在另一项 864 x 480 分辨率的端到端任务中,优化路径将实际总耗时从 232.15 秒降至 204.20 秒,减少 12.04%。系统还成功完成了 1344 x 768 分辨率下的 120 帧和 360 帧生成任务。

这些结果说明,高统一内存的 Apple Silicon 设备已经能够承载 MiniMax H3 的完整本地视频生成流程。需要强调的是,2.09 倍加速来自特定固定任务和预览档位,不能直接理解为所有 H3 工作负载都能获得同等提升;本次测试也不代表实时视频生成。

核心结论

  • MiniMax H3 已在 M3 Ultra 上完成完整本地生成闭环。 测试范围包括模型加载、采样、解码、编码和文件落盘,而不是只统计去噪或采样阶段。

  • 固定短任务最高达到 2.09 倍速度。 在 512 x 512、22 帧、20 步任务中,耗时由 78.97 秒降至 37.73 秒。

  • 端到端任务总耗时下降 12.04%。 864 x 480、124 帧、4 步、Turbo8 任务由 232.15 秒缩短至 204.20 秒。

  • 1344 x 768 高分辨率任务成功跑通。 120 帧和 360 帧任务均在不加载 LoRA 的条件下完成。

  • 生成文件通过交付验收。 输出视频完成完整解码、黑屏检测和音视频格式检查,交付格式为 H.264 24 fps、AAC 32 kHz 双声道。

MiniMax H3 在 M3 Ultra 上的实测数据

下表耗时为端脑科技技术团队记录的实际经过时间,单位为秒。

任务 测试配置 执行档位或路径 耗时 结果
固定短任务 512 x 512,22 帧,20 步 Native 参考档 78.97 秒 1.00 倍
固定短任务 512 x 512,22 帧,20 步 Balanced 平衡档 46.14 秒 1.71 倍
固定短任务 512 x 512,22 帧,20 步 Draft-token 预览档 37.73 秒 2.09 倍
端到端短片 864 x 480,124 帧,4 步,Turbo8 基线路径 232.15 秒 1.00 倍
端到端短片 864 x 480,124 帧,4 步,Turbo8 优化路径 204.20 秒 1.14 倍
高分辨率短片 1344 x 768,120 帧,15 步 不加载 LoRA 1,802.97 秒 已完成
高分辨率长片 1344 x 768,360 帧,15 步 不加载 LoRA 8,959.88 秒 已完成

三个固定任务档位对应不同使用目的。Native 是质量参考档,Balanced 适合日常预览,Draft-token 用于快速试错。由于三种档位在速度与质量取向上并不相同,2.09 倍应被理解为预览型任务的性能提升,而不是完全相同画质条件下的横向对比。

测试方法

本次测试使用了两条计时路径。

原生性能路径固定 BF16 精度、分辨率、帧数和采样步数,并计时至视频文件写出,主要用于识别采样阶段和 Metal 计算环节的性能热点。

端到端路径覆盖采样、解码、编码和文件落盘,用于判断最终视频能否完整生成并作为可交付文件通过检查。两条路径解决的问题不同,因此测试数据被分别记录,不能混为同一组基准成绩。

1344 x 768 的测试使用节点式 MPS 端到端工作流,具体配置如下。

模型或组件 测试配置
主 DiT 模型 minimax_h3_fl2va_pruned_bf16.safetensors
主 DiT 精度 BF16,未量化
文本编码器 qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
文本编码器精度 NVFP4/AWQ 量化
视频 VAE FP16
音频 VAE FP32
LoRA 未加载
采样步数 15 步
注意力路径 启用自定义 QK/PV int8 路径

这套混合精度方案保留了主扩散模型的 BF16 精度,同时通过 NVFP4/AWQ 文本编码器和自定义 int8 注意力路径降低部分计算与内存压力。

输出视频验收

如果生成结果不能稳定解码或存在黑屏,仅有采样速度并不能说明系统已经具备完整的视频生产能力。因此,本次测试在生成完成后继续执行媒体文件验收。

输出文件通过了以下检查:

  • 完整文件解码;

  • H.264、24 fps 视频格式检查;

  • AAC、32 kHz、双声道音频检查;

  • 黑屏检测;

  • 运行记录、结果文件与输出视频对应检查。

这意味着端到端成绩包含了生成最终媒体文件所需的关键环节,而不是只统计模型采样时间。

这些数据对本地 AI 视频生成意味着什么

本次测试首先证明,搭载 M3 Ultra 和 512GB 统一内存的 Mac Studio 可以完成 MiniMax H3 的完整本地视频生成流程。高容量统一内存使模型组件和中间数据能够在共享内存架构下运行,并持续执行到最终文件输出。

测试同时说明,评价本地视频生成能力不能只看一个"加速倍数"。Draft-token 预览档获得了最大的速度提升,但端到端任务的实际优化幅度为 12.04%。1344 x 768 高分辨率任务能够完成,不过 120 帧任务耗时约 30 分钟,360 帧任务耗时约 149 分钟。

因此,对实际生产场景而言,关键问题已经不只是"MiniMax H3 能否在 Apple Silicon 上运行",而是如何根据用途选择分辨率、帧数、采样步数、计算精度和预览质量,在生成速度与输出质量之间取得合适的平衡。

后续优化方向

下一阶段的优化重点,是让计算量随视频画面内容动态变化。运动、纹理和语义探针可以识别关键帧、高运动区域和稳定背景,将完整计算预算保留给变化明显的部分,减少稳定区域的重复计算。以当前 Balanced 平衡档为基准,工程目标是进一步获得 1.3 至 1.6 倍的有效吞吐提升。该数字是优化目标,不是现有实测成绩。

去噪阶段还可以继续重排矩阵乘、注意力、归一化和权重转换操作,根据不同模型层选择 BF16、低比特权重或混合精度,以减少临时缓冲和数据格式转换。统一内存调度则可以进一步优化权重预取、latent 复用及不同阶段之间的并行重叠。

长期来看,端脑科技希望建立 H3 任务特征、硬件调度方式和输出质量之间的对应关系。提示词、随机种子、分辨率、视频时长、运动程度和质量评分越完整,系统就越有可能针对不同任务自动选择更合适的推理参数。

M5 Ultra 的 GPU 与 Neural Engine 协同设想

以下内容仅基于 M3 Ultra 测试结果的工程预测,并非 M5 Ultra 实测结果。

Apple 当前公布的 Mac Studio 规格显示,M5 Ultra 最高可配置 80 核 GPU、32 核 Neural Engine、1.2 TB/s 统一内存带宽和 512GB 统一内存,GPU 内还包含 Neural Accelerators。这些硬件特征为异构推理提供了基础:GPU 负责 H3 DiT 的主要去噪计算,Apple Neural Engine 并行运行规模更小、延迟要求更高的辅助模型。

Apple 的 Core ML 计算单元接口支持开发者选择可用的计算资源,包括涉及 Neural Engine 的执行配置。不过,具体子图能否在 Neural Engine 上运行,仍取决于算子支持情况和模型导出结果。

端脑科技规划的异构分工如下。

协同方向 Apple Neural Engine 的拟承担任务 预期作用
动态计算策略 并行运行运动、纹理和语义探针,识别关键区域并分配采样预算 减少不必要的去噪计算
VAE 子图 承担可导出的卷积模块,GPU 继续处理其他算子 缩短部分 VAE 阶段耗时
质量检查与回退 运行冻结帧、亮度、时序和质量判断模型 降低失败输出与重复生成概率
更大模型子图 在算子覆盖稳定后逐步扩大 Neural Engine 的工作范围 提高异构硬件利用率

基于 M3 Ultra 实测基线及上述任务分工,原始技术报告将 M5 Ultra GPU 与 Neural Engine 协同路径的端到端工程目标设定为 2.0 至 2.6 倍。如果 H3 的矩阵计算能够充分利用新加速单元,且 Neural Engine 辅助任务能够与 GPU 并行执行,部分长视频任务可能存在 2.7 至 3.2 倍的进一步提升空间。

这些数字均为前瞻性工程目标,目前没有在 M5 Ultra 上完成实测,待 M5 Ultra 上线后更新实测对比。

测试范围与数据边界

本次测试是针对一台 Apple Silicon 设备和一套特定 H3 部署方案形成的工程基线,不是跨硬件平台性能排行榜。

  • 本次测试没有将 M3 Ultra 与 NVIDIA 显卡、云端服务或其他 Apple 芯片进行对比。

  • 2.09 倍结果仅适用于指定固定任务和 Draft-token 预览档。

  • 原始报告没有提供 Native、Balanced 和 Draft-token 三档之间的同口径感知质量评分。

  • M5 Ultra 相关数据是优化预测,不是实测结果。

  • 软件版本、模型版本、提示词、随机种子、设备温度和后台任务变化,都可能影响最终耗时。

常见问题

MiniMax H3 可以在 Apple M3 Ultra 上本地运行吗?

可以。在端脑科技的测试中,搭载 80 核 GPU 和 512GB 统一内存的 M3 Ultra Mac Studio 完成了模型加载、采样、解码、编码和文件落盘组成的完整本地视频生成流程。

MiniMax H3 在 M3 Ultra 上生成速度有多快?

在 512 x 512、22 帧、20 步的固定任务中,Native 参考档耗时 78.97 秒,Balanced 平衡档耗时 46.14 秒,Draft-token 预览档耗时 37.73 秒。最快档位达到 Native 参考档的 2.09 倍速度。

2.09 倍是端到端加速成绩吗?

不是。2.09 倍来自固定短任务测试。另一项 864 x 480 端到端任务从 232.15 秒缩短至 204.20 秒,实际总耗时下降 12.04%。

M3 Ultra 能否完成 1344 x 768 的 MiniMax H3 视频生成?

可以。测试设备完成了 1344 x 768、120 帧和 360 帧任务,两项任务均为 15 个采样步数,并且没有加载 LoRA。

生成的视频是否经过检查?

是。输出文件通过了完整解码、H.264 24 fps、AAC 32 kHz 双声道和黑屏检测,并完成了运行记录与输出文件对应检查。

M5 Ultra 的加速数据是实测结果吗?

不是。M5 Ultra 相关数字是根据 M3 Ultra 基线、硬件规格和 GPU 与 Neural Engine 协同方案提出的工程目标。端脑科技已在文章中将预测数据与 M3 Ultra 实测数据明确分开。

关于端脑科技

端脑科技(Cephalon)成立于2023年5月,专注于人工智能算力与智能体场景应用,面向创作者、AI开发者、科研人员、企业用户及产业合作伙伴,提供软硬件一体化的 AI 解决方案,推动算力普惠与智能普惠。

公司构建"云、边、端"协同的核心业务体系:云端以"端脑云" AIGC 算力与应用平台整合 GPU 资源及图像、音频、视频、大模型与开发工具,支持一键启用和 API 调用;边缘端连接分散设备,为视频生成、大模型推理与智能体运行提供分布式算力;本地端以"脑花 AINPC"系列智能硬件融合大模型、智能体、专业工作流与私有存储,实现本地运行、数据自主掌控、开机即用。

端脑科技致力于让每一台设备成为智能入口、每一个节点成为算力基础设施,让 AI 能力可部署、算力可调用、数据更可控。

相关推荐
在线OJ的阿川10 天前
基于智慧一考通Web平台的测试报告
功能测试·学习·测试报告
梁辰兴12 天前
软件工程:确认测试
软件工程·最佳实践·测试报告·测试方法·梁辰兴·测试内容·实施条件
weixin_4407305016 天前
allure总结--解决版本不相容,没有trend(生成原始报告+复制history后在一起生成新报告)+jenkins集成
python·测试报告·allure
学代码的真由酱4 个月前
Java文档搜索引擎-测试报告
java·自动化测试·功能测试·搜索引擎·性能测试·测试报告
琪露诺大湿5 个月前
网页聊天系统——测试报告
java·软件测试·功能测试·websocket·html·项目·测试报告
琪露诺大湿5 个月前
VeloQueue-测试报告
java·开发语言·消息队列·单元测试·项目·测试报告
独断万古他化5 个月前
【抽奖活动管理平台】完整质量测试报告:功能 / 自动化 / 性能三大维度总结
功能测试·自动化·接口测试·测试报告·ui测试
蟹至之6 个月前
友聊驿站——测试报告
测试报告
0和1的舞者6 个月前
高并发论坛系统:单元测试 + 接口自动化 + 性能测试 + CI/CD 全链路测试报告
java·测试开发·测试工具·jmeter·pytest·测试·测试报告