本地跑起 MiniMax H3:SGLang/vLLM/diffusers/ComfyUI 四种部署路线实测对比

H3 开源之后,最受关注的问题之一就是:本地到底怎么跑?这一篇汇总四种主流部署路线,对比各自的适用场景、上手成本和坑点,帮你选对姿势。

路线一:SGLang(推荐)

SGLang 是官方文档里首推的路线,对 H3 的 Omni-Transformer 支持最完整。流程大概是:从 Hugging Face 拉取 checkpoint(FL2VA 或 Ref2VA 任选),起一个 SGLang server,再通过 Python 客户端发请求生成。

优点:官方支持最到位、性能好;缺点:对显存要求高,33B 模型跑 768p 推理建议至少 80GB 级别的显存。

路线二:vLLM

vLLM 是生产环境最常见的大模型推理框架,吞吐量高、与现有 vLLM 生态衔接自然。如果你团队已经在用 vLLM 管理其他模型,把 H3 加进来是最顺的。官方也提供了对应示例。

路线三:diffusers

diffusers 适合"研究型"玩家。它把 H3 的 VAE、Transformer、文本编码器都拆成标准 diffusers 组件,方便你替换其中任意模块做实验。对想深入理解模型结构、或者做二次开发的开发者,这条路最友好------但生成吞吐不如前两者。

路线四:ComfyUI

ComfyUI 是创作者的天堂。如果你不想写代码、只想在节点图上拖拽着生成,ComfyUI 有现成的 H3 工作流。把 checkpoint 放进 models 目录,加载工作流就能出片,适合快速验证效果和做内容生产。

四条路线的取舍一句话总结:要性能和官方支持选 SGLang,要生产吞吐选 vLLM,要做实验和二次开发选 diffusers,要可视化创作选 ComfyUI。

实操前的三个提醒:

  1. 显存是硬门槛:33B 全模态模型 + 双 VAE,显存不足会非常痛苦。先确认自己的显卡,再决定要不要上 2K 路线。

  2. 三个 checkpoint 别搞混:FL2VA(首尾帧转视频+音频)和 Ref2VA(参考图/视频/音频混合)功能不同,按任务需求加载。

  3. 2K 需要 H3-Regenerate-2K:目前还未开源,只能走官方 API。想要最高 2K 分辨率,记得预留 API 调用预算。

相关推荐
谢白羽8 小时前
SGLang的AWQ量化笔记
笔记·python·sglang
苏子寒21 小时前
Nano-VLLM全代码解析笔记(10)-GemmaRMSNorm和MRoPE
笔记·机器学习·ai·nlp·vllm
缘友一世2 天前
GLM-5.3-NVFP4 部署实战系列[八]启动加速:编译缓存挂载与 CUDA 图捕获裁剪,首启 8 分钟 → 3 分钟
vllm·glm5.3 nvfp4·sm80
方方洛2 天前
vllm教程-00-前言与导读
人工智能·算法·vllm
缘友一世2 天前
GLM-5.3-NVFP4 部署实战系列[二]Docker 镜像选择与补丁镜像构建:纯 Python overlay,不重编一行 CUDA
python·docker·容器·vllm
缘友一世3 天前
GLM-5.3-NVFP4 部署实战系列[七]正确的部署脚本与一键部署:deploy.sh参数拆解
vllm·glm5.3 nvfp4·sm80
JAI科研3 天前
Deepseek Agent Harness教程(七) | Deepseek Harness不是一个内核加一堆插件
开发语言·人工智能·深度学习·算法·自然语言处理·transformer·vllm
缘友一世3 天前
GLM-5.3-NVFP4 部署实战系列[四]问题深拆①:sm80 没有稀疏 MLA 注意力后端怎么办
vllm·glm5.3 nvfp4·sm80
随便做点啥3 天前
32卡-64G-910B4-16后端-(Qwen3.8-27B-W8A8)集群部署报告
运维·服务器·经验分享·docker·vllm
xueyongfu4 天前
vLLM 模型编译:从 torch.compile 到分段 CUDA Graph
vllm