本地跑起 MiniMax H3:SGLang/vLLM/diffusers/ComfyUI 四种部署路线实测对比

H3 开源之后,最受关注的问题之一就是:本地到底怎么跑?这一篇汇总四种主流部署路线,对比各自的适用场景、上手成本和坑点,帮你选对姿势。

路线一:SGLang(推荐)

SGLang 是官方文档里首推的路线,对 H3 的 Omni-Transformer 支持最完整。流程大概是:从 Hugging Face 拉取 checkpoint(FL2VA 或 Ref2VA 任选),起一个 SGLang server,再通过 Python 客户端发请求生成。

优点:官方支持最到位、性能好;缺点:对显存要求高,33B 模型跑 768p 推理建议至少 80GB 级别的显存。

路线二:vLLM

vLLM 是生产环境最常见的大模型推理框架,吞吐量高、与现有 vLLM 生态衔接自然。如果你团队已经在用 vLLM 管理其他模型,把 H3 加进来是最顺的。官方也提供了对应示例。

路线三:diffusers

diffusers 适合"研究型"玩家。它把 H3 的 VAE、Transformer、文本编码器都拆成标准 diffusers 组件,方便你替换其中任意模块做实验。对想深入理解模型结构、或者做二次开发的开发者,这条路最友好------但生成吞吐不如前两者。

路线四:ComfyUI

ComfyUI 是创作者的天堂。如果你不想写代码、只想在节点图上拖拽着生成,ComfyUI 有现成的 H3 工作流。把 checkpoint 放进 models 目录,加载工作流就能出片,适合快速验证效果和做内容生产。

四条路线的取舍一句话总结:要性能和官方支持选 SGLang,要生产吞吐选 vLLM,要做实验和二次开发选 diffusers,要可视化创作选 ComfyUI。

实操前的三个提醒:

  1. 显存是硬门槛:33B 全模态模型 + 双 VAE,显存不足会非常痛苦。先确认自己的显卡,再决定要不要上 2K 路线。

  2. 三个 checkpoint 别搞混:FL2VA(首尾帧转视频+音频)和 Ref2VA(参考图/视频/音频混合)功能不同,按任务需求加载。

  3. 2K 需要 H3-Regenerate-2K:目前还未开源,只能走官方 API。想要最高 2K 分辨率,记得预留 API 调用预算。

相关推荐
陈 洪 伟1 天前
大模型推理引擎vLLM(39):CUDAGraph模式以及CUDAGraphWrapper和BreakableCUDAGraphWrapper问题整理
vllm
论文复现现场1 天前
A100 跑 Qwen3.8-27B,FP8 还是 INT8?显存、速度、精度与微调兼容性怎么选
模型量化·vllm·a100·大模型部署·int8·fp8·qwen3.8
Zhu7581 天前
docker环境,vLLM 部署 Qwen3.8-27B
docker·qwen·vllm
basketball6162 天前
Python FastAPI 介绍以及常用方法
python·fastapi·vllm·ai infra
AI模力圈2 天前
slime 源码走读:SGLang-Native 推理架构解析(上)
源码解析·sglang·slime
论文复现现场2 天前
RTX 3090 如何跑 13B 级大模型推理?4-bit AWQ、vLLM 部署与并发调优实战
模型量化·vllm·大模型推理·awq·算家云·rtx3090
一颗小树x3 天前
vLLM大模型推理:Jetson AGX Thor 的 GPU 共享内存清理实战
jetson·vllm·vlm·gpu内存清理
论文复现现场4 天前
Qwen3.8-27B 做 GRPO 需要几张 GPU?4×RTX 4090 与 8×RTX 4090 显存、vLLM 和 ZeRO-3 配置分析
deepspeed·qlora·大模型训练·vllm·rtx4090·grpo·qwen3.8
安易算力4 天前
昇腾生态开发深度实践:CANN算子库架构解析与MindSpore模型优化
网络·容器·架构·kubernetes·vllm
SunnyRivers4 天前
vLLM 官方调优方案
优化·vllm