本地跑起 MiniMax H3:SGLang/vLLM/diffusers/ComfyUI 四种部署路线实测对比

H3 开源之后,最受关注的问题之一就是:本地到底怎么跑?这一篇汇总四种主流部署路线,对比各自的适用场景、上手成本和坑点,帮你选对姿势。

路线一:SGLang(推荐)

SGLang 是官方文档里首推的路线,对 H3 的 Omni-Transformer 支持最完整。流程大概是:从 Hugging Face 拉取 checkpoint(FL2VA 或 Ref2VA 任选),起一个 SGLang server,再通过 Python 客户端发请求生成。

优点:官方支持最到位、性能好;缺点:对显存要求高,33B 模型跑 768p 推理建议至少 80GB 级别的显存。

路线二:vLLM

vLLM 是生产环境最常见的大模型推理框架,吞吐量高、与现有 vLLM 生态衔接自然。如果你团队已经在用 vLLM 管理其他模型,把 H3 加进来是最顺的。官方也提供了对应示例。

路线三:diffusers

diffusers 适合"研究型"玩家。它把 H3 的 VAE、Transformer、文本编码器都拆成标准 diffusers 组件,方便你替换其中任意模块做实验。对想深入理解模型结构、或者做二次开发的开发者,这条路最友好------但生成吞吐不如前两者。

路线四:ComfyUI

ComfyUI 是创作者的天堂。如果你不想写代码、只想在节点图上拖拽着生成,ComfyUI 有现成的 H3 工作流。把 checkpoint 放进 models 目录,加载工作流就能出片,适合快速验证效果和做内容生产。

四条路线的取舍一句话总结:要性能和官方支持选 SGLang,要生产吞吐选 vLLM,要做实验和二次开发选 diffusers,要可视化创作选 ComfyUI。

实操前的三个提醒:

  1. 显存是硬门槛:33B 全模态模型 + 双 VAE,显存不足会非常痛苦。先确认自己的显卡,再决定要不要上 2K 路线。

  2. 三个 checkpoint 别搞混:FL2VA(首尾帧转视频+音频)和 Ref2VA(参考图/视频/音频混合)功能不同,按任务需求加载。

  3. 2K 需要 H3-Regenerate-2K:目前还未开源,只能走官方 API。想要最高 2K 分辨率,记得预留 API 调用预算。

相关推荐
咕噜咕噜啦啦14 小时前
vLLM框架
人工智能·qwen·vllm
thesky1234561 天前
27届大模型面试准备(二十五):推理服务化与投机解码——vLLM、PagedAttention、Medusa 与连续批处理
大模型·vllm·eagle·pagedattention·medusa·推理服务化·投机解码
LitchiCheng3 天前
vllm运行在DGX Spark的启动参数及小问题
人工智能·python·vllm
HyperAI超神经4 天前
【vLLM 学习】Disaggregated Prefill
人工智能·深度学习·学习·vllm
Luchang-Li5 天前
SGLang Qwen3/kimi-k3 Hybrid Linear Mamba KV cache管理
sglang
初级炼丹师(爱说实话版)6 天前
Ubuntu24.04 Docker+vLLM+qianwen2.5-coder-32B部署文档
docker·容器·vllm
一个王同学6 天前
从零到一 | CV转多模态大模型 | week21 | 实战项目-DocuMind-VL:基于 OCR 与 Qwen-VL 的文档多模态问答系统(一)
人工智能·深度学习·计算机视觉·ocr·vllm
江畔柳前堤6 天前
YOLO 目标检测全流程深度剖析
人工智能·yolo·目标检测·计算机视觉·unity·面试·vllm
circuitsosk6 天前
不止于API调用:大模型推理加速与云原生服务化部署指南
python·云原生·agent·vllm·推理加速·大模型部署·ensorrt-llm