H3 开源之后,最受关注的问题之一就是:本地到底怎么跑?这一篇汇总四种主流部署路线,对比各自的适用场景、上手成本和坑点,帮你选对姿势。
路线一:SGLang(推荐)
SGLang 是官方文档里首推的路线,对 H3 的 Omni-Transformer 支持最完整。流程大概是:从 Hugging Face 拉取 checkpoint(FL2VA 或 Ref2VA 任选),起一个 SGLang server,再通过 Python 客户端发请求生成。
优点:官方支持最到位、性能好;缺点:对显存要求高,33B 模型跑 768p 推理建议至少 80GB 级别的显存。
路线二:vLLM
vLLM 是生产环境最常见的大模型推理框架,吞吐量高、与现有 vLLM 生态衔接自然。如果你团队已经在用 vLLM 管理其他模型,把 H3 加进来是最顺的。官方也提供了对应示例。
路线三:diffusers
diffusers 适合"研究型"玩家。它把 H3 的 VAE、Transformer、文本编码器都拆成标准 diffusers 组件,方便你替换其中任意模块做实验。对想深入理解模型结构、或者做二次开发的开发者,这条路最友好------但生成吞吐不如前两者。
路线四:ComfyUI
ComfyUI 是创作者的天堂。如果你不想写代码、只想在节点图上拖拽着生成,ComfyUI 有现成的 H3 工作流。把 checkpoint 放进 models 目录,加载工作流就能出片,适合快速验证效果和做内容生产。
四条路线的取舍一句话总结:要性能和官方支持选 SGLang,要生产吞吐选 vLLM,要做实验和二次开发选 diffusers,要可视化创作选 ComfyUI。
实操前的三个提醒:
-
显存是硬门槛:33B 全模态模型 + 双 VAE,显存不足会非常痛苦。先确认自己的显卡,再决定要不要上 2K 路线。
-
三个 checkpoint 别搞混:FL2VA(首尾帧转视频+音频)和 Ref2VA(参考图/视频/音频混合)功能不同,按任务需求加载。
-
2K 需要 H3-Regenerate-2K:目前还未开源,只能走官方 API。想要最高 2K 分辨率,记得预留 API 调用预算。