💡 一句话总结:NVIDIA Research 开源了 Sol-H3------针对 MiniMax-H3 视频模型的端到端推理加速栈,单台 8 卡 B300 上 5 秒带立体声的 1344×768 视频只要 1.653 秒生成,比播放还快。加速是「少步采样 + 免训练注意力稀疏 + 一整套系统优化」三层叠加,代码全开源;「边生成边看」从 PPT 叙事变成了可复现的工程事实。
导语:生成视频的人,都在等
用过文生视频的人都有同款体验:敲完 prompt,点生成,然后------去泡杯咖啡吧。5 秒的片子等十几二十秒是常态,跑长镜头?那是「挂机一小时」级别的等待。视频生成想做直播、做交互、做 agent 里的世界模拟器,第一道坎不是模型能力,是这个「等」。
9 月初,NVIDIA Research(高效 AI 团队 & 新加坡实验室)把一道相当硬核的答案开源了:Sol-H3。口号只有一行字------「5s of world. 1.653s to infer」:生成 5 秒世界,推理只要 1.653 秒。生成比播放还快,意味着理论上你可以无停顿地「边生成边看」。
想自己动手?
- 🌐 官方项目页(含交互式基准):Sol-H3 · NVIDIA Research
- 💻 开源代码:NVlabs/Sana(sol-engine 分支)
- 🎮 在线 demo:Reactor 实时沙盒
- 📄 方法论文:Sol-Engine / Sol-Attn
「快于播放」到底是什么概念
先看数字。同样是生成 5 秒 1344×768、24FPS、带立体声音频的视频(同一 prompt、同一随机种子,取三次运行中位数):
| GPU 配置 | 基线 Base H3(50 步) | Sol-H3(4 步) | 加速比 |
|---|---|---|---|
| 8× B300 | 18.250 秒 | 1.653 秒 | 11.04× |
| 4× B300 | 35.328 秒 | 2.918 秒 | 12.11× |
| 1× B300 | 129.898 秒 | 13.745 秒 | 9.45× |
把话说清楚:这里的「快于播放」,说的是 8 卡旗舰机(B300 是英伟达当前顶配数据中心卡)上 1.653 秒生成 5 秒片子。消费级单卡没有这个速度------1 张 B300 生成同样的片子要 13.7 秒。但方向是真的:延迟第一次被压到了播放时长以内,实时化的最后一道工程门槛被实测拆掉了。
还有一个容易误读的地方需要澄清:这个「11 倍」不是纯运行时优化的结果。基线模型走 50 个采样步(49 次模型前向),Sol-H3 只走 4 步(4 次前向)------采样步数本身差了一个量级。官方也明说了这是「不是只改注意力的运行时优化」。所以准确的读法是:少步采样(画质换速度)× 注意力稀疏 × 系统工程,三层叠加出 11 倍。引用这个数字时得带口径:计时含文本编码、去噪、视频/音频解码,但不含模型加载、编译预热和最后的 MP4 封装。
怎么做到的:一次系统级的组合拳
Sol-H3 是两个核心系统咬合的结果:Sol-Engine (把整条推理流水线做快)和 Sol-Attn(让注意力只算重要的部分)。拆开看最有意思的三块:
🚀 Sol-Attn:免训练的「选择性精确」 。注意力计算的痛点是所有 token 两两算相似度,成本平方增长。Sol-Attn 的思路是:推理时按查询块动态打分,重要的注意力块老老实实精确算,不重要的用池化摘要近似带过------而且不用重训模型,直接吃现成权重。这对存量模型是相当友好的设计:换个新模型,加速栈几乎白拿。
🧩 算子融合:少搬数据就是快。Norm、RoPE(旋转位置编码)、MLP 这些操作「活多钱少」------张量很宽但计算量不大,瓶颈在显存搬运。Sol-H3 把反复出现的三条操作链融成一步,中间结果留在寄存器里不回显存。50 个 transformer 块跑下来,省的是整整 50 轮的搬运。
📦 多卡通信与解码:8 卡不打架。8 卡并行的通信做了「打包直送」------最快档用 INT8 传 QKV、FP8 传注意力输出,一次 all-to-all 搞定,去掉所有中间拷贝。视频解码也并行化:5 秒片子切成 196 个空间瓦片摊给 8 卡,一批编译好的解码调用收工。另外所有可预计算的条件参数(AdaLN)提前算好缓存,每步省约 400 次小计算启动、约 26GB 的显存读取。
完整的清单还有三项(稀疏计划构建融合、并行 VAE 分块解码、AdaLN 缓存),官方项目页给每一项都配了机制、原理和实测证据------这份「每项优化都有数字背书」的坦诚在技术发布里算得上稀有。
谁做的,生态里都有谁
看致谢名单会发现这是个「学术圈 + 产业界」的混编阵容:核心贡献者包括韩松(Song Han,MIT,模型压缩领域的老熟人)、Enze Xie、Jincheng Yu 等。生态位也摆得很清楚:
- MiniMax:H3 视频模型本身开源权重,是被加速的对象;
- UCSD Hao AI Lab:FastH3 四步适配器,解决「少步采样」这一层;
- Reactor:托管在线 demo,让不动手的人也能玩;
- LightX2V:开源 Turbo LoRA 与工作流。
社区扩散速度也值得一提:发布几天内,GitHub 上已经出现至少三个第三方仓库,把这套东西往 DGX Spark(桌面级单机)上移植。官方没测过的硬件,社区已经自行动手了------不过这些移植的性能数据都是自报,未经验证。
对你意味着什么
分三种人看:
- 做视频应用/agent 的开发者:实时生成在工程上成立,意味着产品形态可以重新想------不是「提交任务等结果」,而是「流式地长出来」。官方预告的下一步就是 24FPS 连续流式与实时交互(改 prompt 不重启会话)。
- 推理系统工程师:这六个优化点全部有代码、有数据、有论文,基本是一份公开的系统设计教材,vLLM 之于文本生成的关系,Sol-Engine 想在视频生成上复刻一遍。
- 视频模型厂:推理栈被硬件厂官方卡位之后,竞争维度变了------「模型开源 + 官方加速栈」会变成用户的默认期待。
把话说明白
回到开头那杯咖啡:Sol-H3 没有让消费级显卡跑出实时,也没有公布「4 步 vs 50 步」的画质损失量化对比(官方样例看着不错,但没有 FVD 这类指标背书,这点得自己跑样例试)。站得住的是:代码开源、数字带口径、方法有论文,三层加速的拆解清清楚楚。有争议的是:基准全部在自家 B300 上测得,跨硬件的最优性未知------英伟达既是裁判又是选手。没证实的是:DGX Spark 移植的实际效果。
不过话说回来,一个「生成快于播放」的开关被打开之后,真正值得盯的已经不是这条基准,而是接下来几个月里,第一批「边生成边看」的产品会长什么样。
参考来源
- NVIDIA Research 官方项目页(一手/官方)--- https://nvlabs.github.io/Sana/Sol-Engine/Sol-H3/
- NVlabs/Sana 开源仓库(一手/官方)--- https://github.com/NVlabs/Sana/tree/sol-engine/models/minimax_h3/Sol-H3
- Sol-Engine 论文(一手/学术)--- https://arxiv.org/abs/2606.23743
- Sol-Attn 论文(一手/学术)--- https://arxiv.org/abs/2607.24027
- MiniMax-H3 开源权重(一手/官方)--- https://huggingface.co/MiniMaxAI/MiniMax-H3
- FastH3 Preview 博客(学术团队)--- https://haoailab.com/blogs/fasth3-preview/
- Reactor 在线 demo(合作方)--- https://www.reactor.inc/sandbox?model=fast-h3