5 秒视频 1.65 秒生成:英伟达开源的这套推理栈,把「实时视频生成」钉进了现实

💡 一句话总结:NVIDIA Research 开源了 Sol-H3------针对 MiniMax-H3 视频模型的端到端推理加速栈,单台 8 卡 B300 上 5 秒带立体声的 1344×768 视频只要 1.653 秒生成,比播放还快。加速是「少步采样 + 免训练注意力稀疏 + 一整套系统优化」三层叠加,代码全开源;「边生成边看」从 PPT 叙事变成了可复现的工程事实。

导语:生成视频的人,都在等

用过文生视频的人都有同款体验:敲完 prompt,点生成,然后------去泡杯咖啡吧。5 秒的片子等十几二十秒是常态,跑长镜头?那是「挂机一小时」级别的等待。视频生成想做直播、做交互、做 agent 里的世界模拟器,第一道坎不是模型能力,是这个「等」。

9 月初,NVIDIA Research(高效 AI 团队 & 新加坡实验室)把一道相当硬核的答案开源了:Sol-H3。口号只有一行字------「5s of world. 1.653s to infer」:生成 5 秒世界,推理只要 1.653 秒。生成比播放还快,意味着理论上你可以无停顿地「边生成边看」。

想自己动手?

「快于播放」到底是什么概念

先看数字。同样是生成 5 秒 1344×768、24FPS、带立体声音频的视频(同一 prompt、同一随机种子,取三次运行中位数):

GPU 配置 基线 Base H3(50 步) Sol-H3(4 步) 加速比
8× B300 18.250 秒 1.653 秒 11.04×
4× B300 35.328 秒 2.918 秒 12.11×
1× B300 129.898 秒 13.745 秒 9.45×

把话说清楚:这里的「快于播放」,说的是 8 卡旗舰机(B300 是英伟达当前顶配数据中心卡)上 1.653 秒生成 5 秒片子。消费级单卡没有这个速度------1 张 B300 生成同样的片子要 13.7 秒。但方向是真的:延迟第一次被压到了播放时长以内,实时化的最后一道工程门槛被实测拆掉了。

还有一个容易误读的地方需要澄清:这个「11 倍」不是纯运行时优化的结果。基线模型走 50 个采样步(49 次模型前向),Sol-H3 只走 4 步(4 次前向)------采样步数本身差了一个量级。官方也明说了这是「不是只改注意力的运行时优化」。所以准确的读法是:少步采样(画质换速度)× 注意力稀疏 × 系统工程,三层叠加出 11 倍。引用这个数字时得带口径:计时含文本编码、去噪、视频/音频解码,但不含模型加载、编译预热和最后的 MP4 封装。

怎么做到的:一次系统级的组合拳

Sol-H3 是两个核心系统咬合的结果:Sol-Engine (把整条推理流水线做快)和 Sol-Attn(让注意力只算重要的部分)。拆开看最有意思的三块:

🚀 Sol-Attn:免训练的「选择性精确」 。注意力计算的痛点是所有 token 两两算相似度,成本平方增长。Sol-Attn 的思路是:推理时按查询块动态打分,重要的注意力块老老实实精确算,不重要的用池化摘要近似带过------而且不用重训模型,直接吃现成权重。这对存量模型是相当友好的设计:换个新模型,加速栈几乎白拿。

🧩 算子融合:少搬数据就是快。Norm、RoPE(旋转位置编码)、MLP 这些操作「活多钱少」------张量很宽但计算量不大,瓶颈在显存搬运。Sol-H3 把反复出现的三条操作链融成一步,中间结果留在寄存器里不回显存。50 个 transformer 块跑下来,省的是整整 50 轮的搬运。

📦 多卡通信与解码:8 卡不打架。8 卡并行的通信做了「打包直送」------最快档用 INT8 传 QKV、FP8 传注意力输出,一次 all-to-all 搞定,去掉所有中间拷贝。视频解码也并行化:5 秒片子切成 196 个空间瓦片摊给 8 卡,一批编译好的解码调用收工。另外所有可预计算的条件参数(AdaLN)提前算好缓存,每步省约 400 次小计算启动、约 26GB 的显存读取。

完整的清单还有三项(稀疏计划构建融合、并行 VAE 分块解码、AdaLN 缓存),官方项目页给每一项都配了机制、原理和实测证据------这份「每项优化都有数字背书」的坦诚在技术发布里算得上稀有。

谁做的,生态里都有谁

看致谢名单会发现这是个「学术圈 + 产业界」的混编阵容:核心贡献者包括韩松(Song Han,MIT,模型压缩领域的老熟人)、Enze Xie、Jincheng Yu 等。生态位也摆得很清楚:

  • MiniMax:H3 视频模型本身开源权重,是被加速的对象;
  • UCSD Hao AI Lab:FastH3 四步适配器,解决「少步采样」这一层;
  • Reactor:托管在线 demo,让不动手的人也能玩;
  • LightX2V:开源 Turbo LoRA 与工作流。

社区扩散速度也值得一提:发布几天内,GitHub 上已经出现至少三个第三方仓库,把这套东西往 DGX Spark(桌面级单机)上移植。官方没测过的硬件,社区已经自行动手了------不过这些移植的性能数据都是自报,未经验证。

对你意味着什么

分三种人看:

  • 做视频应用/agent 的开发者:实时生成在工程上成立,意味着产品形态可以重新想------不是「提交任务等结果」,而是「流式地长出来」。官方预告的下一步就是 24FPS 连续流式与实时交互(改 prompt 不重启会话)。
  • 推理系统工程师:这六个优化点全部有代码、有数据、有论文,基本是一份公开的系统设计教材,vLLM 之于文本生成的关系,Sol-Engine 想在视频生成上复刻一遍。
  • 视频模型厂:推理栈被硬件厂官方卡位之后,竞争维度变了------「模型开源 + 官方加速栈」会变成用户的默认期待。

把话说明白

回到开头那杯咖啡:Sol-H3 没有让消费级显卡跑出实时,也没有公布「4 步 vs 50 步」的画质损失量化对比(官方样例看着不错,但没有 FVD 这类指标背书,这点得自己跑样例试)。站得住的是:代码开源、数字带口径、方法有论文,三层加速的拆解清清楚楚。有争议的是:基准全部在自家 B300 上测得,跨硬件的最优性未知------英伟达既是裁判又是选手。没证实的是:DGX Spark 移植的实际效果。

不过话说回来,一个「生成快于播放」的开关被打开之后,真正值得盯的已经不是这条基准,而是接下来几个月里,第一批「边生成边看」的产品会长什么样。


参考来源

相关推荐
辰域电子1 小时前
STM32项目开源:电子秤计价系统(代码+原理图+仿真)
stm32·单片机·嵌入式硬件·开源·毕业设计·proteus
zzzzzz3104 小时前
anthropics/skills:高关注度“官方技能”项目,应该怎样读
人工智能·开源·github
梦梦代码精12 小时前
《回收租赁系统技术选型避坑指南:业务闭环与二开自由度详解》
开发语言·低代码·docker·开源·代码规范
冬奇Lab14 小时前
一天一个开源项目(第213篇):public-apis —— 474k Star 的免费 API 终极清单
开源·资讯
vipjx117 小时前
2026实测百度网盘文件满速下载方案:主流油猴脚本搭配技巧汇总
开源
辰域电子17 小时前
STM32项目开源:智能万年历/智能闹钟设计(代码+原理图+仿真)
stm32·单片机·嵌入式硬件·开源·proteus
分布式存储与RustFS18 小时前
RustFS 1.0 GA 前的生产验收清单:从 rc.1 到 GA 该准备什么
云原生·开源·对象存储·分布式存储·s3·rustfs·性能基准
ApacheSeaTunnel21 小时前
195 次合并、13 个新连接器!Apache SeaTunnel 8 月有哪些新进展?
大数据·开源·数据集成·seatunnel·技术分享·数据同步