摘要
本文解读 arXiv 2025 论文《Wan-S2V: Audio-Driven Cinematic Video Generation》。该论文提出Wan-S2V 音频驱动电影级视频生成模型 ,通过融合文本全局运动控制 (运镜、轨迹、交互)、音频局部细节驱动 (表情、唇形、手势)与Wan 2.1 视频生成基座 ,把音频驱动人像生成从简单的 talking head 推进到影视级复杂场景。其特别之处在于全参数微调保持文本控制力,并用 FramePack 压缩运动帧 token 实现长视频一致。实验表明 EMTD 基准上 FID 15.66、PSNR 20.49、CSIM 0.677 全面领先,为数字人内容创作与影视预可视化提供了可直接复用的开源基础设施。
视频讲解 :点击观看 B 站视频
- 摘要
- 论文基本信息
- 为什么音频驱动视频生成难以达到影视级?
- 研究主线:从问题到结论
- 基准/方法设计
- 音频驱动方法分类全景
- 方法细节
- 实验设计与结果
- 结果对比总结
- 关键发现
- 局限性
- 常见问题(FAQ)
- [Wan-S2V 和普通数字人视频生成有什么不同?](#Wan-S2V 和普通数字人视频生成有什么不同?)
- [Wan-S2V 为什么选择全参数微调?](#Wan-S2V 为什么选择全参数微调?)
- [FramePack 在 Wan-S2V 中起什么作用?](#FramePack 在 Wan-S2V 中起什么作用?)
- [Wan-S2V 的评测结果如何?](#Wan-S2V 的评测结果如何?)
- [1.3B 轻量版和 14B 版是什么关系?](#1.3B 轻量版和 14B 版是什么关系?)
- 模型开源在哪里?
- 参考链接
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | Wan-S2V: Audio-Driven Cinematic Video Generation |
| 标题(中文) | 音频驱动电影级视频生成 ------ Wan-S2V |
| 作者 | HumanAIGC Team(阿里巴巴通义实验室,24 位贡献者:Xin Gao, Li Hu, Siqi Hu, Bang Zhang, Jingren Zhou 等) |
| 机构 | Tongyi Lab, Alibaba Group |
| 会议 | arXiv 2025 |
| arXiv | https://arxiv.org/abs/2508.18621 |
| 项目网站 | https://wan.video |
为什么音频驱动视频生成难以达到影视级?
音频驱动的人像视频生成在数字人说话、唱歌等 solo 场景已有不错表现:EMO 用扩散模型实现任意肖像的音频驱动,EchoMimicV2 与 MimicMotion 依赖预提取姿态序列做动画,OmniHuman、Hunyuan-Avatar 则基于大规模视频基座直接生成。但这些方法普遍存在三个短板:其一,数据与训练都聚焦简单说话头 ,影视剧所需的复杂人物互动、大幅肢体动作与动态运镜难以覆盖;其二,部分参数微调易引发文本与音频控制冲突 ,模型学会听音频后往往丢掉提示词的控制力;其三,长视频一致性差,EMO 式运动帧机制虽然能衔接片段,但运动帧过多会带来极高的计算复杂度。
从历史视角看,音频驱动生成经历了从 Wav2Lip 时代仅做唇形同步、到 EMO 开启任意肖像扩散驱动、再到本文影视级扩展的三阶段演进(详见附录 H)。Wan-S2V 的核心判断是:影视级生成必须同时利用文本与音频两种互补信号------文本负责全局动态 (摄像机运动、人物轨迹、实体交互),音频负责细微表现(表情、手势、头部朝向)。团队据此从数据、训练、推理三个层面系统性解题,最终把高质量音频驱动生成从"嘴型对齐"升级为"表演生成"。
研究主线:从问题到结论

图 7:Wan-S2V 研究主线------从说话头到影视级生成的四步推理链(Mermaid 流程图)
基准/方法设计
Wan-S2V 建立在 Wan 2.1(DiT + 3D VAE 的开源视频基座)之上,是一个带音频条件注入的流匹配去噪模型。训练时目标视频经 3D VAE 编码为潜变量,按流匹配公式加噪:x_t = t\\epsilon + (1-t)x_0,模型学习预测速度场 \\epsilon - x_0;推理时参考帧、运动帧与目标帧的潜变量 patchify 后拼接为视觉 token 序列,逐时间步去噪还原视频。

图 1:Wan-S2V 整体流程------参考图 + 音频 + 文本提示 → 与音频同步的电影级视频
四个关键设计要素:
- 文本-音频双通道解耦:文本描述运镜与轨迹,音频驱动表情与手势,两者互补而非竞争。
- 全参数微调:14B 模型全量训练而非只训部分参数,用模型容量消解文本/音频控制冲突。
- 逐帧掩码控制:音频影响区域逐帧可掩码,推理时支持多角色对话驱动。
- FramePack 长视频:运动帧按不同时间分辨率压缩 token,容纳更多历史帧而计算可控。
音频驱动方法分类全景

图 8:音频驱动人像生成方法分类------Wan-S2V 位于影视级场景分支(Mermaid 流程图)
方法细节
音频注入:原始波形先经 Wav2Vec 编码,再用可学习加权层融合浅层节奏/情感与深层词义特征,最后经多个因果一维卷积沿时间轴压缩,得到第 i 帧的音频特征 a_i。Audio Block 中,视觉 token 按时间维切段 x_{ti},注意力只在 a_i 与 x_{ti} 之间计算而非全 3D 注意力,既降低开销又天然帧同步。

图 2:音频注入管线------Wav2Vec 特征 → 加权融合 → 因果卷积压缩 → 逐帧 Audio Block 注意力
训练策略(附录 B):采用 FSDP + 上下文并行(RingAttention + Ulysses)的混合并行方案,14B 参数分片到单节点 8 张 80GB 显存卡,单步迭代从约 100 秒降至约 12 秒,近线性加速;支持 16B+ 参数规模与 48 帧 1024×768 高分辨率训练。变长分辨率训练以 patchify 后 token 数为上限 M,超限缩放或裁剪。三阶段训练:音频编码器预训练 → 全量预训练(影视 + 说话数据)→ 高质量 SFT。
实验设计与结果
数据流水线(附录 A):从 OpenHumanVid、Koala36M 等开放集与自建说话/唱歌数据出发,构建数百万级初筛池,再经三层把关------ViTPose→DWPose 姿态跟踪与时空占比细筛、Dover 清晰度 / UniMatch 光流稳定性 / 人脸手部 Laplacian 锐度 / Light-ASD 音画同步的质量检测、QwenVL2.5-72B 稠密字幕标注(强调人物运动、运镜与环境)。

图 3:分层筛选流水线------姿态/质量/音画同步/字幕四层把关
定量评测:在 EMTD 数据集(solo 说话视频)上与 EchoMimicV2、MimicMotion、EMO2、FantasyTalking、Hunyuan-Avatar 五个基线对比,结果如下(FID/FVD 越低越好,其余越高越好):
| 方法 | FID↓ | FVD↓ | PSNR↑ | CSIM↑ |
|---|---|---|---|---|
| EchoMimicV2 | 33.42 | 217.71 | 18.17 | 0.519 |
| MimicMotion | 25.38 | 248.95 | 17.15 | 0.608 |
| EMO2 | 27.28 | 129.41 | 17.75 | 0.650 |
| FantasyTalking | 22.60 | 178.12 | 19.63 | 0.626 |
| Hunyuan-Avatar | 18.07 | 145.77 | 18.16 | 0.583 |
| Wan-S2V(本文) | 15.66 | 129.57 | 20.49 | 0.677 |
Wan-S2V 在 FID、PSNR、CSIM 上全面第一,FVD 129.57 与 EMO2 的 129.41 基本持平------注意 EMO2 依赖预生成姿态序列与 MANO 手模型,本文在不依赖姿态输入的端到端框架下达到同等视频连贯性,实用性更强。
定性对比:Hunyuan-Avatar 在剧烈运动时出现面部扭曲与身份漂移,OmniHuman 生成动作幅度过小、接近参考图静态;Wan-S2V 在动作幅度与身份一致性上同时占优。

图 4:定性对比------Hunyuan-Avatar 身份漂移、OmniHuman 运动受限,Wan-S2V 两者兼得
长视频一致性(附录 D):与 OmniHuman 相比,Wan-S2V 依靠 FramePack 编码更多运动帧,跨片段保持运动趋势(列车方向与速度)与物件身份(纸片外观不漂移);没有 FramePack 时同类物件会出现明显漂移。

图 5:长视频对比------跨片段保持运动趋势(列车方向与速度)

图 6:FramePack 支撑更多运动帧------跨片段保持物件身份
结果对比总结

图 9:Wan-S2V 定量结果总结------四项指标领先、一项持平(Mermaid 流程图)
关键发现
- 双通道控制有效:文本管全局(运镜/轨迹/交互)、音频管局部(表情/手势/唇形),全参数训练下两者和谐共存,这是影视级表达力的来源。
- 定量全面领先:EMTD 上 FID 15.66(次优 18.07)、PSNR 20.49(次优 19.63)、CSIM 0.677(次优 0.650),帧质量与身份一致性均达 SOTA。
- 训练效率近线性:FSDP + 上下文并行把 14B 训练单步从约 100 秒压到约 12 秒,8 卡即可训 48 帧 1024×768 高分辨率。
- 长视频稳定:FramePack 支持更多运动帧,跨片段保持运动趋势与物件身份,解决影视场景的核心痛点。
- 轻量部署路线:同数据同方法训练 1.3B 版本,缓解 14B 推理 81 帧 1080P 需 A100 超 30 分钟的成本问题。
- 创新模式命中三个(附录 C):统一异构输入到同一空间(文本/音频/图像共注入 DiT token 空间)、通过条件化适配而非重训练(基座冻结式注入音频条件且文本控制不退化)、通过构造编码结构(逐帧音频-视觉注意力天然帧同步且支持掩码)。大规模受控实验与开源双规模模型使其成为社区可复用基础设施。
- 应用可扩展:逐帧音频掩码支持多角色对话,基座视频加噪实现唇形编辑,模型已在 Hugging Face 与 ModelScope 开源。
局限性
- 多人互动:音频目前只能驱动单个角色,细粒度多人交互仍是未解难题。
- 运镜控制:纯音频驱动的精确摄像机控制尚未实现,仍需文本提示配合。
- 推理成本:14B 推理 81 帧 1080P 视频在单张 A100 上超过 30 分钟,1.3B 版以质量为代价换取效率。
- 数据成本:影视级数据的筛选与人工 curation 依赖高成本流水线。
- 未来方向:团队 Vida 研究系列将持续推进角色高级控制与动态舞蹈生成。
常见问题(FAQ)
Wan-S2V 和普通数字人视频生成有什么不同?
普通数字人方法聚焦说话头,只做唇形与头部同步;Wan-S2V 面向影视级场景,用文本控制运镜与全局运动、音频控制表情与局部动作,能生成大幅肢体动作、多人互动与长镜头一致的视频,且保持人物身份不漂移。
Wan-S2V 为什么选择全参数微调?
部分参数微调容易导致文本控制与音频控制相互冲突。团队假设更大的模型容量更有利于学习两种控制的和谐共存,因此对 14B 模型做全参数训练,实测文本提示控制力得到保留、音频驱动效果同时领先。
FramePack 在 Wan-S2V 中起什么作用?
长视频生成需要大量历史运动帧,但运动帧 token 过多会急剧增加计算量。FramePack 按不同时间分辨率压缩运动帧 token,使模型能携带更多历史帧,从而在跨片段生成中保持运动趋势与物件身份一致。
Wan-S2V 的评测结果如何?
在 EMTD 数据集上对比五个开源方法,Wan-S2V 的 FID 15.66、PSNR 20.49、CSIM 0.677 全面第一,FVD 129.57 与依赖预生成姿态的 EMO2(129.41)基本持平,说明端到端框架已具备同等视频连贯性。
1.3B 轻量版和 14B 版是什么关系?
两者使用相同的数据与训练方法。14B 版面向影视级复杂场景,1.3B 版重点优化说话/唱歌等相对简单场景,推理成本更低、部署门槛更低,方便社区用户在消费级硬件上使用。
模型开源在哪里?
模型权重已发布在 Hugging Face 与 ModelScope 平台,代码与模型均面向社区开放,可用于数字人直播、影视预可视化、多角色对话生成与视频唇形编辑等场景。
参考链接
- 论文:https://arxiv.org/abs/2508.18621
- 项目/模型:https://wan.video(Hugging Face: Wan-AI 组织,ModelScope 同步开源)
- 基座模型 Wan 2.1:https://arxiv.org/abs/2503.20314
- EMO(运动帧机制):https://arxiv.org/abs/2402.17485
- FramePack(运动帧压缩):https://github.com/pixeli99/FramePack
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群 :白拾的小屋 (750365700)
⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页 :YhbCode000(工程文件)