【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角

摘要

本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型 ,通过融合DiT 架构Flow Matching 训练Wan-VAE 时空压缩 ,以 14B 旗舰 + 1.3B 消费级 双规模覆盖 8 大生成任务 ,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.22% 登顶、超过 Sora(84.28%),1.3B 模型仅需 8.19GB 显存即可运行,为开源视频生成社区提供了可复现、可扩展的重要基座。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Wan: Open and Advanced Large-Scale Video Generative Models
标题(中文) 开源视频生成大模型 Wan 2.1
作者 Ang Wang et al. · Wan Team, Alibaba Group(61 人团队)
机构 阿里巴巴集团 · 通义实验室(通义万相团队)
会议 arXiv 2025
arXiv https://arxiv.org/abs/2503.20314
项目网站 https://wan.video/(代码:https://github.com/Wan-Video/Wan2.1)

背景与动机

开源与闭源视频生成模型之间存在三大差距 :性能不足、能力单一(开源模型基本只做 T2V 文生视频)、效率不足。闭源商业模型自 Sora(2024.02)发布后迅速迭代:Kling / Luma 1.0 / Gen-3(06 月)→ Vidu(07 月)→ Hailuo / Kling 1.5(09 月)→ Pika 1.5 / Movie Gen(10 月)→ Kling 1.6 / Veo 2(12 月),而开源社区则沿 U-Net 路线(VDM / MagicVideo / AnimateDiff)演进到 DiT (2022)与 Latte,再到 MM-DiT(Mochi / HunyuanVideo)、LTX-Video;文本编码从 T5 / CLIP 演进到 HunyuanVideo 的多模态大模型方案。已有开源模型多为单任务 T2V,Wan 2.1 则以同一基座覆盖 8 类任务 ,公开全部训练细节与评测工具,并首个支持中英双语视频内文字。

图 1:Wan 与开源 / 闭源 SOTA 模型的对比:基准测试与人类评测均占优(HunyuanVideo 为开源权重评测)

图 2:Wan 生成样例:大运动、高保真细节,首个支持视频内中英文文字生成

从历史视角看(附录 H),视频生成基座经历了 2022 年 DiT 证明视觉生成可纯靠 Transformer 缩放、2024 年 Sora 破圈引发行业热潮、2024 年开源浪潮(CogVideoX / Mochi / LTX-Video / HunyuanVideo)逐步拉近差距,到 2025 年 Wan 2.1 以开源双规模基座(14B / 1.3B)实现 8 任务 + 中英文字生成,再到 Wan 2.2 / 2.5 的 MoE 化持续扩展。Wan 对下游至关重要:全栈开源 (数据管线 + VAE + 训练细节可复现,降低二次开发门槛)、条件化友好 (掩码 / 适配器机制天然支持动作、相机等外部条件注入)、双规模(1.3B 适合机器人等边缘端实时部署)------具身智能世界模型(Vid2World、Genie Envisioner、DreamDojo、WoW)已直接以 Wan 类基座做动作条件化。Wan 完成了从"闭源商业能力"到"可复现开源基础设施"的迁移,成为视频生成与具身世界模型的公共底座。

研究主线:从问题到结论

图 11:研究主线(Mermaid 流程图):问题 → 动机 → 设计 → 方法 → 实验 → 结论

基准/方法设计

Wan 2.1 的核心设计围绕双规模策略一基座多任务展开:

  • 双规模 :14B 旗舰参数对标闭源商业模型;1.3B 消费级模型仅需 8.19GB 显存,消费级显卡即可运行。
  • 8 大任务:T2V 文生视频、I2V 图生视频、视频编辑、T2I 文生图、个性化、相机控制、实时生成、音频生成,全部由一个基座通过条件化适配完成。
  • 全流程公开:数据构建、VAE、训练策略、加速技术、自动化评测工具一并开源。
  • 训练成本可控:训练成本约为 L(\\alpha bsh\^2 + \\beta bs\^2h),其中 DiT 占 85% 以上算力,14B 模型在可负担预算内完成训练。

分类全景

图 12:分类全景(Mermaid 结构树):一基座覆盖 T2V / I2V / 编辑 / T2I / 个性化 / 相机 / 实时 / 音频

方法细节

Wan-VAE :4×8×8 时空压缩、16 通道、127M 参数,将视频映射到紧凑潜空间;因果 3D 卷积 + RMSNorm、三阶段训练,特征缓存推理比 HunyuanVideo 快 2.5×

DiT 主干 :3D patchify + 全时空注意力 + 文本 cross-attention + 全共享 adaLN(相比独立 adaLN 参数减少 25%)。消融表明深度优先于 adaLN 参数量:1.5B 全共享 35 层 loss 最低,是 14B 高效扩展的关键。

Flow Matching 训练:256px 图像预训练 → 三阶段分辨率课程(256 → 480 → 720px)→ 后训练;文本编码用 umT5(5.3B 参数)。

数据引擎:4 步清洗(淘汰约 50% 数据)+ DenseCaption 稠密标注(LLaVA 风格 + Qwen2.5,视频 3fps 且不超过 129 帧);100 聚类 + 专家 1--5 分筛选、6 级运动分层,使训练 / 评测分布对齐。

大规模训练:FSDP + 2D 上下文并行(Ring 外层 / Ulysses 内层);1M token 规模下注意力占训练时间 95%。

图 3:Wan 整体架构:文本(umT5)与视频经 VAE 编码后进入 3D patchified DiT

图 4:Wan-VAE:橙色 2× 时空 + 绿色 2× 空间下采样,共 4×8×8 压缩

图 5:分阶段数据供给:按训练阶段调节运动幅度、质量与类别比例

推理加速三件套(附录 A)

Wan 的推理加速是三层叠加:Diffusion Cache (注意力缓存 + CFG 缓存 + 残差补偿)提速 1.62×FP8 GEMM 矩阵乘降精度额外 1.13×;8-bit FlashAttention (INT8 S / FP8 O / FP32 跨块累加)再提 1.27×,在 H20 上达到 95% MFU。分布式层面 FSDP 模型分片 + 2D 上下文并行近线性扩展,256K token 时通信开销从 10% 降至 1% 以下。约 50 步采样,加速组合使 14B 推理从"不可用"降至可部署水平。

下游任务:I2V 与视频编辑(附录 B)

Wan-I2V 采用掩码条件图生视频:\[噪声; 条件潜变量; mask\] 通道拼接送入 DiT,CLIP 图像编码经 3 层 MLP 进入解耦 cross-attention;统一视频续写、首尾帧变换、随机插帧,支持 480p 与 720p 双档。人类评测 4 维胜率 vs CN-TopD 综合 81.6%

VACE 统一可控编辑框架:输入范式 VCU = \[文本; 上下文帧; mask\],概念解耦 F_c=F\\times M / F_k=F\\times(1-M);Context Adapter 微调不动基座权重,从 Wan-T2V-14B 训练至 720p。全部下游都通过条件化适配复用同一基座。

图 8:Wan-I2V 框架:掩码机制统一视频续写与首尾帧变换

个性化与相机控制(附录 D)

零样本视频个性化 免特征提取器:直接在 Wan-VAE 潜空间做人脸条件(自注意力范式),K 帧人脸 + 对齐 landmark 前置拼接、inpainting 式扩散;数据为 O(10)M 清洗视频 + O(1)M Instant-ID 合成人脸,ArcFace 相似度 0.5526,接近闭源 CN-TopA(0.5655)。

相机运动控制:逐像素 Plücker 坐标编码 P\\in\\mathbb{R}\^{6\\times F\\times H\\times W} + PixelUnshuffle + 逐 DiT 块自适应范数适配器(零初始化卷积),数据来自 VGG-SfM 轨迹约千级运动片段。

实时流式生成(附录 E)

Streamer 流式管线 :滑动时间窗 w 步求解器、2w token 训练(前 w 个无损失),推理丢弃前 w 个;队列去噪最左 token 缓存、新 token 以噪声 0 重入,保证时序连续。LCM / VideoLCM 4 步蒸馏带来 10--20× 加速,达到 8--16 FPS;int8(注意力 + 线性头)+ TensorRT 全模型量化后,单卡 RTX 4090 实时 20 FPS,8 卡 A100 可连续生成 15 分钟视频(8 FPS)。从固定长度 5--10 秒片段迈向无限时长实时生成,打开直播级创作场景。

图 9:单卡 RTX 4090(int8 + TensorRT)实时 20 FPS 流式生成样例

视频到音频生成 V2A(附录 F)

V2A 用 1D-VAE 原始波形(避免 mel 分帧破坏时序对齐),DiT + Flow Matching 与视频模型同构;CLIP 逐帧视觉嵌入(时间速率适配)+ umT5-XXL 文本(冻结,4096-d)统一到 1536-d 潜空间;输出立体声 ≤12 秒 @44.1kHz,随机 mask 音频 caption 支持纯视频条件。相比 MMAudio:长程一致性更好(倒咖啡)、输出更干净(打字)、节奏更自然(走路 / 马蹄声)。视频 + 音频双模态统一在 DiT / Flow Matching 范式下,架构同源、可联合扩展。

图 10:V2A 框架:视频分块与文本描述双输入,生成环境声 + 背景音乐

实验设计与结果

评测体系由三部分组成:Wan-Bench (自建自动化评测:动态质量 / 图像质量 / 指令遵循 3 大维度 × 14 项细粒度指标,5000+ 人类成对比较学习加权总分);人类评测 (700+ 任务、20+ 标注者、4 维度投票);公开基准 VBench(1,035 样本 / 模型)。基线覆盖闭源(Sora · Kling · Veo 2 · Runway · MiniMax)与开源(HunyuanVideo · Mochi · CogVideoX),消融围绕 adaLN 共享策略、文本编码器、VAE 解码器设计展开。

图 6:Wan-Bench 覆盖维度:动态质量、图像质量、指令遵循

VBench 主表

模型 VBench 总分 性质
Wan 14B(本文) 86.22% 开源 · 旗舰
Sora 84.28% 闭源
Wan 1.3B(本文) 83.96% 开源 · 消费级
MiniMax-Video-01 83.41% 闭源
HunyuanVideo 83.24% 开源
CogVideoX1.5-5B 82.17% 开源

Wan 14B 总分 86.22% 登顶(质量 86.67 / 语义 84.44),1.3B(83.96%)亦超过 Kling 1.6(81.85%)等闭源模型。

结果分析

  • Wan-Bench 加权总分 0.724 > Sora 0.700:ID 一致性、物理合理性、空间位置全面占优。
  • 人类评测综合胜率:vs 国内闭源 Top 44.0%--48.9%,vs Runway 67.6%。
  • 消融结论:全共享 adaLN + 更深网络最优;umT5 优于 Qwen2.5 / GLM-4 文本编码。
  • 首创能力:视频内中英文文字生成,实现"电影级"文字特效。

图 7:Wan-T2V 定性结果:复杂运动、创意转场、电影级画质与中英文字

Oral 信号分析(附录 C)

  • P2 核心算子替换(全时空注意力 + 共享 adaLN):替换分离式时空注意力与独立 adaLN,参数 -25%。消融验证:1.5B 全共享 35 层 loss 最低、非共享 1.7B 无提升;VBench 86.22% > Sora 84.28%。
  • P13 条件化适配而非重训练(8 任务共用基座):I2V 掩码拼接、编辑 Context Adapter、个性化潜空间人脸注入,基座权重基本不动。验证:I2V 人类评测 vs CN-TopD 综合胜率 81.6%。
  • P4 受控评测工具(Wan-Bench 自动化评测):3 维 14 指标,5000+ 成对比较学习权重。验证:加权总分 0.724 > Sora 0.700,可复现的自动化评测。

每个创新点都有消融 / 大规模人类评测背书------执行质量是 Wan 的护城河。

结果对比总结

图 13:VBench 结果对比(Mermaid 流程图):Wan 14B 86.22% 登顶,开源全面领先闭源

关键发现

  • VBench 总分 86.22% 登顶,超过 Sora 的 84.28%;其中质量 86.67、语义 84.44,Wan-Bench 加权总分 0.724 亦高于 Sora 的 0.700。
  • 1.3B 消费级模型 VBench 83.96%,超过 Kling 1.6(81.85%)等闭源模型,且仅需 8.19GB 显存。
  • 一基座 8 任务:T2V / I2V / 编辑 / 个性化 / 相机 / 实时 / 音频 / T2I,首创视频内中英双语文字生成。
  • 推理加速组合:Diffusion Cache 1.62× + FP8 GEMM 1.13× + 8-bit FlashAttention 1.27×,H20 上 95% MFU;int8 + TensorRT 后单卡 RTX 4090 实时 20 FPS。
  • I2V 人类评测综合胜率 81.6%(vs CN-TopD);个性化 ArcFace 相似度 0.5526,接近闭源 CN-TopA(0.5655)。
  • 全共享 adaLN 参数 -25%,1.5B 全共享 35 层 loss 最低;数据管线 4 步清洗淘汰约 50% 数据。

局限性

  • 大运动下细节不足:快速运动时细粒度纹理生成仍是领域普遍短板。
  • 推理成本:14B 未优化时单卡约 30 分钟 / 视频,部署门槛高。
  • 领域专长缺失:教育、医疗等垂直领域缺乏专业知识。
  • 音频无语音:V2A 模型不生成人声 / 歌声(数据过滤所致)。

作者展望:通过全开源 + 社区共建缓解垂直领域短板,继续扩大数据规模与架构规模,并探索面向消费级硬件的极致加速。

常见问题(FAQ)

Wan 2.1 和 Sora 相比表现如何?

Wan 14B 在 VBench 总分 86.22%,超过 Sora 的 84.28%;Wan-Bench 加权总分 0.724 也高于 Sora 的 0.700,在 ID 一致性、物理合理性、空间位置上全面占优,且 Wan 完全开源。

1.3B 消费级模型需要多少显存?

仅需 8.19GB 显存,消费级显卡即可运行;其 VBench 总分 83.96%,甚至超过 Kling 1.6(81.85%)等闭源模型。

Wan 2.1 支持哪些生成任务?

一个基座覆盖 8 大任务:T2V 文生视频、I2V 图生视频、视频编辑、T2I 文生图、个性化、相机控制、实时生成、音频生成,全部通过条件化适配完成,无需重训练。

视频内中英文文字生成是怎么做到的?

Wan 是首个支持视频内中英双语文字生成的模型,通过 umT5 文本编码与训练 / 评测数据分布对齐实现"电影级"文字特效。

推理速度如何提升?

三层加速叠加:Diffusion Cache 1.62×、FP8 GEMM 1.13×、8-bit FlashAttention 1.27×;实时场景下 Streamer 流式管线 + int8/TensorRT 量化可在单卡 RTX 4090 上达到 20 FPS。

全开源具体包括什么?

代码、模型权重、数据管线与评测工具(Wan-Bench)一并公开,社区可直接复现与扩展,这与只开源权重的模型形成鲜明对比。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

相关推荐
白拾2 天前
【RSS 2025】统一世界模型:耦合视频与动作扩散的机器人预训练|从扩散时间步设计视角
扩散模型·世界模型·模仿学习·rss 2025·uwm 论文分享·机器人预训练
AI工具测评与分析2 天前
Seedance2.5 赋能飙算画影AI无限画布,无边画布进阶专业创作工作台
人工智能·信息可视化·ai作画·视频生成·ai视频·爆款视频
科研小刘带你玩学术3 天前
【学术干货】CVPR论文解析:扩散模型如何推动生成式人工智能进入新时代?
人工智能·深度学习·计算机视觉·生成式ai·扩散模型
deepseek235 天前
MiniMax H3 全模态模型拆解:2K 视频成本被腰斩背后,H3-VAE 和 In-context Regeneration 做了什么
人工智能·多模态·视频生成
带娃的IT创业者10 天前
中国开源大模型策略:正在赢得全球AI竞赛
人工智能·开源·qwen·开源大模型·deepseek·ai竞赛·开源策略
星云_byto11 天前
DCDA:双评判器扩散对齐,开放天气LiDAR-4D雷达融合3D检测泛化新范式
3d·扩散模型·3d目标检测·开放天气泛化·lidar-4d雷达融合·鲁棒感知·k-radar
CAE32011 天前
融合深度学习与传统方法的电阻抗成像各种计算框架
扩散模型·eit成像·unet网络
猫先生Mr.Mao12 天前
视频生成之LongLive-2.0详解:如何把 5B 长视频生成推到 45.7 FPS
ai·论文解读·视频生成·ai视频·longlive-2.0