【arXiv 2025】开源视频生成大模型 Wan 2.1|从视频生成开源基座视角

摘要

本文解读 arXiv 2025 论文《Wan: Open and Advanced Large-Scale Video Generative Models》。该论文提出Wan 2.1 开源视频生成大模型 ,通过融合DiT 架构 、Flow Matching 训练 与Wan-VAE 时空压缩 ,以 14B 旗舰 + 1.3B 消费级 双规模覆盖 8 大生成任务 ,其特别之处在于全栈开源(代码 + 权重 + 数据管线 + 评测工具)并首个支持视频内中英双语文字生成。实验表明 Wan 14B 在 VBench 总分 86.22% 登顶、超过 Sora(84.28%),1.3B 模型仅需 8.19GB 显存即可运行,为开源视频生成社区提供了可复现、可扩展的重要基座。

视频讲解 :点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) Wan: Open and Advanced Large-Scale Video Generative Models
标题(中文) 开源视频生成大模型 Wan 2.1
作者 Ang Wang et al. · Wan Team, Alibaba Group(61 人团队)
机构 阿里巴巴集团 · 通义实验室(通义万相团队)
会议 arXiv 2025
arXiv https://arxiv.org/abs/2503.20314
项目网站 https://wan.video/(代码:https://github.com/Wan-Video/Wan2.1)

背景与动机

开源与闭源视频生成模型之间存在三大差距 :性能不足、能力单一(开源模型基本只做 T2V 文生视频)、效率不足。闭源商业模型自 Sora(2024.02)发布后迅速迭代:Kling / Luma 1.0 / Gen-3(06 月)→ Vidu(07 月)→ Hailuo / Kling 1.5(09 月)→ Pika 1.5 / Movie Gen(10 月)→ Kling 1.6 / Veo 2(12 月),而开源社区则沿 U-Net 路线(VDM / MagicVideo / AnimateDiff)演进到 DiT (2022)与 Latte,再到 MM-DiT(Mochi / HunyuanVideo)、LTX-Video;文本编码从 T5 / CLIP 演进到 HunyuanVideo 的多模态大模型方案。已有开源模型多为单任务 T2V,Wan 2.1 则以同一基座覆盖 8 类任务 ,公开全部训练细节与评测工具,并首个支持中英双语视频内文字。

图 1:Wan 与开源 / 闭源 SOTA 模型的对比:基准测试与人类评测均占优(HunyuanVideo 为开源权重评测)

图 2:Wan 生成样例:大运动、高保真细节,首个支持视频内中英文文字生成

从历史视角看(附录 H),视频生成基座经历了 2022 年 DiT 证明视觉生成可纯靠 Transformer 缩放、2024 年 Sora 破圈引发行业热潮、2024 年开源浪潮(CogVideoX / Mochi / LTX-Video / HunyuanVideo)逐步拉近差距,到 2025 年 Wan 2.1 以开源双规模基座(14B / 1.3B)实现 8 任务 + 中英文字生成,再到 Wan 2.2 / 2.5 的 MoE 化持续扩展。Wan 对下游至关重要:全栈开源 (数据管线 + VAE + 训练细节可复现,降低二次开发门槛)、条件化友好 (掩码 / 适配器机制天然支持动作、相机等外部条件注入)、双规模(1.3B 适合机器人等边缘端实时部署)------具身智能世界模型(Vid2World、Genie Envisioner、DreamDojo、WoW)已直接以 Wan 类基座做动作条件化。Wan 完成了从"闭源商业能力"到"可复现开源基础设施"的迁移,成为视频生成与具身世界模型的公共底座。

研究主线:从问题到结论

图 11:研究主线(Mermaid 流程图):问题 → 动机 → 设计 → 方法 → 实验 → 结论

基准/方法设计

Wan 2.1 的核心设计围绕双规模策略 与一基座多任务展开:

  • 双规模 :14B 旗舰参数对标闭源商业模型;1.3B 消费级模型仅需 8.19GB 显存,消费级显卡即可运行。
  • 8 大任务:T2V 文生视频、I2V 图生视频、视频编辑、T2I 文生图、个性化、相机控制、实时生成、音频生成,全部由一个基座通过条件化适配完成。
  • 全流程公开:数据构建、VAE、训练策略、加速技术、自动化评测工具一并开源。
  • 训练成本可控:训练成本约为 L(\\alpha bsh\^2 + \\beta bs\^2h),其中 DiT 占 85% 以上算力,14B 模型在可负担预算内完成训练。

分类全景

图 12:分类全景(Mermaid 结构树):一基座覆盖 T2V / I2V / 编辑 / T2I / 个性化 / 相机 / 实时 / 音频

方法细节

Wan-VAE :4×8×8 时空压缩、16 通道、127M 参数,将视频映射到紧凑潜空间;因果 3D 卷积 + RMSNorm、三阶段训练,特征缓存推理比 HunyuanVideo 快 2.5×。

DiT 主干 :3D patchify + 全时空注意力 + 文本 cross-attention + 全共享 adaLN(相比独立 adaLN 参数减少 25%)。消融表明深度优先于 adaLN 参数量:1.5B 全共享 35 层 loss 最低,是 14B 高效扩展的关键。

Flow Matching 训练:256px 图像预训练 → 三阶段分辨率课程(256 → 480 → 720px)→ 后训练;文本编码用 umT5(5.3B 参数)。

数据引擎:4 步清洗(淘汰约 50% 数据)+ DenseCaption 稠密标注(LLaVA 风格 + Qwen2.5,视频 3fps 且不超过 129 帧);100 聚类 + 专家 1--5 分筛选、6 级运动分层,使训练 / 评测分布对齐。

大规模训练:FSDP + 2D 上下文并行(Ring 外层 / Ulysses 内层);1M token 规模下注意力占训练时间 95%。

图 3:Wan 整体架构:文本(umT5)与视频经 VAE 编码后进入 3D patchified DiT

图 4:Wan-VAE:橙色 2× 时空 + 绿色 2× 空间下采样,共 4×8×8 压缩

图 5:分阶段数据供给:按训练阶段调节运动幅度、质量与类别比例

推理加速三件套(附录 A)

Wan 的推理加速是三层叠加:Diffusion Cache (注意力缓存 + CFG 缓存 + 残差补偿)提速 1.62× ;FP8 GEMM 矩阵乘降精度额外 1.13×;8-bit FlashAttention (INT8 S / FP8 O / FP32 跨块累加)再提 1.27×,在 H20 上达到 95% MFU。分布式层面 FSDP 模型分片 + 2D 上下文并行近线性扩展,256K token 时通信开销从 10% 降至 1% 以下。约 50 步采样,加速组合使 14B 推理从"不可用"降至可部署水平。

下游任务:I2V 与视频编辑(附录 B)

Wan-I2V 采用掩码条件图生视频:\[噪声; 条件潜变量; mask\] 通道拼接送入 DiT,CLIP 图像编码经 3 层 MLP 进入解耦 cross-attention;统一视频续写、首尾帧变换、随机插帧,支持 480p 与 720p 双档。人类评测 4 维胜率 vs CN-TopD 综合 81.6%。

VACE 统一可控编辑框架:输入范式 VCU = \[文本; 上下文帧; mask\],概念解耦 F_c=F\\times M / F_k=F\\times(1-M);Context Adapter 微调不动基座权重,从 Wan-T2V-14B 训练至 720p。全部下游都通过条件化适配复用同一基座。

图 8:Wan-I2V 框架:掩码机制统一视频续写与首尾帧变换

个性化与相机控制(附录 D)

零样本视频个性化 免特征提取器:直接在 Wan-VAE 潜空间做人脸条件(自注意力范式),K 帧人脸 + 对齐 landmark 前置拼接、inpainting 式扩散;数据为 O(10)M 清洗视频 + O(1)M Instant-ID 合成人脸,ArcFace 相似度 0.5526,接近闭源 CN-TopA(0.5655)。

相机运动控制:逐像素 Plücker 坐标编码 P\\in\\mathbb{R}\^{6\\times F\\times H\\times W} + PixelUnshuffle + 逐 DiT 块自适应范数适配器(零初始化卷积),数据来自 VGG-SfM 轨迹约千级运动片段。

实时流式生成(附录 E)

Streamer 流式管线 :滑动时间窗 w 步求解器、2w token 训练(前 w 个无损失),推理丢弃前 w 个;队列去噪最左 token 缓存、新 token 以噪声 0 重入,保证时序连续。LCM / VideoLCM 4 步蒸馏带来 10--20× 加速,达到 8--16 FPS;int8(注意力 + 线性头)+ TensorRT 全模型量化后,单卡 RTX 4090 实时 20 FPS,8 卡 A100 可连续生成 15 分钟视频(8 FPS)。从固定长度 5--10 秒片段迈向无限时长实时生成,打开直播级创作场景。

图 9:单卡 RTX 4090(int8 + TensorRT)实时 20 FPS 流式生成样例

视频到音频生成 V2A(附录 F)

V2A 用 1D-VAE 原始波形(避免 mel 分帧破坏时序对齐),DiT + Flow Matching 与视频模型同构;CLIP 逐帧视觉嵌入(时间速率适配)+ umT5-XXL 文本(冻结,4096-d)统一到 1536-d 潜空间;输出立体声 ≤12 秒 @44.1kHz,随机 mask 音频 caption 支持纯视频条件。相比 MMAudio:长程一致性更好(倒咖啡)、输出更干净(打字)、节奏更自然(走路 / 马蹄声)。视频 + 音频双模态统一在 DiT / Flow Matching 范式下,架构同源、可联合扩展。

图 10:V2A 框架:视频分块与文本描述双输入,生成环境声 + 背景音乐

实验设计与结果

评测体系由三部分组成:Wan-Bench (自建自动化评测:动态质量 / 图像质量 / 指令遵循 3 大维度 × 14 项细粒度指标,5000+ 人类成对比较学习加权总分);人类评测 (700+ 任务、20+ 标注者、4 维度投票);公开基准 VBench(1,035 样本 / 模型)。基线覆盖闭源(Sora · Kling · Veo 2 · Runway · MiniMax)与开源(HunyuanVideo · Mochi · CogVideoX),消融围绕 adaLN 共享策略、文本编码器、VAE 解码器设计展开。

图 6:Wan-Bench 覆盖维度:动态质量、图像质量、指令遵循

VBench 主表

模型 VBench 总分 性质
Wan 14B(本文) 86.22% 开源 · 旗舰
Sora 84.28% 闭源
Wan 1.3B(本文) 83.96% 开源 · 消费级
MiniMax-Video-01 83.41% 闭源
HunyuanVideo 83.24% 开源
CogVideoX1.5-5B 82.17% 开源

Wan 14B 总分 86.22% 登顶(质量 86.67 / 语义 84.44),1.3B(83.96%)亦超过 Kling 1.6(81.85%)等闭源模型。

结果分析

  • Wan-Bench 加权总分 0.724 > Sora 0.700:ID 一致性、物理合理性、空间位置全面占优。
  • 人类评测综合胜率:vs 国内闭源 Top 44.0%--48.9%,vs Runway 67.6%。
  • 消融结论:全共享 adaLN + 更深网络最优;umT5 优于 Qwen2.5 / GLM-4 文本编码。
  • 首创能力:视频内中英文文字生成,实现"电影级"文字特效。

图 7:Wan-T2V 定性结果:复杂运动、创意转场、电影级画质与中英文字

Oral 信号分析(附录 C)

  • P2 核心算子替换(全时空注意力 + 共享 adaLN):替换分离式时空注意力与独立 adaLN,参数 -25%。消融验证:1.5B 全共享 35 层 loss 最低、非共享 1.7B 无提升;VBench 86.22% > Sora 84.28%。
  • P13 条件化适配而非重训练(8 任务共用基座):I2V 掩码拼接、编辑 Context Adapter、个性化潜空间人脸注入,基座权重基本不动。验证:I2V 人类评测 vs CN-TopD 综合胜率 81.6%。
  • P4 受控评测工具(Wan-Bench 自动化评测):3 维 14 指标,5000+ 成对比较学习权重。验证:加权总分 0.724 > Sora 0.700,可复现的自动化评测。

每个创新点都有消融 / 大规模人类评测背书------执行质量是 Wan 的护城河。

结果对比总结

图 13:VBench 结果对比(Mermaid 流程图):Wan 14B 86.22% 登顶,开源全面领先闭源

关键发现

  • VBench 总分 86.22% 登顶,超过 Sora 的 84.28%;其中质量 86.67、语义 84.44,Wan-Bench 加权总分 0.724 亦高于 Sora 的 0.700。
  • 1.3B 消费级模型 VBench 83.96%,超过 Kling 1.6(81.85%)等闭源模型,且仅需 8.19GB 显存。
  • 一基座 8 任务:T2V / I2V / 编辑 / 个性化 / 相机 / 实时 / 音频 / T2I,首创视频内中英双语文字生成。
  • 推理加速组合:Diffusion Cache 1.62× + FP8 GEMM 1.13× + 8-bit FlashAttention 1.27×,H20 上 95% MFU;int8 + TensorRT 后单卡 RTX 4090 实时 20 FPS。
  • I2V 人类评测综合胜率 81.6%(vs CN-TopD);个性化 ArcFace 相似度 0.5526,接近闭源 CN-TopA(0.5655)。
  • 全共享 adaLN 参数 -25%,1.5B 全共享 35 层 loss 最低;数据管线 4 步清洗淘汰约 50% 数据。

局限性

  • 大运动下细节不足:快速运动时细粒度纹理生成仍是领域普遍短板。
  • 推理成本:14B 未优化时单卡约 30 分钟 / 视频,部署门槛高。
  • 领域专长缺失:教育、医疗等垂直领域缺乏专业知识。
  • 音频无语音:V2A 模型不生成人声 / 歌声(数据过滤所致)。

作者展望:通过全开源 + 社区共建缓解垂直领域短板,继续扩大数据规模与架构规模,并探索面向消费级硬件的极致加速。

常见问题(FAQ)

Wan 2.1 和 Sora 相比表现如何?

Wan 14B 在 VBench 总分 86.22%,超过 Sora 的 84.28%;Wan-Bench 加权总分 0.724 也高于 Sora 的 0.700,在 ID 一致性、物理合理性、空间位置上全面占优,且 Wan 完全开源。

1.3B 消费级模型需要多少显存?

仅需 8.19GB 显存,消费级显卡即可运行;其 VBench 总分 83.96%,甚至超过 Kling 1.6(81.85%)等闭源模型。

Wan 2.1 支持哪些生成任务?

一个基座覆盖 8 大任务:T2V 文生视频、I2V 图生视频、视频编辑、T2I 文生图、个性化、相机控制、实时生成、音频生成,全部通过条件化适配完成,无需重训练。

视频内中英文文字生成是怎么做到的?

Wan 是首个支持视频内中英双语文字生成的模型,通过 umT5 文本编码与训练 / 评测数据分布对齐实现"电影级"文字特效。

推理速度如何提升?

三层加速叠加:Diffusion Cache 1.62×、FP8 GEMM 1.13×、8-bit FlashAttention 1.27×;实时场景下 Streamer 流式管线 + int8/TensorRT 量化可在单卡 RTX 4090 上达到 20 FPS。

全开源具体包括什么?

代码、模型权重、数据管线与评测工具(Wan-Bench)一并公开,社区可直接复现与扩展,这与只开源权重的模型形成鲜明对比。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群 :白拾的小屋 (750365700)

⭐B站账号 :白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页 :YhbCode000(工程文件)

相关推荐
风巽·剑染春水9 小时前
【扩散模型原理】(六)A Unified and Systematic Lens on Diffusion Models(2)
人工智能·生成模型·diffusion·扩散模型
小草cys13 小时前
对比一下hunyuanvideo,wan2.2, minimax h3的性能
大模型·多模态·视频生成
风巽·剑染春水13 小时前
【扩散模型原理】(六)A Unified and Systematic Lens on Diffusion Models(1)
人工智能·生成模型·diffusion·扩散模型
漂着的圆木1 天前
AI视频模型路由怎么选?Runway新评测里的成本与可用率陷阱
成本优化·视频生成·ai视频·模型路由·runway
智码看视界1 天前
开源大模型追踪:Qwen-Image-2.1 :7B 视觉生成模型开源榜登顶 60.28,原生 RGBA 透明出图
扩散模型·图像生成·本地部署·开源大模型·qwen-image-2.1·rgba透明
这张生成的图像能检测吗2 天前
(论文速读)一种用于图像超分辨率的有效扩散变换结构
人工智能·计算机视觉·扩散模型·超分辨率
I Am a robert girl2 天前
PhysStream 源码级拆解:流式视频生成如何做到“边生成边控制“
python·音视频·源码解析·视频生成·可控生成·流式生成·物理控制
这张生成的图像能检测吗2 天前
(论文速读)FCDM:ConvNeXt 也能做高效扩散模型,卷积网络重新挑战 DiT
扩散模型·图像生成·卷积
Maynor9963 天前
Kling 4.0(可灵 4.0)怎么用?上线时间、Flash 版、价格与提示词全攻略(2026 最新)
人工智能·aigc·视频生成·ai视频·可灵
Rocky Ding*3 天前
深入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、Qwen-Image、GLM-Image核心基础知识
论文阅读·人工智能·深度学习·机器学习·aigc·扩散模型·ai-native