写在前面

欢迎大家关注Rocky的知乎:Rocky Ding
《三年面试五年模拟》AIGC/LLM/AI Agent算法工程师/开发工程师求职面试秘籍独家资源:【三年面试五年模拟】WeThinkIn/AIGC-Interview-Book,欢迎大家Star~
Rocky最新撰写的10万字AI Agent(AI智能体)深入浅出全维度解析文章: 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
AIGC/LLM/AI Agent算法岗/开发岗求职面试内推学习社群 (涵盖AIGC、LLM大模型、AI Agent、传统深度学习、自动驾驶、机器学习、计算机视觉、自然语言处理、强化学习、大数据挖掘、具身智能、元宇宙、AGI等AI行业最新面试干货经验与核心知识)欢迎大家加入:https://t.zsxq.com/33pJ0
大家好,我是Rocky。
核心导读
关于 Wan 3.0,市场上同时存在两种叙事。一种来自 Hugging Face 社区文章:WanSong、Wan-Dancer、Wan-Streamer 在 2026 年 7 月密集出现,分别把音频生成、音乐驱动舞蹈和实时流式交互推向新的边界,因此它们可能是下一代 Wan 的技术预演。另一种来自 ComfyUI 中文的产品说明:Wan 3.0 已通过合作伙伴 API 节点接入 ComfyUI,支持原生最长 30 秒、最多 10 张图片加 5 段视频和 5 段音频参考,并可在 480p、720p、1080p 间选择。
这两种叙事不能直接等同。前者是基于公开论文、模型卡和版本节奏的架构推断,后者是一个可调用的产品入口;它们共同指向的,是视频生成从"单段画面合成"转向"多模态素材编排和连续场景执行"。截至 2026 年 8 月 26 日,阿里巴巴仍没有公开一个完整的 Wan 3.0 官方模型卡、权重清单或系统技术报告。因此,本文把结论分成三层:已经能通过产品文档或已发布模型验证的事实;从相邻 Wan 研究中得到的高可信技术信号;以及仍需官方确认的推测。
Rocky 的核心判断是:Wan 3.0 真正值得关注的,不是"30 秒"这个单一数字,而是参考素材、长时序、音画同步、实时交互和 ComfyUI 工作流开始被放到同一个生产入口里。模型能力只有被组织成可编辑、可复用、可验收的工作流,才会从 demo 变成生产力。
1. 已经发生的变化:视频生成的输入输出都在扩张
ComfyUI 中文文章给出的产品规格非常具体:提示词上限约 20,000 字符;参考素材可以是 10 张图片、5 段视频、5 段音频,另外还支持一个文件或网页链接;输出时长为 2--30 秒,分辨率覆盖 480p、720p、1080p,画幅包括 16:9、9:16、4:3、3:4 和 1:1,并可关闭音频生成。用户可以在提示词中用 @Image1、@Video2、@Audio1 等语法定位素材的生效位置。
这意味着产品的基本单位不再是"一个 prompt 对应一个视频",而是"一个项目上下文对应一段视频"。角色参考图负责身份,视频片段负责运动,音频片段负责音色,网页或文件负责叙事素材。对于广告、短剧、课程和游戏宣传片,这种输入组织方式比单纯扩大文本窗口更接近真实制作流程。
文章还强调精准视频编辑:可以移除或替换元素、重新布光、改变运动、转换主体、延长已有素材,并把输入与输出总时长控制在 30 秒以内。这里的关键不是模型能否完成某个孤立动作,而是它能否在修改局部时保护未修改区域。专业用户愿意付费的,往往正是"改 A,不要动 B"。
需要注意,ComfyUI 文章描述的是合作伙伴 API 节点,而不是公开权重。API 可用性证明了服务端已经提供某种 Wan 3.0 能力,但不能自动推出本地部署、显存需求、训练数据或许可证。产品入口和模型开放程度必须分开判断。
2. Wan 2.2 之后,为什么会出现三条"侧向"路线
Hugging Face 社区文章观察到,Wan 2.2 之后的 Wan-Dancer、WanSong、Wan-Streamer 没有沿用"2.x"命名,却在一周内连续出现。Wan 2.2 主要是基于 DiT、flow matching、3D VAE 和 T5 条件编码的批量视频生成管线;三条新路线则分别向音频、运动和实时交互扩展。
这是一种重要的研发组织信号:基础模型不再围绕单一模态做线性升级,而是通过多个专门 checkpoint 验证可复用的骨干、数据配方和服务拓扑。它们最终是否合并成一个 Wan 3.0,尚无官方证明;但每条路线解决的瓶颈,正好对应视频产品走向生产时最难的三件事:时间跨度、跨模态控制和交互延迟。
2.1 WanSong:音频生成先把"多模态 DiT"跑通
社区文章把 WanSong v1.0 描述为一个接近 25B 参数的纯扩散音乐模型,最长生成约 5 分钟多语言歌曲,并在一次前向中分离人声和背景音乐。其骨干采用 hybrid-MMDiT,把文本 token 与双音轨音频连续 token 打包到统一序列中,通过共享 AdaLN 在每个 block 内联合建模;输出端又保持人声和伴奏的独立性,以缓解 CFG 对两类声音偏好相互牵制的问题。
音频侧使用 1D VAE,在 44.1 kHz 立体声下进行约 1024 倍压缩。社区文章引用的 SI-SDR 为音乐 7.25 dB、语音 12.92 dB,并以 Stable Audio 2 的结果作为参照。训练数据被描述为超过 600 万小时多语言歌曲,另有约 2.6 亿条音频片段和五阶段数据管线。由于这些数字来自社区文章对论文和模型卡的整理,正式使用时仍应以 WanSong 原论文为准。
WanSong 对 Wan 3.0 的高可信启示是:音频不再是视频生成之后外挂的配乐模块,而可以和视觉 token 在同一扩散骨干中联合学习。若未来 Wan 3.0 真正支持音画同步,核心工程难点会从"生成一段视频"变为"让音轨、口型、动作节奏和镜头切换共享同一个时间轴"。
2.2 Wan-Dancer:长视频需要分层时间规划
Wan-Dancer-14B 将音乐映射为分钟级舞蹈视频,构建在 Wan-I2V 权重之上,并以 Apache 2.0 形式发布。其核心是两阶段分层生成:全局阶段用 38 帧稀疏关键帧覆盖整段音乐,在低分辨率下建模长程结构;局部阶段围绕关键帧生成每个 5 秒片段,输出 720p、30 FPS 视频,局部片段可以并行处理。模型卡给出的全局阶段 48 步、局部阶段 24 步,CFG scale 均为 5.0。
这个结构解决的是单次扩散采样的时间视野问题。让一个模型直接预测几分钟的每一帧,计算量和一致性都会迅速失控;先规划稀疏关键帧,再细化局部片段,相当于把"叙事级规划"和"像素级渲染"解耦。它与 Wan-Image 中 Planner/Visualizer 的思路相似:先形成可控的中间结构,再交给高容量生成器完成细节。
Wan-Dancer 的局限也很清楚。14B bf16 权重至少需要约 28 GB 显存,社区估计 32 GB 显存卡经过优化后才接近可用,生产环境更适合 48 GB 或 80 GB 级别 GPU。局部并行虽能降低延迟,却会引入片段边界、身份漂移和音乐节拍错位问题。分钟级不是把秒级模型简单重复若干次,而是新的调度和验收体系。
2.3 Wan-Streamer:把视频理解成"世界 + 事件"流
Wan-Streamer v0.3 的思路更加底层。它把场景拆成相对持久的 world(环境、主体、声学和声音特征)与持续变化的 event stream(动作、对话、声音),让因果 Transformer 按时间单元预测世界如何继续演化。论文明确说这不是一种全新架构,而是对交错因果序列的训练目标重新解释。
社区文章引用的规格是:640×368、25 FPS、160 ms 流式单元,模型侧延迟约 200 ms,加上网络预算后的总交互延迟约 550 ms;支持语言、音频、视频的 block-causal attention,以及双方可以同时说话和动作的全双工交互。代码使用 CC BY 4.0,但没有公开模型权重。
如果这个训练目标被迁移到 Wan 3.0,视频模型的定义会发生变化:它不再只负责从文本生成一段固定长度视频,而是持续预测"同一个世界下一刻会发生什么"。这更接近实时世界模型或多模态模拟器。不过,640×368 的流式延迟不能外推到 1080p 离线长视频,专用服务拓扑的优势也不能直接归因于骨干模型本身。
3. 三条信号能否拼成 Wan 3.0
目前能够确认的,是三类技术原则存在交集,而不是它们已经共享一套权重。
| 信号来源 | 已确认内容 | 对 Wan 3.0 的合理推断 | 证据边界 |
|---|---|---|---|
| WanSong 论文/整理 | hybrid-MMDiT、共享 AdaLN、文本与音频统一序列 | 音频可成为原生模态 | 未证明与视频模型共用权重 |
| Wan-Dancer-14B 模型卡 | 全局关键帧 + 局部细化、音乐条件、Apache 2.0 | 长时视频可采用分层生成 | 只覆盖音乐到舞蹈垂直任务 |
| Wan-Streamer v0.3 | world/event 训练目标、流式因果建模 | 可扩展到实时多模态预测 | 模型权重和统一参数规模未公开 |
| ComfyUI 合作伙伴节点 | 30 秒、最多 20 个参考素材、480p--1080p | 已有服务化 Wan 3.0 入口 | API 能力不等于开放权重 |
三条路线最可能共享的是可复用的设计语言:统一 token 序列、AdaLN 调制、分层时间建模、模块化条件输入和面向服务的推理拓扑。它们未必在同一 checkpoint 中实现。WanSong 接近 25B,Wan-Dancer 为 14B,Wan-Streamer 参数量未知;把这些数字相加或直接取最大值,都不能得到 Wan 3.0 的真实规模。
社区文章曾提出 30B+ 作为统一音视频模型的容量预估,也有人据此建议准备 4--8 张 A100/H100。这可以作为工程预算的压力测试,却不是规格说明。真实成本还取决于量化、并行策略、分辨率、帧率、音频采样率和是否启用 Refiner。对团队而言,先做显存和吞吐的参数化估算,比把传闻当采购依据更稳妥。
4. "原生 30 秒"到底改变了什么
30 秒的价值不在于比 5 秒多 25 秒,而在于它足以承载一个完整镜头动作:起势、发展、结果可以在同一上下文中完成。过去的工作流常用多个短片段拼接,拼接意味着角色状态、光照、镜头轨迹和声音必须在后处理阶段重新对齐;原生长时生成把部分一致性问题前移到模型内部。
但长时长也会放大错误。一个局部动作在第 3 秒看起来正确,并不代表第 20 秒仍然符合物理、身份和叙事逻辑。真正的验收应至少包含:跨时间身份相似度、动作节奏与音轨的对齐、镜头运动连续性、未编辑区域保持率,以及从 480p 草稿到 1080p 交付的质量漂移。
ComfyUI 的多素材 @ 引用机制为这些验收提供了可操作入口。团队可以把角色图、镜头参考、音色片段和脚本文件登记为可追踪输入,生成后再对每一类条件做单独回归。这比"重新写一遍 prompt 看起来差不多"更适合生产。
5. 对开发者和产品团队的现实建议
第一,Wan 2.2 仍适合作为基线。它的 Diffusers 接口、safetensors 格式和 Apache 2.0 生态更稳定。不要因为等待 Wan 3.0 而暂停现有视频管线;先把输入素材管理、任务队列、缓存和质量回归搭起来,模型升级时迁移成本会更低。
第二,用 Wan-Dancer 做分层生成实验。重点不是复现舞蹈 demo,而是测量全局关键帧如何影响局部片段:关键帧密度、片段长度、并行策略和边界融合分别对一致性、延迟和显存产生什么影响。这些经验可以迁移到广告分镜、课程视频和游戏过场。
第三,把音频当成一等输入。WanSong 的双音轨设计和 ComfyUI 的音频参考能力说明,未来视频工具链需要同时管理音色、节拍、口型和环境声。产品团队现在就可以将音频片段纳入资产版本系统,而不是最后再交给剪辑软件补配乐。
第四,为 API 与本地权重准备两套架构。合作伙伴节点适合快速验证用户价值,但会受到价格、速率、数据合规和接口变更影响;本地部署则受显存、许可证和运维能力约束。WanSong 与 Wan-Streamer 当前许可证状态并不等同于 Wan-Dancer,不能默认未来 Wan 3.0 一定 Apache 2.0。
第五,建立"约束满足率"而不是只看审美评分。视频生成产品的核心指标应包括参考素材命中率、未编辑区域保持率、跨片段身份一致性、音画同步误差、长视频失败率和单位可交付成本。没有这些指标,30 秒只是营销长度,不是生产能力。
6. 仍然不能确认的事情
截至本文写作时,Wan 3.0 的官方发布日期、完整模型卡、参数规模、训练数据、推理代码和许可证都没有被两篇来源共同证明。Hugging Face 文章引用的 2026 年 8 月 6 日发布日期属于未经阿里巴巴确认的社区传闻;日期已经过去,也不能据此反推官方发布状态。ComfyUI 合作伙伴节点的存在,证明的是服务端入口,不等于公开权重已经发布。
同样不能确认的是:WanSong、Wan-Dancer、Wan-Streamer 是否共享一套 backbone;Wan-Streamer 的约 200 ms 延迟能否迁移到高分辨率生成;多图、多视频、多音频输入是否在所有任务上都能同时启用;以及 30 秒视频是否始终包含原生同步音频。对外写作和产品宣传都应该把这些句子写成"来源描述"或"待验证假设",而不是官方承诺。
7. 我的判断:下一代视频模型的竞争在工作流,不在单个 checkpoint
Wan 3.0 相关信号最有价值的地方,是它们把模型竞争从单一画面质量推向四个系统问题:如何表达长程意图,如何管理多模态条件,如何在时间轴上保持世界一致,如何把结果接进真实软件。WanSong 解决音频 token 的统一建模,Wan-Dancer 解决长时序的分层规划,Wan-Streamer 解决持续世界的流式预测,ComfyUI 则把这些能力包装成可以调用的节点。
这不是简单的"模型更大、视频更长"。更大的变化是,视频生成开始拥有类似 Agent 的工作流结构:输入被拆成可引用的资源,Planner 或分层生成器负责安排时间和空间,渲染器负责像素,后处理负责质量,平台负责重试和交付。模型只是其中一个节点,真正的产品壁垒是约束、数据、验收和分发能否连成闭环。
Rocky 认为,工具红利会随着模型 API 普及而下降,工作流认知反而会上升。现在部署 Wan 2.2、试验 Wan-Dancer、接入音频管线和准备 GPU,目的不是押注某个传闻日期,而是提前积累跨模型迁移的能力。当 Wan 3.0 的官方规格真正落地时,已经具备素材管理、时序评测和成本模型的团队,才有机会把"30 秒视频"变成可持续交付的业务,而不是又一次短暂 demo。
术语与概念速查
| 术语 | 含义 |
|---|---|
| Wan 2.2 | Wan 生态中以视频生成和 DiT/flow matching 为核心的公开基线 |
| WanSong | 面向多语言歌曲和双音轨输出的音频扩散模型 |
| Wan-Dancer | 音乐驱动舞蹈视频模型,采用全局关键帧加局部细化的分层生成 |
| Wan-Streamer | 面向实时交互的 world/event 流式建模研究 |
| hybrid-MMDiT | 在统一 token 序列中联合建模多模态信息的扩散 Transformer 设计 |
| AdaLN | 通过自适应 LayerNorm 调制不同模态特征的机制 |
| T2V / I2V | 文本到视频 / 图像到视频 |
| world + event stream | 将持久场景状态与变化事件拆分的时序表示 |
| ComfyUI 合作伙伴节点 | 通过 API 调用 Wan 3.0 能力的工作流入口,不等同于开源权重 |
推荐阅读
1. 深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2025年可以说是AI Agent全面落地应用的元年,因此Rocky在持续撰写对AI Agent的全维度解析文章:
深入浅出完整解析AI Agent(AI智能体)的核心基础知识
2. 深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
Rocky对扩散模型的本质原理与和核心基础知识进行了全面系统的深入浅出分析讲解,同时不断跟进补充扩散模型的最新技术发展,希望能给大家带来帮助:
深入浅出完整解析扩散模型DDPM、DDIM、Score-Based、SDE、LDM、Classifier/Classifier-Free Guidance、Rectified Flow核心基础知识
3. 入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
Rocky对AIGC时代"中场时刻"之后的主流AIGC创作大模型的核心基础知识进行了全面系统的深入浅出分析讲解,力求让大家通俗易懂理解AIGC时代的技术浪潮的本质价值:
入浅出完整解析FLUX.2、Seedream(即梦)、Z-image、GLM-Image核心基础知识
4. 深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
Rocky对FLUX.1 Kontext和FLUX.1 Krea的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析FLUX.1 Kontext和FLUX.1 Krea核心基础知识
5. 深入浅出完整解析DeepSeek系列核心基础知识
Rocky对DeepSeek系列模型的核心基础知识作了全面系统的梳理与解析:
6. 深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
Rocky对Stable Diffusion 3和FLUX.1的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion 3(SD 3)和FLUX.1系列核心基础知识
7. 深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
Rocky对Stable Diffusion XL的核心基础知识作了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion XL(SDXL)核心基础知识
8. 深入浅出完整解析Stable Diffusion(SD)核心基础知识
Rocky对Stable Diffusion 1.x-2.x系列模型的核心基础知识做了全面系统的梳理与解析:
深入浅出完整解析Stable Diffusion(SD)核心基础知识
9. 深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
Rocky对Stable Diffusion中最为关键的U-Net结构进行了深入浅出的全面解析,包括其在传统深度学习中的价值和在AIGC中的价值:
深入浅出完整解析Stable Diffusion中U-Net的前世今生与核心知识
10. 深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
对于AIGC时代中的"ResNet"------LoRA模型,Rocky进行了深入浅出的全面讲解:
深入浅出完整解析LoRA(Low-Rank Adaptation)模型核心基础知识
11. 深入浅出完整解析ControlNet核心基础知识
AIGC图像创作开源社区已经形成以Stable Difffusion/FLUX为核心,ConrtolNet和LoRA作为首要AI辅助工具的变化万千的AIGC图像创作工作流。
ControlNet正是让AI图像创作社区无比繁荣的关键一环,它让AIGC图像创作过程更加的可控,更有助于广泛地将AIGC算法解决方案应用到各行各业中:
12. 深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
AI绘画和AI视频是两个互相促进、相互交融的领域,2024年无疑是AI视频领域的爆发之年,Rocky对AI视频领域核心的Sora、Seedance、Keling等大模型进行了全面系统的梳理与解析:
深入浅出完整解析Sora、Seedance、keling等AI视频大模型核心基础知识
13. 深入浅出完整解析AIGC时代Transformer核心基础知识
在AIGC时代中,Transformer为AI行业带来了深刻的变革。Transformer架构正在一步一步重构所有的AI技术方向,成为AI技术架构大一统与多模态整合的关键核心基座,大有一统"AI江湖"之势。Rocky也对Transformer模型进行持续的深入浅出梳理与解析:
深入浅出完整解析AIGC时代Transformer核心基础知识
14. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
AIGC创作框架正是AIGC算法工作流的运行载体,目前主流的AIGC创作框架有ComfyUI、Diffusers、Stable Diffusion WebUI等 。在传统深度学习时代,PyTorch、TensorFlow以及Caffe是传统深度学习模型的基础运行框架,到了AIGC时代,Rocky相信ComfyUI就是AIGC时代的"PyTorch"、Stable Diffusion WebUI就是AIGC时代的"TensorFlow"、Diffusers就是AIGC时代的"Caffe":
深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
15. 深入浅出完整解析ComfyUI、Diffusers、Stable Diffusion WebUI等主流AIGC创作框架核心基础知识
在AIGC时代中,如何快速转身,入局AIGC产业?如何成为AIGC/LLM/AI Agent算法/开发工程师?如何在学校中系统性学习AIGC/LLM/AI Agent知识,斩获心仪的AIGC/LLM/AI Agent算法/开发offer?
Don't worry,Rocky为大家总结整理了全面的AIGC/LLM/AI Agent算法/开发工程师成长秘籍,为大家答疑解惑,希望能给大家带来帮助:
手把手教你成为AIGC/LLM/AI Agent算法/开发工程师,斩获AIGC/LLM/AI Agent算法/开发offer!
16. AIGC产业的深度思考与分析
2023年3月21日,微软创始人比尔·盖茨在其博客文章《The Age of AI has begun》中表示,自从1980年首次看到图形用户界面(graphical user interface)以来,以OpenAI为代表的科技公司发布的AIGC模型是他所见过的最具革命性的技术进步。
Rocky也认为,AIGC及其生态,会成为AI行业重大变革的主导力量。AIGC会带来一个全新的红利期,未来随着AIGC的全面落地和深度商用,会深刻改变我们的工作、生活、学习以及交流方式,各行各业都将被重新定义,过程会非常有趣。
那么,在此基础上,我们该如何更好的审视AIGC的未来?我们该如何更好地拥抱AIGC引领的革新?Rocky准备从技术、产品、商业模式、长期主义等维度持续分享一些个人的核心思考与观点,希望能帮助各位读者对AIGC有一个全面的了解:
深入浅出全面解析AIGC时代核心价值与发展趋势(2025年版)
17. AI算法工程师的独孤九剑秘籍
为了方便大家实习、校招以及社招的面试准备,同时帮助大家提升扩展技术基本面,Rocky将符合大厂和AI独角兽价值的算法高频面试知识点撰写总结成《三年面试五年模拟》之独孤九剑秘籍:
【三年面试五年模拟】AIGC时代的算法工程师的求职面试秘籍(持续更新中)
18. 深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识
GAN系列模型作为传统深度学习时代的最热门生成式Al模型,在AIGC时代继续繁荣,作为Stable Diffusion/FLUX系列大模型的"得力助手",广泛活跃于AlGC图像创作的产品与工作流中:
深入浅出完整解析AIGC时代中GAN(Generative Adversarial Network)系列模型核心基础知识