Fast-WAM 基于 Wan2.2-5B 视频模型改造,采用 Video DiT + Action DiT 的双专家结构。核心思路是:训练时保留未来视频预测,推理时不再生成未来视频。论文用受控实验说明,WAM 的主要收益更可能来自训练阶段的视频共训练,而不是测试阶段显式生成未来画面。
- 训练机制:当前帧、未来视频潜变量和动作块共同训练;结构化 Attention Mask 禁止动作 token 读取未来帧,避免信息泄漏。
- 推理机制:只编码当前观测并缓存 Video DiT 的 KV,再通过 10 步 Flow Matching 生成连续动作块;不需要未来图像,也不进行未来视频去噪。
论文地址:Fast-WAM: Do World Action Models Need Test-time Future Imagination?
开源地址:https://github.com/yuantianyuan01/FastWAM
模型权重:https://huggingface.co/yuanty/fastwam
1、模型架构
如下图所示,论文把 WAM 分成三类:视频和动作联合去噪、先预测未来视频再生成动作,以及 Fast-WAM 的"训练时预测视频、推理时直接生成动作"。

Fast-WAM 的重点不是删掉世界模型,而是把视频建模目标 与测试时视频生成拆开。思路流程要点如下。
1.1、输入组件:任务指令+当前观测+本体状态
- 任务指令:如"Fold the cloth",由 Wan 自带的 T5 编码器转换为文本特征。
- 当前观测:来自多路相机。LIBERO 使用主视角和腕部相机,RoboTwin 使用高位、左腕和右腕相机。
- 本体状态:机械臂当前状态。源码把它编码后追加到文本上下文中。
- 噪声动作:推理时从高斯噪声初始化,用于 Flow Matching 的动作生成过程。
- 未来视频帧:只在训练时使用,用来提供视频预测监督;推理时不存在。
1.2、核心模块
- Video VAE:把当前图像和训练期未来视频压缩为潜变量。
- Video DiT:来自 Wan2.2-TI2V-5B,隐藏维度为 3072,负责学习视频动态与当前观测的潜在世界表征。
- Action DiT:约 1B 参数,隐藏维度为 1024,负责生成连续动作块。
- MoT共享注意力:Video DiT 与 Action DiT 各自保留专家参数,但每层的 Q/K/V 在同一注意力计算中交互。
- 结构化Attention Mask:规定哪些 token 可以互相读取,是隔离未来信息的关键。
Fast-WAM 总参数约 6B,其中视频骨架约 5B,动作专家约 1B。这里的 Mixture-of-Transformer(MoT)不是按 token 路由的传统 MoE,而是让视频专家和动作专家通过共享注意力交换信息。
1.3、处理流程:视频共训练+连续动作生成

训练阶段:
① 当前帧和未来帧先经过 Video VAE,动作块经过动作编码器。
② 第一帧潜变量保持干净;未来视频潜变量和动作块分别加入高斯噪声。
③ Video DiT 预测未来视频潜变量的速度场,Action DiT 预测动作速度场。
④ 动作 token 只能读取当前帧和动作 token,不能读取未来视频 token,防止训练时"偷看答案"。
⑤ 视频损失与动作损失相加,共同更新模型。
推理阶段:
① 只将当前多相机图像送入 VAE 和 Video DiT。
② Video DiT 前向一次,并缓存各层的 K/V。
③ Action DiT 从动作噪声开始,通过 10 步 Flow Matching 生成动作块。
④ 每个动作去噪步复用视频 KV,不再重复执行视频分支,也不生成未来视频。
1.4、输出结果
模型输出长度为 32 的连续动作块。LIBERO 每步动作为 7 维,包括 6 维末端位姿变化和 1 维夹爪控制;RoboTwin 为 14 维双臂动作。
需要注意,"单次前向"只指当前帧在 Video DiT 中处理一次。动作分支仍要执行 10 步去噪,因此不能把 Fast-WAM 理解为整个模型只计算一次 Transformer。
1.5、Fast-WAM与两类WAM变体的区别
| 对比维度 | Fast-WAM-Joint | Fast-WAM-IDM | Fast-WAM |
|---|---|---|---|
| 训练时视频目标 | 有 | 有 | 有 |
| 推理时未来视频 | 视频与动作联合生成 | 先生成视频,再预测动作 | 不生成 |
| 动作是否读取未来视频 | 是 | 是 | 否 |
| 当前帧视频分支 | 随联合去噪重复计算 | 先完成视频去噪 | 单次前向并缓存KV |
| 论文延迟 | 580 ms | 810 ms | 190 ms |
| 代表范式 | Motus、UWM | LingBot-VA、ViDAR | 训练期世界建模+直接策略接口 |
论文还构造了 Fast-WAM w.o. video co-train:架构和推理过程与 Fast-WAM 相同,只删除训练期视频损失,用它直接检验视频共训练是否重要。
2、Fast-WAM架构设计思路
2.1、核心目标
WAM 面临一个直接矛盾:预测未来视频可以迫使模型学习物体运动和交互规律,但测试时迭代生成视频又会带来较高延迟。
Fast-WAM 的目标是把两部分收益拆开:训练时继续利用未来视频监督学习世界表征,推理时只保留对动作有用的潜在特征,从而降低实时控制成本。
2.2、具体实现
标准视觉运动策略直接建模:
p ( a 1 : H ∣ o , l ) p(a_{1:H}\mid o,l) p(a1:H∣o,l)
其中, o o o 是当前视觉观测, l l l 是语言任务指令, a 1 : H a_{1:H} a1:H 表示从第 1 步到第 H H H 步的连续动作块,论文设置 H = 32 H=32 H=32; p ( ⋅ ) p(\cdot) p(⋅) 表示模型学习的条件动作分布。
传统 imagine-then-execute WAM 引入未来视觉观测:
p ( a 1 : H ∣ o , l ) = ∫ p ( v 1 : T ∣ o , l ) p ( a 1 : H ∣ o , l , v 1 : T ) d v 1 : T p(a_{1:H}\mid o,l)=\int p(v_{1:T}\mid o,l)p(a_{1:H}\mid o,l,v_{1:T})\,dv_{1:T} p(a1:H∣o,l)=∫p(v1:T∣o,l)p(a1:H∣o,l,v1:T)dv1:T
v 1 : T v_{1:T} v1:T 表示未来第 1 到第 T T T 个视觉观测; p ( v 1 : T ∣ o , l ) p(v_{1:T}\mid o,l) p(v1:T∣o,l) 负责生成未来视频; p ( a 1 : H ∣ o , l , v 1 : T ) p(a_{1:H}\mid o,l,v_{1:T}) p(a1:H∣o,l,v1:T) 根据当前信息和想象结果生成动作。积分表示对可能的未来轨迹进行边缘化,实际系统通常用一条或少量生成轨迹近似。
Fast-WAM 则改为:
p θ ( a 1 : H ∣ o , l ) = p θ ( a 1 : H ∣ z ( o , l ) ) p_{\theta}(a_{1:H}\mid o,l)=p_{\theta}(a_{1:H}\mid z(o,l)) pθ(a1:H∣o,l)=pθ(a1:H∣z(o,l))
θ \theta θ 表示模型参数; z ( o , l ) z(o,l) z(o,l) 是 Video DiT 对当前观测和语言条件进行单次编码后得到的潜在世界表征;动作分布只依赖该表征,不依赖测试时生成的未来视频。
2.3、关键细节:未来信息不能进入动作分支
训练时共有三组 token:干净当前帧潜变量 f 0 f_0 f0、加噪未来视频潜变量 f 1 , ... , f h f_1,\ldots,f_h f1,...,fh、加噪动作 token a 1 , ... , a H a_1,\ldots,a_H a1,...,aH。
Attention Mask 的信息流如下:
- 未来视频 token 可以读取当前帧和视频分支内部 token;
- 动作 token 可以读取当前帧和动作分支内部 token;
- 动作 token 不能读取未来视频 token;
- 当前帧不读取未来视频或动作 token。
如果不做这一隔离,动作模型可能直接利用训练数据中的未来画面,而不是根据当前观测学习动作。推理时未来画面消失,训练和推理条件就会不一致。
2.4、设计意义
Fast-WAM 的核心判断是:视频预测的价值不一定要通过"在线生成未来画面"体现,也可能已经固化在 Video DiT 的参数和隐藏特征中。
从工程角度看,它接近"训练时使用世界模型辅助目标,推理时采用直接策略接口"。如果严格把 WAM 定义为"预测未来必须进入测试时动作链路",Fast-WAM 更像受世界建模监督增强的 VLA;论文采用的是更宽的 WAM 定义。
3、视频与动作的联合Flow Matching训练
3.1、核心目标
Fast-WAM 用同一种 Flow Matching 形式学习未来视频潜变量和连续动作。视频损失负责塑造世界表征,动作损失负责学习实际控制,两者通过共享注意力在同一个模型中训练。
3.2、带噪目标构造
给定目标变量 y y y,采样高斯噪声 ϵ \epsilon ϵ 和生成模型内部时间 t t t,构造:
y t = ( 1 − t ) y + t ϵ y_t=(1-t)y+t\epsilon yt=(1−t)y+tϵ
该公式把干净目标和高斯噪声进行线性插值。 t t t 越接近 0, y t y_t yt 越接近真实数据; t t t 越接近 1, y t y_t yt 越接近纯噪声。这里的 t t t 是 Flow Matching 的噪声时间,不是机器人执行时刻,也不是未来视频的帧编号。
3.3、联合损失函数
模型学习速度场:
L F M ( y ) = E y , ϵ , t ∥ f θ ( y t , t , o , l ) − ( ϵ − y ) ∥ 2 2 \mathcal{L}{\mathrm{FM}}(y)=\mathbb{E}{y,\epsilon,t}\left\\left\\\|f_{\\theta}(y_t,t,o,l)-(\\epsilon-y)\\right\\\|_2\^2\\right LFM(y)=Ey,ϵ,t∥fθ(yt,t,o,l)−(ϵ−y)∥22
动作和视频分别代入该目标:
L a c t = L F M ( a 1 : H ) \mathcal{L}{\mathrm{act}}=\mathcal{L}{\mathrm{FM}}(a_{1:H}) Lact=LFM(a1:H)
L v i d = L F M ( z 1 : T ) \mathcal{L}{\mathrm{vid}}=\mathcal{L}{\mathrm{FM}}(z_{1:T}) Lvid=LFM(z1:T)
最终损失为:
L = L a c t + λ L v i d \mathcal{L}=\mathcal{L}{\mathrm{act}}+\lambda\mathcal{L}{\mathrm{vid}} L=Lact+λLvid
L a c t \mathcal{L}{\mathrm{act}} Lact 优化动作速度场, L v i d \mathcal{L}{\mathrm{vid}} Lvid 优化未来视频潜变量速度场, z 1 : T z_{1:T} z1:T 是 Video VAE 得到的未来视频 latent, λ \lambda λ 用于平衡两项损失。
论文正文没有给出 λ \lambda λ 的明确数值;当前开源实现中视频和动作损失默认权重均为 1.0。这是源码默认设置,不能写成论文明确报告的超参数。
3.4、训练与推理的阶段化分工
**训练阶段:**未来视频与动作都加噪并计算损失;视频和动作噪声时间独立采样;第一帧 latent 被替换回干净观测。
**推理阶段:**完全删除未来视频 token 与视频损失,只保留当前帧编码、Video KV Cache 和动作去噪。
这说明未来视频是训练监督,不是 Fast-WAM 测试时动作生成的输入。
4、关键公式详细分析
4.1、Flow Matching公式逐符号解析
理解 Fast-WAM 损失的关键,是理解下面这个速度场目标:
L F M ( y ) = E y , ϵ , t ∥ f θ ( y t , t , o , l ) − ( ϵ − y ) ∥ 2 2 \mathcal{L}{\mathrm{FM}}(y)=\mathbb{E}{y,\epsilon,t}\left\\left\\\|f_{\\theta}(y_t,t,o,l)-(\\epsilon-y)\\right\\\|_2\^2\\right LFM(y)=Ey,ϵ,t∥fθ(yt,t,o,l)−(ϵ−y)∥22
| 符号 | 类型 | 具体含义 | 在Fast-WAM中的落点 |
|---|---|---|---|
| y y y | 干净目标 | 模型希望还原的数据 | 动作块 a 1 : H a_{1:H} a1:H 或未来视频 latent z 1 : T z_{1:T} z1:T |
| ϵ \epsilon ϵ | 随机变量 | 标准高斯噪声, ϵ ∼ N ( 0 , I ) \epsilon\sim\mathcal{N}(0,I) ϵ∼N(0,I) | 代码用 torch.randn_like 生成 |
| I I I | 矩阵 | 单位协方差矩阵 | 表示各维标准高斯噪声 |
| t t t | 标量 | Flow Matching 噪声时间 | 与机器人物理时间无关 |
| y t y_t yt | 带噪目标 | 干净数据与噪声的插值结果 | 视频和动作分别构造 |
| f θ f_\theta fθ | 模型输出 | 预测的速度场 | Video DiT 或 Action DiT 输出 |
| ϵ − y \epsilon-y ϵ−y | 监督目标 | 线性插值路径上的真实速度 | 源码 training_target 的返回值 |
| E \mathbb{E} E | 数学期望 | 对数据、噪声、时间采样求均值 | 实际由 batch 均值近似 |
| ∣ ⋅ ∣ 2 2 |\cdot|_2^2 ∣⋅∣22 | 平方L2范数 | 衡量预测与目标速度的差异 | 源码使用逐元素MSE |
4.2、公式核心逻辑
训练时,模型不是直接回归干净动作或未来视频,而是学习带噪样本应该沿什么方向变化。
- 对动作分支, y = a 1 : H y=a_{1:H} y=a1:H,模型学习把动作噪声还原成连续动作块。
- 对视频分支, y = z 1 : T y=z_{1:T} y=z1:T,模型学习把噪声 latent 还原成未来视频 latent。
- 两个任务共享当前帧与语言条件,但动作不能读取未来 latent。
推理调度器从噪声侧逐步积分到数据侧。源码使用 Euler 形式更新:
x k + 1 = x k + Δ k f θ ( x k , t k , o , l ) x_{k+1}=x_k+\Delta_k f_{\theta}(x_k,t_k,o,l) xk+1=xk+Δkfθ(xk,tk,o,l)
x k x_k xk 是第 k k k 个去噪步的动作状态, t k t_k tk 是该步噪声时间, Δ k \Delta_k Δk 是相邻时间点差值, f θ f_\theta fθ 是 Action DiT 预测的速度场。论文评测使用 10 个动作更新步。
4.3、用"折叠毛巾"理解训练与推理
以论文真机任务"Fold the cloth"为例。
**训练阶段:**当前观测是毛巾尚未折叠的多相机画面;未来视频监督展示毛巾被双臂抓取、拉平、折叠后的变化;动作监督是对应的 32 步连续控制。Video DiT 学习毛巾形变,Action DiT 学习动作速度场,Mask 保证 Action DiT 不能直接读取未来毛巾画面。
**推理阶段:**模型只看到当前毛巾画面、任务指令和机器人状态;Video DiT 对当前画面前向一次并缓存 KV;Action DiT 从高斯噪声出发,经过 10 步更新得到 32 步动作。机器人执行动作后获取新观测,再进入下一个闭环控制周期。
Fast-WAM 并不会先生成"毛巾接下来如何折叠"的视频,再根据这段视频控制机器人。
5、源码解析
本节核对官方仓库 main 分支,commit 为 45d8e1458921d83f8ad6cf9ce993d371208dabd0,提交时间为 2026-04-03。
5.1、项目目录
text
FastWAM/
├── configs/
│ ├── data/libero_2cam.yaml
│ ├── data/robotwin.yaml
│ ├── model/fastwam.yaml
│ ├── model/fastwam_joint.yaml
│ └── model/fastwam_idm.yaml
├── scripts/
│ ├── train.py
│ ├── preprocess_action_dit_backbone.py
│ └── precompute_text_embeds.py
├── experiments/
│ ├── libero/eval_libero_single.py
│ └── robotwin/fastwam_policy/deploy_policy.py
└── src/fastwam/models/wan22/
├── fastwam.py
├── fastwam_joint.py
├── fastwam_idm.py
├── mot.py
└── schedulers/scheduler_continuous.py
5.2、论文模块与源码对应关系
| 论文模块 | 源码文件/函数 | 实际作用 |
|---|---|---|
| Fast-WAM主模型 | fastwam.py::FastWAM |
组装Video DiT、Action DiT、VAE、调度器和损失 |
| 结构化Mask | FastWAM._build_mot_attention_mask |
控制video/action token的可见关系 |
| 视频+动作损失 | FastWAM.training_loss |
分别加噪、预测速度场并计算加权MSE |
| MoT共享注意力 | mot.py::MoT |
拼接不同专家的Q/K/V并执行统一注意力 |
| 视频KV缓存 | MoT.prefill_video_cache |
当前帧只计算一次,缓存30层K/V |
| 动作去噪 | FastWAM.infer_action |
从动作噪声开始迭代生成动作块 |
| Joint变体 | fastwam_joint.py::FastWAMJoint |
联合去噪视频和动作 |
| IDM变体 | fastwam_idm.py::FastWAMIDM |
先处理未来视频,再条件化动作 |
| Flow调度 | scheduler_continuous.py |
加噪、速度目标、推理时间表和Euler更新 |
5.3、Attention Mask的源码实现
python
mask[:video_seq_len, :video_seq_len] = video_self_mask
mask[video_seq_len:, video_seq_len:] = True
mask[video_seq_len:, :first_frame_tokens] = True
第一行建立视频分支内部注意力;第二行允许动作 token 双向交互;第三行只允许动作读取第一帧视频 token。代码没有打开 action → future video,因此未来帧不会泄漏到动作分支。
5.4、联合训练损失的源码实现
python
latents = video_scheduler.add_noise(input_latents, noise_video, t_video)
noisy_action = action_scheduler.add_noise(action, noise_action, t_action)
target_video = video_scheduler.training_target(input_latents, noise_video, t_video)
target_action = action_scheduler.training_target(action, noise_action, t_action)
loss_total = lambda_video * loss_video + lambda_action * loss_action
视频和动作分别采样噪声与时间,随后由 MoT 输出 pred_video 和 pred_action。源码还对 padding token 做掩码,并根据噪声时间使用 training_weight 加权,不是所有时间点完全等权。
5.5、KV Cache与动作推理
python
video_kv_cache = mot.prefill_video_cache(video_tokens, ...)
for t, delta in action_schedule:
pred_action = predict_action_with_cache(action, video_kv_cache, ...)
action = scheduler.step(pred_action, delta, action)
prefill_video_cache 保存 Video DiT 每层的 K/V。动作去噪时重新计算动作 Q/K/V,再与缓存的视频 K/V 拼接。这样 10 个动作去噪步都不需要重复执行 Video DiT,也不需要创建未来视频 latent。
5.6、数据与动作配置
| 配置 | LIBERO | RoboTwin 2.0 |
|---|---|---|
| 相机数量 | 2路 | 3路 |
| 拼接后尺寸 | 224 × 448 224\times448 224×448 | 配置输出 384 × 320 384\times320 384×320 |
| 动作维度 | 7 | 14 |
| 本体状态维度 | 8 | 14 |
| 归一化方式 | min/max | z-score |
| 原始时间帧 | 33 | 33 |
| 动作块长度 | 32 | 32 |
| VAE潜视频帧 | 9 | 9 |
原始序列包含 33 帧,动作块对应 32 个相邻控制步;视频 VAE 时间压缩 4 倍后得到 9 个 latent frame。9 个视频 latent 不等于 9 步动作。
5.7、最小环境与官方入口
bash
conda create -n fastwam python=3.10 -y
conda activate fastwam
pip install torch==2.7.1+cu128 torchvision==0.22.1+cu128 \
--extra-index-url https://download.pytorch.org/whl/cu128
pip install -e .
bash scripts/train_zero1.sh 8 task=libero_uncond_2cam224_1e-4
python experiments/libero/run_libero_manager.py \
task=libero_uncond_2cam224_1e-4 \
ckpt=./checkpoints/fastwam_release/libero_uncond_2cam224.pt
正式运行前还要准备 Wan2.2、Action DiT 初始化权重、T5 embedding cache、数据集和统计文件。README 建议 LIBERO 使用单机 8 GPU,RoboTwin 使用 64 GPU 加速训练,因此这里只做源码静态解析,不声称已完成大规模复现。
6、模型效果
6.1、RoboTwin实验
RoboTwin 2.0 包含 50 多个双臂任务。训练数据由 2,500 条 clean 场景演示和 25,000 条强随机化场景演示组成,每个任务在 clean 和 randomized 设置下各测试 100 次。
| 方法 | 具身预训练 | Clean | Rand. | 平均成功率 |
|---|---|---|---|---|
| π 0 .5 \pi_0.5 π0.5 | 是 | 82.74 | 76.76 | 79.8 |
| Motus | 是 | 88.66 | 87.02 | 87.8 |
| LingBot-VA | 是 | 92.90 | 91.50 | 92.2 |
| Fast-WAM | 否 | 91.88 | 91.78 | 91.8 |
| Fast-WAM-Joint | 否 | 90.84 | 90.32 | 90.6 |
| Fast-WAM-IDM | 否 | 91.16 | 91.34 | 91.3 |
| Fast-WAM w.o. video co-train | 否 | 82.76 | 84.80 | 83.8 |
Fast-WAM、Joint 和 IDM 的平均成功率分别为 91.8%、90.6% 和 91.3%,差距不超过 1.2 个百分点;删除视频共训练后下降到 83.8%,降低 8.0 个百分点。
这一结果说明,在当前实验中,视频训练目标造成的性能差异明显大于测试时是否生成未来视频。
6.2、LIBERO实验
LIBERO 包含 Spatial、Object、Goal 和 Long 四个 suite,共 40 个任务、2,000 次测试。Fast-WAM 平均成功率为 97.6%,Joint 为 98.5%,IDM 为 98.0%,删除视频共训练后为 93.5%。
Fast-WAM 并不是所有变体中分数最高的,因此论文更准确的结论是"性能接近显式未来生成,但推理更快",而不是"Fast-WAM全面超过所有WAM"。
此外,"无具身预训练"不等于"从零训练"。Fast-WAM 使用了 Wan2.2 视频预训练模型、T5 和 Video VAE,只是没有在大规模机器人数据上做额外 embodied pretraining。
6.3、真机毛巾折叠
如下图所示,论文在 Galaxea R1 Lite 上测试长时序毛巾折叠任务,并收集了 60 小时遥操作演示。


真机结果同时统计成功率、平均完成时间和推理延迟:
- 预训练 π 0 .5 \pi_0.5 π0.5 成功率为 100%,平均完成时间约 120 s,延迟 180 ms。
- Fast-WAM 成功率约 75%,平均完成时间约 150 s,延迟 190 ms。
- Fast-WAM-Joint 成功率约 70%,延迟 580 ms。
- Fast-WAM-IDM 成功率约 90%,延迟 810 ms。
- 删除视频共训练后,成功率降到 10%,平均完成时间约 240 s。
论文所说的"4× 更快"主要对应 190 ms 与 Fast-WAM-IDM 的 810 ms 相比,约为 4.26×;与 Joint 的 580 ms 相比约为 3.05×。所有延迟均在单张 NVIDIA RTX 5090D V2 32GB 上测量,不包含机器人完成整个动作块的物理执行时间。
7、论文与开源实现差异
- 噪声时间分布不同。 论文写的是 logit-normal 分布;当前
WanContinuousFlowMatchScheduler实际采样 u ∼ U ( 0 , 1 ) u\sim U(0,1) u∼U(0,1),再做 shift 映射,默认 shift 为 5。 - 视频损失权重未在论文中明确。 源码默认
lambda_video=1.0、lambda_action=1.0。 - 真机代码尚未公开。 当前仓库提供 LIBERO 和 RoboTwin 训练评测,未提供毛巾折叠数据、配置、脚本与 checkpoint。
- 官方权重只覆盖Fast-WAM主模型。 已发布 LIBERO 和 RoboTwin 两个 checkpoint,Joint 与 IDM 变体权重未列出。
- 推理步数存在配置与函数默认值差异。 论文和评测配置使用 10 步,但
infer_action函数签名默认是 20 步;复现论文延迟需要使用 release 配置。
8、总结
Fast-WAM 的核心结论可以概括为:模型需要在训练时学会预测未来,但不一定要在推理时把未来视频真正生成出来。
在 RoboTwin、LIBERO 和真机毛巾折叠中,删除视频共训练带来的性能下降,明显大于删除测试时未来想象造成的差异;同时,跳过未来视频生成把延迟从 810 ms 降到 190 ms。
但论文并没有证明未来想象普遍无用。Fast-WAM-IDM 在真机上的成功率高于 Fast-WAM,只是在线成本更高;长时规划、失败恢复、多候选轨迹评估以及显式 action-conditioned dynamics 是否仍需要测试时想象,也没有被当前实验完全回答。
因此,更稳妥的判断是:在当前 Wan2.2 骨架、数据规模和评测范围内,视频共训练是主要收益来源,显式未来生成的边际收益较小,而实时计算代价较高。