****论文题目:****DisCa: Accelerating Video Diffusion Transformers with Distillation-Compatible Learnable Feature Caching(DISCA:利用与蒸馏兼容的可学习特征缓存加速视频扩散转换器)
会议:CVPR 2026
****摘要:****虽然扩散模型在视频生成领域取得了巨大成功,但这一进步伴随着计算负担的迅速增加。在现有加速方法中,特征缓存因其无训练特性和显著的加速性能而受欢迎,但随着进一步压缩,语义和细节下降不可避免。另一种广泛采用的方法------训练感知阶梯蒸馏,虽然在图像生成方面取得成功,但在视频生成过程中也面临着显著的退化。此外,当仅对步进蒸馏模型应用无训练特征缓存时,由于采样步骤更稀疏,质量损失会更加严重。本文首次新颖地引入了一种与蒸馏兼容的可学习特征缓存机制。我们采用轻量级可学习神经预测器,取代传统的无训练启发式扩散模型,实现高维特征演化过程的更准确捕捉。此外,我们探讨了在大型视频模型上进行高度压缩蒸馏的挑战,并提出了一种保守的受限平均流量方法,以实现更稳定和无损的蒸馏。通过开展这些举措,我们将加速边界进一步提升至11.8×同时保持发电质量。大量实验证明了我们方法的有效性。
DisCa:用可学习特征缓存突破视频扩散模型的加速极限
一、背景:视频生成模型的速度困境
近年来,以 HunyuanVideo、Wan 为代表的大规模视频扩散Transformer(Video DiT)在生成质量上取得了显著突破。然而,这类模型在推理时需要数十次迭代去噪,计算成本极为高昂------以 HunyuanVideo 为例,50步原始推理的延迟高达 1155秒,在实际部署中几乎不可接受。
为了解决这一问题,学界主要探索了两条技术路线:
- 训练感知的步骤蒸馏(Step Distillation):如MeanFlow,通过训练将多步去噪压缩为少数几步,甚至一步完成。
- 训练无关的特征缓存(Feature Caching):如TaylorSeer、TeaCache,通过复用相邻时间步的特征来跳过部分计算,无需重新训练。
然而,这两条路线各自存在明显局限,且叠加使用时效果反而更差 。DisCa 这篇工作正是针对这一根本矛盾提出系统性解决方案,在保持生成质量的前提下,将加速比推至 11.8×。
二、现有方法的问题分析
2.1 传统特征缓存的固有缺陷
传统特征缓存方法的核心假设是:相邻时间步的特征高度相似,因此可以直接复用或通过简单插值来近似。
- 朴素缓存 (Naïve Caching,如DeepCache、FORA):直接将时间步
计算的特征复用到
,理论上可达 N 倍加速,但随着 N 增大,误差指数级积累。
- 泰勒展开预测(TaylorSeer):在每层维护特征的多阶导数缓存,通过泰勒级数展开做预测,显著降低缓存误差。但这种手工构造的预测函数本质上难以捕捉高维特征的复杂演化规律,仍存在明显的语义细节丢失。
更关键的是,TaylorSeer 等方法需要为每一个 DiT Block 的每一层 缓存特征及其多阶导数,额外 VRAM 开销高达 33.49 GB。在高分辨率、长序列视频生成场景(需要序列并行)下,这一开销几乎不可接受。

📊 图1(a)------展示未蒸馏模型下特征缓存的工作原理示意图(相邻时间步相似,缓存误差可接受)
2.2 步骤蒸馏在视频模型上的失效
MeanFlow 通过将训练目标从瞬时速度场改为平均速度场,在图像生成上取得了出色的少步甚至一步生成效果。但将其应用于大规模视频生成模型时,存在两个严重问题:
- 数值误差放大:MeanFlow 训练需要计算 Jacobian-vector product(JVP),其引入的数值误差随序列长度增长而急剧恶化,在长视频生成中极易导致训练发散。
- 目标过于激进:MeanFlow 以一步蒸馏为设计目标,对视频这类高复杂度任务而言过度压缩,导致生成结果出现明显畸变和伪影。
2.3 两种方法叠加后效果更差

📊 图1(b)------展示步骤蒸馏后特征缓存失效的示意图(步骤稀疏导致相邻特征差异极大,缓存误差"TOO MUCH")
如图1所示,未蒸馏模型的采样轨迹连续密集,相邻步骤特征差异小,传统缓存方法有效;而经过步骤蒸馏后,采样点变得稀疏,相邻步骤之间的特征差异显著增大,简单的线性或高阶初等函数无法有效预测特征演化------传统缓存方法完全失效。
因此,现有方法存在一个根本性矛盾:步骤蒸馏让模型变快,但也让特征缓存变得更难;将两者叠加,反而比单独使用任何一种方法效果更差。
三、DisCa 的解决方案
DisCa 提出两项核心创新,使特征缓存与步骤蒸馏真正兼容互补。

📊 图2------DisCa整体框架概览图(包含(a)推理流程、(b)预测器训练、(c)预测器架构、(d)Restricted MeanFlow对比)
3.1 受限MeanFlow(Restricted MeanFlow)
为解决 MeanFlow 在大规模视频模型上训练不稳定的问题,DisCa 提出 Restricted MeanFlow :通过引入限制因子 ,将平均速度的采样区间从原始的
限制为:
直觉理解 :MeanFlow 中 越大,对应的压缩比越高(越激进)。对视频模型而言,这些"高压缩比"的训练样例不仅难以学习,还会引入大量数值误差导致训练发散。通过直接裁剪这部分训练案例,Restricted MeanFlow 专注于学习局部的平均速度,实现更稳定的蒸馏。

📊 图2(d)------MeanFlow与Restricted MeanFlow的采样过程对比示意图

📊 图3------MeanFlow与Restricted MeanFlow在20步和10步下的视觉质量对比
量化结果(Table 1):

📊 Table 1------Restricted MeanFlow在HunyuanVideo上的VBench定量对比
以 为例:
- 20步推理 :Restricted MeanFlow 语义分数为 70.4,比 MeanFlow 的 66.6 提升 +5.7%,甚至超过了 50步CFG蒸馏模型(66.7)
- 10步推理 :语义分数为 68.2,比 MeanFlow 的 60.9 大幅提升 +12.0%
- 加速比与 MeanFlow 几乎相同(4.97× vs 4.96×),无额外计算开销
3.2 可学习特征缓存(Learnable Feature Caching)
核心思路:用轻量级神经网络预测器替代手工预测公式,通过数据驱动的方式捕捉高维特征的演化规律。
推理流程

如图2(a)所示,推理时采用"整体计算 + 预测器接力"的模式:
- 完整计算步 :大规模DiT
对当前时间步做完整前向推理,输出结果作为缓存
- 预测步 :后续
步由轻量预测器
接收缓存
和当前噪声输入,快速推断输出
这样每 N 步中只需 1 次完整 DiT 推理,大幅节省计算量。
预测器架构

📊 图2(c)------轻量预测器架构图(FFN + 2个DiT Block)
预测器 由 FFN + 2个DiT Block 堆叠而成,参数量始终保持在主模型的 4% 以下,推理开销几乎可以忽略不计。
内存高效的缓存设计
与 TaylorSeer、FORA 等方法需要为每一层维护多个缓存张量不同,DisCa 仅维护最终层的单一张量作为缓存。这一设计带来显著的内存优势:
- DisCa 额外 VRAM 开销:仅 0.43 GB(约 1.3%)
- TaylorSeer 额外 VRAM 开销:33.49 GB
- FORA 额外 VRAM 开销:27.39 GB

📊 图7------各方法VRAM占用分析对比柱状图
在需要序列并行(sequence parallel)的高分辨率长视频生成场景中,这一差距直接决定方法是否可用。
预测器训练与生成对抗策略
预测器的训练目标是:给定大模型在时间步 t 的缓存 ,准确预测时间步
处的模型输出:
然而,仅使用 MSE 损失训练往往导致输出模糊,缺乏高频细节。为此,DisCa 引入生成对抗训练(GAN Training):
- 构建多尺度判别器
(基于谱归一化 + Hinge Loss)
- 将大模型和预测器的输出分别通过特征提取器
(即大模型本身作为预训练骨干)送入判别器
- 判别器和预测器交替优化,形成对抗博弈
最终的训练目标为:
其中 。

📊 图2(b)------预测器训练流程图(缓存初始化、判别器对抗、最大化/最小化目标)

📊 图5------生成对抗训练过程中判别器损失和预测器损失的曲线图
四、实验结果
4.1 实验配置
- 基础模型:HunyuanVideo 1.0(Text-to-Video),在 H20 GPU 上基于 540p 预训练检查点进行蒸馏和训练
- 评测视频:704×704分辨率,129帧,5秒时长
- 评估指标 :VBench(16个子维度,语义分数×1 + 质量分数×4 = 总分),以语义分数为主要指标(对畸变和可控性最敏感)
- 训练流程:CFG蒸馏(lr=1e-5)→ Restricted MeanFlow蒸馏(lr=1e-5)→ 预测器对抗训练(预测器lr=1e-4,判别器lr=1e-2)
4.2 与各加速方法的全面对比

📊 Table 2------各加速方法在HunyuanVideo上的VBench全面定量对比(中低速区域和高速区域)

📊 图4------各加速方法在HunyuanVideo上的视觉效果对比(CFG/CFG-distilled/DisCa/PAB/TaylorSeer/TeaCache)
以下重点分析高速区域(约10×加速)下各方法的表现,这也是最能体现方法能力边界的场景:
| 方法 | 加速比 | 语义分数 | 语义损失 | 总分损失 |
|---|---|---|---|---|
| 原始50步 | 1.00× | 73.5 | --- | --- |
| CFG蒸馏10步 | 9.65× | 59.0 | -19.7% | -8.4% |
| △-DiT (N=8) | 4.55× | 42.7 | -41.9% | -18.4% |
| PAB (N=8) | 6.46× | 56.3 | -23.4% | -9.8% |
| TeaCache (l=0.4) | 9.22× | 62.1 | -15.5% | -5.6% |
| TaylorSeer (N=6) | 6.96× | 63.7 | -13.3% | -4.0% |
| DisCa (N=4) | 11.8× | 69.3 | -5.7% | -1.4% |
DisCa 在达到最高加速比(11.8×)的同时,语义损失仅为 -5.7% ,远优于所有对比方法。值得注意的是,即便与总分对比,DisCa 的 78.8 也明显优于 50步CFG蒸馏模型的 77.9,实现了在更高加速比下超越非蒸馏加速基线。
4.3 消融实验分析

📊 Table 3------消融实验:Restricted MeanFlow、可学习预测器、GAN训练各组件的贡献
各组件贡献(以DisCa完整配置为基准,语义分数69.3为参考):
- 去掉 Restricted MeanFlow (改用原始MeanFlow):语义分数降至 65.2,下降 -5.9%,对应生成结果出现"完全不可接受的畸变"。这说明稳定的蒸馏基础是整个方案的根本前提。
- 去掉可学习预测器 (改用传统训练无关缓存):语义分数降至 67.3,下降 -2.9%,质量分数也下降 -0.7%,"在语义保真度和质量上均产生不可接受的损失"。
- 去掉 GAN 训练 (仅使用MSE损失):语义分数降至 68.5,下降 -1.2%,进一步验证了对抗训练对语义感知能力的重要性。
4.4 理论加速比 vs 实际加速比

📊 Table 7------各方法理论FLOPs加速比与实际延迟加速比的对比
这是本文一个重要但容易被忽略的发现:多层缓存结构在序列并行环境下会导致理论与实际加速比的显著偏差。
- PAB、FORA、TaylorSeer 等方法需要对每个 DiT Block 的每一层维护缓存,在缓存步骤中产生大量稀疏内存访问。在序列并行(computational resources相对充裕)的场景下,这些稀疏访问无法被底层硬件充分优化,导致实际延迟远高于理论预期。例如 TaylorSeer 理论加速比 9.09×,实际仅 6.96×。
- DisCa 采用单一张量缓存 + 高度并行化的预测器计算,实际加速比 11.8× 与理论值 11.9× 几乎完全一致。
4.5 图像到视频(I2V)泛化性验证

📊 Table 4------各方法在HunyuanVideo 1.5 I2V任务上的PSNR/SSIM/LPIPS对比
在更激进的设置下(NFE=4),DisCa 在 HunyuanVideo 1.5 的 I2V 任务上同样取得最优结果:LPIPS=0.1942,PSNR=19.29,SSIM=0.7071,均优于 TaylorSeer、MagCache、AdaCache、DCM 等方法。
4.6 用户研究

📊 图6------用户研究饼图(4步和8步偏好占比)
用户研究进一步验证了定量结果:
- 4步推理:74.7% 的用户偏好 DisCa,其余所有方法合计仅占 25.3%
- 8步推理:Restricted MeanFlow(我们的方法)获得 38.2% 偏好,仅次于非加速50步模型的 46.7%
4.7 更多可视化对比

📊 图8------更多场景下的视觉对比(湍流水花、喷泉、金鱼、熊猫弹吉他、胡萝卜、椅与沙发)
图8展示了多种场景下的可视化对比。PAB 在几乎所有场景下都出现明显模糊和伪影;TaylorSeer 和 TeaCache 在"维多利亚式房屋"、"湖边公园长椅"等场景中出现畸变;而 DisCa 在 11.8× 加速下仍保持丰富细节和清晰结构,与参考输出高度一致。
五、总结与展望
DisCa 的核心贡献可以概括为一句话:首次将可学习特征缓存与步骤蒸馏真正兼容,形成互补增强而非相互削弱的加速体系。
具体而言:
- Restricted MeanFlow 解决了"蒸馏不稳定"的根本问题,提供高质量的稀疏采样基础
- 可学习预测器 + GAN训练 解决了"稀疏轨迹上缓存失效"的技术问题,以数据驱动方式精确捕捉高维特征演化
- 单层单张量缓存设计 解决了"内存开销过大"的工程问题,使方法在真实部署中切实可行
最终,DisCa 将 HunyuanVideo 的加速极限从此前最优的约 7× 提升至 11.8×,且质量总分损失仅 1.4%,相比 50步CFG蒸馏模型还有显著提升,为大规模视频生成模型的高效部署提供了一条全新路径。