摘要
扩散模型在跨模态生成任务中展现出卓越的能力,尤其在文本/图像到视频生成、音视频联合生成等场景中取得了突破性进展。然而,时序一致性------即生成内容在时间维度上的连贯性与稳定性------始终是制约其走向实际应用的核心瓶颈。长序列生成中的身份漂移、结构变形、运动不连贯和帧间闪烁等问题,暴露了扩散模型在时序建模方面的深层局限。本文系统梳理了跨模态扩散模型中时序一致性问题的成因,从模型架构设计、训练策略优化和推理时引导三个维度全面综述了当前主流的优化方法,包括时空注意力机制、分层生成框架、感知条件联合建模、训练自由引导以及跨模态对齐等技术路线。在此基础上,本文分析了各类方法的优势与局限,探讨了时序一致性评估的现有标准与挑战,并对未来研究方向进行了展望。
关键词:扩散模型;跨模态生成;时序一致性;视频生成;时空建模
一、引言:跨模态生成时代的"时间之困"
扩散模型(Diffusion Models)的崛起,重新定义了视觉内容生成的边界。从DALL·E到Stable Diffusion,从图像生成到视频合成,扩散模型以其卓越的生成质量和灵活的模态控制能力,迅速取代了GAN和自回归模型,成为生成式AI的主流范式。在跨模态生成领域------即利用文本、图像、音频、姿态等多种模态信号驱动视觉内容创作------扩散模型更是展现出前所未有的潜力。
然而,当生成任务从静态图像扩展到动态视频时,一个根本性的难题浮出水面:时序一致性。简单来说,模型生成的每一帧单独看可能都很逼真,但放在一起却"穿帮"了------同一个物体在不同帧中结构变形,纹理忽有忽无,主体走着走着形状漂移,背景出现不连续的跳动。一张文本到图像(T2I)模型生成的图片可以近乎完美,但一段由扩散模型生成的视频却常常让人感到"不对劲"------不是这里闪烁一下,就是那里突然冒出一个不速之客。
这一困境并非偶然。正如多篇综述所指出的,尽管当前最先进的扩散模型在感知质量和语义对齐方面取得了令人瞩目的成果,但在长序列的时序一致性、跨域泛化和计算效率方面仍然面临严峻挑战。特别是在跨模态场景下,模型需要在文本描述、参考图像、音频信号等多种条件之间建立时空关联,时序一致性问题的复杂性进一步加剧。
本文旨在系统梳理扩散模型在跨模态生成任务中时序一致性优化的研究进展。我们将首先分析时序一致性问题的成因,然后从架构设计、训练策略和推理引导三个维度综述主流优化方法,最后讨论评估标准与未来方向。
二、时序一致性:概念、成因与挑战
2.1 什么是时序一致性?
时序一致性(Temporal Consistency)是指生成视频或序列化内容在时间维度上的连贯性与稳定性。具体而言,它包含以下几个层面的要求:
- 身份一致性(Identity Consistency) :同一主体(人物、物体)在视频全程应保持可辨识的外观特征,不发生突然变形或身份混淆。
- 结构一致性(Structural Consistency) :物体的几何结构在不同帧之间应保持稳定,不发生非物理的扭曲。
- 运动连贯性(Motion Coherence) :物体的运动轨迹应平滑自然,符合物理规律,不出现跳变或卡顿。
- 语义一致性(Semantic Consistency) :视频内容应始终与输入的文本提示或跨模态条件保持语义对齐。
这些要求共同构成了"好的视频"的评判标准------每一帧不仅要"好看",更要"说得通"。
2.2 扩散模型为何"记性不好"?
扩散模型在时序一致性上面临困境,根源在于其生成范式的结构性特征。
首先,是逐帧独立生成的局限。 大多数基于扩散的视频生成模型采用"逐帧生成"或"分段生成"的策略。每一帧的生成过程在本质上是一个独立的去噪过程------模型从纯噪声开始,逐步还原出清晰的图像。虽然研究者通过在模型中引入时序注意力机制来建立帧间联系,但这种联系往往是局部的、后验的,难以保证长程的时序连贯性。
其次,是误差累积效应。 在长视频生成中,模型通常采用自回归或滑动窗口的方式逐段生成。前一段的微小误差会在后续生成中被不断放大,导致物体结构在长时间跨度上逐渐漂移。正如WorldWeaver的研究团队所指出的,现有方法主要依赖RGB信号进行建模,而RGB信息在长时间传播中对漂移非常敏感。
再次,是跨模态对齐的复杂性。 在跨模态生成中,模型需要同时处理文本、图像、音频等多种输入条件,并将它们映射到统一的时空表示空间中。不同模态信息的时间粒度、语义密度和表达方式各不相同,如何让它们在时间轴上精确对齐,是一个极具挑战性的问题。
最后,是训练与推理的差异。 扩散模型在训练时通常以固定长度的视频片段为样本,但推理时往往需要生成长度远超训练样本的视频。这种长度外推(length extrapolation)的能力天然不足,导致长序列生成质量急剧下降。
2.3 跨模态场景下的特殊挑战
当生成任务从纯文本到视频(T2V)扩展到更丰富的跨模态场景时,时序一致性面临额外的挑战:
- 多模态条件的时间对齐:在音视频联合生成中,音频信号与视觉帧需要在时间轴上精确同步。音频的节奏、情感和事件必须与画面中的动作、表情和场景变化相匹配。
- 主体身份的多模态绑定:在主体到视频(Subject-to-Video)生成中,模型需要根据参考图像保持特定主体的身份一致性,同时让其在不同时间点执行复杂的动作和交互。
- 交错生成的时序规划:在交错文本-图像生成(Interleaved Generation)中,模型需要在一个序列中交替生成文本描述和视觉帧,两者之间需要保持时序和语义的连贯。
三、时序一致性优化的技术路线
面对上述挑战,研究者从多个层面发展了系统的优化策略。本章按照"架构设计---训练策略---推理引导"的逻辑主线,分类综述代表性方法。
3.1 架构设计:让模型"记住"时间
3.1.1 时空注意力机制
注意力机制是Transformer架构的核心,也是扩散模型处理时序信息的主要工具。在视频扩散模型中,研究者通常将传统的空间自注意力扩展为时空自注意力(Spatiotemporal Attention),即在计算注意力时同时考虑空间位置和时间索引。
Tune-A-Video是最早将文本到图像扩散模型扩展到视频生成的开创性工作之一,其核心贡献在于引入了时空注意力机制------在原有的空间注意力基础上增加时间维度的注意力计算,使模型能够捕捉帧间的对应关系。这一思路随后被广泛采用,成为视频扩散模型的标准组件。
在此基础上,研究者进一步探索了更高效的时序注意力设计。例如,Subject-Aware Cross-Frame Attention(SACFA) 机制被引入到Ouroboros-Diffusion中,专门用于在短片段内对齐主体特征,实现更好的视觉连贯性。在跨模态场景中,非对称跨模态交互(Asymmetric Cross-Modal Interaction) 机制则实现了双向的、时间对齐的跨注意力,确保音视频之间的精确时空同步。
3.1.2 记忆机制与状态建模
如果说注意力机制解决的是"局部看得见"的问题,那么记忆机制解决的是"长久记得住"的问题。
WorldWeaver 提出了一个富有洞见的方案:利用深度线索(depth cues)构建记忆库(Memory Bank) 。研究者观察到,深度信息比RGB颜色信息更能抵抗时间漂移------物体的深度在短时间内变化较小,而颜色和纹理容易受到光照、视角等因素的影响。通过将深度信息作为长期记忆存储,模型可以在生成后续帧时回溯更清晰的上下文信息,从而显著提升长视频的时序一致性。
Ouroboros-Diffusion 则提出了一种自循环引导(Self-Recurrent Guidance) 机制。其核心思想是:在FIFO(先进先出)视频扩散的队列结构中,将队列前端已经生成的较干净帧的信息反馈到队列尾端,用于指导更嘈杂帧的去噪过程。这种"以过去引导未来"的设计,实现了丰富的全局上下文信息交互。
Loom 采取了另一种策略------不是记住所有历史帧,而是有选择地条件化。对于每一帧的生成,Loom只条件化一小部分采样的先前帧,并结合全局文本上下文,而非拼接全部历史信息。这种方法在保证时序连贯性的同时,大幅提升了长序列生成的计算效率。
3.1.3 分层与多阶段生成架构
面对长序列生成中"一步到位"的困难,研究者发展出分层生成和多阶段生成的架构思路。
多阶段生成框架将视频生成分解为多个子任务:先生成关键帧(key frames),再通过插帧生成中间帧,最后进行视觉增强。这种方法通过将复杂的时序建模任务分解为更简单的子问题,降低了单次生成的难度。实验表明,这类方法能够稳定生成超过20秒(32帧/秒)的视频,同时保持身份一致性和时序连续性。
LumosFlow 则采用了一种分层长视频生成流水线:首先使用大运动文本到视频扩散模型生成具有较大运动间隔的关键帧,再在此基础上进行细化。这种"先粗后精"的策略,使得模型能够在宏观层面把握视频的整体结构和运动轨迹,再在微观层面填充细节。
3.2 训练策略:在源头解决问题
3.2.1 感知条件联合建模
传统的视频扩散模型以RGB帧为主要训练目标。WorldWeaver的研究表明,这种单一模态的训练方式正是长序列时序一致性不佳的重要原因。
WorldWeaver提出在统一的长时域建模方案 中联合预测RGB帧和感知条件 (如深度图、光流等)。这种联合训练框架带来了三重优势:第一,通过同时预测感知条件和颜色信息,显著增强了时序一致性和运动动态;第二,深度线索作为更抗漂移的信号,为模型提供了稳定的长期参照;第三,采用分段噪声调度(segmented noise scheduling)训练预测组,进一步减轻了时间漂移并降低了计算成本。
3.2.2 蒸馏中的专家分工
扩散模型虽然生成质量高,但推理时需要多次迭代去噪,计算开销巨大。一致性模型(Consistency Model)通过蒸馏技术大幅减少了采样步数,但直接应用于视频扩散模型时,往往会严重损害时序一致性和外观细节。
双专家一致性模型(Dual-Expert Consistency Model, DCM) 通过分析一致性模型蒸馏过程中的训练动态,发现了一个关键问题:不同时间步的优化梯度和损失贡献存在显著差异,这种冲突导致蒸馏后的学生模型无法达到最优状态。为解决这一问题,DCM引入了参数高效的双专家架构 ------语义专家专注于学习语义布局和运动,细节专家专注于精细细节的 refinement。此外,DCM还引入了时序连贯性损失(Temporal Coherence Loss) 来改善语义专家的运动一致性。这种"术业有专攻"的设计,使得蒸馏后的模型在极少采样步数下仍能保持高质量的时序一致性。
3.2.3 双模态与多模态协同训练
在跨模态生成中,不同模态之间的协同训练可以产生"1+1>2"的效果。
UniAVGen 提出了一个统一的双分支联合合成架构,包含两个并行的扩散Transformer(DiT),用于构建 cohesive 的跨模态潜在空间。其核心创新在于:通过联合多任务训练,可以进一步提升联合生成的性能。实验表明,UniAVGen仅用130万训练样本(对比竞争对手的3010万),就在音视频同步、音色一致性和情感一致性方面取得了整体优势。
BindWeave 则从另一个角度切入------利用多模态大语言模型(MLLM)进行深度跨模态推理,将复杂的提示语义绑定到具体的视觉主体上。通过让MLLM解构角色、属性和交互关系,生成主体感知的隐状态,再以此条件化扩散Transformer,实现了高度的主体一致性视频生成。
3.3 推理引导:无需训练的即插即用方案
如果说架构设计和训练策略是"治本",那么推理时的引导方法则是"治标"的灵活补充------无需重新训练模型,即可在推理阶段提升时序一致性。
3.3.1 基于流的运动引导
FlowMo 提出了一种新颖的训练自由引导方法,仅利用模型自身在每一步扩散中的预测来增强运动连贯性。其核心思路是:首先从模型的预测中推导出外观去偏的流估计,然后通过测量时间维度上的逐块方差来评估运动连贯性,并在采样过程中动态引导模型降低这种方差。实验表明,FlowMo在多个文本到视频模型上显著改善了运动连贯性,同时不牺牲视觉质量或提示对齐。作为一种即插即用的解决方案,FlowMo为预训练视频扩散模型提供了增强时序保真度的有效途径。
3.3.2 原生对应关系的利用
CorrAdapter 提出了一个令人耳目一新的思路:在生成之前先"对齐" 。研究者发现,多图像扩散模型的中间噪声特征中"天生"就编码了跨图像的对应关系(diffusion-native correspondence)。CorrAdapter设计了一个即插即用的旁路分支,在图像真正生成之前,就利用这些原生对应关系将匹配区域对齐。这种方法不依赖额外的深度图、分割图、光流或显式几何先验,纯粹从扩散模型内部挖掘可用的对应关系。
CorrAdapter的核心价值在于它回答了一个基础性问题:如果推理时没有额外的几何或语义先验,模型自己内部有没有可用的对应关系? 答案是肯定的。实验表明,CorrAdapter可以稳定提升图像条件多视角生成、文本条件多视角生成以及文本到视频生成中的一致性。
3.3.3 历史引导与长序列扩展
History-Guided Video Diffusion 利用分类器自由引导(Classifier-Free Guidance, CFG) 的扩展来改善长视频生成。通过将历史帧的信息作为额外的引导信号,模型在生成每一新帧时都能"回顾"过去的内容,从而保持长程的时序连贯性。
FlowLong 则提出了另一种推理时方法:使用带有Tweedie匹配的重叠滑动窗口和随机早期采样来生成长视频。这种方法通过滑动窗口的重叠设计,确保了窗口之间的平滑过渡,同时利用Tweedie匹配提高了去噪质量。
四、评估:如何衡量"时序一致性"?
"无法衡量,就无法改进"------时序一致性的评估同样是研究的核心环节。
4.1 现有评估指标
时序一致性的评估通常从以下几个维度展开:
- 帧间相似度:如SSIM(结构相似性指标)和PSNR(峰值信噪比),衡量相邻帧之间的像素级相似度。
- 光流一致性:通过计算相邻帧之间的光流场,评估运动的平滑性和物理合理性。
- CLIP Score:衡量每一帧与文本提示的语义对齐程度,以及跨帧的语义一致性。
- FID(Fréchet Inception Distance) :评估生成视频整体分布与真实视频分布的差异。
- VBench:专门针对视频生成的综合评估基准,包含主体一致性、运动平滑度、时序一致性等多个子维度。
4.2 评估的挑战
然而,现有评估体系远非完美。正如一项综述所指出的,该领域亟需建立标准化的基准测试协议、感知指标和公平的评估实践,以实现有意义的比较和可信赖的模型部署。
主要挑战包括:
- 主观性与客观性的鸿沟:许多时序一致性问题(如"不自然感")难以用客观指标捕捉,人类感知与自动评估指标之间常存在差异。
- 任务特异性:不同跨模态任务(T2V、I2V、音频-视频联合生成等)对时序一致性的要求不同,难以用统一指标衡量。
- 长序列评估的困难:现有基准大多针对短视频(几秒),长视频的评估缺乏公认的标准。
五、未来展望:走向更"懂事"的生成模型
5.1 长时域建模的突破
尽管已有诸多进展,但长序列(数分钟甚至更长)的时序一致性仍然是最大的挑战。未来研究可能需要从更根本的层面突破------例如引入循环隐状态(recurrent latent states) 或结构化先验(如场景图) 来支持长时间跨度的生成。世界模型(World Model)的思想------让模型不仅生成像素,还理解物理规律和因果结构------可能是最终的解决路径。
5.2 更高效的架构
当前扩散模型的计算开销仍然是实际部署的主要障碍。蒸馏技术(如DCM)已经展示了在极少数采样步数下保持高质量的可能性。未来,架构创新 (如更高效的时序注意力设计)与蒸馏技术的结合,有望实现实时的高质量视频生成。
5.3 跨模态深度融合
跨模态生成的下一个前沿,可能是真正意义上的多模态深度融合------不再是简单的"文本→视频"或"图像→视频",而是多种模态在生成过程中持续交互、相互塑造。UniAVGen已经展示了联合音视频生成的潜力,未来这种思路可能扩展到更多模态(如触觉、深度、语义分割等)的联合建模。
5.4 可解释性与可控性
时序一致性不仅是技术问题,也是可控性问题。用户不仅希望视频"连贯",还希望按照自己的意图控制连贯的方式------例如指定某个主体的运动轨迹、某段的时间节奏等。如何在保证时序一致性的同时提供精细的控制能力,是值得深入探索的方向。
六、结语
扩散模型在跨模态生成任务中的时序一致性优化,是一个处于快速演进中的前沿课题。从时空注意力机制到感知条件联合建模,从双专家蒸馏到训练自由的运动引导,研究者已经发展出一套日益丰富的"工具箱"。然而,这一领域的根本挑战------如何让生成模型真正"理解"时间------远未得到彻底解决。
时序一致性问题的本质,或许不仅仅是工程层面的"如何让帧与帧之间更连贯",而是更深层的认知科学问题:什么是时间上的"合理"? 一个真正时序一致的生成模型,不仅需要像素级的平滑过渡,更需要理解物理规律、因果关系和叙事逻辑。从这个意义上说,时序一致性优化的每一次进步,都是人工智能向"理解世界"迈出的一小步。
正如一项综述所言,基于扩散的视频生成" poised to revolutionize the field of generative visual media"。但要实现这一革命,时序一致性这座大山必须被跨越。幸运的是,从学术界到产业界,从CVPR到NeurIPS,越来越多的研究者正在为此努力------而这本身,就是最令人振奋的进展。
参考文献
1 Xiang Q, Hu J, et al. Video diffusion generation: comprehensive review and open problemsJ. Artificial Intelligence Review, 2025.
2 Albaghdadi A A, Naghsh-Nilchi A R. Towards Human-Centered and Efficient Video Synthesis: A Survey of Multimodal Diffusion ModelsJ. 2025.
3 Zhang S, Shen Q, Wang X. Align Images Before You GenerateC. CVPR, 2026.
4 Liu Z, Deng X, Chen S, et al. WorldWeaver: Generating Long-Horizon Video Worlds via Rich PerceptionC. NeurIPS, 2025.
5 Chen J, Long F, An J, et al. Ouroboros-Diffusion: Exploring Consistent Content Generation in Tuning-free Long Video DiffusionC. AAAI, 2025.
6 Zhang G, Zhou Z, Hu T, et al. UniAVGen: Unified Audio and Video Generation with Asymmetric Cross-Modal InteractionsC. CVPR, 2026.
7 Li Z, Qian D, Su K, et al. BindWeave: Subject-Consistent Video Generation via Cross-Modal IntegrationJ. arXiv:2510.00438, 2026.
8 Shaulov A, Hazan I, Wolf L, et al. FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video GenerationC. NeurIPS, 2025.
9 Dual-Expert Consistency Model for Efficient and High-Quality Video GenerationC. ICCV, 2025.
10 Ye M, Liu J, Song Y. Loom: Diffusion-Transformer for Interleaved GenerationJ. arXiv:2512.18254, 2025.
11 Towards Long-Sequence Image-to-Video Generation: A Multi-Stage Diffusion Framework for Temporal and Motion ConsistencyC. 2025.
12 A Diffusion-based Framework for Realistic And Temporally Coherent Video GenerationC. 2025.
13 Bai Q. Consistent and Controllable Visual Generation in Diffusion EraR. PhD Qualifying Examination, HKUST, 2025.