文章目录
一、核心本质
文生视频 = 文本语义理解 + 时序图像生成 + 帧间一致性约束
文生图只输出单张静态图像;文生视频需要一次性生成连续多帧图像,并且保证帧和帧之间物体、光影、场景不崩坏。
二、三大核心模块
- 文本编码器
把自然语言提示词(运镜、场景、动作、风格)转为向量,让模型理解画面内容、运动方式。
痛点:复杂长文本、细粒度动作容易理解偏差。
- 时空生成主干(核心中的核心)
同时处理空间维度(单帧画面构图、细节) + 时间维度(帧之间运动逻辑)
主流两类架构:
- 视频扩散模型:最常用,逐步降噪生成连续帧;MiniMax、Runway、Pika 都属于这类
- 自回归视频模型:逐帧依次生成,长视频更容易出现累积误差
- 帧间一致性控制模块
专门解决视频特有问题:物体变形、人脸漂移、画面闪烁、物体突然消失/形变。
常用手段:光流约束、参考图锚定、运动强度参数。