【论文阅读】VASA-1: Lifelike Audio-Driven Talking FacesGenerated in Real Time

整体框架。不直接生成视频帧,而是在潜在空间中生成整体面部动态和头部运动,条件是音频和其他信号。给定这些运动潜在编码,通过面部解码器生成视频帧,还接受从输入图像中提取的外观和身份特征作为输入。

构建了一个面部潜在空间并训练面部编码器和解码器。

我们设计并训练了一个具有表现力和可分离特征的面部潜在学习框架,该框架基于真实面部视频。然后,训练一个扩散变换器,用于建模运动分布,并在测试时根据音频和其他条件生成运动潜在编码。

相关推荐
诸葛思颖1 天前
论文阅读笔记——Flow-of-Action
论文阅读·笔记
Chunyyyen1 天前
【第四十八周】论文阅读
论文阅读
大模型最新论文速读1 天前
06-08 · LLM 最新论文速览
论文阅读·人工智能·深度学习·机器学习·自然语言处理
长桥夜波2 天前
【第四十三周】论文阅读《Planning with the Views via Scene Self-Exploration》
论文阅读·vln
chnyi6_ya2 天前
论文阅读笔记:VChain: Chain-of-Visual-Thought for Reasoning in Video Generation
论文阅读·笔记
StfinnWu3 天前
论文阅读:Rethinking Performance Gains in Image Dehazing Networks
论文阅读
CV-杨帆3 天前
论文阅读 ICML 2026 Active Attacks: Red-teaming LLMs via Adaptive Environments
论文阅读
大模型最新论文速读3 天前
StreamMA:把流式输出应用到多智能体系统
论文阅读·人工智能·深度学习·机器学习·自然语言处理
大模型最新论文速读4 天前
06-05 · LLM 最新论文速览
论文阅读·人工智能·深度学习·机器学习·自然语言处理
verphan4 天前
AI论文阅读(一)《Long Context Pre-Training with Lighthouse Attention》
论文阅读·人工智能