技术栈

wan-s2v 论文分享

白拾
1 天前
数字人·音频驱动·视频生成·arxiv 2025·wan-s2v 论文分享
【arXiv 2025】音频驱动电影级视频生成 —— Wan-S2V 论文解读|从AI数字人内容创作视角本文解读 arXiv 2025 论文《Wan-S2V: Audio-Driven Cinematic Video Generation》。该论文提出Wan-S2V 音频驱动电影级视频生成模型,通过融合文本全局运动控制(运镜、轨迹、交互)、音频局部细节驱动(表情、唇形、手势)与Wan 2.1 视频生成基座,把音频驱动人像生成从简单的 talking head 推进到影视级复杂场景。其特别之处在于全参数微调保持文本控制力,并用 FramePack 压缩运动帧 token 实现长视频一致。实验表明 EMTD 基
我是有底线的