NUS:冻结语义表征构建视频生成潜空间

📖标题:V-RAE: Rethinking Video Latent Spaces for Generation

🌐来源:arXiv, 2608.13556v1

🛎️文章简介

🔸研究问题:当前视频自编码器的潜空间主要优化像素级重建,但重建最优的潜空间是否适合生成建模?

🔸主要贡献:论文提出V-RAE,在冻结的视觉基础模型表征之上构建紧凑的生成潜空间,实现更高质量、更快收敛的视频生成。

📝重点思路

🔸采用冻结的视觉基础模型(如DINOv3、V-JEPA 2.1等)作为编码器,提取具有丰富语义信息的帧级或时空特征,避免重新优化编码器破坏语义结构。

🔸设计轻量级时序池化模块,通过内容自适应聚合去除时序冗余,同时保留预训练编码器继承的语义结构,支持多种池化方式(均值池化、3D卷积、时序注意力、Q-Former)。

🔸构建基于Transformer的解码器,使用3D RoPE提供时空位置信息,从压缩的语义潜变量中重建连续运动视频。

🔸引入tFVD(时序连贯性诊断指标),通过对潜变量进行插值后重建来评估潜空间的时序建模能力,比rFVD更能反映下游生成质量。

🔎分析总结

🔸V-RAE在K600上实现2.13的rFVD,比最强视频VAE基线(Wan2.2 VAE的3.58)提升40.5%,证明冻结语义表征可有效支持视频重建。

🔸在相同生成设置下,V-RAE最优变体在UCF101和K600上分别达到117.86和19.16的gFVD,收敛速度比传统VAE潜空间快6倍,表明语义组织使生成更易学习。

🔸实验发现重建质量(rFVD)与生成质量(gFVD)相关性较弱(Pearson r=0.20.47),而tFVD与gFVD相关性更强(r=0.620.92),说明仅优化重建不足以保证生成效果。

🔸语义探测实验表明V-RAE潜空间保留更多语义信息,在K400、SSv2、UCF101分类任务上显著优于传统视频tokenizer。

🔸在Cityscapes未来视频预测任务中,V-RAE(EUPE)相比Wan2.2 VAE在gFVD上从144.47降至111.36,证明语义潜空间可作为可解码的预测状态空间。

💡个人观点

论文不再从头训练视频VAE去追求像素级重建,而是直接利用预训练视觉模型已有的强大语义表征,只需学习轻量的时序压缩和解码模块。

相关推荐
老金带你玩AI5 小时前
这几天,我都是拿手机让dot帮我干活
人工智能
7yewh8 小时前
SLAM 三维空间刚体运动(2)
数据结构·人工智能·机器人·嵌入式·slam
小虎AI生活8 小时前
WorkBuddy 模型选型实操:0.03 倍的 Space-Bunny 怎么用、派什么活、避什么坑
人工智能·超级个体·一人公司·青玥ai
ai小陈8 小时前
GPU服务器租用存储验收:检查点写入与磁盘吞吐实战
运维·服务器·人工智能·ai·ssh·gpu算力
微三云马玮均—GEO源码系统 私有化部署8 小时前
消费返物业费:消费+服务趋势的必然产物!
大数据·人工智能·物联网·区块链·生活
明月_清风8 小时前
Muse 登顶 App Store 第一,SDK 直接开源:AI Agent 开始进入下一个阶段
人工智能·后端
JackSparrow4149 小时前
和AI一起将全部CSDN博文迁移到个人博客站
人工智能·程序人生·ai·github·cloudflare·astro·静态博客
55873 生态系统9 小时前
第 22 篇|社区聊天|55873 文明共建者的日常交流与协作界面
人工智能·区块链·55873全域文明生态体系·55873操作系统·55873社区聊天
搬砖的小码农_Sky9 小时前
AI Agent:如何处理Claude Code 最近版本(2026年更新)引入的模型上下文限制
人工智能·windows·ai·ai编程