⭐CVPR2025 MatAnyone:稳定且精细的视频抠图新框架

📄论文题目:MatAnyone: Stable Video Matting with Consistent Memory Propagation

✍️作者及机构:Peiqing Yang、Shangchen Zhou、Jixin Zhao、Qingyi Tao、Chen Change Loy(1S-Lab, Nanyang Technological University;2SenseTime Research, Singapore)

🧩面临问题:当前辅助 - free 视频抠图方法存在诸多局限。一方面,在复杂或模糊背景下易混淆目标,尤其当背景中出现相似物体(如其他人物)时性能下降;另一方面,现有视频抠图数据集(如 VideoMatte240K)质量差(核心区有漏洞、边界细节模糊)、规模小且偏合成,导致模型泛化能力弱;此外,难以同时兼顾核心区域语义稳定性与边界细节精细度,现有方法常出现核心语义崩坏或边界粗糙问题。

🎯创新点及其具体研究方法:

1️⃣ 提出 MatAnyone 目标指定视频抠图框架:基于记忆范式,仅需第一帧的目标分割掩码即可实现全程稳定抠图。借鉴视频目标分割的记忆机制,将过去帧及对应结果编码为记忆,新帧通过检索记忆实现目标稳定跟踪,兼顾交互性与长视频鲁棒性。

2️⃣ 一致记忆传播机制:通过区域自适应记忆融合实现稳定传播。先估算当前帧与前一帧的 alpha 值变化,标记 "大变化"(边界区)和 "小变化"(核心区)区域;"小变化" 核心区优先保留前帧记忆以保证语义稳定,"大变化" 边界区侧重当前帧信息以捕捉精细细节,提升 temporal consistency 与细节质量。

3️⃣ 构建高质量数据集:推出 VM800 训练集和 YoutubeMatte 测试集。VM800 规模为 VideoMatte240K 的 2 倍,质量更高(核心区无漏洞、边界细节清晰)且多样性更强;YoutubeMatte 包含更多样的真实前景视频,提升测试基准的挑战性与可靠性。

4️⃣ 基于分割数据的核心区监督策略:针对真实视频抠图数据稀缺问题,利用大规模分割数据增强训练。核心区采用像素级损失确保语义稳定性;边界区改进 DDC 损失为缩放版本,无需真实 alpha 标签即可优化边界细节,避免原版 DDC 导致的锯齿边缘问题。

#论文精读 #视频抠图 #计算机视觉 #CVPR #深度学习 #图像分割 #视频处理、


相关推荐
zhangzhangkeji2 分钟前
FFMPEG - 6:合并、提取音视频;截取、连接音视频,
ffmpeg·音视频
水中加点糖3 分钟前
使用LangChain+LangGraph自定义AI工作流,实现音视频字幕生成工具
人工智能·ai·langchain·工作流·langgraph
威视锐科技6 分钟前
5G科研平台客户案例分享:-基于可编程5G网络的空天地海(水)跨域协同平台
人工智能·5g·软件无线电·威视锐
reept8 分钟前
Pytorch常用函数学习摘录
人工智能·pytorch·学习
进击monkey27 分钟前
2025年企业级知识库系统技术解析:如何用AI重构文档管理效率
人工智能·重构
金融小师妹30 分钟前
OpenAI拟借AI估值重构浪潮冲击1.1万亿美元IPO——基于市场情绪因子与估值量化模型的深度分析
大数据·人工智能·深度学习·1024程序员节
DisonTangor42 分钟前
OpenAI开源gpt-oss-safeguard-120b和gpt-oss-safeguard-20b
人工智能·gpt·语言模型·开源·aigc
mit6.8241 小时前
[nanoGPT] 文本生成 | 自回归采样 | `generate`方法
人工智能
Baihai IDP1 小时前
对 GPT 5 模型路由机制的深度解析
人工智能·gpt·ai·大模型·llms
七宝大爷1 小时前
从 “你好 Siri” 到 “你好 GPT”:语言模型如何改变对话?
人工智能·gpt·语言模型