视频分割Video K-Net

参考:北大CVPR 2022 Oral新作Video K-Net:视频全景分割模型 - 知乎

(一知半解)

K-Net: 使用一组可学习的卷积核统一图像分割(实例,语义)。

Video K-Net通过基于内核的外观建模和跨时间内核交互,学会了同时分割和跟踪视频中的"things"和"stuff"(语义分割和实例分割)。

三个改进,分别包括:

  1. 通过改进的对比学习损失学习内核关联嵌入

  2. 学习链接跟踪内核

  3. 学习融合内核

网络结构:

1 学习内核关联嵌入Kernel Association Embeddings

模块如图4右下角

学习内核关联嵌入的目的是对两帧之间的实例内核嵌入进行跟踪实例对比学习。

  1. 在原来的K-Net解码器之后添加了一个额外的轻量级嵌入头,以提取每个内核的嵌入特征。嵌入头通过几个完全连接层实现。

  2. 将实例内核对应的mask prediction 与GT掩码进行比较,如果对象对应的掩码的IoU高于a1,则内核嵌入被定义为对象的正嵌入;如果IoU低于a2则内核嵌入被定义为负嵌入。

  3. 只考虑与GT掩码匹配的内核进行训练,如果两个采样帧上两个区域与同一对象关联,则这两个内核匹配为positive,否则为negative。

2 学习链接跟踪内核Learning to Link Kernels

3 学习融合内核Learning to Fuse Kernels

模块如图4中间下方

前面的Link步骤可能只关注跟踪一致性 ,而忽略了分割的一致性。

为了解决这个问题,在 K-Net 的帧之间进行内核融合。具体步骤如K-Net一致。

相关推荐
renhongxia12 小时前
ORACLE-SWE:量化Oracle 信息信号对SWE代理的贡献
人工智能·深度学习·学习·语言模型·分类
AI自动化工坊2 小时前
Google LiteRT-LM生产级部署指南:如何在边缘设备实现高效LLM推理?
人工智能·ai·llama
互联网江湖2 小时前
携程当学胖东来
人工智能
陌殇殇3 小时前
001 Spring AI Alibaba框架整合百炼大模型平台 — 快速入门
人工智能·spring boot·ai
Proxy_ZZ03 小时前
用Matlab绘制BER曲线对比SPA与Min-Sum性能
人工智能·算法·机器学习
黎阳之光3 小时前
黎阳之光:以视频孪生领跑全球,赋能数字孪生水利智能监测新征程
大数据·人工智能·算法·安全·数字孪生
宇擎智脑科技3 小时前
基于 SAM3 + FastAPI 搭建智能图像标注工具实战
人工智能·计算机视觉
F_U_N_3 小时前
效率提升80%:AI全流程研发真实项目落地复盘
人工智能·ai编程
月诸清酒3 小时前
24-260409 AI 科技日报 (Gemma 4发布一周下载破千万,开源模型生态加速演进)
人工智能·开源