视频分割Video K-Net

参考:北大CVPR 2022 Oral新作Video K-Net:视频全景分割模型 - 知乎

(一知半解)

K-Net: 使用一组可学习的卷积核统一图像分割(实例,语义)。

Video K-Net通过基于内核的外观建模和跨时间内核交互,学会了同时分割和跟踪视频中的"things"和"stuff"(语义分割和实例分割)。

三个改进,分别包括:

  1. 通过改进的对比学习损失学习内核关联嵌入

  2. 学习链接跟踪内核

  3. 学习融合内核

网络结构:

1 学习内核关联嵌入Kernel Association Embeddings

模块如图4右下角

学习内核关联嵌入的目的是对两帧之间的实例内核嵌入进行跟踪实例对比学习。

  1. 在原来的K-Net解码器之后添加了一个额外的轻量级嵌入头,以提取每个内核的嵌入特征。嵌入头通过几个完全连接层实现。

  2. 将实例内核对应的mask prediction 与GT掩码进行比较,如果对象对应的掩码的IoU高于a1,则内核嵌入被定义为对象的正嵌入;如果IoU低于a2则内核嵌入被定义为负嵌入。

  3. 只考虑与GT掩码匹配的内核进行训练,如果两个采样帧上两个区域与同一对象关联,则这两个内核匹配为positive,否则为negative。

2 学习链接跟踪内核Learning to Link Kernels

3 学习融合内核Learning to Fuse Kernels

模块如图4中间下方

前面的Link步骤可能只关注跟踪一致性 ,而忽略了分割的一致性。

为了解决这个问题,在 K-Net 的帧之间进行内核融合。具体步骤如K-Net一致。

相关推荐
sugarzhangnotes31 分钟前
【无标题】
开发语言·人工智能·python
盼小辉丶31 分钟前
PyTorch强化学习实战(27)——进化策略在强化学习中的应用
人工智能·pytorch·深度学习·强化学习
东离与糖宝33 分钟前
Agent长期记忆六大方案对比,彻底解决AI失忆问题
人工智能
小小测试开发38 分钟前
Prompt评估:加一句「请一步步思考」,结构化输出的解析失败率从 2% 涨到 17%
人工智能·prompt
xiaohaiAIgeo1 小时前
【2026年】实验室应急预案中通风系统的关键作用
大数据·人工智能·科普知识
想用offer打牌1 小时前
Personal Agent爆火 - 它到底是个什么
人工智能·后端·ai编程
IT_陈寒1 小时前
Vue的v-if和v-for混用居然是个天坑
前端·人工智能·后端
xailorliu1 小时前
SLIC_超像素算法
c++·opencv·目标检测·机器学习·计算机视觉
会议咨询1 小时前
2026年智能计算、机械工程与人工智能国际会议(IMAI 2026)
人工智能·机械工程·智能计算
可视化运维管理爱好者1 小时前
nVisual-FiberMap光缆网设计、竣工文档交付工具
人工智能