视频分割Video K-Net

参考:北大CVPR 2022 Oral新作Video K-Net:视频全景分割模型 - 知乎

(一知半解)

K-Net: 使用一组可学习的卷积核统一图像分割(实例,语义)。

Video K-Net通过基于内核的外观建模和跨时间内核交互,学会了同时分割和跟踪视频中的"things"和"stuff"(语义分割和实例分割)。

三个改进,分别包括:

  1. 通过改进的对比学习损失学习内核关联嵌入

  2. 学习链接跟踪内核

  3. 学习融合内核

网络结构:

1 学习内核关联嵌入Kernel Association Embeddings

模块如图4右下角

学习内核关联嵌入的目的是对两帧之间的实例内核嵌入进行跟踪实例对比学习。

  1. 在原来的K-Net解码器之后添加了一个额外的轻量级嵌入头,以提取每个内核的嵌入特征。嵌入头通过几个完全连接层实现。

  2. 将实例内核对应的mask prediction 与GT掩码进行比较,如果对象对应的掩码的IoU高于a1,则内核嵌入被定义为对象的正嵌入;如果IoU低于a2则内核嵌入被定义为负嵌入。

  3. 只考虑与GT掩码匹配的内核进行训练,如果两个采样帧上两个区域与同一对象关联,则这两个内核匹配为positive,否则为negative。

2 学习链接跟踪内核Learning to Link Kernels

3 学习融合内核Learning to Fuse Kernels

模块如图4中间下方

前面的Link步骤可能只关注跟踪一致性 ,而忽略了分割的一致性。

为了解决这个问题,在 K-Net 的帧之间进行内核融合。具体步骤如K-Net一致。

相关推荐
fthux1 小时前
招聘季实测:我用 TraeWork 搭了一套 AI 简历初筛系统
人工智能·ai编程·trae
SLD_Allen1 小时前
NVIDIA KAI Scheduler深度解析——Kubernetes原生AI调度器的架构、原理与实践
人工智能·架构·kubernetes
小玮看世界1 小时前
从“画图”到“Mermaid”:AI语义理解与架构绘制的演进之路
人工智能·深度学习·计算机视觉
小岐AI观2 小时前
智赋岐黄适合养生馆吗?
大数据·人工智能·物联网
YOLO数据集集合2 小时前
煤炭物料检测数据集:基于YOLO26的矿山传送带智能“哨兵”
人工智能·yolo·数据挖掘·煤炭·煤炭检测·矿山传送带·传送带异物
深小乐2 小时前
DeepSeek Harness 强是真的强,普通用户可以再等等
人工智能
蜡台3 小时前
大模型算力下放客户端:浏览器/本地设备全落地方案解析
人工智能·ai