论文阅读——What Can Human Sketches Do for Object Detection?(cvpr2023)

论文:https://openaccess.thecvf.com/content/CVPR2023/papers/Chowdhury_What_Can_Human_Sketches_Do_for_Object_Detection_CVPR_2023_paper.pdf

代码:What Can Human Sketches Do for Object Detection? (pinakinathc.me)

一、

Baseline SBIR Framework:给一组图片:轮廓和图片,学习到对应的两个特征,然后使用余弦距离计算triplet loss。

本文使用hard-triplet loss,再加上一个分类损失

二、

使用RPN或者selective search生成框和对应的特征,输入到分类头检测头得到两个分数。通过这两个来判断图片中是否出现某个类别。分类头分数分别判断每个区域属于某个类别的概率,检测头分数判断这个patch对属于被分到的这个类别的贡献度。

labels:

,

三、

下面是微调框:

因为没有坐标标注,所以使用了一个迭代微调分类器对每个ROI预测一个精细的类别分数,标签从第k-1步迭代获得:

1、计算每个类别分数最高的patch

2、和这个patch重叠度高的(iou>0.5)patch都是一个类别

3、如果某个区域和任何一个分数高的patch重合度都不高,就是背景。

4、如果某个类别没出现在图片中,也是0

损失函数:

四、

然后检测一般是预先固定多少类别,作者克服了这个限制

每个头原本预测分数,改为计算嵌入向量

用预训练的Fs编码patch得到

计算分数:

多加了一个来自原始图片的监督Fp,

最终损失为:

五、

泛化到开放词汇检测:

轮廓向量集合:

图片向量集合:

映射到ViT第一层,以诱导CLIP学习下游轮廓/照片分布

ViT权重冻结,CLIP学习到知识被蒸馏为prompts的权重。

最后新的轮廓和图片encoder为使用sketch prompt和图片prompt的CLIP's image encoder,

只训练Vs和Vp

学习跨类别的FGSBIR:

相关推荐
Csvn几秒前
第 21 章 排错与调试实战
人工智能·aigc·agent
科技林总5 分钟前
氛围编程场景下AI提示词使用核心原则
人工智能
面朝大海,春不暖,花不开5 分钟前
翻译自 英语
人工智能·机器学习
xwz小王子8 分钟前
GPT‑6 Astra 机器人实测:简单任务碾压,精细任务撞墙——大模型离“会摸”还有多远?
人工智能
深圳海导科技14 分钟前
单北斗车载定位:国产车辆高精度导航技术|深圳海导科技navynav
人工智能·物联网
来自于狂人18 分钟前
我在教室 75 寸大屏上跑了一个超低成本 AI 数字人:系统设计 + 口型同步、拒答根治、实时化三线攻坚实录
人工智能
tianxuanjg19 分钟前
工业/协作机器人不锈钢精密零件批量加工难点与量产解决方案
人工智能·经验分享·机器人·无人机·制造
LeapMay21 分钟前
中国科学院深圳先进技术研究院-深圳职业技术大学联合培养博士后招聘(具身智能/多模态感知/视觉检测方向)
人工智能·计算机视觉·3d·机器人
飞奔的猫22 分钟前
锈了儿—素材工作流简化游戏场景元素的生成(三)
人工智能·游戏·个人开发
开源量化GO36 分钟前
看到“2026年 Python 与 API”时,用示例和拆解看清关系
人工智能·python