CVPR 2024 | Retrieval-Augmented Open-Vocabulary Object Detection

CVPR 2024 - Retrieval-Augmented Open-Vocabulary Object Detection

本文提出了一种新的开放词汇目标检测方法 Retrieval-Augmented Losses and visual Features (RALF)。RALF 通过从大型词汇库中检索词汇并增强损失函数和视觉特征来提高检测器对新类别的泛化能力。

该方法由两个部分组成:检索增强损失(RAL)和检索增强视觉特征(RAF)。

RAL RAF
  • RAL 通过使用与负词汇库的语义相似性的距离来优化嵌入空间。通过从大型词汇库中,按照语义相似性检索与真实类别标签相关的难负词汇和易负词汇。然后,RAL 使用这些词汇和真实框嵌入来定义难负损失和易负损失。
  • RAF 则利用大型语言模型(LLM)生成关于大型词汇库的描述,并从中提取有关目标的详细信息,以增强视觉特征。RAF 首先在离线阶段从目标提案中生成视觉特征。然后,在推理阶段,RAF 使用概念检索器和增强器从概念存储库中检索相关概念,并使用这些概念来增强视觉特征。

通过实验,作者证明了 RALF 在 COCO 和 LVIS 基准数据集上的有效性。特别是在 COCO 数据集的新类别上,APN50 提高了 3.4%,在 LVIS 数据集的新类别上,mask APr 提高了 3.6%。 未命名

相关推荐
人工智能AI技术6 分钟前
基于定时器的手搓任务调度器:树莓派Pico实战
人工智能
程序员cxuan6 分钟前
ChatGPT 开启无限 token
人工智能·后端·程序员
机核研创社7 分钟前
HN 慧拿 HN-06 全自动上橡筋机|圆筒扩张结构与三针五线绷缝原理
人工智能·自动化
AI增长技术研究院10 分钟前
品牌官网没有被AI引用,怎样区分页面发现问题与内容适用问题?
人工智能
xcLeigh12 分钟前
AI写作的前世今生:从规则模板到大语言模型的演进之路
人工智能·ai·ai写作
前端.火鸡13 分钟前
AI取代互联网开发者:冲击、优势与行业重构的深度分析
人工智能
DogDaoDao16 分钟前
HYPERmotion 深度解析:当人形机器人学会“自己想招“——LLM 规划 + RL 技能库 + 全身优化的混合行为规划框架
人工智能·机器人·人形机器人·运动轨迹·自由度·运动估计·hypermotion
常山云栈19 分钟前
axios和restful的区别是什么?
人工智能
wshzd23 分钟前
LLM之Agent(六十九)|PI(八)发布流程与供应链安全
人工智能
罗西的思考26 分钟前
[Agent Memory / 强化学习] MemPO源码学习笔记 — (2)— 训练
人工智能·深度学习