开放词汇目标检测

开放词汇目标检测(Open Vocabulary Object Detection, OVOD)是一种计算机视觉技术,它扩展了传统目标检测的概念,能够识别和定位图像中的对象,即使这些对象的类别没有在训练数据集中明确列出。这种技术通过结合大规模预训练的图像-文本对模型,使得目标检测能够覆盖更广泛的词汇和对象类别,实现对新颖或罕见对象的有效识别。

  1. 预训练的图像-文本对模型:使用大规模的图像和配对文本数据进行预训练,如使用视觉-语言预训练(VLP)模型。这些模型通过学习图像内容与自然语言描述之间的关系,能够理解和表示广泛的对象和属性。

  2. 细粒度属性突出显示:传统的目标检测模型通常关注于识别对象的大类别(如狗、车等)。开放词汇目标检测模型通过显式突出显示细粒度属性(如颜色、形状、动作等),增强了模型对具有特定属性对象的识别能力。这通常通过修改模型的文本编码器部分,使其能够识别和强调输入文本中的细粒度属性词汇。

  3. 特征重组和调整:将全局文本特征与属性特定特征结合,通过设计或学习得到的算法对这些特征进行调整和优化,以提高对细粒度属性的检测精度。

开放词汇目标检测不仅提升了目标检测技术的覆盖范围和精确度,也为未来的智能系统提供了更强的视觉理解能力。

  • 泛化能力:开放词汇目标检测能够扩展模型的泛化能力,使其能在没有直接训练数据的情况下识别新的对象类别。
  • 细粒度识别:通过关注对象的细粒度属性,可以更精确地理解和描述场景中的各种元素,这对于自动驾驶、增强现实、内容创建等领域具有重要意义。
  • 适应新环境:这种技术可以帮助模型适应动态变化的环境和持续扩展的对象类别,对于持续学习和适应性系统尤为重要。

论文作者:Yuqi Ma,Mengyin Liu,Chao Zhu,Xu-Cheng Yin

作者单位:University of Science and Technology Beijing

论文链接:http://arxiv.org/abs/2409.16136v1

内容简介:

1)方向:开放词汇目标检测

2)应用:目标检测

3)背景:传统的OVD模型注重对象的粗粒度类别而非细粒度属性,导致无法识别具有特定属性的对象。然而,这些OVD模型是在大规模图像-文本对上进行预训练的,具有丰富的属性词汇,其潜在特征空间可以表示全局文本特征,但未突出显示细粒度属性。

4)方法:本文提出一种通用和显式的方法,通过在显式线性空间中突出显示细粒度属性,增强了冻结主流OVD模型的属性级别检测能力。利用LLM突出显示输入文本中的属性词汇,通过调整令牌掩码,提取OVD模型的文本编码器中的全局文本和属性特定特征,将它们显式组合为新的属性突出显示特征,其中相应的标量被手工设计或学习以重新调整这两个向量。

5)结果:在FG-OVD数据集上的实证评估表明,所提出的方法统一提高了各种主流模型的细粒度属性级别OVD,并取得了新的最先进性能。

相关推荐
墨染天姬3 小时前
【AI】端侧AIBOX可以部署哪些智能体
人工智能
AI成长日志3 小时前
【Agentic RL】1.1 什么是Agentic RL:从传统RL到智能体学习
人工智能·学习·算法
2501_948114243 小时前
2026年大模型API聚合平台技术评测:企业级接入层的治理演进与星链4SAPI架构观察
大数据·人工智能·gpt·架构·claude
小小工匠3 小时前
LLM - awesome-design-md 从 DESIGN.md 到“可对话的设计系统”:用纯文本驱动 AI 生成一致 UI 的新范式
人工智能·ui
黎阳之光3 小时前
黎阳之光:视频孪生领跑者,铸就中国数字科技全球竞争力
大数据·人工智能·算法·安全·数字孪生
小超同学你好4 小时前
面向 LLM 的程序设计 6:Tool Calling 的完整生命周期——从定义、决策、执行到观测回注
人工智能·语言模型
智星云算力4 小时前
本地GPU与租用GPU混合部署:混合算力架构搭建指南
人工智能·架构·gpu算力·智星云·gpu租用
jinanwuhuaguo4 小时前
截止到4月8日,OpenClaw 2026年4月更新深度解读剖析:从“能力回归”到“信任内建”的范式跃迁
android·开发语言·人工智能·深度学习·kotlin
xiaozhazha_4 小时前
效率提升80%:2026年AI CRM与ERP深度集成的架构设计与实现
人工智能
枫叶林FYL4 小时前
【自然语言处理 NLP】7.2.2 安全性评估与Constitutional AI
人工智能·自然语言处理