transformer目标检测 DETR

(在某些位置上查询有无物体以及类别)

四部分组成:

  • 骨干是CNN,输出的特征拉成一维;
  • transformer的encoder;
  • ransformer的decoder,Object Query,向量形式的anchor;
  • FFN,就是由两个全连接层+ReLu激活函数组成。

亮点:位置编码,encoder中加了,decoder中也加了;没用NMS,用的匈牙利匹配;两个注意力自注意力+交叉注意,交叉注意在decoder,object queries做的是qurey;object queries是固定100个;

论文:https://arxiv.org/abs/2005.12872

代码:GitHub - facebookresearch/detr: End-to-End Object Detection with Transformers

翻译论文博客:https://zhuanlan.zhihu.com/p/701507885
https://zhuanlan.zhihu.com/p/366938351

相关推荐
三声三视几秒前
周日晚九点半,两份 JD 喂进 tri-jobhunt:全中的那份和缺一项的,都拿了 70 分
人工智能·ai·skillhub·tri-skill·tri-jobhunt
硅谷秋水1 分钟前
从语言模型到作用于世界的系统:智能体AI在数字、社交、虚拟及物理环境中的进展与局限
人工智能·机器学习·语言模型·自然语言处理
乃嘿仔5 分钟前
AI 热点日报 · 2026-09-27
人工智能
weixin_1772972206911 分钟前
成立三年估值80亿美元:法律AI公司Harvey给中国企业的四个启发
大数据·人工智能
镭封11 分钟前
从人工到AI:短视频配音方式正在发生哪些变化
人工智能·音视频·语音识别·媒体
初学大模型14 分钟前
先剔后识:OpenCV三维预处理与YOLO语义检测协同的机器人视觉系统可行性分析
人工智能·opencv·yolo·计算机视觉·机器人
IT·陈寒20 分钟前
Vite热更新失效?你可能漏了这个配置项
人工智能·大模型·api·创业·变现·简历优化
我想问问天21 分钟前
Jev 是做什么的?聊聊它能帮 LLM 分担哪些工作
人工智能·llm·aigc
-cywen-29 分钟前
OpenSeg
人工智能
大熊背35 分钟前
Bayer‑Raw 域 AF vs YUV 域 AF 完整对比
人工智能·自动对焦·af