ICML 2026 目标检测(object detection)方向上接收论文总结

ICML 2026 目标检测(object detection)方向上接收论文总结

目录

  • [ICML 2026 目标检测(object detection)方向上接收论文总结](#ICML 2026 目标检测(object detection)方向上接收论文总结)
    • [一、遥感 / 航拍 / 无人机检测](#一、遥感 / 航拍 / 无人机检测)
      • [1. DroneDINO: Towards Heterogeneous Routed Mixture of Experts for Drone-based Unified Object Detection(Oral)](#1. DroneDINO: Towards Heterogeneous Routed Mixture of Experts for Drone-based Unified Object Detection(Oral))
      • [2. Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection(OTA-Det)](#2. Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection(OTA-Det))
      • [3. SLIP-RS: Structured-Attribute Language-Image Pre-Training for Remote Sensing Object Detection](#3. SLIP-RS: Structured-Attribute Language-Image Pre-Training for Remote Sensing Object Detection)
      • [4. Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining(BabelRS)](#4. Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining(BabelRS))
    • [二、开放词汇 / 开放世界 / 零样本检测](#二、开放词汇 / 开放世界 / 零样本检测)
      • [5. OOVDet: Low-Density Prior Learning for Zero-Shot Out-of-Vocabulary Object Detection](#5. OOVDet: Low-Density Prior Learning for Zero-Shot Out-of-Vocabulary Object Detection)
      • [6. Knowing the Unknown: Interpretable Open-World Object Detection via Concept Decomposition Model(IPOW)](#6. Knowing the Unknown: Interpretable Open-World Object Detection via Concept Decomposition Model(IPOW))
      • [7. Object-level Semantic and Spatial Distillation for Open Vocabulary Detection(OSSD)](#7. Object-level Semantic and Spatial Distillation for Open Vocabulary Detection(OSSD))
    • [三、域自适应 / 域泛化检测](#三、域自适应 / 域泛化检测)
      • [8. Domain Adaptive Object Detection via Dynamic Causal Refinement(DCR)](#8. Domain Adaptive Object Detection via Dynamic Causal Refinement(DCR))
      • [9. SCoA: Revisiting Domain Generalized Object Detection with Style-Conditioned Adaptation](#9. SCoA: Revisiting Domain Generalized Object Detection with Style-Conditioned Adaptation)
    • [四、增量 / 持续学习检测](#四、增量 / 持续学习检测)
      • [10. Focus, Align, and Sustain: Counteracting Gradient Dilution in Incremental Object Detection(FAS)](#10. Focus, Align, and Sustain: Counteracting Gradient Dilution in Incremental Object Detection(FAS))
      • [11. Symbiosis-Inspired Knowledge Distillation for Incremental Object Detection](#11. Symbiosis-Inspired Knowledge Distillation for Incremental Object Detection)
    • 五、伪装目标检测
      • [12. CODiff: One-Step Diffusion Model for Camouflaged Object Detection](#12. CODiff: One-Step Diffusion Model for Camouflaged Object Detection)
      • [13. Unsupervised Camouflaged Object Detection with Dual-Eigenvector Spectral Pseudo-Labeling and Contrastive Refinement(DualUCOD)](#13. Unsupervised Camouflaged Object Detection with Dual-Eigenvector Spectral Pseudo-Labeling and Contrastive Refinement(DualUCOD))
      • [14. PMSPO: Progressive Matching and Semantic-Aware Policy Optimization for Camouflaged Object Detection](#14. PMSPO: Progressive Matching and Semantic-Aware Policy Optimization for Camouflaged Object Detection)
    • [六、红外小目标 / 低信噪比检测](#六、红外小目标 / 低信噪比检测)
      • [15. Diffuse to Detect: Bi-Level Sample Rebalancing with Pseudo-Label Diffusion for Point-Supervised Infrared Small-Target Detection(Spotlight)](#15. Diffuse to Detect: Bi-Level Sample Rebalancing with Pseudo-Label Diffusion for Point-Supervised Infrared Small-Target Detection(Spotlight))
      • [16. Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection(TEP-SAM)](#16. Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection(TEP-SAM))
      • [17. CodeMamba: Shifting from Target Semantics to Self-Supervised Background Manifold Learning for Singularity Detection in Infrared Sequences](#17. CodeMamba: Shifting from Target Semantics to Self-Supervised Background Manifold Learning for Singularity Detection in Infrared Sequences)
    • [七、3D / 点云 / 具身目标检测](#七、3D / 点云 / 具身目标检测)
      • [18. Embodied-DETR: End-to-End Temporal 3D Object Detection in Egocentric Views](#18. Embodied-DETR: End-to-End Temporal 3D Object Detection in Egocentric Views)
      • [19. Radial Scaling Voxelization for Accurate Small Object 3D Detection(RSV)](#19. Radial Scaling Voxelization for Accurate Small Object 3D Detection(RSV))
    • [八、新架构 / 多模态融合 / 鲁棒性](#八、新架构 / 多模态融合 / 鲁棒性)
      • [20. Bio-Vision-Inspired Spiking Neural Networks for Object Detection with Event Cameras](#20. Bio-Vision-Inspired Spiking Neural Networks for Object Detection with Event Cameras)
      • [21. MFH-NAS: A Hybrid Neural Architecture Search Framework for Multimodal Fusion Object Detection](#21. MFH-NAS: A Hybrid Neural Architecture Search Framework for Multimodal Fusion Object Detection)
      • [22. Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection](#22. Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection)
    • 九、其他:题名未直接含"目标检测"的检测相关方向
      • [9.1 开放词汇 / 视觉定位(Grounding)](#9.1 开放词汇 / 视觉定位(Grounding))
      • [9.2 视觉目标跟踪与重定位](#9.2 视觉目标跟踪与重定位)
      • [9.3 目标计数](#9.3 目标计数)
      • [9.4 其他检测相关](#9.4 其他检测相关)
    • 总结
    • 参考入口

ICML 2026(The Forty-Third International Conference on Machine Learning)于 2026 年 7 月 6 日至 11 日在韩国首尔 COEX Convention & Exhibition Center 举行,主会期为 7 月 7 日至 9 日。

目标检测(Object Detection)旨在定位并识别图像、视频或点云中的感兴趣目标,是自动驾驶、遥感解译、安防监控、机器人感知与具身智能等应用的基础能力。ICML 作为机器学习主会,目标检测并非主流方向:据公开统计,本届主会共接收论文约 6352 篇(投稿约 23918 篇,录用率约 26.6%),其中以目标检测为核心任务的论文约 22 篇。

本文以 ICML 2026 官方论文列表 及其虚拟会议数据接口(https://icml.cc/static/virtual/data/icml-2026-orals-posters.json,共 6797 条记录)为基础,通过标题关键词匹配(object detection、detector、DETR、camouflaged、infrared small target、open-world / open-vocabulary、incremental、domain adaptive / generalized、aerial、remote sensing、3D detection 等)并结合官方摘要逐篇复核,共收录 22 篇 题名直接指向目标检测的论文;另将 13 篇题名未直接写"目标检测"、但属于检测强相关任务(视觉定位/指代、视觉跟踪与重定位、目标计数等)的工作归入"其他"。

链接说明:Paper 优先给出已核对题名的 arXiv 链接,无 arXiv 时回退到 OpenReview;同时给出 ICML 官方虚拟会议页面便于核验。Code 仅列出论文海报页/摘要中作者明确给出的官方仓库。Blog 仅列单篇精讲(中英文均可),未找到可靠精讲时不显示该字段。Team 以作者单位或论文署名机构为主。


一、遥感 / 航拍 / 无人机检测

1. DroneDINO: Towards Heterogeneous Routed Mixture of Experts for Drone-based Unified Object Detection(Oral)

  • Paper: OpenReviewICML 2026 Oral 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Blog: ChatPaper 中文解读
  • Keywords: 无人机统一检测、异构路由混合专家(HR-MoE)、任务识别辅助训练、多模态(RGB / IR / RGB-IR)、共享 / 任务特定 / 动态专家
  • Features: 把 RGB、红外、RGB-IR 三种检测范式统一到一个基于 DINO 的框架中。针对多任务数据分布不均衡导致主导任务的专家被过度激活,DroneDINO 将专家划分为共享、任务特定、动态三组并采用异构路由;共享专家对所有输入激活,任务特定专家仅对匹配任务激活,再以任务识别辅助训练惩罚低任务判别性特征。在 VisDrone、DroneVehicle、RGBTDronePerson 构成的五个 Drone-UOD 子任务上一致超过统一检测器与任务专用检测器。ICML 2026 Oral(同时保留 Poster 场次)。
  • Team: 国防科技大学、天津大学(Dongdong Li, Rui Chen, Yan Fan, Yan Liu, Yangliu Kuai, Pengfei Zhu)

2. Open-Text Aerial Detection: A Unified Framework For Aerial Visual Grounding And Detection(OTA-Det)

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/GT-Wei/OTA-Det
  • Blog: Lacuna 深度解读
  • Keywords: 开放文本航拍检测、开放词汇航拍检测(OVAD)、遥感视觉定位(RSVG)、任务重构、密集语义对齐、RT-DETR、实时推理
  • Features: 首个把开放词汇航拍检测(限粗粒度类别语义)与遥感视觉定位(限单目标定位)统一到同一架构的框架。用任务重构把 RSVG 由纯定位扩展为联合分类-定位,并以图像级标注聚合提供稠密分类监督;再以属性级数据分解、统一对应矩阵、解耦多粒度头实现密集语义对齐。基于 RT-DETR 扩展为开放文本检测,在覆盖 OVAD 与 RSVG 的 6 个基准上达到 SOTA,同时保持 34 FPS。
  • Team: 南京理工大学、西北工业大学、之江实验室、云天励飞(Intellifusion)等

3. SLIP-RS: Structured-Attribute Language-Image Pre-Training for Remote Sensing Object Detection

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/facias914/SLIP-RS
  • Keywords: 遥感目标检测、结构化属性解耦、语言-图像预训练、共形预测、细粒度表征、RS-Attribute-15M
  • Features: 指出遥感语言-图像预训练受"单体标签学习(Monolithic Label Learning)"制约------依赖黑盒数据穷举开放类别空间,与遥感领域固有的数据稀缺不相容。SLIP-RS 建立结构化属性解耦范式,把开放类别空间映射为有限、物理有意义的属性空间:结构化属性对比学习(SACL)通过组合式属性增广学习解耦的内在视觉逻辑;共形属性可靠性引擎(CARE)借助共形预测从噪声源蒸馏高保真监督,产出 1500 万+ 属性标注的 RS-Attribute-15M。在细粒度检测与跨域泛化上表现领先。
  • Team: 南开大学(VCIP)、国防科技大学、NKIARI 深圳福田

4. Unifying Heterogeneous Multi-Modal Remote Sensing Detection Via Language-Pivoted Pretraining(BabelRS)

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/zcablii/SM3Det(与 AAAI 2026 Oral 的 SM3Det 共享官方仓库)
  • Keywords: 异构多模态遥感检测、语言枢纽预训练、模态对齐与任务解耦、概念共享指令对齐(CSIA)、逐层视觉-语义退火(LVSA)
  • Features: 针对 RGB / SAR / 红外等异构传感器检测中"后期对齐"范式把模态对齐与任务优化纠缠在一起、训练不稳的问题,提出 BabelRS 语言枢纽预训练框架:CSIA 将每种模态对齐到共享语言概念,以语言为语义枢纽桥接异构视觉表示;LVSA 逐层聚合多尺度视觉特征,缓解高层语言表示与稠密检测目标之间的粒度失配。实验显示训练更稳定,并一致优于现有 SOTA。
  • Team: 南开大学、清华大学(Yuxuan Li, Yuming Chen, Yunheng Li, Ming-Ming Cheng, Xiang Li, Jian Yang)

二、开放词汇 / 开放世界 / 零样本检测

5. OOVDet: Low-Density Prior Learning for Zero-Shot Out-of-Vocabulary Object Detection

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/binyisu/OOVDet
  • Blog: Lacuna 深度解读ArxivLens 摘要与要点
  • Keywords: 零样本词汇外检测(ZS-OOVD)、低密度先验、Dirichlet 梯度归因、伪 OOV 提示合成、高斯核密度估计、开放集
  • Features: 针对零样本检测器过度拟合已知(IV)类、把未定义(OOV)目标高置信度误判为已知类的问题,从隐藏空间类条件高斯分布的低似然区域采样合成区域级 OOV 提示;用基于 Dirichlet 的梯度归因机制,把归因梯度解释为 Dirichlet 证据以估计不确定性并挖掘伪 OOV 图像;再以低密度先验约束用高斯核密度估计构造 IV-OOV 决策边界。OOV-VOC 上 OOV mAP 提升 2.70、OOV 召回提升 8.71,同时已知类 mAP 维持 79.30。
  • Team: 河北工业大学(Binyi Su, Chenghao Huang, Haiyong Chen)

6. Knowing the Unknown: Interpretable Open-World Object Detection via Concept Decomposition Model(IPOW)

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/qiangzai-lv/IPOW
  • Blog: Lacuna 深度解读ArxivLens 要点
  • Keywords: 开放世界目标检测(OWOD)、可解释性、概念分解模型、概念瓶颈、已知-未知混淆、概念引导校正
  • Features: 目标是让整个 OWOD 流程可解释。引入概念分解模型(CDM),把 Faster R-CNN 中耦合的 RoI 特征显式分解为判别性概念(拉大已知类间距)、共享概念与背景概念(两者泛化性强、可迁移用于发现未知类)。论文据此指出"已知-未知混淆"源于未知目标落入已知类判别空间,并提出概念引导校正(CGR)。M-OWODB Task1 上 U-Recall 达 50.1%,S-OWODB 34.7%,已知-未知混淆相关指标大幅下降。
  • Team: 西北工业大学、华为技术有限公司(Xueqiang Lv, Shizhou Zhang, Yinghui Xing, Di Xu, Peng Wang, Yanning Zhang)

7. Object-level Semantic and Spatial Distillation for Open Vocabulary Detection(OSSD)

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 开放词汇检测(OVD)、CLIP 适配、区域级蒸馏、语义-空间解耦、空间保真度
  • Features: 指出现有 OVD 方法用同一套区域级蒸馏特征同时承担分类与定位,在提升新类语义一致性的同时损害了空间保真度。OSSD 提出对象级语义与空间蒸馏,将语义蒸馏与空间蒸馏解耦,使开放词汇检测在保持新类语义对齐的同时改善定位精度。
  • Team: 中国地质大学(武汉)

三、域自适应 / 域泛化检测

8. Domain Adaptive Object Detection via Dynamic Causal Refinement(DCR)

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Blog: Lacuna 深度解读
  • Keywords: 域自适应目标检测(DAOD)、因果不变性、伪相关 / 捷径特征、谱扰动、闭环反馈、频域
  • Features: 指出主流 DAOD 依赖特征分布对齐,在增强统计不变性的同时也放大了域间共有的伪相关(如共同的环境上下文),这些捷径特征并非分类的真正因果因素。DCR 在数据增广与模型优化之间建立闭环反馈以渐进细化因果特征:语义预测一致性(SPC)过滤域特有伪因素并建立稳健统计不变性;差异引导因果细化(DGCR)通过 DCT 频域弹性谱扰动主动抑制对域共有伪因素的依赖。Foggy Cityscapes 上达 65.6% mAP,且因果细化仅在训练阶段进行、推理零额外开销。
  • Team: 电子科技大学、同济大学(Zeyu Ma, Jiaqi Huang, Yitong Qin, Ziqiang Zheng, Jiwei Wei, Jie Zou, Yang Yang, Heng Tao Shen)

9. SCoA: Revisiting Domain Generalized Object Detection with Style-Conditioned Adaptation

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Blog: Lacuna 深度解读
  • Keywords: 域泛化目标检测(DGOD)、视觉基础模型、风格条件适配、谱风格建模、Token 混合专家、查询精炼
  • Features: 指出基于视觉基础模型(VFM)的参数高效微调多用固定、风格无关的适配参数,忽略不同视觉风格会带来不同的任务差异(如雾天主要损害定位、夜间主要造成分类混淆)。SCoA 提出风格条件适配:谱风格建模(SSM)以记忆库与对抗权重从单一源域刻画多样风格;Mixture-of-Tokens 适配(MTA)按风格动态路由适配 token 组合;风格条件查询精炼(SCQR)把风格信息注入 object query。在跨天气与 Cityscapes-C 腐蚀基准上达到 SOTA,且对骨干(DINOv2 / SAM / EVA02)不敏感。
  • Team: 中国科学技术大学(Han Jiang, Wenfei Yang, Tianzhu Zhang, Yongdong Zhang)

四、增量 / 持续学习检测

10. Focus, Align, and Sustain: Counteracting Gradient Dilution in Incremental Object Detection(FAS)

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Blog: Lacuna 深度解读专知(中文翻译)
  • Keywords: 增量目标检测(IOD)、检测 Transformer(DETR)、梯度稀释、信号分散、分配漂移、支撑衰减
  • Features: 把将 DETR 适配到增量检测的性能退化根因归结为"梯度稀释",并拆分为三个相互耦合的因素:信号分散(背景 query 远多于前景,前景梯度被淹没)、分配漂移(二分匹配随机抖动导致梯度方向不一致)、支撑衰减(回放样本偏质心,旧类特征空间边界失守)。FAS 框架分别以先验注入查询(PIQ)聚焦判别信号、确定性锚点蒸馏(DAD)对齐 query-target 匹配、流形支撑回放(MSR)覆盖旧类分布。COCO 40+10×4 上 AP 提升超 5.0,逼近联合训练上界。
  • Team: 中国科学院信息工程研究所、南开大学、清华大学、哈尔滨工业大学

11. Symbiosis-Inspired Knowledge Distillation for Incremental Object Detection

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 增量目标检测、知识蒸馏、对象共生、共现与遮挡、决策边界
  • Features: 指出主流增量检测采用类增量学习视角、倾向分离特征空间以锐化决策边界,却忽视了检测中的"对象共生"(对象共现与遮挡带来的空间与语义关联)。论文受共生关系启发设计知识蒸馏,利用共生结构缓解新类学习对旧类知识的干扰。
  • Team: 西安电子科技大学(Mingyue Zeng, De Cheng, Zhipeng Xu, Huaijie Wang, Nannan Wang, Xinbo Gao)

五、伪装目标检测

12. CODiff: One-Step Diffusion Model for Camouflaged Object Detection

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/KiiSooo/CODiff
  • Keywords: 伪装目标检测(COD)、一步扩散、全局语义引导、层次条件集成、特征正则
  • Features: 现有扩散式 COD 依赖多步采样精炼掩码,计算开销大。CODiff 先论证 COD 一步采样的理论可行性,再设计面向一步推理的网络:全局语义引导机制在全局范围引导去噪,层次条件集成块提供细粒度结构语义,并用一个直截的正则桥接条件骨干与扩散模型之间的表示差距。在多个基准上 SOTA,COD10K 上 MAE 相对降低 22% 以上。
  • Team: 浙江大学、西安交通大学(Xiaotong Fu, Qian Liu, Qihang Zhou, Wenchao Meng, Qinmin Yang, Shibo He)

13. Unsupervised Camouflaged Object Detection with Dual-Eigenvector Spectral Pseudo-Labeling and Contrastive Refinement(DualUCOD)

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/LPZliu/DualUCOD
  • Keywords: 无监督伪装目标检测(UCOD)、双特征向量谱伪标签、DINO 特征、对比精炼、伪标签去噪
  • Features: 针对无监督 COD 仅靠 DINO 高维特征后处理生成伪标签、噪声过多导致训练退化的两大局限,提出双特征向量谱伪标签生成与对比精炼,提升无像素级标注条件下伪标签的可靠性。
  • Team: 清华大学深圳国际研究生院、杜克大学、清华大学、天津大学、香港中文大学(深圳)、大湾区大学

14. PMSPO: Progressive Matching and Semantic-Aware Policy Optimization for Camouflaged Object Detection

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 伪装目标检测、多模态大模型、强化学习、渐进匹配、语义感知策略优化
  • Features: 面向伪装目标检测中目标与背景高度融合的难题,用强化学习训练多模态大模型完成视觉定位:渐进匹配缓解多目标匹配困难,语义感知策略优化抑制低质量样本与视觉干扰物造成的误定位。
  • Team: 华中农业大学(Maosheng Su, Junlei Cao, Zhiyuan Wang, Shuo Wang, Ning Zhang, Jun Luo)

六、红外小目标 / 低信噪比检测

15. Diffuse to Detect: Bi-Level Sample Rebalancing with Pseudo-Label Diffusion for Point-Supervised Infrared Small-Target Detection(Spotlight)

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/yuanhang-yao/diffuse-to-detect
  • Keywords: 红外小目标检测、点监督、伪标签扩散、双层优化、样本再平衡、元分类器
  • Features: 点监督可缓解红外小目标稠密标注成本,但受制于两点耦合瓶颈:杂乱低对比度红外图像中伪标签演化不稳定、样本分布严重失衡。论文提出双层框架:底层用元分类器动态预测每个样本的损失权重以再平衡样本分布,上层用可微扩散模块依据检测反馈精炼伪标签,使伪标签质量随训练持续改善。ICML 2026 Spotlight。
  • Team: 大连理工大学(Zhu Liu, Yuanhang Yao, Ping Qian, Zihang Chen, Risheng Liu)

16. Temporal-Emerged Prompting for Segment Anything in Multiframe Infrared Small Target Detection(TEP-SAM)

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/cdh8285/TEP-SAM
  • Blog: Lacuna 深度解读alphaXiv Overview
  • Keywords: 多帧红外小目标检测(M-IRSTD)、SAM、时间涌现提示、运动差异、非交互式分割、冻结基础模型
  • Features: 观测到红外小目标会随时间从背景中逐渐"涌现"而变得可区分,于是把运动差异当作提示信号。差异增强时间编码器(DETE)联合建模全局背景运动与局部目标运动偏差;时间特征注入(TFI)把时间特征注入冻结的 SAM 编码器各层;时间提示生成器(TP-Gen)自动把时间特征转为提示 token,实现无需人工点击的非交互式分割。在 NUDT-MIRSDT 与 TSIRMT 上,尤其在极低信噪比子集上大幅领先。
  • Team: 西北工业大学、华为技术有限公司(Yinghui Xing, Donghao Chu, Shizhou Zhang, Di Xu)

17. CodeMamba: Shifting from Target Semantics to Self-Supervised Background Manifold Learning for Singularity Detection in Infrared Sequences

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Blog: Lacuna 深度解读
  • Keywords: 多帧红外小目标检测、背景流形学习、状态空间模型(Mamba)、概率向量量化、运动奇异性、贝叶斯不确定度融合
  • Features: 面对目标语义极度匮乏与类不均衡导致的表征坍缩,CodeMamba 把问题从"学目标语义"转为"学背景流形"。隐式流用层次概率向量量化(PVQ)把高冗余背景编码为码本,目标作为不拟合原型的重构残差浮现;显式流用混合空间-频率 Mamba 建模运动一致性与时域奇异性,并以 FFT 谱显著性突出目标;最后以贝叶斯不确定度加权融合两流。IRDST 上 Precision 90.85%、Recall 90.40%。
  • Team: 天津理工大学(Jingwen Ma, Xinpeng Zhang, Fan Shi, Xu Cheng, Shengyong Chen)

七、3D / 点云 / 具身目标检测

18. Embodied-DETR: End-to-End Temporal 3D Object Detection in Egocentric Views

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/UniPerceptor/UniPerceptor
  • Blog: Lacuna 深度解读
  • Keywords: 具身 3D 目标检测、第一人称时序、Embodied-Det 基准、场景感知特征聚合、实例感知查询嵌入、时序一致性
  • Features: 指出现有 3D 检测基准与方法面向完整重建的全局场景,无法刻画第一人称下部分观测、重度遮挡与实例演化。论文构建 Embodied-Det 基准(23 万余帧、1513 序列、18 类、约 50 万目标标注,并引入时序一致性与稳定性指标),并提出端到端时序框架 Embodied-DETR:场景感知特征聚合(SFA)用全局 Memory Bank 检索视野内历史点云特征,实例感知查询嵌入(IQE)用新实例 / 活跃实例两类 query 在帧间追踪目标并容忍短暂遮挡。帧级 42.90 mAP50,时序稳定性显著提升。
  • Team: 复旦大学(Ziheng Ding, Xiaze Zhang, Yuejie Zhang, Lifeng Chen, Rui Feng)

19. Radial Scaling Voxelization for Accurate Small Object 3D Detection(RSV)

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/Zeoy2020/RadialScalingVoxelization
  • Blog: Lacuna 深度解读
  • Keywords: 3D 目标检测、点云体素化、非均匀离散化、径向缩放、LiDAR、小目标(行人 / 骑行者)
  • Features: 均匀笛卡尔体素对近处小目标不利(目标仅占少数体素),但全局提高分辨率会带来内存与计算爆炸。RSV 在体素化前对输入坐标施加连续的径向缩放函数,使近处等效体素更细、远处基本不变,并保持笛卡尔网格拓扑以直接复用标准 3D 卷积。方法架构无关,可即插即用地替换任意体素检测器的离散化模块。KITTI 与 nuScenes 上行人与骑行者 AP 大幅提升,额外开销极小。
  • Team: 华东师范大学、中山大学(Hao Liu, Yi Zhou, Yanni Ma)

八、新架构 / 多模态融合 / 鲁棒性

20. Bio-Vision-Inspired Spiking Neural Networks for Object Detection with Event Cameras

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 事件相机、脉冲神经网络(SNN)、仿生视网膜、能效、多尺度脉冲、异步感知
  • Features: 事件相机与脉冲神经网络天生契合事件数据的异步特性,但面临噪声敏感、稠密表示破坏脉冲通路、多尺度建模不足等落地挑战。论文提出仿生脉冲网络用于事件相机目标检测,在保持高能效的同时改善检测精度。
  • Team: 北京大学、鹏城实验室(Dongyang Ma, Zhengyu Ma, Yifan Huang, Chenlin Zhou, Wei Zhang, Yonghong Tian)
  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/someboy0/MFH-NAS(作者表示代码将发布)
  • Keywords: 多模态融合目标检测、神经架构搜索(NAS)、跨阶段交互、模态互补、架构建模
  • Features: 指出多模态融合检测在同一骨干阶段存在明显模态鸿沟,预定义的阶段对齐融合难以支持跨阶段交互。MFH-NAS 提出混合神经架构搜索框架,同时搜索局部融合原语与阶段级融合结构,自动发现更能利用跨模态互补性的融合架构。
  • Team: 西北农林科技大学(QuanWei Gao, Shuqi Zhao, Ruyu Wang, Shuyin Zhang, Cong Liu, Zirui Luo)

22. Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/Yongyx99/Fourier-shape-attack
  • Keywords: 红外目标检测、物理对抗攻击、傅里叶形状、热辐射调制、频域、鲁棒性评估
  • Features: 与 RGB 域依赖颜色纹理不同,红外攻击必须操控热特征,挡热材料的几何形状成为主要对抗信息载体,而现有形状法表达能力受限。论文从频域出发,用傅里叶形状构造物理可实现的对抗扰动来攻击红外目标检测器,揭示红外检测器在频域的脆弱性,为鲁棒性评估与防御提供新视角。
  • Team: 西安交通大学(Yixing Yong, Jian Wang, Ming Lei, Lijun He, Fan Li)

九、其他:题名未直接含"目标检测"的检测相关方向

本节收录题名未直接出现"object detection / 目标检测",但本质属于"定位并识别目标"这一目标检测核心能力的论文,按任务族归类。仅在相关工作中附带提及检测、且不以检测为核心方法或评测的论文不纳入。

9.1 开放词汇 / 视觉定位(Grounding)

A. ExpAlign: Expectation-Guided Vision--Language Alignment for Open-Vocabulary Grounding

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/inlmouse/ExpAlign
  • Keywords: 开放词汇定位、视觉-语言对齐、期望引导、弱监督
  • Features: 开放词汇定位需要弱监督下的精细视觉-语言对齐,而现有方法或依赖缺乏细粒度的全局句向量,或需显式监督/重型交叉注意力。ExpAlign 提出有理论依据的期望引导对齐框架,在弱监督下获得更细粒度的对齐能力。
  • Team: 清华大学、glasssix、电子科技大学、哥本哈根大学

B. UGround: Towards Unified Visual Grounding with Unrolled Transformers

  • Paper: arXivOpenReviewICML 2026 页面
  • Code: https://github.com/rui-qian/UGround
  • Keywords: 统一视觉定位、Unrolled Transformer、中间层选择、mask-as-prompt
  • Features: 提出统一视觉定位范式,动态选择 unrolled transformer 的中间层并以"mask as prompt",而非沿用固定末层隐藏层作为提示的既有流程,缓解其表达能力与泛化方面的局限。
  • Team: 复旦大学、浙江大学、上海交通大学等

C. DSGCR: Decomposed Spectral Geometry-Aware Cross-Modal Semantic Representation for 3D Visual Grounding

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/CayrJ/DSGCR
  • Keywords: 3D 视觉定位、跨模态表示、频域分解、几何感知、语义对齐
  • Features: 针对单模态预训练编码器各自迁移视觉/语言知识导致领域偏移、跨模态对齐差的问题,DSGCR 用分解的谱域与几何感知表示实现更细粒度的跨模态语义对齐与几何推理。
  • Team: 西安电子科技大学(Jing He, Licheng Jiao, Lingling Li, Xiaoqiang Lu, Xu Liu, Wenping Ma, Fang Liu, Long Sun)

D. AmbiRefer3D: 3D Visual Grounding with Referential Ambiguity

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/yearnallover/AmbiRefer3D
  • Keywords: 3D 视觉定位、指代歧义、新任务定义、多候选消歧
  • Features: 指出现有 3D 视觉定位默认语言表达无歧义,而真实指令常模糊或信息不足,导致模型关联到多个可能目标。论文提出"带指代歧义的 3D 视觉定位"新任务并给出相应方法。
  • Team: 北京理工大学、深圳北理莫斯科大学

9.2 视觉目标跟踪与重定位

E. RELO: Reinforcement Learning to Localize for Visual Object Tracking

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/Multimedia-Analytics-Laboratory/RELO
  • Keywords: 视觉目标跟踪、强化学习、IoU/AUC 对齐、定位监督
  • Features: 传统跟踪器用热图等手工空间先验做代理监督,与 IoU、AUC 等评测指标不一致。RELO 直接用强化学习做定位,使优化目标与跟踪评测指标对齐。
  • Team: 香港城市大学、大连理工大学、微软亚洲研究院

F. STORM: Segment, Track, and Object Re-Localization from a Single Image

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 6D 位姿估计与跟踪、参考条件跟踪、遮挡与快速运动、失败识别
  • Features: 面向物理 AI 的 6D 位姿估计与跟踪,在无需 CAD 模型与逐目标适配的前提下,用单一参考条件统一框架完成分割、跟踪与目标重定位,并具备失败识别能力。
  • Team: 达姆施塔特工业大学(TU Darmstadt)、Hessian.AI、SB Intuitions、Google Intrinsic、德国人工智能研究中心(DFKI)

G. Unified Multimodal Visual Tracking with Dual Mixture-of-Experts

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 多模态视觉跟踪、混合专家、统一跟踪框架
  • Features: 用双重混合专家结构统一多模态视觉跟踪,在多种跟踪模态与场景下共享一个模型。
  • Team: 复旦大学、上海交通大学、南洋理工大学、TikTok、联想等

H. Foreground-Aware Token Routing Vision Transformer for Real-Time Satellite Video Tracking

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 卫星视频跟踪、前景感知 token 路由、实时、视觉 Transformer
  • Features: 面向卫星视频实时跟踪,用前景感知的 token 路由视觉 Transformer 降低冗余计算、聚焦前景目标。
  • Team: 西安电子科技大学

I. Beyond Detection: A Structure-Aware Framework for Scene Text Tracking

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 场景文本跟踪、结构化建模、视频文本编辑、新任务与基准
  • Features: 题名含 Detection,但任务实为"场景文本跟踪":通用跟踪器在场景文本上性能显著下降,而视频动态文本的分割、擦除、编辑都依赖稳定跟踪。论文形式化该任务、给出首个系统基准与结构感知框架。
  • Team: 南开大学、中国科学院信息工程研究所、中国科学院大学

9.3 目标计数

J. Benchmarking Dense and Indiscernible Object Counting with Blueberries(DIOCblueberry)

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 密集与不可辨别目标计数(DIOC)、农业计数、基准数据集、伪装与聚簇
  • Features: 面向真实农业计数中目标极小、聚簇、高度伪装的极端场景,提出大规模基准 DIOCblueberry,推动密集不可辨别目标计数研究。
  • Team: 南京理工大学、新加坡国立大学、浙江大学

K. Mitigating Noise-Induced Layout Priors for Object Counting in Diffusion Models

  • Paper: OpenReviewICML 2026 页面
  • Code: https://github.com/lxlong1201/MitigateNoisePrior
  • Blog: 杭州电子科技大学成果报道(中文)
  • Keywords: 文生图扩散模型、目标计数控制、噪声诱导布局先验、免训练、早期交叉注意力
  • Features: 识别出初始噪声是空间布局形成的主要决定因素,并将该现象命名为"噪声诱导布局先验(Noise-Induced Layout Prior)"。据此提出免训练框架:计数感知噪声调整策略显式操控初始潜噪声以匹配目标物体数量,注意力引导布局一致性策略在推理期优化早期交叉注意力以稳定布局。属于"生成中的计数/布局控制",故置于其他。
  • Team: 杭州电子科技大学、新加坡国立大学、浙江大学

9.4 其他检测相关

L. QuantWear: Quantum-scale Wear Particle Detection for Jet Engine Diagnosis

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 磨损颗粒检测、发动机健康诊断、微小目标、工业视觉
  • Features: 面向喷气发动机油液磨损颗粒的量子尺度检测用于故障诊断,题名含 Detection 但对象为工业微小颗粒而非通用目标检测,故列入其他。
  • Team: 湖南大学、得克萨斯大学达拉斯分校、岭南大学、中南大学、香港理工大学

M. G²TAM: Geometry Grounded Track Anything Model

  • Paper: OpenReviewICML 2026 页面
  • Code: 截至检索日未检索到可确认的公开代码仓库。
  • Keywords: 几何基础、Track Anything、视频分割与跟踪、时序一致性
  • Features: 将几何先验与"Track Anything"式视频分割/跟踪结合,提升任意目标在视频中的时空追踪一致性。
  • Team: 香港大学、上海人工智能实验室、加州大学洛杉矶分校、浙江大学

总结

从本届 ICML 2026 接收的目标检测相关论文看,呈现以下几条主线:

  1. 开放世界 / 开放词汇成为最活跃的语义方向:OOVDet、IPOW、OSSD 分别从"拒绝未知""可解释地分解概念""解耦语义与空间蒸馏"三条路径,解决已知-未知混淆与细粒度语义对齐问题。
  2. 红外小目标检测集中体现了"从数据驱动转向先验驱动":Diffuse to Detect 引入扩散式伪标签、CodeMamba 转为背景流形学习、TEP-SAM 把运动差异当作提示、Fourier Shapes 从频域构造物理攻击,都在用物理 / 几何 / 时序先验弥补数据不足。这也是本届 ICML 目标检测论文最密集的方向之一。
  3. 遥感 / 航拍 / 无人机是多模态与基础模型落地的主战场:DroneDINO(Oral)用异构路由 MoE 统一 RGB/IR/RGB-IR,OTA-Det 统一开放词汇检测与视觉定位,SLIP-RS 与 BabelRS 分别以"结构化属性"和"语言枢纽"重塑遥感预训练。
  4. 域适应与增量学习回到"优化机理"本身:DCR 用因果细化抑制捷径特征,SCoA 用风格条件适配替代风格无关适配,FAS 把 DETR 增量检测的遗忘归因为"梯度稀释"。三者都强调稳定、可解释的优化动力学,而非堆叠更大模型。
  5. 3D / 具身检测强调时序与几何:Embodied-DETR 用记忆库与实例查询建模第一人称时序一致性,RSV 以径向缩放体素保持笛卡尔拓扑的同时提升近处小目标分辨率。
  6. 检测正在被并入更大的感知 / 生成链路:视觉定位(ExpAlign、UGround、DSGCR、AmbiRefer3D)、跟踪与重定位(RELO、STORM 等)以及生成中的计数控制(Noise-Induced Layout Prior)与检测共享"定位目标、判断存在"的核心能力。

总体而言,ICML 2026 的目标检测研究规模不大(约占录用论文的 0.35%),但选题更偏方法论与机理创新,且与基础模型、多模态、生成模型、具身智能深度交织;目标检测正在从"一个独立任务"演化为各类感知与推理系统的可调用基础能力。

参考入口


本文由 AI 辅助检索、归类和整理。建议引用前再次核对论文最终版本、作者主页、OpenReview 与代码仓库。

相关推荐
vibecoding777 小时前
一文搞懂企业级 API 网关选型:12 个维度、4 类企业、7 步落地
人工智能·大模型·ai编程
Rocktech_ruixun7 小时前
机器人本地跑LLM大模型对主板硬件有什么要求?瑞迅科技RK3588/3568方案选型解析
人工智能·科技·嵌入式硬件·机器人·边缘计算
yxlalm7 小时前
Spring AI+RAG 01-项目背景与技术选型
java·人工智能·spring
tedcloud1237 小时前
Wand-Enhancer 怎么搭建?开源 Wand 客户端增强与远程控制工具介绍
大数据·服务器·人工智能·开源·音视频
科技苑7 小时前
如何用Python编程实现一个简单的Web爬虫?
人工智能·python
迅利科技7 小时前
新能源汽车零部件研发,SIMULIA一站式仿真解决方案如何缩短研发周期
人工智能·汽车
Databuff8 小时前
AI SSH工具,集齐SSH、SFTP、知识库RAG、AI助手
网络·人工智能·ssh
Blockchina8 小时前
从一篇文章到一条完整视频:用 Codex 搭建可复用的 AI 视频生产线
人工智能
Proaiapi9 小时前
一张图介绍gpt-image-2.5
人工智能·gpt