2026-ICML-CoGeoAD: Hierarchical Color-Geometric Fusion with Multi-View Attention for Zero-Shot 3D Anomaly Detection
- CoGeoAD:基于多视图注意力机制的分层颜色几何融合零样本3D异常检测
-
- 摘要
- 引言
- [2. 相关工作](#2. 相关工作)
-
- [2.1. 无监督点云异常检测](#2.1. 无监督点云异常检测)
- [2.2 零样本图像异常检测](#2.2 零样本图像异常检测)
- [2.3. 零样本点云异常检测](#2.3. 零样本点云异常检测)
- [3. 方法论](#3. 方法论)
-
- [3.1. 概述](#3.1. 概述)
- [3.2. 彩色几何多视角点云渲染](#3.2. 彩色几何多视角点云渲染)
- [3.3 多视图注意力模块](#3.3 多视图注意力模块)
- [3.4 多阶段颜色-几何融合模块](#3.4 多阶段颜色-几何融合模块)
- [3.5 损失函数设计](#3.5 损失函数设计)
- [4. 实验](#4. 实验)
-
- [4.1. 数据集](#4.1. 数据集)
- [4.2 实现细节](#4.2 实现细节)
- [4.3 主要结果](#4.3 主要结果)
- [4.4 消融实验](#4.4 消融实验)
- [5. 结论](#5. 结论)
- 致谢
- 影响声明
- 参考文献
CoGeoAD:基于多视图注意力机制的分层颜色几何融合零样本3D异常检测
作者 :Ke Xu, Xinle Wang, Yanning Hou, Xueliang Ma, Juan Xie, Jianfeng Qiu
单位 :State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China; School of Artificial Intelligence, Anhui University, Hefei, China; College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China; School of Mathematics & Physics, Anhui Jianzhu University, Hefei, China.
摘要
零样本三维异常检测对于工业质量检测至关重要,因为标记异常样本十分稀缺。然而,现有方法缺乏将互补的二维彩色图像与三维几何结构有效融合的机制,限制了它们在统一框架下检测表面和结构缺陷的能力。为了解决这些问题,我们提出了 CoGeoAD,一个基于 CLIP 的统一框架,它通过构建像素对齐的多视图配对图像来融合颜色和几何特征。该框架引入了数据驱动的多视图注意力(MVA)机制来自适应地聚合三维特征,以及多阶段颜色-几何融合(MSCGF)模块来分层整合来自两种模态的多级特征。在 MVTec3D-AD 和 Eyecandies 基准测试集上的大量实验表明,CoGeoAD 达到了目前最先进的性能,能够有效地捕捉复杂工业场景中的结构和纹理异常。
引言
智能制造和工业自动化的蓬勃发展催生了对异常检测(AD)的迫切需求(Bergmann et al., 2020; Tao et al., 2022a; Gu et al., 2024)。然而,在实际工业环境中,获取大量带标注的异常数据往往极其困难(Tao et al., 2022a;b)。异常事件本身就十分罕见,导致数据分布极度不平衡(Bergmann et al., 2019; 2021; Bonfiglioli et al., 2022; Wang et al., 2024; Gao, 2024; Huang et al., 2025; Dai et al., 2025)。此外,数据采集成本高昂,且常常受到隐私和安全问题的制约(Zhou et al., 2023)。鉴于这些数据限制,零样本异常检测(无需依赖目标域训练数据)已成为一个重要的研究方向。更广泛地说,近期研究探索了软推理和可迁移表征学习,以提高数据稀缺环境下的泛化能力(Hou et al., 2025c)。在视觉异常检测领域,研究人员转向了基础视觉语言模型(VLM),特别是 CLIP 模型(Radford et al., 2021)。CLIP 模型凭借其卓越的跨模态语义理解和泛化能力,为应对零样本异常检测的挑战提供了强大的基础。
虽然传统的自动检测方法在二维视觉领域取得了长足发展(Huang et al., 2022; You et al., 2022; Cao et al., 2024b),但它们对 RGB 数据的过度依赖本质上忽略了关键的几何信息。相反,新兴的基于三维点云的方法(Bergmann & Sattlegger, 2023; Chen et al., 2023a; Chu et al., 2023)虽然擅长捕捉空间细节,但往往无法检测到以颜色或材料纹理形式呈现的缺陷(见图1(a))。近年来,基于 CLIP 的图像异常检测任务取得了显著成果(Jeong et al., 2023; Chen et al., 2023b; Cao et al., 2024c; Qu et al., 2024; Gao et al., 2025),但其在三维领域的潜力仍有待挖掘。尽管一些方法(Cheng et al., 2025b; Zhou et al., 2024a; 2025)尝试在三维点云环境中利用二维 RGB 图像信息,但它们通常仅将 RGB 图像视为辅助线索,而没有将颜色信息整合到几何模型中。由于纹理异常受视角影响,上述方法无法有效实现跨多个三维视角的二维颜色异常感知。因此,如何建立颜色和几何模态之间的有效协同作用仍然是一个关键挑战。
为了弥合这一差距,我们提出了 CoGeoAD,一个基于 CLIP 的统一框架,它融合了颜色和几何特征。与简单的集成方法不同,我们的框架利用了具有明确点到像素对应关系的几何和颜色渲染配对。这使我们能够通过几何投影分离结构异常,同时通过颜色视图捕获纹理缺陷。通过在冻结的 CLIP 编码器之外融合模态,我们的方法保持了模型的泛化能力,并避免了通常会导致灾难性遗忘的内部网络修改。

图 1. 动机与性能分析。(a) 视觉互补性:左图展示了单一模态的局限性:几何特征会遗漏颜色缺陷(例如泡沫污渍),而 RGB 特征则会忽略结构裂纹(例如贝果裂纹)。相比之下,右图展示了我们的 CoGeoAD 框架,该框架融合了多视角几何和颜色表示,能够准确地检测和定位这两种类型的异常。(b) 性能比较:在 MVTec3D-AD 数据集上的定量比较表明,我们提出的融合方法显著优于单模态基线方法和简单的集成方法。
此外,为了在不继承预训练模型偏差的情况下改进特征聚合,我们引入了一种直接源自多视角图像的数据驱动多视角注意力(MVA)机制。最后,为了稳健地合成这些表征,我们提出了多阶段颜色-几何融合(MS-CGF)模块。该模块分层集成了来自两种模态的多级特征,确保能够检测到单模态方法可能遗漏的细微异常。图 1(b) 比较了在 MVTec3D-AD 数据集上,从 2D-RGB(仅颜色)、3D-Point(仅几何)、2D-RGB+3D-Point(颜色-几何集成)到我们提出的 3D-Point+3D-RGB(颜色-几何融合)等方法的性能提升。我们的主要贡献如下:
- 我们提出了一种名为 CoGeoAD 的零样本框架,它利用双模态渲染生成成对的几何和彩色视图。这些视图经 CLIP 处理后,通过点到像素对应关系映射回 3D 空间,从而消除遮挡噪声。
- 我们引入了一种与模型无关的多变量分析 (MVA) 机制,该机制直接从图像而非中间特征嵌入计算注意力权重。通过避免依赖预训练模型的偏差,MVA 显著增强了 3D 特征聚合的鲁棒性,从而能够识别细微的工业异常。
- 我们提出了 MS-CGF 模块,用于分层聚合多层 CLIP 特征。该模块采用动态层选择器和模态特定的最大化方法,能够有效地捕获跨颜色和几何的多级异常,确保从表面缺陷到结构不规则等各种异常的全面检测。
- 在 MVTec3D-AD 和 Eyecandies 基准测试上的大量实验表明,CoGeoAD 的性能优于现有的零样本方法,为复杂的工业异常检测任务树立了新的先进水平。为了便于复现,我们的源代码可在 https://github.com/kingdomShu/CoGeoAD 获取。
2. 相关工作
2.1. 无监督点云异常检测
无监督三维异常检测主要依赖于重建、记忆库和多模态特征学习。基于重建的方法通过异常样本的高重建误差来检测异常(例如,IMRNet(Li et al., 2024)、R3D-AD(Zhou et al., 2024b))。近年来,PASDF(Zheng et al., 2025)、DUS-Net(Liang et al., 2025b)、MC3D-AD(Cheng et al., 2025a)和 Simple3D(Cheng et al., 2026)等方法通过提高几何建模精度并面向高分辨率工业检测,进一步推进了这一范式。记忆库方法通过将测试特征与存储的正常原型进行比较来识别缺陷(例如,Reg3D-AD(Liu et al., 2023)),而诸如 M3DM(Wang et al., 2023)、CPMF(Cao et al., 2024a)、ISMP(Liang et al., 2025a)和 BridgeNet(Xiang et al., 2025)等框架则融合了多模态线索和空间视图来构建鲁棒的记忆表征。尽管在重建质量和多模态融合方面取得了显著进展,但大多数方法仍然需要针对特定类别或数据集进行训练,这从根本上限制了它们在零样本部署中的灵活性。
2.2 零样本图像异常检测
零样本图像工业异常检测技术发展迅速,主要得益于 CLIP 技术的推动。WinCLIP(Jeong et al., 2023)开创了该领域的先河,建立了基线模型,利用滑动窗口和多级视觉特征融合来捕捉精细的细节。为了增强图像块级的定位能力,APRIL-GAN(Chen et al., 2023b)引入了一个轻量级的线性投影层用于视觉特征重编码,但它并未解决文本空间歧义问题。针对文本空间,AnomalyCLIP((Zhou et al., 2023)首次采用可学习的文本提示来动态增强异常语义。在此基础上,AdaCLIP(Cao et al., 2024c)提出了一种静态和动态的可学习提示策略。 VCP-CLIP(Qu et al., 2024)引入了一个视觉上下文提示框架,将可学习的图像级视觉上下文注入到 CLIP 架构中。最近的研究通过探索级联 CLIP-SAM 提示、聚类驱动的堆叠提示和基于 ViT 的无语言异常建模(Hou et al., 2025b;a; 2026),进一步改进了零样本工业异常检测。
2.3. 零样本点云异常检测
近年来,三维数据的稀缺性推动了基于CLIP的零样本方法的研究,这些方法无需训练。PointCLIP(Zhang et al., 2022)和 PointCLIP V2(Zhu et al., 2023)率先将三维数据投影到多视角二维图像上进行分类。MVP-PCLIP(Cheng et al., 2025b)将此方法应用于异常检测,利用深度图像以及专门的视觉和文本提示;PointAD(Zhou et al., 2024a)则通过采用高精度渲染和视图掩码增强了精细定位。随后,PointAD+(Zhou et al., 2025)超越了单纯的投影,引入了显式的三维表示建模来直接捕捉几何关系。最近,MuSc-V2(Li et al., 2025)探索了零样本多模态工业异常分类和分割,通过对未标记的二维和三维样本进行相互评分,无需额外的微调。GS-CLIP(Deng et al., 2026)进一步引入了几何感知提示和协同视图表示学习,使 CLIP 能够适应零样本三维异常检测。与这些同期和近期的方法相比,CoGeoAD 专注于分层颜色几何融合和数据驱动的多视图注意力机制,显式地利用成对的颜色和几何渲染,同时保持冻结 CLIP 编码器的泛化能力。
3. 方法论
3.1. 概述
如图 2 所示,CoGeoAD 是一个零样本框架,旨在通过将二维语义先验与三维几何表示相结合来弥合领域鸿沟。该流程包含三个核心模块:(1)彩色几何多视角点云渲染(ColorGeometric Multi-View Point Cloud Render),它建立 RGB 图像与点云之间的像素级对应关系,以生成颜色和几何视图;(2)数据驱动的多视角注意力机制(Data-Driven Multi-View Attention,MVA),它利用轻量级的基于卷积神经网络(CNN)的像素编码器,动态计算多视角图像的注意力得分,确保信息丰富的视角得到优先处理;(3)多阶段 CoGeo 融合(Multi-Stage CoGeo Fusion,MS-CGF),它分层聚合多级特征并计算文本-图像相似度,以生成异常图。

图 2. CoGeoAD 框架。该流程首先将 RGB 图像与点云对齐,生成配对的彩色和几何多视图图像(步骤 1)。基于 CNN 的像素编码器为每个视图分配重要性分数,并自适应地融合这些分数(步骤 2)。从 CLIP 图像编码器中提取多层特征,并与文本嵌入进行匹配,然后通过可学习的权重进行融合(步骤 3)。最后,通过逐元素取最大值的方式组合彩色和几何异常图,生成最终的异常图和分数。
3.2. 彩色几何多视角点云渲染
为了将二维异常检测迁移到三维域,彩色几何多视角点云渲染模块作为基础预处理阶段。它将点云渲染成多视角下的彩色几何图像对,从而建立结构化二维表示的显式点到像素对应关系。
为了捕捉复杂三维物体的表面细节,我们通过绕几何中心旋转输入点云来生成多视角表示,以减少自遮挡。视角集定义在离散的旋转角度网格 θ x ∈ Θ x \theta_x \in \Theta_x θx∈Θx 和 θ y ∈ Θ y \theta_y \in \Theta_y θy∈Θy 上,其中每个视角均通过相应的复合旋转矩阵获得:

CoGeoAD 通过双模态渲染将几何形状与颜色解耦。对于每个视点,我们首先生成几何多视图图像,方法是将点云渲染成均匀的中性灰,背景为白色,从而有效地将结构异常与颜色干扰隔离开来。同时,我们利用色度信息渲染彩色多视图图像,以捕捉与颜色相关的缺陷,例如污渍。
为了实现像素级精确的异常定位,使其能够回到三维物体上,我们为每个生成的视图计算一个密集对应图。对于旋转后的三维点 p k ′ = ( x ′ , y ′ , z ′ ) T \mathbf{p}'_k = (x', y', z')^T pk′=(x′,y′,z′)T,我们使用针孔相机模型计算其在二维图像平面坐标 KaTeX parse error: Undefined control sequence: \mahtbf at position 1: \̲m̲a̲h̲t̲b̲f̲{x}_k = (u, v)^... 上的投影:

其中 s s s 表示相机坐标系中的深度缩放因子, K K K 是内参矩阵, R c a m ∣ t c a m \\mathbf{R}_{cam} \| \\mathbf{t}_{cam} Rcam∣tcam 是由虚拟相机的姿态设置确定的外参矩阵。
关键在于,我们通过计算可见性掩码来解决遮挡问题。由于多个 3D 点可能投影到同一个 2D 像素坐标 π ( p ) \pi(\mathbf{p}) π(p),我们基于相机空间深度 z ′ z' z′ 强制执行几何一致性检查。点 p k ′ \mathbf{p}'_k pk′ 的可见性指示符 M k ∈ { 0 , 1 } M_k \in \{0, 1\} Mk∈{0,1} 定义如下:

其中,最小化过程是对所有投影到与目标点 p k ′ \mathbf{p}'_k pk′ 相同像素坐标的点 p m ′ \mathbf{p}'_m pm′ 进行的。
因此,最终的对应关系图存储了每个点的坐标映射元组 ( x k , M k ) (\mathbf{x}_k, M_k) (xk,Mk)。这种映射使得在推理过程中能够将二维异常分数精确地反投影到三维流形上,从而有效地滤除遮挡噪声。
3.3 多视图注意力模块
为了防止关键异常线索被无关的背景视图掩盖,数据驱动的多视图注意力(MVA)模块通过为每个二维视图分配可学习的重要性分数来自适应地聚合三维特征。MVA 优先考虑语义内容而非固定权重,从而有效地抑制遮挡噪声并增强局部异常的检测,尤其是在具有挑战性的零样本场景中。
首先,我们采用一个轻量级的像素编码器,它由卷积骨干和投影头组成。令 I = { I k } k = 1 N v \mathcal{I} = \{\mathbf{I}k\}{k=1}^{N_v} I={Ik}k=1Nv 表示由 N v N_v Nv 个渲染图像组成的多视图输入集合。对于第 k k k 个视图 I k \mathbf{I}k Ik,编码过程被建模为一个两阶段映射。首先,卷积骨干 Φ conv \Phi{\text{conv}} Φconv 提取空间特征图,然后通过全局平均池化 A ( ⋅ ) \mathcal{A}(\cdot) A(⋅) 对这些特征图进行空间聚合。随后,线性投影头 W \mathcal{W} W 将聚合后的特征映射到最终的潜在嵌入 h k ∈ R d \mathbf{h}_k\in\mathbb{R}^d hk∈Rd:

其中 Φ conv : R H × W × 3 → R H ′ × W ′ × C ′ \Phi_\text{conv} : \mathbb{R}^{H\times W\times 3} \to \mathbb{R}^{H'\times W'\times C'} Φconv:RH×W×3→RH′×W′×C′ 表示具有 C ′ C' C′ 输出通道的堆叠卷积层,而 W : R C ′ → R d \mathcal{W} : \mathbb{R}^{C'} \to \mathbb{R}^d W:RC′→Rd 表示可学习的线性变换层。
为了自适应地加权每个视图的贡献,我们采用了一种数据驱动的注意力机制,该机制由一个评分网络 ϕ : R d → R \phi : \mathbb{R}^d \to \mathbb{R} ϕ:Rd→R 参数化。该网络将潜在嵌入 h k \mathbf{h}_k hk 投影到一个标量非归一化分数 s k = ϕ ( h k ) s_k = \phi(\mathbf{h}k) sk=ϕ(hk)。我们将视图重要性表示为一个归一化概率分布 α \alpha α,使得 α k ≥ 0 \alpha_k \ge 0 αk≥0 且 ∑ k = 1 N v α k = 1 \sum{k=1}^{N_v} \alpha_k = 1 ∑k=1Nvαk=1。为了控制该分布的锐度,我们引入了一个可学习的温度参数 τ \tau τ 和一个缩放因子 γ \gamma γ。注意力权重 α k \alpha_k αk 通过玻尔兹曼分布导出:

因此,聚合点云异常得分 S p o i n t S_{point} Spoint 计算为在分布 α \mathbf{\alpha} α 下特定视图预测 S v i e w ( I k ) S_{view}(\mathbf{I}_k) Sview(Ik) 的期望值:

此外,为了防止注意力机制陷入平凡的解(例如,总是选择单个视图),我们在训练期间引入熵正则化项 L e n t \mathcal{L}_{ent} Lent,以鼓励分布平滑性:

其中 ϵ = 10 − 8 \epsilon = 10^{−8} ϵ=10−8 是一个用于保证数值稳定性的较小常数。该损失项确保权重分布在保持信息量的同时,还能在必要时灵活地关注多个相关视角。
3.4 多阶段颜色-几何融合模块
为了有效弥合二维预训练特征与三维异常检测之间的领域鸿沟,我们提出了多阶段颜色-几何融合(MS-CGF)模块。该架构系统地聚合了四个维度的信息:特征深度、语义相似度、视角和模态。
**特征深度聚合。**标准的 CLIP 自适应通常仅依赖于最后一层,忽略了对异常检测至关重要的细粒度细节。为了缓解这个问题,我们将中间层划分为 N g N_g Ng 组。令 Ω g = { f 1 , ... , f L } \Omega_g = \{\mathbf{f}_1, \dots, \mathbf{f}_L\} Ωg={f1,...,fL} 表示第 g g g 组中的特征图集合,其中 f L \mathbf{f}_L fL 表示作为语义参考的最深层。我们采用基于 MLP 的动态特征选择器来计算融合表示 F g \mathcal{F}_g Fg :

其中 σ \sigma σ 表示 Softmax 函数, Avg ( ⋅ ) \text{Avg}(\cdot) Avg(⋅) 表示全局平均分组, β ∈ R L \beta \in \mathbb{R}^L β∈RL 是组内的自适应注意力权重。
**语义相似度计算。**与以往先聚合特征再进行比较的方法不同,我们独立地在每个语义深度上执行异常检测。对于每个特征组 g g g,我们计算融合特征图 F g \mathcal{F}_g Fg 与由提示学习器导出的文本嵌入 T \mathcal{T} T 之间的余弦相似度:

其中 ( i , j ) (i, j) (i,j) 表示像素坐标。考虑到不同语义层级的贡献不均等,我们引入了一种可学习的加权求和机制来聚合来自不同组的这些图。统一的视图异常图 S v i e w \mathcal{S}_{view} Sview 计算如下:

其中 w g w_g wg 是可学习参数,其初始值用于平衡浅层特征和深层特征的贡献。
**视图聚合。**然后,通过对所有 N v N_v Nv 个视图进行加权求和(如公式 6 所示),并由 MVA 注意力权重 α \alpha α 指导,执行自适应聚合。该机制优先考虑信息丰富的视角并抑制遮挡噪声,从而确保最终得分对视角变化具有鲁棒性。
**模态融合。**最后,我们并行处理颜色流和几何流。令 S p o i n t C o S^{Co}{point} SpointCo 和 S p o i n t G e o S^{Geo}{point} SpointGeo 分别为每种模态的异常得分;最终融合点云的异常得分 A p o i n t A_{point} Apoint 由逐元素最大化策略确定:

这种基于最大值的融合方法类似于软逻辑或运算,使得来自任一域的显著异常证据都能占据主导地位。通过避免平均运算固有的信号稀释,该方法对纹理和结构缺陷均保持了极高的灵敏度。
3.5 损失函数设计
为了在二维和三维空间中实现精确定位和鲁棒识别,我们采用了一种统一的多任务学习目标。总损失函数 L t o t a l L_{total} Ltotal 联合了分割监督、分类监督和注意力正则化。对于细粒度定位,我们对渲染视图得分和反投影三维流形都施加了约束。对于视图,我们通过结合 Focal Loss 和 Dice Loss 来解决稀疏异常像素和占主导地位的正常像素之间固有的类别不平衡问题:

其中, S v i e w S_{view} Sview 是聚合相似性图, M g t M_{gt} Mgt 是对应的真实掩码。Focal Loss 项侧重于难以分类的边界像素,而 Dice Loss 则确保预测异常区域与实际异常区域之间的结构重叠。
在对视图得分进行反投影后,我们对点云应用二元 Dice 损失函数,以确保其与 3D 真实结构进行结构对齐:
其中, A p o i n t ∈ R N A_{point} \in \mathbb{R}^N Apoint∈RN 表示最终的逐点异常得分, P g t P_{gt} Pgt 表示 3D 真实标签。这种针对特定点的约束可以滤除投影噪声,并确保检测到的异常与物理物体表面相符。
为了增强判别能力,我们采用基于二元交叉熵(BCE)损失的分层监督策略。令 l b c e ( p , y ) \mathcal{l}{bce}(p, y) lbce(p,y) 表示标准 BCE 目标函数,其中 y ∈ 0 , 1 y\in{0, 1} y∈0,1 为真实标签。首先,我们引入一个逐视图分类损失 L c l s v i e w \mathcal{L}{cls}^{view} Lclsview,它独立地监督每个视图 k k k。令 p k p_k pk 表示视图 k k k 的预测概率;损失值对所有视图取平均值:

同样地,我们对聚合点级预测 p a g g p_{agg} pagg 也应用相同的目标,以确保全局一致性:

最后,我们对 MVA 权重引入熵损失 L e n t \mathcal{L}{ent} Lent,以保持渲染视图的信息量。总损失 L t o t a l \mathcal{L}{total} Ltotal 定义如下:

4. 实验
4.1. 数据集
我们使用 MVTec 3DAD(Bergmann et al., 2021)和 Eyecandies(Bonfiglioli et al., 2022)数据集评估 CoGeoAD 模型。这两个数据集均包含十个不同的类别,每个类别都包含几何点云(深度图)和 RGB 图像。我们主要通过跨数据集零样本泛化来评估模型性能,即在一个数据集上训练模型,然后在另一个数据集上进行测试。为了全面评估 CoGeoAD,我们使用了四个指标:图像级(I-AUROC、AP)和像素级(P-AUROC)任务的受试者工作特征曲线下面积(AUROC)和平均精度(AP)。此外,我们还计算了区域重叠面积(AUPRO),以评估预测异常图与真实掩膜之间的空间重叠度,从而确保模型对异常大小变化具有鲁棒性。我们在附录 C 中进一步报告了 Real3D-AD(Liu et al., 2023)数据集上的结果。
4.2 实现细节
图像编码器和文本编码器均采用预训练的 CLIP 模型(ViT-L/14@336px)。与视觉骨干网络一致,该网络以 336 × 336 336 \times 336 336×336 的三通道图像作为输入,生成 768 维的嵌入特征。我们通过依次绕 X \rm X X 轴和 Y \rm Y Y 轴旋转物体,将点云渲染成多视角二维图像。具体来说,我们定义了一组视角,其中 X \rm X X 轴旋转角度 θ x ∈ { − 4 π , − 12 π , 0 , 12 π , π } \theta_x \in \{-4\pi, -12\pi, 0, 12\pi, \pi\} θx∈{−4π,−12π,0,12π,π}, Y \rm Y Y 轴旋转角度 θ y ∈ { − 6 π , − 12 π , 12 π , π } \theta_y \in \{-6\pi, -12\pi, 12\pi, \pi\} θy∈{−6π,−12π,12π,π}。这组角度组合共生成 20 个候选视角。为了平衡计算效率和几何覆盖范围,我们从生成的序列中选择 N v = 9 N_v = 9 Nv=9 个视角用于模型训练。
所有实验均在单块 NVIDIA RTX 3090 GPU(24GB)上进行,采用 PyTorch 2.0.0 框架。为保留预训练知识,CLIP 主干网络的参数在整个过程中保持不变。优化仅针对新引入的模块:提示学习器(Prompt Learner)、视图注意力模块(View Attention module)和多阶段颜色-几何融合模块(Multi-Stage Color-Geometric Fusion Module)。训练采用 Adam 优化器,学习率为 1 × 10 − 3 1 \times 10^{-3} 1×10−3, β \beta β 值范围为 ( 0.5 , 0.999 ) (0.5, 0.999) (0.5,0.999),批大小为 4 4 4,训练周期为 20 20 20 个 epoch。
4.3 主要结果
在本节中,我们使用 MVTec3DAD(Bergmann et al., 2021)和 Eyecandies(Bonfiglioli et al., 2022)数据集评估 CoGeoAD,并将其与最先进的零样本方法进行比较,包括 PointCLIP V2(Zhu et al., 2023)、MVP-PCLIP(Cheng et al., 2025b)、AnomalyCLIP(Zhou et al., 2023)、PointAD(Zhou et al., 2024a)、PointAD+(Zhou et al., 2025)以及最新的基于 CLIP 的 GS-CLIP(Deng et al., 2026)。我们还纳入了强大的无监督多模态方法,包括 CPMF(Cao et al., 2024a)和 BridgeNet(Xiang et al., 2025),作为参考上限。PASDF(Zheng et al., 2025)、DUS-Net(Liang et al., 2025b)、MC3DAD(Cheng et al., 2025a)、Simple3D/MiniShift(Cheng et al., 2026)和 MuSc-V2(Li et al., 2025)等 2025 年的最新方法在"相关工作"部分进行了讨论;由于它们在不同数据集或不同评价标准下的结果,我们并未将它们的结果混入表 1 中。附录 B 提供了 MVTec3D-AD 和 Eyecandies 数据集上各类别性能的详细比较。
如表 1 所示,CoGeoAD 在可直接比较的零样本 3D 异常检测方法中树立了新的 SOTA(最先进)地位。在 MVTec3D-AD 数据集上,我们的方法取得了最佳的零样本 I-AUROC(87.4%)、P-AUROC(97.5%)和 AUPRO(91.9%),同时达到了最高的 AP 分数(96.5%)。与最新的 GS-CLIP 基线相比,CoGeoAD 的 I-AUROC 提高了 3.8%,P-AUROC 提高了 1.2%,AUPRO 提高了 5.5%,这表明分层颜色-几何融合优于仅基于几何感知的提示。虽然像 CPMF 和 BridgeNet 这样的无监督方法可以通过依赖目标域的正常训练数据或基于内存的建模获得良好的结果,但 CoGeoAD 无需目标数据集自适应即可在零样本环境下运行。在 Eyecandies 数据集上,CoGeoAD 在所有指标上均持续优于所有零样本竞争对手,在 I-AUROC、AP、P-AUROC 和 AUPRO 指标上分别比 PointAD+ 高出 2.3%、1.4%、2.4% 和 2.0%,并且在 I-AUROC 和 AUPRO 指标上分别比 GS-CLIP 高出 12.3% 和 13.8%。这些优势充分展现了 CoGeoAD 在处理复杂物体几何形状和纹理方面的强大鲁棒性。
除了检测精度之外,我们在表 2 中对 CoGeoAD 的计算效率进行了基准测试。尽管引入了多视图注意力机制(MVA),CoGeoAD 仍然在性能和成本之间实现了更优的平衡。与重量级的 PointCLIP V2 相比,我们的方法将 GFLOPs 降低了约 29.1%(3305.65 对比 4660.49),并将推理吞吐量提高了近一倍(1.28 FPS 对比 0.66 FPS)。此外,CoGeoAD 的峰值内存占用为 4445MB,远低于 PointCLIP V2(9747MB)、MVP-PCLIP(5694MB)和 PointAD+(5811MB),使其非常适合部署在消费级 GPU 上。虽然像 AnomalyCLIP 或 PointAD 这样的轻量级基线方法可以提供更高的 FPS,但 CoGeoAD 适中的计算开销因其在检测精度方面的显著提升而显得物有所值。
为了直观地展示我们双分支设计的有效性,图 3 说明了双分支设计的互补性。颜色分支能够准确识别纹理污渍(例如泡沫),而几何分支则能够捕捉结构裂纹(例如百吉饼状裂纹)。最终的融合有效地整合了这些线索,确保了对各种异常类型的稳健检测。

表 1. MVTec3D-AD 和 Eyecandies 数据集上与现有最先进方法的定量比较。我们纳入了 BridgeNet 等最新的无监督多模态方法作为参考上限,以及 GS-CLIP 等最新的零样本 CLIP 方法用于直接比较。在零样本方法中,最佳结果以粗体突出显示,次佳结果以下划线标出。"-"表示结果并非在相同的基准或指标协议下报告。

表 2. MVTec3D-AD 的计算效率和性能比较。

图 3. 互补特征学习的可视化。几何分支捕捉顶行中的结构裂纹,而颜色分支识别中间行中的纹理污渍。最终的融合图通过我们的 MS-CGF 模块整合这些互补线索,实现精确的 3D 定位。
4.4 消融实验
我们通过一系列消融实验分析了每个模块和各种超参数的影响。
关键组件的有效性。表 3 展示了我们提出的模块的必要性。排除颜色或几何分支会导致性能显著下降,这证实了 3D 异常检测受益于多模态协同作用。此外,移除多阶段颜色-几何融合(MS-CGF)会使 MVTec3D-AD 的 AUPRO 从 91.9% 下降到 87.9%,证明了其在捕获多级异常方面的有效性。

表 3. CoGeoAD 关键组件在 MVTec3D-AD 和 Eyecandies 数据集上的消融研究。在零次消融类别中,最佳结果以粗体突出显示,次佳结果以下划线标出。"-"表示未报告结果。
多视图注意力(MVA)的影响。为了单独分析 MVA 的贡献,我们在表 4 和图 4 中提供了定量和定性的消融实验结果。用标准均值池化替换 MVA 会导致 I-AUROC 下降 3.1%。如图 4 所示,MVA 能够智能地为"信息丰富"的视图(例如,缺陷清晰可见的视图 8)赋予更高的权重,同时抑制噪声较大或被遮挡的视图(例如,视图 1)。这种动态优先级排序方式相比传统的平均融合方法,能够生成更清晰的 3D 异常图,并实现更精确的定位。

表 4. MVTec3D-AD 数据集上的层融合和视图融合方法的消融。

图 4. 数据驱动多视图注意力(MVA)机制的可视化。
视图数量和分辨率的影响 。表 5 显示,当视图数量 N v = 9 N_v = 9 Nv=9 时,性能达到峰值。将视图数量增加到 12 会引入冗余,并显著增加延迟。此外,高分辨率至关重要;分辨率从 336 降至 224 会导致 I-AUROC 值急剧下降(从 87.4% 降至 75.1%),因为低分辨率图像难以分辨细微的几何异常。

表 5. 图像分辨率和视图数量对 MVTec3D-AD 数据集的影响。
层融合策略。我们在表 4 中研究了 CLIP ViT-L/14 骨干网络中不同层组合的影响。结果揭示了一个清晰的性能趋势:更深的层对于零样本异常检测的效果显著更佳。具体而言,仅使用浅层 1-12 时,I-AUROC 值接近随机水平(50.9%),而最后四层(21-24)则达到了 87.4% 的峰值性能。这表明,虽然浅层捕获的是底层纹理信息,但最后几层的高级语义抽象对于定义"正常性"和识别零样本环境下的偏差至关重要。值得注意的是,我们的最后层策略优于 Strided 方法,表明网络尾部的密集信息对于此任务最具代表性。
视图融合方法。我们将提出的多视图注意力机制(MVA)与几种基线融合策略进行了比较。如表 4 下半部分所示,MVA 的性能始终优于所有其他方法。与标准均值池化相比,MVA 将 I-AUROC 提高了 3.1%,AUPRO 提高了 3.5%,这表明对所有视图一视同仁会引入来自无信息或被遮挡视角的噪声。虽然 MLP 加权和静态标量相比均值池化略有改进,但它们缺乏 MVA 的动态适应性。MVA 能够根据视觉内容分配实例特定的权重,从而确保优先处理最显著的缺陷特征,最终获得最高的 P-AUROC(97.5%)和 AUPRO(91.9%)。
异常尺寸的影响。我们分析了 CoGeoAD 在不同真实异常尺寸下的检测和定位性能,具体数据见表 6。不出所料,由于微尺度异常的全局信号较弱,其全局图像级指标有所下降,IAUROC 在最小尺寸区间(1-100 点)降至 79.7%,而对于大于 5000 点的异常,IAUROC 则完美地恢复至 100.0%。然而,我们的方法在精确定位缺陷方面展现出卓越的鲁棒性,且不受尺寸大小的影响。值得注意的是,局部指标保持了极高的稳定性,即使在极具挑战性的 1-100 点区间,也实现了极具竞争力的 97.8% P-AUROC 和 91.7% AUPRO。这种鲁棒性凸显了我们 3D 到 2D 点到像素对齐策略的有效性,该策略通过高密度 3D 点云采样成功弥补了 2D 分辨率的限制,从而实现了亚毫米级缺陷的精确定位。

表 6. 不同异常尺度区间的详细定量评估。这些指标证实,我们的 CoGeoAD 框架能够可靠地检测微尺度异常。
对噪声和校准偏移的鲁棒性。表 7 评估了 CoGeoAD 对模拟的"实际应用"扰动的鲁棒性,具体包括点云高斯噪声(GN)和相机校准偏移(像素错位)。该模型在受到单一扰动时表现出卓越的稳定性;例如,引入高达 ±10 像素的显著校准偏移仅导致 I-AUROC 略微下降(从 87.4% 降至 87.2%),而标准差高达 0.1 的高斯噪声也仅造成极小的性能下降。更重要的是,CoGeoAD 在面对混合扰动时展现出强大的鲁棒性。即使在极端条件下(标准差为 0.5 的噪声与 ±20 像素的偏移相结合),该模型的性能下降也较为平缓,仍保持了 96.7% 的 P-AUROC 和 88.7% 的 AUPRO 的竞争力。这些结果证实,我们的方法并不严格依赖于完美的点云或完美的传感器校准,因此对于复杂的现实世界工业部署而言,它具有很高的实用性和可靠性。

表 7. 针对点云噪声和相机标定偏移(像素错位)的鲁棒性分析。我们的 CoGeoAD 算法对独立扰动和混合扰动均表现出强大的鲁棒性,即使在严苛的"实际应用"噪声模拟条件下也能保持高性能。
5. 结论
本文提出了一种零样本三维工业异常检测框架 CoGeoAD,该框架融合了二维语义先验和三维几何表示。通过采用数据驱动的多视图注意力(MVA)模块,CoGeoAD 能够自适应地优先处理显著视角,有效缓解传统基于池化的聚合方法中固有的噪声。具体而言,我们实现了一种双流渲染策略,通过生成互补的色彩和几何表示,将几何结构与表面纹理显式解耦。此外,多阶段色彩-几何融合(MS-CGF)模块实现了分层特征对齐,确保了纹理和结构异常的精确定位。虽然 CoGeoAD 在 MVTec 3D-AD 和 Eyecandies 基准测试中取得了最先进的性能,但它也揭示了几何覆盖率和计算效率之间存在着关键的权衡。未来的工作将解决高密度视图采样中观察到的冗余问题,并进一步改进专用工业缺陷与通用视觉语言模型之间的语义对齐。
致谢
本研究部分由国家自然科学基金(项目编号:62576001、62206003)、安徽省自然科学基金(项目编号:2308085MF201)、安徽省教育厅自然科学重点项目(项目编号:KJ2021A0048)以及安徽省教育厅自然科学研究重大项目(项目编号:2025AHGXZK20062)资助。
影响声明
本研究推进了零样本三维异常检测技术在工业检测中的应用,有望降低标注成本并辅助质量控制流程。在实际应用中,漏检可能导致缺陷产品漏检,而误报则可能增加人工审核成本。因此,CoGeoAD 旨在作为决策支持或预筛选工具,而非在安全至关重要的制造场景中取代人工检测人员。除上述应用考量外,我们未发现其他社会影响。
参考文献
- Bergmann, P. and Sattlegger, D. Anomaly detection in 3d point clouds using deep geometric descriptors. In Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision, pp. 2613--2623, 2023.
- Bergmann, P., Fauser, M., Sattlegger, D., and Steger, C. Mvtec ad--a comprehensive real-world dataset for unsupervised anomaly detection. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 9592--9600, 2019.
- Bergmann, P., Fauser, M., Sattlegger, D., and Steger, C. Uninformed students: Student-teacher anomaly detection with discriminative latent embeddings. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 4183--4192, 2020.
- Bergmann, P., Jin, X., Sattlegger, D., and Steger, C. The mvtec 3d-ad dataset for unsupervised 3d anomaly detection and localization. arXiv preprint arXiv:2112.09045, 2021.
- Bonfiglioli, L., Toschi, M., Silvestri, D., Fioraio, N., and De Gregorio, D. The eyecandies dataset for unsupervised multimodal anomaly detection and localization. In Proceedings of the Asian Conference on Computer Vision, pp. 3586--3602, 2022.
- Cao, Y., Xu, X., and Shen, W. Complementary pseudo multimodal feature for point cloud anomaly detection. Pattern Recognition, 156:110761, 2024a.
- Cao, Y., Xu, X., Zhang, J., Cheng, Y., Huang, X., Pang, G., and Shen, W. A survey on visual anomaly detection: Challenge, approach, and prospect. arXiv preprint arXiv:2401.16402, 2024b.
- Cao, Y., Zhang, J., Frittoli, L., Cheng, Y., Shen, W., and Boracchi, G. Adaclip: Adapting clip with hybrid learnable prompts for zero-shot anomaly detection. In European Conference on Computer Vision, pp. 55--72. Springer, 2024c.
- Chen, R., Xie, G., Liu, J., Wang, J., Luo, Z., Wang, J., and Zheng, F. Easynet: An easy network for 3d industrial anomaly detection. In Proceedings of the 31st ACM International Conference on Multimedia, pp. 7038--7046, 2023a.
- Chen, X., Han, Y., and Zhang, J. April-gan: A zero-/fewshot anomaly classification and segmentation method for cvpr 2023 vand workshop challenge tracks 1&2: 1st place on zero-shot ad and 4th place on few-shot ad. arXiv preprint arXiv:2305.17382, 2023b.
- Cheng, J., Gao, C., Zhou, J., Wen, J., Dai, T., and Wang, J. Mc3d-ad: A unified geometry-aware reconstruction model for multi-category 3d anomaly detection. In Proceedings of the Thirty-Fourth International Joint Conference on Artificial Intelligence, 2025a. doi: 10.24963/ijcai.2025/94.
- Cheng, Y., Cao, Y., Xie, G., Lu, Z., and Shen, W. Toward zero-shot point cloud anomaly detection: A multiview projection framework. IEEE Transactions on Systems, Man, and Cybernetics: Systems, pp. 1--14, 2025b.
- Cheng, Y., Sun, Y., Zhang, H., Shen, W., and Cao, Y. Towards high-resolution 3d anomaly detection: A scalable dataset and real-time framework for subtle industrial defects. In Proceedings of the AAAI Conference on Artificial Intelligence, 2026.
- Chu, Y.-M., Liu, C., Hsieh, T.-I., Chen, H.-T., and Liu, T.L. Shape-guided dual-memory learning for 3d anomaly detection. In Proceedings of the 40th International Conference on Machine Learning, pp. 6185--6194, 2023.
- Dai, Z., Zeng, S., Liu, H., Li, X., Xue, F., and Zhou, Y. Seas: Few-shot industrial anomaly image generation with separation and sharing fine-tuning. In Proceedings of the IEEE/CVF International Conference on Computer Vision, pp. 23135--23144, 2025.
- Deng, Z., Liu, A., and Wang, Y. Gs-clip: Zero-shot 3d anomaly detection by geometry-aware prompt and synergistic view representation learning. arXiv preprint arXiv:2602.19206, 2026.
- Gao, B.-B. Learning to detect multi-class anomalies with just one normal image prompt. In European Conference on Computer Vision, pp. 454--470. Springer, 2024.
- Gao, B.-B., Zhou, Y., Yan, J., Cai, Y., Zhang, W., Wang, M., Liu, J., Liu, Y., Wang, L., and Wang, C. Adaptclip: Adapting clip for universal visual anomaly detection. arXiv preprint arXiv:2505.09926, 2025.
- Gu, Z., Zhu, B., Zhu, G., Chen, Y., Tang, M., and Wang, J. Anomalygpt: Detecting industrial anomalies using large vision-language models. In Proceedings of the AAAI conference on artificial intelligence, pp. 1932--1940, 2024.
- Hou, Y., Ruan, Y., Li, J., Wang, S., Qiu, J., and Xu, K. Stackclip: Clustering-driven stacked prompt in zero-shot industrial anomaly detection. ArXiv, abs/2506.23577, 2025a. URL https://api.semanticscholar. org/CorpusID:280011796.
- Hou, Y., Xu, K., Li, J., Ruan, Y., and Qiu, J. Enhancing zero-shot anomaly detection: Clip-sam collaboration with cascaded prompts. In Chinese Conference on Pattern Recognition and Computer Vision, 2025b. URL https://api.semanticscholar. org/CorpusID:274233331.
- Hou, Y., Zhou, S., Liang, K., Meng, L., Chen, X., Xu, K., Wang, S., Liu, X., and Huang, J. Soft reasoning paths for knowledge graph completion. In International Joint Conference on Artificial Intelligence, 2025c. URL https://api.semanticscholar. org/CorpusID:278339368.
- Hou, Y., Li, P., Liu, Z., Wang, Y., Ruan, Y., Qiu, J., and Xu, K. Visualad: Language-free zero-shot anomaly detection via vision transformer. 2026. URL https://api.semanticscholar. org/CorpusID:286377708.
- Huang, C., Guan, H., Jiang, A., Zhang, Y., Spratling, M., and Wang, Y.-F. Registration based few-shot anomaly detection. In European conference on computer vision, pp. 303--319. Springer, 2022.
- Huang, Z., Li, X., Liu, H., Xue, F., Wang, Y., and Zhou, Y. Anomalyncd: Towards novel anomaly class discovery in industrial scenarios. In Proceedings of the Computer Vision and Pattern Recognition Conference, pp. 47554765, 2025.
- Jeong, J., Zou, Y., Kim, T., Zhang, D., Ravichandran, A., and Dabeer, O. Winclip: Zero-/few-shot anomaly classification and segmentation. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 19606--19616, 2023.
- Li, W., Xu, X., Gu, Y., Zheng, B., Gao, S., and Wu, Y. Towards scalable 3d anomaly detection and localization: A benchmark via 3d anomaly synthesis and a self-supervised learning network. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 22207--22216, 2024.
- Li, X., Xue, F., and Zhou, Y. Musc-v2: Zero-shot multimodal industrial anomaly classification and segmentation with mutual scoring of unlabeled samples. arXiv preprint arXiv:2511.10047, 2025.
- Liang, H., Xie, G., Hou, C., Wang, B., Gao, C., and Wang, J. Look inside for more: Internal spatial modality perception for 3d anomaly detection. In Proceedings of the AAAI Conference on Artificial Intelligence, pp. 51465154, 2025a.
- Liang, H., Zhang, J., Dai, T., Shen, L., Wang, J., and Gao, C. Taming anomalies with down-up sampling networks: Group center preserving reconstruction for 3d anomaly detection. In Proceedings of the 33rd ACM International Conference on Multimedia, 2025b. doi: 10.1145/3746027. 3754492.
- Liu, J., Xie, G., Chen, R., Li, X., Wang, J., Liu, Y., Wang, C., and Zheng, F. Real3d-ad: A dataset of point cloud anomaly detection. Advances in Neural Information Processing Systems, 36:30402--30415, 2023.
- Qu, Z., Tao, X., Prasad, M., Shen, F., Zhang, Z., Gong, X., and Ding, G. Vcp-clip: A visual context prompting model for zero-shot anomaly segmentation. In European Conference on Computer Vision, pp. 301--317. Springer, 2024.
- Radford, A., Kim, J. W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I. Learning transferable visual models from natural language supervision. In Proceedings of the 38th International Conference on Machine Learning, ICML, pp. 8748--8763, 2021.
- Tao, X., Gong, X., Zhang, X., Yan, S., and Adak, C. Deep learning for unsupervised anomaly localization in industrial images: A survey. IEEE Transactions on Instrumentation and Measurement, 71:1--21, 2022a.
- Tao, X., Zhang, D., Ma, W., Hou, Z., Lu, Z., and Adak, C. Unsupervised anomaly detection for surface defects with dual-siamese network. IEEE Transactions on Industrial Informatics, 18(11):7707--7717, 2022b.
- Wang, C., Zhu, W., Gao, B.-B., Gan, Z., Zhang, J., Gu, Z., Qian, S., Chen, M., and Ma, L. Real-iad: A real-world multi-view dataset for benchmarking versatile industrial anomaly detection. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp. 22883--22892, 2024.
- Wang, Y., Peng, J., Zhang, J., Yi, R., Wang, Y., and Wang, C. Multimodal industrial anomaly detection via hybrid fusion. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 8032--8041, 2023.
- Xiang, A., Huang, Z., Gao, X., Ye, K., and Xu, C.-z. Bridgenet: A unified multimodal framework for bridging 2d and 3d industrial anomaly detection. In Proceedings of the 33rd ACM International Conference on Multimedia, 2025. doi: 10.1145/3746027.3755261.
- You, Z., Cui, L., Shen, Y., Yang, K., Lu, X., Zheng, Y., and Le, X. A unified model for multi-class anomaly detection. Advances in Neural Information Processing Systems, 35: 4571--4584, 2022.
- Zhang, R., Guo, Z., Zhang, W., Li, K., Miao, X., Cui, B., Qiao, Y., Gao, P., and Li, H. Pointclip: Point cloud understanding by clip. In Proceedings of the IEEE/CVF conference on computer vision and pattern recognition, pp. 8552--8562, 2022.
- Zheng, B., Gan, J., Xu, X., Chen, X., Li, W., Huang, X., Ni, N., and Wu, Y. Bridging 3d anomaly localization and repair via high-quality continuous geometric representation. In Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025.
- Zhou, Q., Pang, G., Tian, Y., He, S., and Chen, J. Anomalyclip: Object-agnostic prompt learning for zero-shot anomaly detection. arXiv preprint arXiv:2310.18961, 2023.
- Zhou, Q., Yan, J., He, S., Meng, W., and Chen, J. Pointad: Comprehending 3d anomalies from points and pixels for zero-shot 3d anomaly detection. Advances in Neural Information Processing Systems, 37:84866--84896, 2024a.
- Zhou, Q., He, S., Yan, J., Meng, W., and Chen, J. Pointad+: Learning hierarchical representations for zero-shot 3d anomaly detection. arXiv preprint arXiv:2509.03277, 2025.
- Zhou, Z., Wang, L., Fang, N., Wang, Z., Qiu, L., and Zhang, S. R3d-ad: Reconstruction via diffusion for 3d anomaly detection. In European conference on computer vision, pp. 91--107. Springer, 2024b.
- Zhu, X., Zhang, R., He, B., Guo, Z., Zeng, Z., Qin, Z., Zhang, S., and Gao, P. Pointclip v2: Prompting clip and gpt for powerful 3d open-world learning. In Proceedings of the IEEE/CVF international conference on computer vision, pp. 2639--2650, 2023.