****论文题目:****An automatic inspection system for the detection of tire surface defects and their severity classification through a two-stage multimodal deep learning approach(基于两阶段多模式深度学习的轮胎表面缺陷自动检测及严重程度分类系统)
****期刊:****Journal of Intelligent Manufacturing
****摘要:****在轮胎制造领域,对不打折扣的产品质量的追求是基石。本文介绍了一种创新的多模式方法,旨在通过对立体光度摄像机获得的数据进行深度学习来实现轮胎质量控制过程的自动化,立体光度摄像机精心集成到专门构建的复杂轮胎采集系统中,能够全面捕获所有轮胎区域的数据。所寻找的缺陷在大小(从几毫米到几十厘米不等)和类型(包括加工过程中的异常污渍、脱模问题造成的痕迹、异物颗粒、气泡、变形等)上表现出显著的差异。我们提出的方法包括两个不同的阶段:初始实例分割阶段,用于缺陷检测和定位,随后是基于严重程度的分类阶段,将从第一阶段的检测网络中提取的特征与轮胎元数据相结合。实验验证表明,该方法达到了自动化目标,在缺陷检测和根据严重程度分类方面取得了令人满意的结果,根据轮胎区域的不同,F1得分在0.7到0.89之间。此外,这项研究提出了一种适用于所有轮胎区域的新方法,解决了该领域内的各种缺陷。
用深度学习自动检测轮胎表面缺陷:一种两阶段多模态方法
一、论文背景:为什么轮胎质检如此困难?
在轮胎制造行业,产品质量是不可妥协的底线。传统的质量控制流程依赖经验丰富的工人逐一对轮胎进行人工目视检查。这种方式不仅耗时费力、高度重复,而且极度依赖个人经验------一名检测员通常需要长达 六个月的实际上岗训练才能熟练辨别轮胎缺陷。
然而,工业 4.0 的到来使得自动化成为必然趋势。问题是:自动化轮胎质检远比想象中困难。
论文指出的核心问题
1. 缺陷视觉特征差异极大
轮胎缺陷的尺寸跨度从几毫米到几十厘米不等,类型也多种多样,包括:异常污渍、脱模痕迹、异物颗粒、气泡、变形等。不同缺陷之间的外观差异极大,而同一类缺陷在不同轮胎区域也可能呈现完全不同的视觉效果(即类内差异大、跨区差异更大)。

【论文 Fig. 6 --- 不同缺陷在不同光照条件下的视觉样本展示】
2. 传统机器视觉方法泛化能力不足
经典方法(如 SVM、手工特征提取)在受控环境下表现良好,但面对轮胎这种"每种产品花纹完全不同"的场景时,泛化能力严重不足。即便是同一缺陷家族中的两个缺陷,其外观也可能截然不同。
3. 严重性分类不能简单套用规则
检测出缺陷只是第一步,更关键的是判断其"严重程度"(是否需要返工/报废)。直接用理论规则判断严重性行不通,因为存在诸多未知因素(如缺陷深度、定性特征),而且跨工厂的泛化也是一大难题。

【论文 Fig. 2 --- 同一视觉家族(Bumps)但严重程度不同的两个缺陷示例】
4. 高分辨率图像带来的工程挑战
轮胎图像分辨率极高(垂直分辨率可达 3096 像素),在同一网络中同时完成检测与严重性分类会导致显存占用急剧上升,实际难以落地。
二、数据集:自研采集系统 + 专家标注
图像采集
论文采用立体光度测量(Stereo-photometric) 相机系统进行图像采集,而非普通线阵相机或 3D 轮廓仪。核心思路是:用同一相机视角、不同打光角度来隐式捕捉深度信息,并将不同光照模态的图像沿通道维度拼接输入网络。
每条完整的轮胎采集流程需要 11 台相机,每台配备独立嵌入式照明系统。系统能自动适应不同轮胎尺寸,通过 PLC(可编程逻辑控制器)自动调整相机位置。实际使用中,统一处理 3 个光照通道(而非 3~4 个),以便于跨区域迁移学习。

【论文 Fig. 5 --- 采集系统整体示意图 & 相机布置俯视图】
轮胎被划分为以下 6 个区域(Zone):
| 编号 | 区域名称 |
|---|---|
| 1 | 外侧胎圈(Ext Bead) |
| 2 | 外侧肩部(Ext Shoulder) |
| 3 | 外侧胎面(Ext Tread) |
| 4 | 内侧胎面(Int Tread) |
| 5 | 内侧肩部(Int Shoulder) |
| 6 | 内侧胎圈(Int Bead) |

【论文 Fig. 4 --- 轮胎区域命名示意图】
数据规模与标注
- 标注图像总数:25,450 张(其中 14,100 张为健康图像,无缺陷)
- 标注工作由工厂内专家完成,但论文坦承:由于任务极具挑战性,数据集中仍存在标注错误
共定义 10 种缺陷类型,各类型实例数量如下:
| 缺陷类型 | 实例数量 |
|---|---|
| Bumps(凸起) | 2,107 |
| Surface Roughness(表面粗糙) | 3,298 |
| Imprint(压痕) | 1,210 |
| Cut(切割痕) | 837 |
| Contrast Difference(对比度差异) | 2,086 |
| Tread Pattern Erosion(花纹侵蚀) | 70 |
| Flashes(飞边) | 3,726 |
| Smooth Dent(光滑压痕) | 214 |
严重程度原本分为 4 级,论文将其简化为**严重(severe)/ 不严重(not severe)**二分类,以缓解类别不平衡问题。
三、方法论:两阶段解耦架构
本文的核心创新在于将整个质检流程拆分为两个独立阶段,而非端到端一步完成。

【论文 Fig. 3 --- 整体方法框架图(检测 → 特征提取 → 严重性分类)】
为什么要解耦?
论文给出了五点理由:
- 贴近真实业务流程:和人工检测员"先发现缺陷,再判断严重性"的工作流程完全一致
- 降低黑盒效应:两任务合并会增加单步骤的不透明性
- 节省显存:高分辨率图像下,合并处理会导致显存暴增
- 纠正假阳性:第二阶段分类器有机会过滤掉第一阶段的误检
- 模块化训练:两阶段可分别训练,第二阶段训练时间远短于整体网络
第一阶段:实例分割(缺陷检测与定位)
骨干网络:MASK-RCNN(基于 ResNet-50 + FPN)
在标准 MASK-RCNN 基础上,论文额外引入了两个预测分支:
- Mask-IoU 分支:预测预测掩码与真值掩码之间的交并比(IoU),用于量化分割质量,从而消除那些分类置信度高但分割质量差的假阳性
- Bbox-IoU 分支:预测预测框与真值框之间的 IoU,与 Mask-IoU 分支目的相同,但作用于边界框层面
这两个 IoU 值连同分类置信度分数,共同传入第二阶段作为重要特征。

【论文 Fig. 7 --- 检测模型及特征提取模块的详细架构图】
训练策略:全局预训练 + 逐区域微调
- 从 COCO 数据集上预训练的 MASK-RCNN 权重出发
- 用所有区域图像(统一缩放至 1024×1024)进行全局训练,让网络适应立体光度图像
- 对每个区域单独进行微调,保持图像原始比例,尽可能使用最高分辨率
各区域微调使用的图像数量及尺寸如下(共 5 个区域,对应不同图像数量):

【论文 Fig. 8 --- 逐区域微调策略示意图,包含各区域图像数量】
损失函数
总损失为以下七项损失的加权和:
其中前五项来自标准 MASK-RCNN / Faster-RCNN,后两项为新增 IoU 预测分支的损失(均采用 MSE)。训练时所有权重 。
第二阶段:严重性分类(多模态深度学习)
第二阶段的输入来自第一阶段的输出,对每个检测到的缺陷实例进行严重性分类(严重 / 不严重)。
输入特征(表格数据)
从第一阶段提取的特征包括:
- 缺陷边界框的坐标(相对垂直位置 y、水平扇区编号 1~12)
- 边界框的高、宽及高宽比
- 分类分支的类别概率
- Mask IoU 和 Bbox IoU 预测值
- 缺陷掩码面积
- 轮胎元数据(产品系列、宽度、高度、直径)
基线模型(Baseline)
仅使用上述表格特征,输入 LightGBM(梯度提升树)分类器,每个区域独立训练一个模型。

【论文 Fig. 9 --- 基线模型(机器学习分类器)结构图】
提出的多模态深度学习模型
在基线之上,论文引入图像模态,构建了一个三部分融合的深度学习架构:
-
表格数据处理(MLP):对类别特征使用 Embedding 编码(维度为类别数的一半),引入 Soft Label Encoder(负类填 0.1 而非 0),再经两层 MLP 提取特征
-
图像特征提取(ResNet18 + GRU):
- 首先在区域图像上预训练一个 ResNet18 编码器,分类小 patch 的严重程度(无缺陷 / 不严重 / 严重),patch 尺寸统一为 128×128(内侧肩部为 258×258)
- 对缺陷区域按扫描顺序提取 patch 序列,送入双向 GRU(Bi-directional GRU),捕捉 patch 间的上下文关系
- 该方案独立于图像原始尺寸,可处理任意大小的缺陷区域
-
多模态融合(自注意力 + 交叉注意力):
- 两路特征各自经过多头自注意力(Self-Attention)模块,过滤无关信息(如背景干扰)
- 再经**交叉注意力(Cross-Attention)**模块实现互引导:图像特征引导表格特征的选择,表格特征也引导图像特征的聚焦
- 最终拼接两路输出送入最后一层 MLP 输出分类结果
超参数使用 Optuna 框架自动搜索,采用 Tree-structured Parzen Estimator 采样器 + HyperBandPruner,优化指标为 F1-score。

【论文 Fig. 10 --- 提出的深度学习严重性分类模型结构图】
四、实验结果
第一阶段:缺陷检测结果(IoU 阈值 = 0.1)
各区域、各缺陷类型的 F1-score 如下(X 表示该区域无此类缺陷):

【论文 Table 2 --- 各区域各缺陷类型的检测 F1-score】
几个关键观察:
- Contrast Difference 和 Surface Roughness 得分最低:因为这类缺陷形态弥散,边界模糊,连专家标注都极为困难
- Flashes 在 Int Bead 区域得分最高(0.83),Cut 在 Ext Tread 也达到 0.83
- 整体来看,检测任务本身极具挑战性,但定性结果(见 Table 4)令人满意
论文特别强调:数字指标看起来不高,但鉴于任务难度(人工检测员需要 6 个月培训期),这些结果已经相当令人满意,且检测质量足以支撑下一阶段。


【论文 Table 4 --- 各区域定性检测结果样本(含原图 vs. 预测 vs. 真值对比)】
【论文 Table 5 --- 标注困难案例示例(弥散缺陷、歧义缺陷、缺失标注)】
第二阶段:严重性分类结果
提出方法 vs. 基线(LightGBM)的 F1-score 对比:

【论文 Table 3 --- 各区域严重性分类 F1-score 对比】
| 区域 | 基线 F1 | 提出方法 F1 | 提升幅度 |
|---|---|---|---|
| EXT SHOULDER | 0.63 | 0.83 | +0.20 |
| EXT BEAD | 0.52 | 0.70 | +0.18 |
| EXT TREAD | 0.68 | 0.82 | +0.14 |
| INT SHOULDER | 0.58 | 0.89 | +0.31 |
| INT BEAD | 0.53 | 0.76 | +0.23 |
| INT TREAD | 0.64 | 0.84 | +0.20 |
提出的多模态深度学习方法相较基线,各区域平均 F1-score 提升约 21% ,最终 F1 范围为 0.70~0.89(取决于轮胎区域)。
IoU 分支的有效性验证(SHAP 分析)
为验证 Mask-IoU 和 Bbox-IoU 分支的价值,论文使用 SHAP(Shapley 加性解释)方法对 LightGBM 基线模型进行特征重要性分析(以内侧胎面区域为例)。
关键发现:
- 缺陷面积(area) 是最重要特征,正相关(面积越大越可能严重)
- 垂直位置(y) 是第二重要特征,呈现复杂非线性关系
- Bbox IoU 是第三重要特征,重要性甚至超过分类置信度分数(score)
- Mask IoU 排名第八,同样显著
这证明了两个 IoU 分支的设计是有效的,它们为第二阶段提供了重要的不确定性量化信息。

【论文 Fig. 11 --- SHAP 特征重要性分析(Top 12 特征的 SHAP 值蜂群图)】
消融实验:元数据的贡献
论文在外侧胎面区域(轮胎元数据与胎面花纹相关性最强的区域)进行了消融实验,结论是:加入轮胎尺寸元数据后,F1-score 提升约 1 个百分点 。注意力机制相比简单拼接也带来了约 1 个百分点的提升(在外侧胎面区域实测)。
五、讨论:创新点总结与局限性
三大核心创新
-
全区域统一方案:这是首篇同时处理轮胎内外所有区域的研究,提出了适用于所有轮胎区域的通用缺陷检测与严重性分类方法
-
增强 MASK-RCNN 的 IoU 预测分支:在标准网络基础上引入 Mask-IoU 和 Bbox-IoU 两个额外分支,既提升检测精度,又为下游分类器提供关键不确定性特征
-
图像 + 元数据多模态融合架构:借鉴医学影像领域(皮肤病变分类)的思路,将 ResNet18 + Bi-GRU 图像特征与结构化元数据通过交叉注意力机制融合,实现了约 21% 的平均 F1 提升
现存局限与未来方向
- 推理时间 :未经优化的情况下,每个区域推理耗时约 20 秒,仍有优化空间
- 决策粒度:当前严重性判断在边界框层面(Bbox 级),理想状态下应在整个图像或整条轮胎层面做出统一判断,以捕捉多个缺陷之间的相互关系
- 标注质量:部分标注错误仍存在,可考虑用模型输出反哺标注质量的迭代优化
- 超参数搜索成本高:架构对超参数敏感,依赖自动化搜索框架,部署复杂度较高
- 数据集未公开:受保密协议限制,数据集不对外发布
六、总结
这篇来自米其林与里昂国立应用科学学院的联合研究,将工业场景下的真实问题(轮胎质检自动化)与前沿深度学习方法(实例分割、多模态融合、注意力机制)结合得相当紧密。其最大的价值或许不在于某一具体的技术创新,而在于:将一个真实工业质检问题从头到尾系统性地走通了------从自研采集硬件、到大规模专家标注数据集,再到两阶段可部署系统。
最终,该系统在 F1-score 为 0.70~0.89 的区间内达到了轮胎缺陷检测与严重性分类的自动化目标,为轮胎制造行业的智能质检落地提供了一条可行路径。