一、 核心定调:为什么视觉提示是工业质检的最优解?
- 文本提示的死穴 :工业缺陷(如 0.05mm 虚焊、冷焊、拉丝、阳极氧化发花)具有像素级微小纹理特征,缺乏行业图文预训练对,且人类自然语言根本无法精准描述。
- 视觉提示的突破 :质检员在 1~5 张样本上画框(Box)或打点(Point) ,模型直接提取高维视觉特征向量(Visual Embedding)。后续产线直接做特征匹配,彻底消除语义鸿沟,实现零重训的秒级换线。
二、 核心主流模型盘点(事实核验版)
1. 视觉提示 / 双提示阵营(工业质检首选)
- YOLOE-26(实时高吞吐王者)
- 机制 :清华团队(YOLO-World 原班作者),SAVPE 模块解耦提取示例语义与空间激活;支持视觉提示 + 文本 + 原生 Mask 实例分割。
- 性能 :T4 TensorRT 达 161 FPS,RTX 4090 仅需 2~4ms。
- 注意事项 :开源协议为 AGPL-3.0(有传染风险,闭源商用需做服务化隔离)。
- PET-DINO(精度上限与商用安全底座)
- 机制 :Prompt-Enriched Training DINO (CVPR 2026 Highlight,腾讯优图+华中科大)。文本+视觉双提示,AFVPG 共享参数,视觉增强的同时文本能力零损失(COCO 零样本 54.0 AP)。
- 性能:Swin-T TRT 约 30~60ms,对复杂反光背景与微小缺陷特征极其敏感。
- 最大优势 :Apache 2.0 开源协议,商用最干净的高精度底座。
- SAM 3(轮廓质检终局,2025.11)
- 机制:Meta 概念级分割(Promptable Concept),支持单图示例/文本提示,直接输出全图/视频连续 Mask 并跟踪,性能与泛化远超 SegGPT/Matcher。
- 用途:工件装配间隙测量、异形瑕疵高精度测面积与定损。
- RF-DETR(无污染实时备选)
- 机制 :Apache 2.0 协议的实时 DETR 检测/分割模型,是避开 YOLOE(AGPL-3.0)产权风险的首选平替。
- 避坑警示 :
- T-Rex / T-Rex2 :密集计数极强,但仅有商业 API,无开源权重,不可本地/边端部署。
- MQ-Det :切断文本做纯视觉会导致性能腰斩(LVIS 34.7 AP 跌至 17.6 AP),且无开源 License,不建议工程采用。
2. 文本提示阵营(宏观与复合工位为主)
- Florence-2(复合工位神器) :微软开源,MIT 协议 。0.23B 极小体积(边缘端 20~30ms),单模型搞定目标检测 + 细粒度 OCR 字符识别,适合铭牌读数与装配漏装一体化检查。
- Grounding DINO :高精度语义基线。注意 1.0 开源(Apache 2.0) ,而 1.5/1.6 已转向商业闭源 API。
- YOLO-World:纯文本驱动实时检测(AGPL-3.0),受限于 CLIP 语义先验,对工业冷门缺陷乏力。
三、 工业落地选型速查口诀
| 场景需求 | 推荐模型 | 核心理由 |
|---|---|---|
| 产线飞拍高速拦截(>60 FPS)+ 测缺陷面积 | YOLOE-26 | 速度最快(T4 161 FPS),自带 Mask 分割输出 |
| 高反光精密工件 + 要求商用闭源安全 | PET-DINO | Apache 2.0 纯净协议,双模态无损,微瑕疵捕获精度极高 |
| 需要避开 AGPL 传染的实时备选方案 | RF-DETR | Apache 2.0,一键导出 TensorRT,兼顾速度与合规 |
| 字符读取 (OCR) + 零部件到位复合检测 | Florence-2 | MIT 协议,0.23B 极低显存,多任务统一输出 |
| 异形缺陷高精度轮廓定量测量 | SAM 3 | 最强概念级 Mask 分割能力 |
| 换线初期(仅有良品,零缺陷样本) | AnomalyDINO | 1~4 张良品图建立白名单分流,解决冷启动空窗期 |
四、 视觉画框(Exemplar)工程落地必须解决的 3 件事
- 防背景污染 :缺陷 <32px<32\text{px}<32px 时,画框内 80% 是良品底纹。必须强制升级为点提示(Point Prompt)或显著性加权 Pooling,并绑定 P2 高分辨率特征层。
- 多原型字典(Multi-Prototype) :同类缺陷累计 ≥8\ge 8≥8 个样本时,用 K-means 聚成 2~3 个特征向量,推理时取最大余弦相似度;严禁全局统一阈值,需在验证集上按类别独立标定。
- 大图切片(SAHI)协同坑 :切片后当前 Tile 内可能没有示例目标,会导致局部提示缓存失效。必须在全局图上单次提取 Embedding,作为静态 Query 注入至各切片检测头,再合并坐标。