基于文本提示 视觉提示的主流模型

一、 核心定调:为什么视觉提示是工业质检的最优解?

  • 文本提示的死穴 :工业缺陷(如 0.05mm 虚焊、冷焊、拉丝、阳极氧化发花)具有像素级微小纹理特征,缺乏行业图文预训练对,且人类自然语言根本无法精准描述。
  • 视觉提示的突破 :质检员在 1~5 张样本上画框(Box)或打点(Point) ,模型直接提取高维视觉特征向量(Visual Embedding)。后续产线直接做特征匹配,彻底消除语义鸿沟,实现零重训的秒级换线。

二、 核心主流模型盘点(事实核验版)

1. 视觉提示 / 双提示阵营(工业质检首选)
  • YOLOE-26(实时高吞吐王者)
    • 机制 :清华团队(YOLO-World 原班作者),SAVPE 模块解耦提取示例语义与空间激活;支持视觉提示 + 文本 + 原生 Mask 实例分割。
    • 性能 :T4 TensorRT 达 161 FPS,RTX 4090 仅需 2~4ms。
    • 注意事项 :开源协议为 AGPL-3.0(有传染风险,闭源商用需做服务化隔离)。
  • PET-DINO(精度上限与商用安全底座)
    • 机制 :Prompt-Enriched Training DINO (CVPR 2026 Highlight,腾讯优图+华中科大)。文本+视觉双提示,AFVPG 共享参数,视觉增强的同时文本能力零损失(COCO 零样本 54.0 AP)。
    • 性能:Swin-T TRT 约 30~60ms,对复杂反光背景与微小缺陷特征极其敏感。
    • 最大优势 :Apache 2.0 开源协议,商用最干净的高精度底座。
  • SAM 3(轮廓质检终局,2025.11)
    • 机制:Meta 概念级分割(Promptable Concept),支持单图示例/文本提示,直接输出全图/视频连续 Mask 并跟踪,性能与泛化远超 SegGPT/Matcher。
    • 用途:工件装配间隙测量、异形瑕疵高精度测面积与定损。
  • RF-DETR(无污染实时备选)
    • 机制 :Apache 2.0 协议的实时 DETR 检测/分割模型,是避开 YOLOE(AGPL-3.0)产权风险的首选平替。
  • 避坑警示 :
    • T-Rex / T-Rex2 :密集计数极强,但仅有商业 API,无开源权重,不可本地/边端部署。
    • MQ-Det :切断文本做纯视觉会导致性能腰斩(LVIS 34.7 AP 跌至 17.6 AP),且无开源 License,不建议工程采用。
2. 文本提示阵营(宏观与复合工位为主)
  • Florence-2(复合工位神器) :微软开源,MIT 协议 。0.23B 极小体积(边缘端 20~30ms),单模型搞定目标检测 + 细粒度 OCR 字符识别,适合铭牌读数与装配漏装一体化检查。
  • Grounding DINO :高精度语义基线。注意 1.0 开源(Apache 2.0) ,而 1.5/1.6 已转向商业闭源 API。
  • YOLO-World:纯文本驱动实时检测(AGPL-3.0),受限于 CLIP 语义先验,对工业冷门缺陷乏力。

三、 工业落地选型速查口诀

场景需求 推荐模型 核心理由
产线飞拍高速拦截(>60 FPS)+ 测缺陷面积 YOLOE-26 速度最快(T4 161 FPS),自带 Mask 分割输出
高反光精密工件 + 要求商用闭源安全 PET-DINO Apache 2.0 纯净协议,双模态无损,微瑕疵捕获精度极高
需要避开 AGPL 传染的实时备选方案 RF-DETR Apache 2.0,一键导出 TensorRT,兼顾速度与合规
字符读取 (OCR) + 零部件到位复合检测 Florence-2 MIT 协议,0.23B 极低显存,多任务统一输出
异形缺陷高精度轮廓定量测量 SAM 3 最强概念级 Mask 分割能力
换线初期(仅有良品,零缺陷样本) AnomalyDINO 1~4 张良品图建立白名单分流,解决冷启动空窗期

四、 视觉画框(Exemplar)工程落地必须解决的 3 件事

  1. 防背景污染 :缺陷 <32px<32\text{px}<32px 时,画框内 80% 是良品底纹。必须强制升级为点提示(Point Prompt)或显著性加权 Pooling,并绑定 P2 高分辨率特征层。
  2. 多原型字典(Multi-Prototype) :同类缺陷累计 ≥8\ge 8≥8 个样本时,用 K-means 聚成 2~3 个特征向量,推理时取最大余弦相似度;严禁全局统一阈值,需在验证集上按类别独立标定。
  3. 大图切片(SAHI)协同坑 :切片后当前 Tile 内可能没有示例目标,会导致局部提示缓存失效。必须在全局图上单次提取 Embedding,作为静态 Query 注入至各切片检测头,再合并坐标。
相关推荐
看浪的路人1 小时前
第6讲:敏感数据检测与脱敏
人工智能·深度学习
倔强的石头1061 小时前
ChatGLM系列解析_清华智谱大模型技术路线
人工智能·大模型
龙亘川1 小时前
数智驱动民政升级 精准守护民生保障
大数据·数据库·人工智能
IanSkunk1 小时前
长葛儿童近视防控的一个真问题:机构能做与不能做的边界,从建档到转诊的流程拆解
人工智能
码云之上1 小时前
把网页变成可引用知识——Chatbot 联网工具
人工智能·架构·agent
一木 之林2 小时前
提示词工程学习总结:用 Few-shot 把大模型调教成金融文本分类、抽取与匹配的自动化流水线
人工智能·学习·计算机视觉·金融·分类
付威20232 小时前
【pi-rust源码拆解】Agent 源码看不懂?先跟着一条消息走一遍--万字长文
人工智能
老马识码2 小时前
复杂架构的取舍:Agentic RAG、LLM Wiki 与 Multi-Agent
人工智能
Maynor9962 小时前
让 AI 编程助手学会做视频、做 PPT:Agent Skills 入门与安装全指南
人工智能·aigc·ai编程·效率工具·cursor·claude code