双模型引擎协同:基于 YOLO + 多模态 VLM 的目标检测、语义理解与 SOP 合规分析复合工业场景实践与应用

通过网盘分享的文件:iNeuOS_Vision

链接: https://pan.baidu.com/s/19GrUoWXnG2fnNhesNDJ5Qg?pwd=unmy 提取码: unmy

新版本还没有发布,如果有需要,请联系文章后面的联系方式

一、 概述

iNeuOS_Vision 是以YOLO 目标检测多模态VLM模型语义理解为双引擎的工业视觉智能分析平台。

正向数据流 ,样本源分别进入 YOLO(实时检测)和 VLM(画面语义理解),输出支撑实时识别、SOP 操作分析和智能巡检;摄像头视频源统一接入,各业务结果汇总至告警管理,形成"视频接入→双模型推理→业务分析→统一告警"的完整链路。

反向数据流 ,告警记录回流为样本数据,反哺 YOLO 标注与 VLM 训练,实现"应用产出数据、数据反哺模型 "的自我进化闭环。框架如下图:

**  根据框架图,有一个核心问题** :不管是YOLO目标识别和VLM语义理解的结果已经形成告警记录,并且保存到告警管理中,那么为什么还要把告警数据(图像+文本)从告警管理中导出到样本标注(YOLO)和 VLM 数据集?

**  用一句话来回答: 告警管理中沉淀了误报、漏报、边界复杂场景样本,将告警数据(图像 + 文本)导出回流至样本标注与 VLM 数据集,用来持续迭代优化 YOLO 目标检测与 VLM 语义理解能力,形成 AI 视觉系统的自迭代闭环。几种情况:**

**  (1)** 误报:YOLO模型受场景干扰导致假告警,VLM模型语义理解正常生产环境有风险,例如生产环境杂乱造成的假告警。

**  (2)** 漏报:YOLO模型的老样本库没有的新工况、新违规动作。但是VLM模型可以不依赖YOLO模型识别结果,语义理解有风险,形成告警记录。

**  (3)** 复杂现场环境:介于合规和不合规之间,YOLO模型和VLM模型语义理解不一致的情况。

案例1:车辆距离过近。没有YOLO识别结果,通过VLM模型语义理解分析结果:

|------------------------------------------------------------------------------------------------------------------------------------------|
| 符合场景识别:是, 场景识别要求:无, 模型语义理解:图像为车间监控画面,中央通道内一辆叉车 / 托盘搬运车与一个深色带轮的升降搬运工装首尾贴靠、间距过小,一名戴帽工人站在车旁操作,另一人员部分可见,处于两车夹近区域,存在车辆间及人机间距不足的安全风险,值得关注。 |

案例2:人员在两个物体之间。没有YOLO识别结果,通过VLM模型语义理解分析结果:

|------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------|
| 符合场景识别:是, 场景识别要求:无, 模型语义理解:图像为造纸/卷材车间监控画面,一名戴白色安全帽、穿浅色上衣和深色长裤的工人正站在两卷大型纸卷之间进行作业,两侧纸卷均为重物,若发生位移、倾倒或滚动,工人处于狭窄间隙内无避让空间,存在被挤压、夹伤的严重安全风险;且画面同区域停有叉车进行物料转运,若叉车或输送线动作,人机交叉风险进一步叠加。该站位属典型卷材堆场 "夹持/挤压" 危险区域,应提示人员撤离或采取卷材固定、防倾倒措施,并加装隔离与限位防护。其余未见明火、烟雾、泄漏等异常,本次风险集中于人员处于两卷之间的站位问题。 |

二、 应用场景

该应用模式,相当于给人眼所能观察到的各类现场场景,装上一双"YOLO+VLM 协同的智能眼睛":可接入摄像头、电脑桌面、应用程序视频流等各类视频源,完成实时目标识别、全图语义理解与风险场景预警。

(1)实时识别场景:YOLO 对摄像头视频源进行毫秒级检测,实现了19个模型和85个应用场景的识别。

(2)SOP 操作分析场景:双引擎联动校验作业流程,YOLO 识别操作对象与步骤要素,VLM 判断画面语义合规性,核查是否按标准程序执行。

(3)智能巡检场景:用户以自然语言输入指令,VLM 按指令对多路视频进行语义筛查,实现"对话式巡检监控"。

(4)告警闭环与自进化:所有场景告警统一汇聚,经人工确认修正后,既完成处置,又自动转化为 YOLO 样本标注数据和 VLM 训练数据,反哺模型,推动识别与理解能力迭代提升。

三、 特点与创新

当前市场已有"小检测模型 + VLM 大模型"协同的视频检测和分析产品,都集中在硬件摄像头品牌厂家;但同时具备"**YOLO目标检测、VLM与YOLO检测结果联动及定时独立巡检、告警驱动完成YOLO样本及VLM数据集迭代闭环"**这三项完整能力的标准化商用产品较少,大多需要项目定制开发。

(1)双引擎差异化协同 :YOLO 负责目标检测(有无、类别),VLM 负责语义理解(场景、事件、合规),实现从**"识别"到"理解"**的升级。

(2)YOLO 链路内部反馈:训练与样本测试、追踪测试形成双向互促机制,持续迭代优化检测效果。

(3)VLM 模型链路双重驱动:基础模型与参数调优共同支撑训练,通过指令和提示词驱动视频的实时目标检测、SOP操作分析和智能巡检,将自然语言能力融入视频场景。

(4)样本闭环回流:告警记录转化为YOLO新样本和VLM数据集,沉淀为数据集并重新训练模型,打通业务告警到模型优化的"最后一公里"。

(5)告警来源可追溯:区分告警由 YOLO 检出或 VLM实时和定时语义理解告警,为跨模型联合分析和质量评估提供数据基础。

四、 系统总览

汇总整个视觉分析平台的核心运行统计数据,包括样本管理、训练管理、视觉分析、告警管理、VLM模型管理和本机核心参数等。如下图:

五、 YOLO目标检测应用

详细应用手册在上面网盘下载

本案例对车间的342样本数据标注了336个,标注的类别只有人员(person)、叉车(forklift)、lifting_platform(升降起重车)。如下图:

实际识别检测结果,如下图:

六、 VLM大模型应用

6.1 配置默认VLM模型

系统设置->VLM模型设置->设置默认模型,这是系统初始应用的模型,如下图:

6.2 VLM模型在智能巡检应用

智能巡检可以使用配置的默认VLM模型对视频布局显示的摄像头画面按巡检指令进行巡检,当前画面与巡检指令匹配的情况,保存信息到告警管理中,参见章节:配置摄像头的VLM模型信息和告警。智能巡检如下图:

6.3 VLM模型在摄像头实时分析和SOP分析应用

**实时识别分析** **SOP** **操作分析**中编辑摄像头,配置"VLM语义理解"、"定时周期"、"VLM场描述", "VLM语义理解"的"识别检出"方式就是在YOLO有检测结果才进行VLM模型语义理解,"定时获取"就是不考虑YOLO检测结果,按定时周期进行VLM场景描述进行语义理解,符合场景描述结果则把当前数据保存到告警管理中。如下图:

"告警管理"显示VLM模型的语义理解结果,如下图:

在"告警管理"可以批量和单条对告警记录的图像信息进行VLM语义理解,如下图:

6.4 形成新YOLO模型样本和VLM模型数据集

VLM模型数据集创建数据集,如下图:

告警管理中选择"导出到VLM模型数据集",也可以"导出到样本标注"进行YOLO模型重新标注和训练。如下图:

6.5 VLM数据集图像样本管理

VLM模型数据集中"图像样本"可以对数据集的图像样本进行管理,如下图:

编辑图像样本描述,本来符合场景识别为:是,但是现场确实没有危险点,修改为:否。如下图:

图像样本标注完成,3个人工上传的,均为人工行为有危险的情况;3个是YOLO检测出来有叉车的,但是没有风险。如下图:

6.6 VLM模型训练

VLM模型训练功能,单击「创建 VLM 训练任务」,用于配置并新建一个 VLM 训练任务,分为四组配置项:

(1)基本信息:任务名称、模型名称、任务描述、基础模型(含下拉选择);

(2)训练参数:训练轮数、批次大小、学习率、梯度累积步数、学习率预热、序列最大长度、LoRA 秩、LoRA 缩放系数,各项均带说明标识;

(3)**硬件配置:**设备类型(GPU)、GPU 显存限制(MB,-1 表示自动),并提供「获取 GPU 信息」「验证配置」「自动确保 GPU」三个操作按钮,下方实时显示 GPU 识别结果;

(4)**VLM 模型数据集:**支持勾选要用于训练的数据集。如下图:

创建好训练任务后,单击"开始训练",训练完成及添加新图像数据后可以"重新训练",如下图:

可以"查看日志",训练完成,如下图:

6.7 配置训练完成的VLM模型

系统设置中在"可选模型"的"系统内部"添加刚训练好的模型,如下图:

在"VLM模型设置"中设置默认模型,如下图:

形成VLM模型应用的闭环。

6.8 应用训练后的VLM模型效果

显示应用训练后的VLM模型起到效果了,新VLM模型分析的结果提示:人员与设备间的风险。如下图:

为什么会是这样,因为我的训练数据集中和实时识别分析提词其中有这一项,也提供了相应的图像样本。部分提示词如下图:

当然,这只是2B的VLM模型,在参数和推理方面能力有限,所以要求高的场景、复杂的场景,不仅需要高质量的数据集,同时也要选择一款好的VLM模型。


参考文章

(1)硬件网关:https://mp.weixin.qq.com/s/iKMqn62YIhBlXjGtY2wKXQ

(2)物联网(IOT):https://mp.weixin.qq.com/s/5u4L8fItaFpIbVYOlxbmGg

(3)视觉分析(Vision):https://mp.weixin.qq.com/s/SiiuXTTGplTAERRYyCmGCQ

(4)大模型智库(AiMind):https://mp.weixin.qq.com/s/SH_q2k_zbQ-pcd05zj86-g

(5)大模型智能问数(AiInsight): https://mp.weixin.qq.com/s/A1fIQq_w9c8SW9aEWVIsgw

(6)小i助手:https://mp.weixin.qq.com/s/5UCoYsDAbfFP-ZI2sj_QBg

(7)视觉模型:https://mp.weixin.qq.com/s/Gq74ITDfEwK88jt8b--1PA


物联网&大数据技术 QQ群:54256083

物联网&大数据项目 QQ群:727664080

QQ:504547114