基于主成分分析与两级分层支持向量机框架的烘焙咖啡掺假物高光谱成像检测

**英文标题:**A two-stage hierarchical support vector machine framework detects roasted coffee adulterants through principal component analysis of hyperspectral imaging data

**研究单位:**埃及开罗军事技术学院

摘要:

烘焙咖啡存在经济利益驱动型掺假(EMA)问题,严重损害全球市场秩序与消费者安全,典型掺假手段是隐秘混入大麦、大豆等高致敏原料。烘焙过程会发生美拉德热反应,使掺假物与咖啡基质在视觉、光谱特征上高度趋同,给掺假检测带来巨大技术壁垒。针对这一司法鉴定空白,本文提出一套融合高光谱成像(400--1000 nm)的两级分层支持向量机(SVM)识别框架,实现掺假筛查与具体生物种类精准分类解耦。

本研究核心创新为采用主成分分析(PCA)消解 128 波段高光谱立方体的光谱冗余;仅保留前两个主成分即可覆盖 92% 以上总方差,搭建 "光谱 - 化学关联桥梁",提取传统 RGB 相机无法捕捉的隐性色度、生化差异特征。该高显著性特征空间能够克服无监督聚类算法普遍存在的 "欧氏距离陷阱",解决烘焙物料分类中频发的类别坍缩问题。

实验结果表明,分层模型总体分类精度达 88.6%,科恩卡帕系数 0.378;一级二元筛查模型 F1 分数高达 0.922,可精准保护纯咖啡样本不被误判;二级多分类模型能够像素级定位高度隐蔽的致敏掺假物空间分布。本研究实现像素级自动化掺假风险评估,为智能食品安全体系提供数据支撑,验证该方法在工业品质管控领域食品司法鉴定的应用潜力。

图1本研究用于对比分析的实验物料,包含纯阿拉比卡咖啡以及三种生物掺假物:烘焙大麦、烘焙海枣籽、烘焙大豆

图2高光谱图像采集系统原理图。整套装置搭载推扫式 SOC710 高光谱成像仪,相机垂直样品天底 0° 架设,配备施耐德 Xenoplan 35 mm F/1.9 镜头以实现高空间分辨率;Derungs 20 P SX 宽光谱光源呈 45° 斜向入射采集漫反射信号。图中剖视展示内部光学组件:入射光先经过狭缝与准直光学元件,透射式衍射光栅将光色散后投射至 CCD 传感器,整套设备生成覆盖可见光 - 近红外(400--1000 nm)、高精度连续空谱数据立方体。

图3用于模拟咖啡经济利益驱动掺假场景 S0--S3 的高光谱真彩色 RGB 成像图。S0 场景为 100% 纯阿拉比卡咖啡,S1--S3 场景在咖啡基质中划分独立区域分别混入烘焙大麦、海枣籽、大豆;所有物料均经烘焙、研磨、过筛统一粒径,平铺哑光无反光托盘,最大程度消除颗粒形态与背景干扰

图4 在第 60 波段的大麦样本高光谱数据立方体上交互式选取 5 块互不重叠、尺寸为 40×40 像素的感兴趣区域(ROI),选取效果示意。

图5通过交互式多边形标注生成 S0--S3 场景高精度真值标注图,彩色叠加图层为用于像素级模型性能验证的标准真实区域

图6 咖啡掺假司法鉴定对比计算框架流程图。第一阶段(预处理):原始漫反射高光谱立方体经(SG)平滑、标准正态变量(SNV)散射校正处理,最大化光谱信号保真度。第二阶段(对比分类):分两条技术路线对比测试:左侧无监督基线:分别采用 K=2 二元聚类、K=4 多聚类的 K-Means 算法,评估光谱自然可分性;右侧本文提出分层系统:面向司法鉴定的两级 SVM 框架,一级快速二元筛查区分咖啡 / 非咖啡异常像素,二级完成多分类精准判别大麦、大豆、海枣三类生物掺假物。

图 7 烘焙咖啡与掺假物光谱方差碎石图,柱状图为各主成分单独方差占比,折线为累积解释方差占比

图8 主成分载荷曲线图,展示前两个主成分下各波长的贡献;美拉德热变色标记对应可见光区间方差,生化特征标记对应近红外区间方差。

表2烘焙咖啡及掺假样品前两个主成分主要光谱方差信息汇总表

图9 主成分得分散点图:PC1-PC2 二维特征空间下各类样本分离效果(每类随机抽取 2000 个感兴趣区训练像素),星号为各类聚类中心;簇间部分重叠说明烘焙带来光谱趋同,需采用高级机器学习算法实现区分

图10 标准光谱库与反射光谱对比分析。上图:纯阿拉比卡咖啡与大麦、海枣籽、大豆三类掺假物在 400--1000 nm 可见光 - 近红外区间的平均叠加光谱;下图:各类物料独立光谱曲线。可见光区间光谱高度重叠直观体现 "美拉德光谱趋同" 现象。

图11 S1 大麦、S2 海枣籽、S3 大豆混合场景一级二元筛查(咖啡 / 非咖啡)可视化对比。左列:真彩色 RGB 参考图;中间:二元 SVM 分类图,黑色区域为完整连续掺假区域;右列:K=2 K-Means 聚类结果,存在大量椒盐噪点、区域边界破碎。

图12 S1、S2、S3 场景二级多分类司法鉴定结果对比。左:样品真彩色参考图;中间:两级 SVM 多分类图(红 = 大麦,橙 = 海枣籽,绿 = 大豆,蓝 = 咖啡);右:K=4 K-Means 基线模型,存在严重类别坍缩,无法识别海枣籽类别。

表3 S0--S3 全部独立测试场景下两级分层 SVM 与 K-Means 基线模型像素级平均评价指标表;A 部分为一级二元筛查(咖啡 / 非咖啡)性能,B 部分为完整五类宏平均指标

图13 SVM 与 K-Means 模型像素级评价指标对比柱状图,包含全部实验场景总体精度、宏召回率、单类平均召回率、单类 F1 分数

图14 整合全部独立测试场景 S0--S3 的两级 SVM 像素级混淆矩阵。(a) 原始像素计数混淆矩阵;(b) 行归一化召回率混淆矩阵

图15 整合全部独立测试场景 S0--S3 的 K-Means 基线模型像素级混淆矩阵。(a) 原始像素计数混淆矩阵;(b) 行归一化召回混淆矩阵,海枣籽样本召回率为 0

表4 由分层 SVM 与 K-Means 基线模型行归一化混淆矩阵得到的各类召回率汇总表

图16整合全部独立测试场景,两级 SVM 框架一对多 ROC 曲线,并标注每类物料对应曲线下面积 AUC 值。

表5 由分层 SVM 与 K-Means 基线模型行归一化混淆矩阵得到的各类召回率汇总表

图17 咖啡混合大麦独立盲样测试图。(a) 俯视真彩色实物照片;(b) 二级 SVM 多分类图,红色区域为咖啡基质(蓝色)中分布的大麦掺假物。

图17多掺假物综合盲样测试图。(a) 包含烘焙咖啡、大麦、大豆、海枣籽的真彩色实物图;(b) 两级 SVM 分类图,通过不同颜色同步区分四类物料

研究结论:

本研究针对烘焙咖啡美拉德反应引发光谱趋同、掺假物难以司法鉴定难题,本文融合漫反射高光谱成像与两级分层 SVM 框架,实现无损像素级多掺假物同步检测,核心结论如下:

  1. 主成分分析仅保留前两个主成分即可覆盖 92.1% 光谱信息,分离可见光美拉德色素、近红外生化两类独立特征,破解 128 波段高光谱维数灾难;

  2. 两级分层 SVM 总体分类精度 88.6%,一级二元筛选咖啡 F1 分数 0.922,最大程度避免合格咖啡误拦截,适配工业高通量初筛;二级模型可同步区分大麦(麸质致敏)、大豆(食物过敏)、海枣籽(无害填充剂);

  3. 无监督 K-Means 依赖欧氏光谱距离,存在严重类别坍缩,完全无法识别海枣掺假物;有监督 SVM 依靠 RBF 核构建非线性边界,克服烘焙粉末光谱高度重叠难题;

  4. 整套框架实现 "先筛查异常、再精准定性" 的工业分级质控逻辑,为智能食品无损检测、食品掺假司法鉴定提供完整可行方案,后续将开展产线在线设备开发与多批次规模化样品验证。

原文链接:https://doi.org/10.1038/s41598-026-60975-z

相关推荐
Luhui Dev2 小时前
如何在 WorkBuddy 中使用大角几何:从 MCP 接入到 AI 几何作图
人工智能·数学·算法·agent·luhuidev
Smilecoc2 小时前
决策树(五):决策树回归
算法·决策树·回归
小龙报2 小时前
【优选算法】1.搜索插入位置 2.x的平方根
java·c语言·数据结构·c++·python·算法·蓝桥杯
The moon forgets2 小时前
Qwen团队提出Ego2Robot, 第一人称视频助力具身VLA训练新数据
人工智能·机器学习·音视频
Hi李耶2 小时前
【LeetCode】15.三数之和
java·算法·leetcode
rannn_1113 小时前
【力扣hot100】链表专题|21、2、19、24、92、25
java·数据结构·算法·leetcode·链表·开发
SNAKEpc121383 小时前
OpenGL(十五)- 着色器语言GLSL
c语言·c++·线性代数·算法·矩阵·图形渲染·着色器
AI服务老曹3 小时前
AI视频分析API完整流程:设备、算法与告警接口接入指南
人工智能·算法·音视频
鹿角片ljp3 小时前
LeetCode 21. 合并两个有序链表
算法·leetcode·链表
watersink4 小时前
机器学习LDA
人工智能·机器学习