文章目录
- [1 课题背景](#1 课题背景)
- [2 背景理解](#2 背景理解)
-
- [2.1 近红外光谱](#2.1 近红外光谱)
- [2.2 香精香料](#2.2 香精香料)
- [3 实验样本](#3 实验样本)
- [4 光谱数据](#4 光谱数据)
- [5 实验方法](#5 实验方法)
-
- [5.1 MATLAB](#5.1 MATLAB)
- [5.2 Python](#5.2 Python)
-
- [5.2.1 一些参考教程:](#5.2.1 一些参考教程:)
1 课题背景
课题拟通过近红外光谱智能检测分析技术,对香精香料生产全流程(包括原料采购入库、预处理产品、调配模块及成品香精香料)质量进行分析和评价。通过研究香精香料光谱数据快速采集和数据预处理方法,特征光谱选择与优化方法,光谱特征提取和表示方法,深度智能学习和高可靠性建模方法,并结合多元统计过程分析方法,构建不同批次香原料一致性定性判别模型,稀释单体/过程模块/成品子类快速鉴别模型招投标原料匹配推荐模型。
2 背景理解
2.1 近红外光谱
近红外光谱(又称NIR光谱或NIRS)作为一种成熟的分析技术,已经拥有30多年的历史,是一种快速可靠地测量固体和液体化学和物理性质的方法。近红外光谱通过分析光与物质之间的相互作用产生光谱。在光谱方法中,光通常是通过波长来描述的,而非能量。近红外光谱在电磁波谱的近红外区域(波长范围为780~2500 nm)工作,也就是说,近红外光谱仪测量的是样品对近红外区域不同波长光的吸收情况。

近红外光谱是一种间接分析技术,在使用时需要先建立预测模型,我们可以测量一些已知浓度或其他参数值的样品光谱,根据这些光谱建立预测模型,然后对未知样品进行分析。近红外光谱可以分析不同类型的样品,不同类型的样品有不同的测量方法,测量方法分别有漫反射(固体样品)、透反射(不透光液体和凝胶)和透射(将样品放置在近红外光源和检测器之间,近红外光穿过样品后,未被吸收的近红外光到达检测器。这种方法适合测量透明的液体溶液或悬浮液。),目前我们的数据全部使用透射方法测量得到。

2.2 香精香料
香精香料是指专供各种制品加香矫味使用的一种添加剂,它是卷烟生产过程中施加于卷烟中不可缺少的原料,对于修饰、增补并突出优质烟叶原来的烟香风味起着极其重要的作用,并有助于形成和突出卷烟风格特征。
烟叶经过调制和自然发酵,虽然吸食品质有很大改善,但是香味或多或少存在一些缺陷。为了保持卷烟产品质量的相对稳定,在合理设计叶组配方的同时,也通过加烟用香精香料物质来克服香味缺陷,即加香也是提高产品质量的一个重要措施。烟用香精香料的选用通常是施加于卷烟中进行评吸,香精香料在卷烟燃烧前后会发生很大的变化,同时会和致香成分混合后发生相长、相消作用。卷烟加香可以补充优美的香气,赋予卷烟独特的特征香味,并能协调香味,使不同类型、不同等级烟叶香气有机组合并相互协调,掩盖或冲淡杂气。卷烟通过加香也可以增加甜河度,改善吸味,减轻烟气的刺激性,减弱一些杂气,从而改善品质。
3 烟用香精香料
3 实验样本
样品共涉及三种香精原料:罗望子浸膏(Luowangzi extract)、糖料 (Sugar material) 及 异戊酸异戊酯 (Isoamyl isovalerate)。为全面评估近红外光谱技术在样品鉴别与质量控制中的应用潜力,针对每种
材料设计了三类样本:
正品样本 (Authentic Samples): 选取了5个不同生产日期批次的合格产品,用于表征正常的批次间差异。
稀释样本 (Diluted Samples): 将正品样本用特定溶剂稀释至5个不同的浓度梯度(原样本浓度分别为 94%, 92%, 90%, 88%, 85%),用于模拟样品中有效成分含量不足的情况。
掺假样本 (Adulterated Samples): 在正品样本中掺入特定干扰物,设置5个不同的掺杂水平(正品样本含量分别为 94%, 92%, 90%, 88%, 85%),用于模拟产品被恶意掺假的情形。
具体的稀释与掺假方案如下:
罗望子浸膏: 使用纯净水 (Purified water) 进行稀释,使用其他品牌的同类产品 进行掺假。
糖料: 使用纯净水进行稀释,使用其他种类的糖料进行掺假。
异戊酸异戊酯: 使用丙二醇 (Propylene glycol) 进行稀释,使用异戊酸苄酯 (Benzyl isovalerate) 进行掺假。
综上,本研究共有 (5个正品 + 5个稀释 + 5个掺假) × 3种材料 = 45份独立样本。

4 光谱数据
采用赛默飞 (Thermo Fisher Scientific) 近红外光谱仪对上述45份样本进行光谱扫描。光谱采集说明如下:
- 光谱范围 (Spectral Range): 10000 ~ 4000 cm −1。
- 重复测量 (Replicates): 为保证数据的可靠性与代表性,对每份独立样本进行3次重复测量。最终,共获得 135个近红外光谱 (45份样本 × 3次重复)。
- 得到的光谱数据有spa格式与csv格式。
为便于数据管理与溯源,文件采用以下统一规则进行命名:
sp 样品类型-样品状态-批次或浓度-重复编号.spa
sp 样品类型-样品状态-批次或浓度-重复编号.csv
命名示例:
- sp 罗望子浸膏-合格-20240111-1.csv: 表示罗望子浸膏的正品样本,日期批次为20240111的第1次重复测量光谱。
- sp 糖料-稀释-85%-2.csv: 表示糖料的稀释样本,原样本浓度为85%的第2次重复测量光谱。
- sp 异戊酸异戊酯-掺假-90%-3.csv: 表示异戊酸异戊酯的掺假样本,原样本含量为90%的第3次重复测量光谱。


在csv格式的数据中,第一列为波长 (Wavelength),第二列为吸光度 (Absorbance):

5 实验方法
实验方法按步骤依次有原始数据整理、数据预处理、特征提取与选择、模型构建与评价。在具体的实验中,一般通过 MATLAB 或 Python 进行实现。

具体实验方法可参考硕士学位论文《基于高光谱成像技术的牛奶蛋白质含量检测研究》中第二部分的 相关理论和方法。
5.1 MATLAB
MATLAB(Matrix Laboratory,矩阵实验室)是由美国The MathWorks公司出品的商业数学软件。MATLAB是一种用于算法开发、数据可视化、数据分析以及数值计算的高级技术计算语言和交互式环境。
5 MATLAB安装参考教程:MATLAB R2023b安装教程及下载
5.2 Python
Python 是一种功能强大且易于上手的解释型高级编程语言。它开源自由,拥有庞大的标准库和活跃的社区生态,特别是在机器学习和深度学习等领域,Python 提供了诸如 TensorFlow、PyTorch 等成熟框架,成为主流的数据科学开发语言。
项目主要方向是使用深度学习解决相关问题,MATLAB不开源且进行深度学习时没有Python方便,所以项目建议主要使用Python。(使用Python进行的实验尚未完善,完成后会分享给大家)
5.2.1 一些参考教程:
安装Anaconda
Q:为什么要安装Anaconda?
A:
安装NVIDIA、CUDA、CUDNN、PyTorch
Q:为什么要安装NVIDIA、CUDA、CUDNN、PyTorch?
A:让我们的GPU参与加速深度学习模型训练/推理,在深度学习任务中,比如图像识别、NLP、语音识别等,模型往往包含上百万甚至上亿参数,训练过程非常耗时。GPU(图形处理器)可以通过并行计算大大加速这些任务,而不是完全依赖 CPU。但要让程序正常调用 GPU,需要安装一系列"驱动"和"接口库"------这就是 NVIDIA 驱动、CUDA、cuDNN 的作用。
9 NVIDIA、CUDA、CUDNN、PyTorch安装吐血整理!!!
10 GPU版本pytorch的安装,配套环境python、Cuda、Anaconda安装和版本选择,及常见问题调用gpu返回false
每个教程的侧重点不同,学习时可以对照参考