特征级SMOTE(Feature-level SMOTE)论文分享

一、研究背景与核心思路

在实际分类任务与机器学习建模中,少数类样本稀缺带来的类别不平衡问题十分常见,同时类别重叠(Inter-class overlap)也进一步增加了分类难度。论文《Feature-level SMOTE: Augmenting fault samples in learnable feature space for imbalanced fault diagnosis of gas turbines》针对这一问题展开了深入研究。传统的合成少数类过采样技术(SMOTE)及其变体主要在原始数据空间中进行线性插值,当少数类与多数类在原始空间中高度混叠时,直接在原始空间插值容易在边界或重叠区域生成模糊甚至错误的合成样本,进而对分类器的判别带来负面干扰。

为解决原始空间插值带来的重叠加剧问题,该论文提出了将数据增强过程从原始空间迁移至可学习特征空间的思路,即特征级SMOTEFeature-level SMOTE )。该方法的核心逻辑在于先利用深度网络将复杂的原始数据映射到一个类间距离大、类内紧凑的潜在特征空间,在该空间中消除或显著减少类别之间的混叠现象,然后在已解耦且具备良好可分性的特征空间内执行少数类样本的合成操作。通过这种方式,合成样本不仅能够平衡样本数量,还能在一定程度上避免引入噪声样本。

二、技术框架与实现机制

特征级SMOTE 的整体技术框架主要由空间映射、特征级数据增强以及下游数据分类 三个连续阶段组成。在数据准备完成后,原始多维时序输入样本首先送入空间映射模块以学习具备强判别性的特征分布;然后,算法在提取出的潜在特征空间中利用少数类样本邻域执行过采样,形成特征层面的类别均衡集;最后,基于均衡特征集训练最终的分类器,用于对未知样本进行类别预测与识别。

在空间映射阶段,该方法构建了基于多头自注意力机制的深度孪生网络(DSMHSA)。网络采用共享权重的双分支结构,利用多头自注意力机制自适应捕捉输入数据的复杂动态依赖特征,同时在损失函数层面引入对比损失(Contrastive Loss)。在构建样本对时,同类样本对的标签被设定为拉近彼此距离,异类样本对的标签则在设定的边界裕度内被推远,从而驱动网络将原始数据投射到类间分离度高、类内聚类紧密的特征嵌入空间。

在特征级数据增强阶段,算法直接在训练好的孪生网络输出的低维特征向量空间中执行SMOTE操作。对于每一个少数类的特征向量,算法在其同类最近邻中随机选取参考点,并通过线段随机插值生成全新的合成特征向量,直至少数类与多数类在特征层面的样本数量达到平衡。由于此时的特征空间已基本消除了类间混叠,所生成的合成特征点能够严格保持在少数类特征的有效分布区域内,在一定程度上规避了原始空间插值越界的问题。

在数据分类阶段,由原始特征与合成特征合并构成的均衡特征集被输入至分类器(如Softmax分类器)进行参数优化与训练。由于特征级SMOTE在输入分类器前就完成了空间解耦与类别均衡,使得分类器能够在不受多数类主导和类别混叠干扰的条件下学习各类别的决策边界。作为一个通用的特征级数据增强范式,该方法为处理多维复杂信号下的高重叠、不平衡分类问题提供了一套可参考的技术实现路径。

参考文献:

Feature-level SMOTE: Augmenting Fault Samples in Learnable Feature Space for Imbalanced Fault Diagnosis of Gas Turbines. Expert Systems with Applications, 2024, 238(F): 122023.

https://www.sciencedirect.com/science/article/pii/S0957417423025253

相关推荐
仙魁XAN43 分钟前
【Codex + Deepseek】第 2 篇:什么是 vibe coding:自然语言驱动开发的真实含义
人工智能·codex·deepseek·vibe coding
xxwxx__44 分钟前
深入理解 C++ STL:stack、queue 与 deque 从使用到底层实现全解析
开发语言·c++·算法
财复视界44 分钟前
光智科技全景透视:一家被“光学元件”标签遮蔽的稀散金属材料平台
大数据·人工智能·科技
黑科技工坊1 小时前
2026年口碑载道:铝面板定制供应商优选指南
大数据·人工智能·python
ai小陈1 小时前
PyTorch实验可复现实战:随机种子、依赖锁定与配置归档
人工智能·pytorch·python·深度学习·ai·gpu算力
喜欢睡觉1 小时前
从"堵车"到"水管":一文搞懂 SSE 流式输出与大模型结构化解析
人工智能
聚铭网络1 小时前
【一周安全资讯】两项数据资产分类与登记国家标准9月1日实施;索尼、华纳联合起诉Anthropic,指控盗用版权音乐训练Claude模型
人工智能·安全·分类
自信人间三百年1 小时前
STEPONMOON的人工智能之旅(五)
人工智能
阿尔法工场研究院1 小时前
deepseek时刻到来前,洋河先重置了自己
人工智能