数据挖掘13

数据挖掘13--特征子集选择

一、为什么要选择特征?而不是用全部的特征?

1.去除冗余和噪声特征

有些特征之间高度相关(冗余),或者与目标完全无关(噪声)。保留它们不仅无益,反而有害。

例如:同时包含"年龄"和"出生年份"是冗余的。

2.减少过拟合

过多的无关或冗余特征会增加模型复杂度,使模型"记住"训练数据中的噪声,从而在新数据上泛化能力变差。

3.训练更快

特征越少,模型训练所需的时间和内存就越少。

4.增强模型可解释性

特征越少,越容易理解模型是如何做出决策的。

二、特征子集选择(Feature Subset Selection)

1.性质

(1)不生成新的特征,仅在原始特征构成的集合中选择部分特征构成子集

不同于主成分分析,主成分分析会对原始特征组合生成新的特征

(2)不改变特征的物理含义

比如"年龄"还是"年龄",不会变成"标准化后的年龄"或"年龄平方"。

特征的原始意义保持不变,容易理解和解释。

(3)与数据挖掘任务相关------相关特征包含对当前数据挖掘任务有用的信息

举个例子:如果你要预测一个人是否会贷款违约,那么"信用记录"很重要,"头发颜色"就不重要。

所以特征子集选择会优先保留那些和任务目标相关的特征。

相关推荐
怦怦蓝1 分钟前
给AI装上“眼睛”:一文讲透视觉语言模型(VLM)
人工智能·语言模型·自然语言处理·vlm
(轻舟已过万重山)2 分钟前
B2 · RAG 实战——检索卫生决定 80% 效果
人工智能·ai
YH行业报告分析5 分钟前
2026台式RFID和条码打印机行业分析:双模识别技术如何驱动工业标识升级?
数据挖掘
月光船幽幽6 分钟前
昆仑流形多模态融合新架构
人工智能·python
西柚研究生1234561 小时前
论文分析15:跨层特征交互的多尺度无人机小目标检测算法
人工智能·算法·目标检测
fthux7 小时前
装闭 RenoPit 源码解析(07):装修闭坑知识库与AI Prompt构建
人工智能·ai·开源·github·open source·renopit
zyplayer-doc8 小时前
VuePress类静态文档站和动态知识库怎么选:两种技术路线的适用场景
javascript·人工智能·后端·安全·智能手机
KKKlucifer9 小时前
拨开接口黑盒迷雾:运营商第三方合作接口安全审计与准入管控落地实践
网络·人工智能·安全
WangYan20229 小时前
基于XGBoost与AI的生态—地学多源数据建模:植被与土地利用识别、土壤碳氮空间预测、生物多样性驱动机制、土壤微生物功能预测、生态退化与风险识别
python·机器学习·xgboost
梦梦代码精9 小时前
连锁品牌数字化:从门店扩张到用户资产运营的技术底座
大数据·人工智能·低代码·docker·开源·代码规范