数据挖掘13

数据挖掘13--特征子集选择

一、为什么要选择特征?而不是用全部的特征?

1.去除冗余和噪声特征

有些特征之间高度相关(冗余),或者与目标完全无关(噪声)。保留它们不仅无益,反而有害。

例如:同时包含"年龄"和"出生年份"是冗余的。

2.减少过拟合

过多的无关或冗余特征会增加模型复杂度,使模型"记住"训练数据中的噪声,从而在新数据上泛化能力变差。

3.训练更快

特征越少,模型训练所需的时间和内存就越少。

4.增强模型可解释性

特征越少,越容易理解模型是如何做出决策的。

二、特征子集选择(Feature Subset Selection)

1.性质

(1)不生成新的特征,仅在原始特征构成的集合中选择部分特征构成子集

不同于主成分分析,主成分分析会对原始特征组合生成新的特征

(2)不改变特征的物理含义

比如"年龄"还是"年龄",不会变成"标准化后的年龄"或"年龄平方"。

特征的原始意义保持不变,容易理解和解释。

(3)与数据挖掘任务相关------相关特征包含对当前数据挖掘任务有用的信息

举个例子:如果你要预测一个人是否会贷款违约,那么"信用记录"很重要,"头发颜色"就不重要。

所以特征子集选择会优先保留那些和任务目标相关的特征。

相关推荐
aircrushin11 小时前
从春晚看分布式实时协同算法与灵巧手工程实现
人工智能·机器人
恋猫de小郭11 小时前
Apple 的 ANE 被挖掘,AI 硬件公开,宣传的 38 TOPS 居然是"数字游戏"?
前端·人工智能·ios
银河系搭车客指南12 小时前
AI Agent 的失忆症:我是怎么给它装上"第二个大脑"的
人工智能
张拭心12 小时前
春节后,有些公司明确要求 AI 经验了
android·前端·人工智能
我的username12 小时前
极致简单的openclaw安装教程
人工智能
小锋java123412 小时前
【技术专题】嵌入模型与Chroma向量数据库 - Chroma 集合操作
人工智能
七月丶12 小时前
别再手动凑 PR 了:这个 AI Skill 会按仓库习惯自动建分支、拆提交、提 PR
人工智能·设计模式·程序员
用户51914958484513 小时前
CVE-2024-10793 WordPress插件权限提升漏洞利用演示
人工智能·aigc
chaors13 小时前
从零学RAG0x01之向量化
人工智能·aigc·ai编程
chaors13 小时前
从零学RAG0x02向量数据库
人工智能·aigc·ai编程