不同字段的特征工程

本次主要内容是:特征工程中类别字段、数值字段和日期字段的编码方法。对于类别字段,为了避免标签信息泄露,可以使用平均值来代替某个取值对应的标签。此外,还介绍了数值字段的处理方法,包括缩放和分箱。缩放是为了避免标签泄露和模型学习细枝末节规律,而分箱则是手动将数值划分为不同的区间。对于日期字段,介绍了提取离散特性和避免信息泄露的方法。此外,还强调了不同类型特征的注意事项,如数值类型特征容易出现异常值和离群点。

一、类别字段的特征工程

1.可以使用One-Hot Encoding,但维度较大时可能导致问题。

2.Label Encoding的优点是不增加原始类别的维度,缺点是编码后字段间会产生大小关系。

3.大部分情况下:对于取值空间小的类别(小于10的),使用One-Hot Encoding;取值空间大的类别(大于10的),使用Label Encoding。

4.顺序编码ordinal encode:识别字段的大小关系,需要人工进行参与,而且对字段有一定的理解,用顺序编码是比较好。

5.binary encode:与onehot差不多,但是是以二进制的形式进行编码,是onehot的一种压缩版本。

6.frequency/count encode,利用出现次数或频率来进行编码,优点是任何字段都可以使用。缺点是只有数据集分布整体比较一致的情况下才能使用。也可以单纯用来计数。

7.mean/target encode根据标签的值取平均进行编码,优点:帮助模型快速收敛。缺点:容易过拟合,和标签泄露。利用训练集的target encode作为验证集字段的编码。

二、数值字段的特征工程:信息量大,容易出现异常点和离群点,很少对它进行处理

1.数值型特征如年龄、成绩等,常见于数据集中。

2.数值型特征的处理包括取整和分箱,目的是减少取值空间的精确度,防止模型过拟合。

3.取整可以通过向下取整、向上取整或四舍五入等方式进行。

4.分箱可以将连续的数值区间划分为不同的箱子,便于模型处理。

取整:利于机器学习规则

分箱:用二值化的bins或者box来完成

三、日期字段的特征工程

1.日期型特征需要提取其离散特性,如年、月、日、星期等。

2.可以通过统计日期字段的持续时间、间隔时间、历史中位数等信息来构建特征。

3.日期字段的处理需要注意信息泄露问题,特别是在标签存在先后次序的情况下。

相关推荐
m0_493934535 分钟前
CSS如何禁止子元素浮动影响父级_设置父容器BFC属性
jvm·数据库·python
weixin_586061468 分钟前
Golang怎么安装和配置开发环境_Golang环境搭建完整教程【总结】
jvm·数据库·python
Dxy12393102169 分钟前
Python在图片上画矩形:从简单边框到复杂标注的全攻略
开发语言·python
wltx168810 分钟前
谷歌SEO+外贸版GEO优化步骤?
人工智能·python
龙腾AI白云11 分钟前
智能体如何配知识库?
人工智能·机器学习·数据挖掘
white-persist13 分钟前
【vulhub shiro 漏洞复现】vulhub shiro CVE-2016-4437 Shiro反序列化漏洞复现详细分析解释
运维·服务器·网络·python·算法·安全·web安全
m0_4939345320 分钟前
html标签怎么避免标签嵌套错误_div不能放在p内原因【详解】
jvm·数据库·python
꯭爿꯭巎꯭22 分钟前
python下载手机版(python3手机版(免费))
开发语言·python·智能手机
2301_7826591822 分钟前
Go语言goroutine调度原理_Go语言GMP调度模型教程【高效】
jvm·数据库·python
2603_9535279926 分钟前
WordPress Finale Lite 插件高危漏洞检测与利用工具 (CVE-2024-30485)
前端·python·安全·web3·xss