机器学习-离散型变量处理

离散型变量处理思路

离散型变量输入通常为字符串形式,除了少数决策树模型能够直接处理类别型变量之外,对于逻辑回归、支持向量机等模型而言,必须将类别型变量转换为数值型变量才能正确的工作。

1.Ordinary Encoding(Label Encoding)

自然编码,按照类别出现的自然顺序进行编码,通常用于处理类别之间存在大小关系的数据。

编码顺序会按照大小关系对类别型特征赋予自己的数值ID,但是同时保留了大小关系。

2.One-hot Encoding

独热编码,将N个特征编码为N维的稀疏向量,有效解决了自然编码存在大小关系保留的问题,不好处理数据属性的问题,在一定程度上扩充了维度。

但是当类别过多时,会造成维度灾难。

3. Binary Encoding

将原本的独热编码编码为二进制单位,一定程度上增加了信息的稠密度

4.直接采用LGB、catboost等能直接读取类别型变量的树模型

5.Embedding

将模型类别型变量进行嵌入的操作,可以有效压缩one-hot编码造成的数据稀疏的问题

相关推荐
jkyy20142 分钟前
AI健康管家:大模型赋能私域健康服务,重塑新零售智慧运营体系
人工智能·零售
薛定猫AI6 分钟前
Codex 与 Claude Code 安装配置完全指南
大数据·人工智能·架构
前沿AI10 分钟前
AI营销服一体化方案亮相2026中国汽车经销商大会,助力汽车销售全链路提效
大数据·人工智能·汽车
头盔小妹16 分钟前
在本地调用大语言模型
人工智能·语言模型·自然语言处理
圣殿骑士-Khtangc22 分钟前
智谱AI完成5亿美元融资 + AutoGLM 2.0发布:对标GPT-5 Agent Mode
人工智能
LLM落地研习社24 分钟前
一行命令部署 NIM:Docker 容器化生产级最佳实践
人工智能
十有八七31 分钟前
🧩 组件库死亡倒计时?—— AI 编码冲击下的前端基础设施重构
前端·人工智能
bryant_meng31 分钟前
【Hugging Face】The GitHub of Open-Source AI Models
人工智能·github·qwen·hugging face·clip
有味道的男人33 分钟前
从采集到铺货:AI 对接京东数据完整落地流程
人工智能
风止何安啊39 分钟前
我一个前端仔,居然用 Python 搞起了 AI?从零到一,撸了个 AI 聊天框小 demo
前端·人工智能·后端