机器学习:决策树1--ID3决策树和C4.5决策树

公式

(信息)熵 = ∑ -分类占比 * log 2(分类占比)

信息增益

实际案例:信息增益

实际案例:信息增益率

为啥选择信息增益率,不用信息增益?信息增益弊端是啥

因为信息增益等于 熵 - 条件熵

在 实际案例:信息增益率 中可以看出来,一个特征如果分类多(特征b),他的条件熵很小,一个特征如果分类少(特征a),他的条件熵很大。 但是无论特征多,还是特征少,他们的熵是一致的。

所以 信息增益等于熵 - 条件熵 的情况,会一直选择 特征分类多的。

特征分类越多,模型越容易在训练集上表现完美,但在测试集上表现很差。信息增益的弊端就是它无法区分"真正有用的分类"和"仅仅是把数据切碎的无效分类"。

举个例子:我们在做一个"是否购买电脑"的预测,数据里有 10 个人,其中 5 个买、5 个不买(熵 = 1)

现在有两个特征:

  • 特征 A(年龄):分为"青年、中年、老年" 3 类。
  • 特征 B(身份证号):分为 10 类,因为每个人身份证号都不同。

如果用信息增益来选特征,会发生什么?

看特征 B(身份证号) :它把 10 个人分成了 10 个小组,每组只有 1 个人。对于每个小组,要么是"买",要么是"不买",纯度 100%。所以它的条件熵 = 0。那么它的信息增益 = 1 - 0 = 1(最大值)。

看特征 A(年龄):虽然把人群分成了 3 组,但每组里可能还是有买有没买的,纯度没那么高。假设它的条件熵 = 0.8。那么它的信息增益 = 1 - 0.8 = 0.2。

结论 :信息增益会毫不犹豫地选择"身份证号"这个特征。

但"身份证号"这个特征对于预测"是否买电脑"毫无意义,它只是把数据切碎了,产生了过拟合,不能泛化到新数据。

相关推荐
Evan_Lai6 小时前
(一)独热编码、标签编码、目标编码、序数编码详解
python·机器学习
在所不辞兄7 小时前
分层PINN提升多物理场耦合效率
人工智能·深度学习·神经网络·机器学习·工程仿真
Rocky Ding*8 小时前
Emu3大模型深度解析:下一Token预测如何统一图像、视频与理解,以及它尚未解决的问题
论文阅读·人工智能·深度学习·机器学习·aigc·ai-native·emu3
袖清暮雨8 小时前
机器学习之决策树
人工智能·决策树·机器学习
Li_RuiQi8 小时前
rtx4090_pi0_training_pitfalls
人工智能·机器学习
liuchangng8 小时前
类Jev项目Kev从入门到实战(7):如何选型:决策树与 checklist
算法·决策树·机器学习
镜子AI10 小时前
教培机构多模态内容跨模态检索系统:基于CLIP的统一表征与图文混合召回算法
人工智能·python·算法·机器学习
小宋102110 小时前
合成评测集怎么造才不“自嗨”:自动出题、去重、泄漏检测与人工抽检
人工智能·算法·机器学习
珠海西格电力11 小时前
AI预测与优化:基于机器学习的负荷预测与调度策略
大数据·人工智能·机器学习·信息可视化·架构·能源
龙腾AI白云11 小时前
数字孪生驱动大模型工业知识库:为具身机器人植入领域专业经验
数据库·人工智能·机器学习·知识图谱