机器学习:决策树1--ID3决策树和C4.5决策树

公式

(信息)熵 = ∑ -分类占比 * log 2(分类占比)

信息增益

实际案例:信息增益

实际案例:信息增益率

为啥选择信息增益率,不用信息增益?信息增益弊端是啥

因为信息增益等于 熵 - 条件熵

实际案例:信息增益率 中可以看出来,一个特征如果分类多(特征b),他的条件熵很小,一个特征如果分类少(特征a),他的条件熵很大。 但是无论特征多,还是特征少,他们的熵是一致的。

所以 信息增益等于熵 - 条件熵 的情况,会一直选择 特征分类多的。

特征分类越多,模型越容易在训练集上表现完美,但在测试集上表现很差。信息增益的弊端就是它无法区分"真正有用的分类"和"仅仅是把数据切碎的无效分类"。

举个例子:我们在做一个"是否购买电脑"的预测,数据里有 10 个人,其中 5 个买、5 个不买(熵 = 1)

现在有两个特征:

  • 特征 A(年龄):分为"青年、中年、老年" 3 类。
  • 特征 B(身份证号):分为 10 类,因为每个人身份证号都不同。

如果用信息增益来选特征,会发生什么?

看特征 B(身份证号) :它把 10 个人分成了 10 个小组,每组只有 1 个人。对于每个小组,要么是"买",要么是"不买",纯度 100%。所以它的条件熵 = 0。那么它的信息增益 = 1 - 0 = 1(最大值)。

看特征 A(年龄):虽然把人群分成了 3 组,但每组里可能还是有买有没买的,纯度没那么高。假设它的条件熵 = 0.8。那么它的信息增益 = 1 - 0.8 = 0.2。

结论信息增益会毫不犹豫地选择"身份证号"这个特征。

但"身份证号"这个特征对于预测"是否买电脑"毫无意义,它只是把数据切碎了,产生了过拟合,不能泛化到新数据

相关推荐
wuyk5552 小时前
第四章 ROS2 开发环境配置【VMware Ubuntu22.04 Humble】
机器学习
我要见SA姐112 小时前
告别 Copilot?Codex 本地化部署指南
运维·数据库·机器学习·oracle·回归
搞科研的小刘选手15 小时前
【落地武汉 | EI, Scopus 双检索】第二届智能决策与机器学习国际学术会议 (ICIDML 2026)
机器学习·智能决策·学术会议·会议推荐·武汉
萌新小码农‍16 小时前
KL散度的介绍
人工智能·深度学习·机器学习
张祥64228890416 小时前
牛顿迭代法求解开普勒方程:从RTKLIB源码到数值分析
人工智能·算法·机器学习
面包狗AI4S18 小时前
GitHub AI4S 项目观察(2026-09-07—2026-09-13)
人工智能·深度学习·机器学习
宣宣猪的小花园.20 小时前
【机器学习】过拟合与泛化:模型为什么会“刷题很强、实战失灵”
人工智能·算法·机器学习
江畔柳前堤1 天前
On-Policy Distillation 全景深潜
人工智能·网络协议·目标检测·http·机器学习·chatgpt·重构