《随机森林》知识点总结

一、基本定义

随机森林是Bagging(自助聚合)框架下的集成监督学习算法,可完成分类、回归任务,结构化/图像、文本等非结构化数据集都适用。核心思路:不依赖单个模型,训练大量决策树(基学习器/弱模型)共同预测结果。

  • 分类任务:所有树投票选出最终类别
  • 回归任务:所有树输出结果取平均值

二、训练核心步骤

1、有放回采样(Bootstrap 自助采样)

从原始数据集中有放回抽样生成多个独立的数据子集,分别用来训练每一棵决策树。

  • 目的:保证基学习器之间既有一部分公共知识,又拥有差异性(多样性)。
  • 额外增加随机特征选择:每棵树再随机挑选部分特征训练,进一步提升树之间的差异化。

集成效果前提:单个弱学习器准确率只需要大于 0.5 即可,不是要求单棵树精度极高。

2、为什么多棵树组合之后整体性能会变好?

  1. 不同决策树对噪声、异常样本敏感度不一样,可以互相抵消一部分错误,提升鲁棒性。
  2. 每一棵树会学到数据集里面不一样的特征和内在模式,多个模型融合覆盖更多情况。举例(单棵树准确率 0.6)。
  • 3棵树:至少2棵预测正确 →整体准确率0.648
  • 5棵树:至少3棵预测正确 →整体准确率0.683
  • 7棵树:至少4棵预测正确 →整体准确率0.710

树不是越多越好:数量过大容易造成过拟合,模型学习到噪声。

三、OOB袋外估计(Out‑of‑Bag)

定义

自助有放回采样的时候,原始训练集里面一部分样本不会被抽到,这部分样本叫做袋外样本。可以直接拿袋外样本,评估当前树的泛化性能。

  • 优点:不需要单独划分验证集,就能大致评估模型泛化能力。
  • 局限性 :只是近似估计,不能完全代替独立验证集。

注意细节:1. 样本没有出现在某一棵树 OOB 集,仍然能够参与整体 OOB 得分运算;2. 基学习器太少,部分样本无法参与 OOB 评分计算。

四、整体流程速记

原始数据集 →自助采样生成多个子集 +随机选特征 →训练一堆独立决策树 →预测阶段投票/平均输出结果 →OOB 样本评估模型效果

相关推荐
蛋蛋的就会顺顺的27 分钟前
hot100——矩阵
java·数据结构·算法·leetcode·力扣
老歌老听老掉牙33 分钟前
麻花钻切屑形态演变的力学机制与临界条件分析
python·算法·钻头
zhangfeng11331 小时前
国产GPU/AI算力芯片现状(修订完整版 · 截至2026年9月
人工智能·算法·ai编程·npu
学代码的CJY1 小时前
从代码出发理解时间复杂度与空间复杂度
数据结构·算法
白帽攻防录2 小时前
SRC 挖洞:WSO2 JWT 算法混淆绕过深度复盘,CVE-2026-5430 不支持的算法怎么变成管理员
网络·算法·安全·网络安全·jwt
小O的算法实验室2 小时前
IEEE TEVC,基于精确与DQN群智能调度方法用于多目标异构USV
算法
可乐ea3 小时前
AI Agent 工具调用准确性评测:选择错误与参数错误分开测
大数据·人工智能·算法·大模型·工具调用·ai智能体·agent评测
上位机妹子3 小时前
C 语言 数组删除指定元素(快慢指针法)
c语言·数据结构·算法
心中有你02143 小时前
【路径规划】A*寻路算法最通俗易懂讲解(C语言完整实现+详细注释)
c语言·开发语言·算法
papaofdoudou4 小时前
初中数学-整数整除判定法全解:从 2 到 19 的方法、依据与证明
算法