周志华《机器学习—西瓜书》八

周志华《机器学习---西瓜书》八

八、集成学习

以下是按顺序整理的内容:

1. 集成学习

  • 定义:使用多个学习器协同解决问题的方法("多个模型融合")。
  • 实践表现:近十年KDDCup、Kaggle等竞赛的获胜方案几乎都用到了集成技术,是实战中提升模型性能的关键方法之一。

2.好而不同

如何得到好的集成
  • 核心原则:令个体学习器 "好而不同"

    • "好":个体学习器的性能不能太差(如准确率高于随机猜测);
    • "不同":个体学习器之间要有差异性(预测结果不完全一致)。
  • 示例验证:

    • 当个体学习器"好且不同"时,集成性能会远高于单个学习器;
    • 若个体学习器"差"或"无差异",集成性能会很差甚至失效。
多样性是关键(误差-分歧分解)
  • 理论分解:集成误差 E=Eˉ−AˉE = \bar{E} - \bar{A}E=Eˉ−Aˉ,其中:

    • Eˉ\bar{E}Eˉ:个体学习器的平均误差;
    • Aˉ\bar{A}Aˉ:个体学习器的平均"分歧"(即多样性)。
  • 结论:个体学习器越准确、多样性越高,集成性能越好。

  • 局限:"分歧"缺乏可操作的定义,且该分解仅适用于回归任务的平方损失场景。

3. 成功的集成学习方法分类

  • 序列化方法 (个体学习器按顺序训练,后一个学习器依赖前一个):
    代表:AdaBoost、GradientBoost、LPBoost等。
  • 并行化方法 (个体学习器独立训练):
    代表:Bagging、Random Forest、Random Subspace等。

4. Boosting流程

  • 核心思路:逐步调整数据集权重,让前一个学习器预测错误的样本在后续训练中获得更高权重,最终通过"加权组合"整合所有学习器。

  • 流程:

    1. 从原始数据集生成初始子数据集,训练第一个学习器;
    2. 根据第一个学习器的预测结果,增加错误样本的权重,生成新的子数据集,训练第二个学习器;
    3. 重复上述步骤,得到多个学习器;
    4. 对所有学习器的输出进行加权组合,得到最终结果。

5. Bagging

  • 核心思路:通过可重复采样(Bootstrap) 生成多个数据集,每个数据集训练一个个体学习器,最终通过"投票(分类)"或"平均(回归)"聚合结果。

  • 流程:

    1. 从原始数据集通过Bootstrap采样(有放回随机采样)生成多个子数据集;
    2. 每个子数据集训练一个个体学习器;
    3. 分类任务:选择得票最多的类别;回归任务:取个体学习器的输出平均值。
相关推荐
QC777LX3 小时前
中文专业在AI行业的新岗位:从Prompt到人文训练
人工智能
知几蜗牛3 小时前
2.8万亿参数上云之后,Kimi K3的门槛变低了吗
人工智能
jingli93 小时前
微信自动回复怎么设置?重复问题怎么自动回答——私域FAQ自动应答搭建全流程(关键词匹配+知识库+语义AI,2026实操版)
人工智能·自动化·用户运营
Ai_easygo3 小时前
AI下半场_09_CSDN版_Agent安全攻防
人工智能
速易达网络3 小时前
宇树机器人和Microduck仿真区别
人工智能
PNP Robotics3 小时前
【PNP具身解读】GPT6 Astra:具身智能新范式,大模型 + Franka机器人快速落地验证一、GPT6 Astra 背后的布局、数据与具身方向
人工智能·学习·机器学习·机器人
一木 之林3 小时前
手搓家庭服务器:二手装机、Docker部署、端口映射与frp内网穿透
服务器·人工智能·git·编辑器
咖啡星人k3 小时前
MCP 协议入门:从 tools/list 到一次真实调用
人工智能·mcp·ai工程
YOLO数据集集合3 小时前
光伏板红外-可见光配对缺陷检测数据集 | 光伏板缺陷 红外可见光配准 多模态检测 无人机巡检 目标检测 YOLO格式9094期
人工智能·目标检测·计算机视觉·目标跟踪·红外·无人机视角·太阳能板
知几蜗牛3 小时前
Agent会互相调用了,但A2A 1.0真正解决的是协作边界
人工智能