目录
- [第129集 树叶分类竞赛技术总结(26:29)](#第129集 树叶分类竞赛技术总结(26:29))
- [第130集 目标检测(42:05)](#第130集 目标检测(42:05))
- [第131集 目标检测 QA(16:24)](#第131集 目标检测 QA(16:24))
- [第132集 多尺度锚框(09:57)](#第132集 多尺度锚框(09:57))
- [第133集 SSD(52:45)](#第133集 SSD(52:45))
- [第134集 SSD QA(27:01)](#第134集 SSD QA(27:01))
- [两阶段 vs 单阶段目标检测对比](#两阶段 vs 单阶段目标检测对比)
**摘要:**本文系统梳理李沐《动手学深度学习》第129至134集的核心内容,涵盖树叶分类竞赛的实战技巧、目标检测的基础机制、多尺度锚框的设计思路以及 SSD 单发多框检测器的完整原理。通过阅读,你将掌握小数据图像分类的制胜公式、锚框与 IoU 的核心概念,以及两阶段与单阶段检测算法的选型要点。
李沐深度学习191集课程全解析:模块拆解、学习路径-CSDN博客
吴恩达《面向开发者的提示词工程》-CSDN博客
吴恩达 MCP 教程(Model Context Protocol)(一)-CSDN博客
一句话总结
第129集《树叶分类竞赛技术总结》 :小数据集图像分类的制胜公式 = 预训练微调 + 数据增广 + 模型集成。
第130集《目标检测》 :让模型从"认得出"进阶到"框得准"------锚框、IoU、NMS 三件套,撑起 R-CNN 两阶段与 SSD/YOLO 单阶段两大门派。
第131集《目标检测 QA》:围绕锚框设计、正负样本失衡与速度精度权衡的现场答疑。
详细总结
第129集 树叶分类竞赛技术总结(26:29)
围绕 Kaggle 树叶分类竞赛(176 个细分类别、训练图像仅一万余张)的完整复盘:小数据场景下首选 ImageNet 预训练 ResNet 做迁移学习,只需替换最后的分类头即可获得很高精度;随机翻转、裁剪缩放、颜色扰动等数据增广是抑制过拟合的关键;换更大骨干网络、提高输入分辨率通常能稳定涨点;训练上配合余弦学习率衰减与权重衰退等正则化;最后靠 TTA(测试时增广)、多模型集成与 K 折交叉验证榨干剩余精度。核心启示一句话:数据不够时,"迁移学习 + 数据增广"是性价比最高的方案,竞赛刷分靠集成。
第130集 目标检测(42:05)
这一讲系统拉开计算机视觉任务谱系:图像分类 → 分类+定位 → 目标检测(多目标的类别 + 边界框)→ 实例分割。核心机制是以每个像素为中心生成多尺度、多高宽比的锚框 ,把检测问题转化为对锚框的"分类 + 偏移回归";用 IoU(交并比,IoU=∣A∩B∣∣A∪B∣IoU=∣A∪B∣∣A∩B∣)衡量两框重合度、划分正负样本;用 NMS 非极大值抑制按置信度排序并去除高重叠的冗余框。算法分两大门派:两阶段 R-CNN 家族------R-CNN(选择性搜索提候选 + 逐块 CNN,准但极慢)→ Fast R-CNN(整图共享特征 + RoI 池化)→ Faster R-CNN(RPN 区域提议网络,端到端)→ Mask R-CNN(加掩码分支做实例分割),精度取胜;单阶段的 SSD(多尺度特征图上直接预测锚框)与 YOLO(检测整体化为一次回归),速度取胜、适合实时场景。
第131集 目标检测 QA(16:24)
上一讲的配套答疑,焦点集中在工程实践层面:锚框数量与尺寸设计和计算量之间的权衡;检测训练中正负样本极度不均衡的处理思路;多尺度特征图对缓解小目标漏检的作用;以及实际项目中两阶段(精度优先)与单阶段(速度优先)的选型取舍。
下面为你生成这三集的可视化摘要卡片,生成后附上可分享的在线链接 👇
可视化已渲染完成 ✅ 现在把它发布为在线页面。
✅ 可视化摘要已发布上线:李沐《动手学深度学习》129--131 集摘要
点开即可查看或分享给同学。这三集正好构成一条完整学习线:先用竞赛复盘把「图像分类」打扎实(微调 + 增广 + 集成),再顺势进入「目标检测」的新任务范式(锚框 + IoU + NMS,两阶段 vs 单阶段),最后用 QA 扫清工程实践中的常见疑惑 👍
一句话总结
第132集《多尺度锚框》 :用不同大小的特征图生成不同尺寸的锚框------细层找小目标,粗层找大目标。
第133集《SSD》 :单发多框检测器 = CNN 骨干 + 多尺度特征图 + 每格多锚框,一次前向同时出类别和偏移,NMS 收尾。
第134集《SSD QA》:围绕锚框总数、计算开销与训练细节的现场答疑。
详细总结
第132集 多尺度锚框(09:57)
为上一讲的锚框机制升级:单一尺度只适合某一范围大小的目标,因此在多个不同分辨率的特征图上分别生成锚框------低层特征图分辨率高、感受野小,负责小目标;高层分辨率低、感受野大,负责大目标。生成方式是在图像上均匀采样像素,按不同缩放比例和高宽比铺锚框,直接为下一讲的 SSD 打地基。
第133集 SSD(52:45)
单发多框检测器 (Single Shot MultiBox Detector)把前几讲的零件组装成完整模型:CNN 骨干网络提特征 → 截取多个不同尺度的特征图 → 每个特征图单元按中心像素生成若干锚框 → 每个锚框配一个「类别预测头 + 边界框偏移头」。训练时按 IoU 阈值把锚框匹配到真实框,标注类别与四个偏移量,损失 = 类别损失 + 偏移损失;预测时直接一次前向输出所有锚框的结果,经 NMS 去重得到最终检测框。无需候选区域提议,速度远快于两阶段,是典型的单阶段检测器。
第134集 SSD QA(27:01)
配套答疑:锚框总数 = 特征图单元数 × 每单元锚框数,多尺度叠加后量很大,需权衡计算与显存;不同层通道数与检测头的设计取舍;以及匹配阈值、损失加权等训练细节。
下面生成这三集的可视化摘要卡片,随后附上在线链接 👇
✅ 可视化已发布上线:李沐《动手学深度学习》132--134 集摘要
两阶段 vs 单阶段目标检测对比
结合第130集《目标检测》与第133集《SSD》的内容,下表从五个维度对比两阶段与单阶段目标检测算法的核心差异:
| 对比维度 | 两阶段(R-CNN 家族) | 单阶段(SSD / YOLO) |
|---|---|---|
| 代表算法 | R-CNN → Fast R-CNN → Faster R-CNN → Mask R-CNN | SSD(单发多框检测器)、YOLO |
| 检测流程 | 先由区域提议网络(RPN)或选择性搜索生成候选区域,再对每个候选区域做分类与边界框回归,分两步完成检测 | CNN 骨干提特征 → 多尺度特征图上直接生成锚框 → 一次前向同时输出类别与偏移,经 NMS 去重得到最终检测框,无需候选区域提议 |
| 速度 | 较慢,候选区域提议 + 逐区域分类带来额外计算开销 | 快,一次前向完成全部预测,适合实时场景 |
| 精度 | 更高,候选区域精修使定位更准,精度取胜 | 略低,但通过多尺度特征图与多锚框设计可逼近两阶段精度 |
| 适用场景 | 对精度要求高、对速度不敏感的任务,如学术研究、精细检测、实例分割 | 对实时性要求高的场景,如视频监控、自动驾驶、移动端检测 |
某一范围大小的目标,因此在多个不同分辨率的特征图上分别生成锚框------低层特征图分辨率高、感受野小,负责小目标;高层分辨率低、感受野大,负责大目标。生成方式是在图像上均匀采样像素,按不同缩放比例和高宽比铺锚框,直接为下一讲的 SSD 打地基。
第133集 SSD(52:45)
单发多框检测器 (Single Shot MultiBox Detector)把前几讲的零件组装成完整模型:CNN 骨干网络提特征 → 截取多个不同尺度的特征图 → 每个特征图单元按中心像素生成若干锚框 → 每个锚框配一个「类别预测头 + 边界框偏移头」。训练时按 IoU 阈值把锚框匹配到真实框,标注类别与四个偏移量,损失 = 类别损失 + 偏移损失;预测时直接一次前向输出所有锚框的结果,经 NMS 去重得到最终检测框。无需候选区域提议,速度远快于两阶段,是典型的单阶段检测器。
第134集 SSD QA(27:01)
配套答疑:锚框总数 = 特征图单元数 × 每单元锚框数,多尺度叠加后量很大,需权衡计算与显存;不同层通道数与检测头的设计取舍;以及匹配阈值、损失加权等训练细节。
下面生成这三集的可视化摘要卡片,随后附上在线链接 👇
✅ 可视化已发布上线:李沐《动手学深度学习》132--134 集摘要