动手学深度学习笔记--卷积层、微调

一、从全连接层到卷积层

1、全连接层的二维形式与固有局限

1.1 全连接层的四阶张量表达

当输入为二维图像 / 特征图时,全连接层的矩阵乘法可扩展为四阶权重张量形式,完整描述二维位置间的全连接关系:

计算公式为:

1.2 全连接层处理图像的核心缺陷

全连接层每个输出神经元与所有输入像素全相连,处理图像时存在两个本质问题:

参数量爆炸:输入图像尺寸稍大,权重参数量便会急剧增长,易引发过拟合,且计算效率极低;

空间结构丢失:将二维图像展平为一维向量进行计算,破坏了像素间的空间邻接关系,无法有效捕捉图像的局部语义模式。

卷积层正是基于平移不变性局部性两大视觉先验,对全连接层做约束与简化,从而适配图像数据的特性。

2、坐标变换:从绝对坐标到相对偏移

为引入空间相对关系,我们对输入坐标做等价变换:将输入的绝对坐标(k,l),转换为相对于输出位置 (i,j) 的偏移坐标 (a,b),令:k = i+a, l = j + b

代入全连接公式后,输出可改写为偏移视角下的形式:

3、平移不变性:权重共享与张量降阶

3.1 平移不变性的语义内涵

图像的核心语义具有平移不变性:同一物体无论移动到图像的哪个位置,其语义类别与特征模式都不会改变。对应到特征提取逻辑中:提取特征的 "模板" 不应随空间位置变化,图像所有区域应复用同一套特征提取规则。

3.2 权重共享的数学推导

基于平移不变性,权重不再依赖输出的绝对位置i,j,仅与相对偏移 a,b 有关。由此张量发生降阶:

公式大幅简化为:

这一机制称为权重共享,是卷积层的核心特性:整张特征图共用同一组卷积核参数,既极大压缩了参数量,又完整保留了像素的空间结构信息。

补充说明:严格意义上,权重共享带来的是平移等变性------ 输入特征平移后,输出特征会对应发生同等平移,特征模式本身保持一致;真正的平移不变性主要由后续的池化层提供。入门语境中常将二者统称为平移不变性。

4、局部性:感受野约束与卷积核成型

4.1 局部性的视觉依据

图像的语义信息具有局部相关性:一个像素的语义只和它周围小范围的邻域像素强相关,与距离很远的像素几乎无关。因此输出神经元无需关联整张图像,只需关注当前位置周围的局部窗口即可。

4.2 局部窗口的数学约束

基于局部性,我们限定相对偏移的有效范围:设置阈值Δ ,当 |a| > Δ 或 |b| > Δ 时,对应权重置为 0,仅保留以 (0,0) 为中心、大小为 (2Δ +1) × (2Δ+1)的局部窗口内的权重。

公式进一步约束为:

至此,我们从全连接层出发,通过「平移不变性(权重共享)+ 局部性(感受野约束)」两步约束,完整推导出了标准二维卷积运算。

5、卷积层的关键配置与特殊变体

5.1 输出形状控制:填充与步幅

卷积输出的空间尺寸可通过两个超参数灵活控制:

填充(Padding):在输入特征图的边缘填充特定数值(通常为 0),避免卷积后特征图尺寸缩小,同时保留边缘信息。填充大小为 p 时,输入尺寸等效增加 2p。

步幅(Stride):卷积核每次滑动的像素步长。步幅为 s 时,卷积核每隔 s 个像素计算一次输出,可对特征图进行下采样,压缩空间尺寸。

5.2 多通道卷积的计算规则

实际卷积层通常处理多通道特征图,计算遵循以下规则:

每个输入通道对应一个独立的二维卷积核;

卷积计算时,所有输入通道的卷积结果逐元素相加,最终得到单通道输出

输出通道的数量等于卷积核的组数,每组卷积核包含与输入通道数相等的二维核;

每个输出通道对应一个独立的偏置值。

通过调整卷积核的组数,可自由控制输出特征图的通道数,实现通道维度的升维或降维。

5.3 1×1 卷积的作用与本质

尺寸为 1×1 的卷积核不具备空间感受野,无法识别空间结构模式;

核心作用是跨通道信息融合与通道数调整,在通道维度做线性组合;

可等价为作用在通道维度的全连接层,是网络中调整通道数、融合特征、降低计算量的常用轻量模块。

6、池化层:下采样与位置鲁棒性

6.1 池化层的核心作用

池化层(Pooling)对卷积输出的特征图进行下采样,核心价值包括:

压缩特征尺寸:减少后续层的参数量与计算量,控制过拟合风险;

提升位置鲁棒性:缓解卷积层对特征精确位置的敏感性,使特征对微小偏移更具不变性;

扩大感受野:通过下采样,让后续层的神经元覆盖更广的原始图像区域。

池化层在每个通道上独立运算,不进行通道间的融合,因此不会改变特征图的通道数

6.2 两种主流池化方式

最大池化(Max Pooling):取感受野范围内的最大特征值作为输出。对边缘、纹理等显著特征保留效果更好,能更好地应对特征的小幅偏移,是最常用的池化方式。

平均池化(Average Pooling):取感受野范围内所有数值的平均值作为输出。对背景信息的保留更平滑,常用于网络末端的全局特征聚合。

二、迁移学习与模型微调

1、 微调的核心思想

卷积神经网络可拆解为特征提取器(底层卷积层) + **分类器(顶层全连接层)**两部分:底层卷积提取边缘、纹理等通用视觉特征,高层卷积提取与数据集强相关的抽象语义特征。

**微调(Fine-tuning)**是迁移学习的核心方法:将在大规模数据集(如 ImageNet)上预训练好的模型,复用其特征提取部分的参数,仅在目标小数据集上调整部分或全部参数,完成任务适配。

2、 微调的核心优势

相比从零开始随机初始化训练,微调具有显著优势:

收敛速度快:模型已有良好的特征提取基础,无需从无到有学习视觉特征;

精度表现更优:预训练学到的通用视觉特征可迁移到目标任务,尤其在小数据集上提升效果显著;

数据门槛更低:无需海量标注数据,即可训练出性能可观的模型。

3 分层冻结的参数策略

通常底层特征通用性强,高层特征与原数据集关联度高,因此微调常采用分层冻结策略:

冻结底层卷积层的参数,不参与梯度更新,保留通用特征提取能力;

微调中层与高层卷积层,适配目标数据集的专属语义特征;

替换并重新训练顶层全连接分类器,适配目标任务的类别数量。

目标数据集越小、与预训练数据集差异越小,可冻结更多底层参数;数据集越大、任务差异越大,则可放开更多层参与微调

相关推荐
日拱一卒的小田11 小时前
ZYNQ学习笔记4-ZYNQ的SD卡控制器2
笔记·学习
IT_陈寒11 小时前
Redis主从切换竟让业务卡了3秒?这个坑我替你踩了
前端·人工智能·后端
江湖人称菠萝包11 小时前
【Qt】《Qt 5.9 C++开发指南》笔记-Chapter8-绘图
笔记·qt·qt5
byte轻骑兵11 小时前
时序数据库选型全指南|大数据工业场景Apache IoTDB落地实操
大数据·数据库·人工智能·apache iotdb
xieliyu.11 小时前
JVM 垃圾回收机制详解:从标记过程、回收算法到垃圾收集器
java·jvm·笔记·java-ee
xieliyu.12 小时前
前端基础:常见CSS选择器用法
前端·css·笔记·vscode
周玉奎先生12 小时前
河南少商新材料CGM灌浆料:扎根河南工程现场的水泥基灌浆材料
经验分享·笔记·零售
墨天梦12 小时前
21-ReAct循环的完整实现
人工智能·自然语言处理
troy12812 小时前
告别 Copilot?Codex、Claude Code、DeepSeek Harness、Kimi、ChatGPT 哪个更适合本地化部署,更有性价比?
人工智能·python·开源软件
AI的探索之旅12 小时前
97 个 OpenCV 实例(二十九):三相机联合标定,把三只眼睛绑在一起
人工智能·opencv·计算机视觉