一、从全连接层到卷积层
1、全连接层的二维形式与固有局限
1.1 全连接层的四阶张量表达
当输入为二维图像 / 特征图时,全连接层的矩阵乘法可扩展为四阶权重张量形式,完整描述二维位置间的全连接关系:

计算公式为:

1.2 全连接层处理图像的核心缺陷
全连接层每个输出神经元与所有输入像素全相连,处理图像时存在两个本质问题:
参数量爆炸:输入图像尺寸稍大,权重参数量便会急剧增长,易引发过拟合,且计算效率极低;
空间结构丢失:将二维图像展平为一维向量进行计算,破坏了像素间的空间邻接关系,无法有效捕捉图像的局部语义模式。
卷积层正是基于平移不变性 与局部性两大视觉先验,对全连接层做约束与简化,从而适配图像数据的特性。
2、坐标变换:从绝对坐标到相对偏移
为引入空间相对关系,我们对输入坐标做等价变换:将输入的绝对坐标(k,l),转换为相对于输出位置 (i,j) 的偏移坐标 (a,b),令:k = i+a, l = j + b
代入全连接公式后,输出可改写为偏移视角下的形式:


3、平移不变性:权重共享与张量降阶
3.1 平移不变性的语义内涵
图像的核心语义具有平移不变性:同一物体无论移动到图像的哪个位置,其语义类别与特征模式都不会改变。对应到特征提取逻辑中:提取特征的 "模板" 不应随空间位置变化,图像所有区域应复用同一套特征提取规则。
3.2 权重共享的数学推导
基于平移不变性,权重不再依赖输出的绝对位置i,j,仅与相对偏移 a,b 有关。由此张量发生降阶:

公式大幅简化为:

这一机制称为权重共享,是卷积层的核心特性:整张特征图共用同一组卷积核参数,既极大压缩了参数量,又完整保留了像素的空间结构信息。
补充说明:严格意义上,权重共享带来的是平移等变性------ 输入特征平移后,输出特征会对应发生同等平移,特征模式本身保持一致;真正的平移不变性主要由后续的池化层提供。入门语境中常将二者统称为平移不变性。
4、局部性:感受野约束与卷积核成型
4.1 局部性的视觉依据
图像的语义信息具有局部相关性:一个像素的语义只和它周围小范围的邻域像素强相关,与距离很远的像素几乎无关。因此输出神经元无需关联整张图像,只需关注当前位置周围的局部窗口即可。
4.2 局部窗口的数学约束
基于局部性,我们限定相对偏移的有效范围:设置阈值Δ ,当 |a| > Δ 或 |b| > Δ 时,对应权重置为 0,仅保留以 (0,0) 为中心、大小为 (2Δ +1) × (2Δ+1)的局部窗口内的权重。
公式进一步约束为:


至此,我们从全连接层出发,通过「平移不变性(权重共享)+ 局部性(感受野约束)」两步约束,完整推导出了标准二维卷积运算。
5、卷积层的关键配置与特殊变体
5.1 输出形状控制:填充与步幅
卷积输出的空间尺寸可通过两个超参数灵活控制:
填充(Padding):在输入特征图的边缘填充特定数值(通常为 0),避免卷积后特征图尺寸缩小,同时保留边缘信息。填充大小为 p 时,输入尺寸等效增加 2p。
步幅(Stride):卷积核每次滑动的像素步长。步幅为 s 时,卷积核每隔 s 个像素计算一次输出,可对特征图进行下采样,压缩空间尺寸。

5.2 多通道卷积的计算规则
实际卷积层通常处理多通道特征图,计算遵循以下规则:
每个输入通道对应一个独立的二维卷积核;
卷积计算时,所有输入通道的卷积结果逐元素相加,最终得到单通道输出;
输出通道的数量等于卷积核的组数,每组卷积核包含与输入通道数相等的二维核;
每个输出通道对应一个独立的偏置值。
通过调整卷积核的组数,可自由控制输出特征图的通道数,实现通道维度的升维或降维。
5.3 1×1 卷积的作用与本质
尺寸为 1×1 的卷积核不具备空间感受野,无法识别空间结构模式;
核心作用是跨通道信息融合与通道数调整,在通道维度做线性组合;
可等价为作用在通道维度的全连接层,是网络中调整通道数、融合特征、降低计算量的常用轻量模块。
6、池化层:下采样与位置鲁棒性
6.1 池化层的核心作用
池化层(Pooling)对卷积输出的特征图进行下采样,核心价值包括:
压缩特征尺寸:减少后续层的参数量与计算量,控制过拟合风险;
提升位置鲁棒性:缓解卷积层对特征精确位置的敏感性,使特征对微小偏移更具不变性;
扩大感受野:通过下采样,让后续层的神经元覆盖更广的原始图像区域。
池化层在每个通道上独立运算,不进行通道间的融合,因此不会改变特征图的通道数。
6.2 两种主流池化方式
最大池化(Max Pooling):取感受野范围内的最大特征值作为输出。对边缘、纹理等显著特征保留效果更好,能更好地应对特征的小幅偏移,是最常用的池化方式。
平均池化(Average Pooling):取感受野范围内所有数值的平均值作为输出。对背景信息的保留更平滑,常用于网络末端的全局特征聚合。
二、迁移学习与模型微调
1、 微调的核心思想
卷积神经网络可拆解为特征提取器(底层卷积层) + **分类器(顶层全连接层)**两部分:底层卷积提取边缘、纹理等通用视觉特征,高层卷积提取与数据集强相关的抽象语义特征。
**微调(Fine-tuning)**是迁移学习的核心方法:将在大规模数据集(如 ImageNet)上预训练好的模型,复用其特征提取部分的参数,仅在目标小数据集上调整部分或全部参数,完成任务适配。
2、 微调的核心优势
相比从零开始随机初始化训练,微调具有显著优势:
收敛速度快:模型已有良好的特征提取基础,无需从无到有学习视觉特征;
精度表现更优:预训练学到的通用视觉特征可迁移到目标任务,尤其在小数据集上提升效果显著;
数据门槛更低:无需海量标注数据,即可训练出性能可观的模型。
3 分层冻结的参数策略
通常底层特征通用性强,高层特征与原数据集关联度高,因此微调常采用分层冻结策略:
冻结底层卷积层的参数,不参与梯度更新,保留通用特征提取能力;
微调中层与高层卷积层,适配目标数据集的专属语义特征;
替换并重新训练顶层全连接分类器,适配目标任务的类别数量。
目标数据集越小、与预训练数据集差异越小,可冻结更多底层参数;数据集越大、任务差异越大,则可放开更多层参与微调