动手学深度学习笔记--卷积层、微调

一、从全连接层到卷积层

1、全连接层的二维形式与固有局限

1.1 全连接层的四阶张量表达

当输入为二维图像 / 特征图时,全连接层的矩阵乘法可扩展为四阶权重张量形式,完整描述二维位置间的全连接关系:

计算公式为:

1.2 全连接层处理图像的核心缺陷

全连接层每个输出神经元与所有输入像素全相连,处理图像时存在两个本质问题:

参数量爆炸:输入图像尺寸稍大,权重参数量便会急剧增长,易引发过拟合,且计算效率极低;

空间结构丢失:将二维图像展平为一维向量进行计算,破坏了像素间的空间邻接关系,无法有效捕捉图像的局部语义模式。

卷积层正是基于平移不变性局部性两大视觉先验,对全连接层做约束与简化,从而适配图像数据的特性。

2、坐标变换:从绝对坐标到相对偏移

为引入空间相对关系,我们对输入坐标做等价变换:将输入的绝对坐标(k,l),转换为相对于输出位置 (i,j) 的偏移坐标 (a,b),令:k = i+a, l = j + b

代入全连接公式后,输出可改写为偏移视角下的形式:

3、平移不变性:权重共享与张量降阶

3.1 平移不变性的语义内涵

图像的核心语义具有平移不变性:同一物体无论移动到图像的哪个位置,其语义类别与特征模式都不会改变。对应到特征提取逻辑中:提取特征的 "模板" 不应随空间位置变化,图像所有区域应复用同一套特征提取规则。

3.2 权重共享的数学推导

基于平移不变性,权重不再依赖输出的绝对位置i,j,仅与相对偏移 a,b 有关。由此张量发生降阶:

公式大幅简化为:

这一机制称为权重共享,是卷积层的核心特性:整张特征图共用同一组卷积核参数,既极大压缩了参数量,又完整保留了像素的空间结构信息。

补充说明:严格意义上,权重共享带来的是平移等变性------ 输入特征平移后,输出特征会对应发生同等平移,特征模式本身保持一致;真正的平移不变性主要由后续的池化层提供。入门语境中常将二者统称为平移不变性。

4、局部性:感受野约束与卷积核成型

4.1 局部性的视觉依据

图像的语义信息具有局部相关性:一个像素的语义只和它周围小范围的邻域像素强相关,与距离很远的像素几乎无关。因此输出神经元无需关联整张图像,只需关注当前位置周围的局部窗口即可。

4.2 局部窗口的数学约束

基于局部性,我们限定相对偏移的有效范围:设置阈值Δ ,当 |a| > Δ 或 |b| > Δ 时,对应权重置为 0,仅保留以 (0,0) 为中心、大小为 (2Δ +1) × (2Δ+1)的局部窗口内的权重。

公式进一步约束为:

至此,我们从全连接层出发,通过「平移不变性(权重共享)+ 局部性(感受野约束)」两步约束,完整推导出了标准二维卷积运算。

5、卷积层的关键配置与特殊变体

5.1 输出形状控制:填充与步幅

卷积输出的空间尺寸可通过两个超参数灵活控制:

填充(Padding):在输入特征图的边缘填充特定数值(通常为 0),避免卷积后特征图尺寸缩小,同时保留边缘信息。填充大小为 p 时,输入尺寸等效增加 2p。

步幅(Stride):卷积核每次滑动的像素步长。步幅为 s 时,卷积核每隔 s 个像素计算一次输出,可对特征图进行下采样,压缩空间尺寸。

5.2 多通道卷积的计算规则

实际卷积层通常处理多通道特征图,计算遵循以下规则:

每个输入通道对应一个独立的二维卷积核;

卷积计算时,所有输入通道的卷积结果逐元素相加,最终得到单通道输出

输出通道的数量等于卷积核的组数,每组卷积核包含与输入通道数相等的二维核;

每个输出通道对应一个独立的偏置值。

通过调整卷积核的组数,可自由控制输出特征图的通道数,实现通道维度的升维或降维。

5.3 1×1 卷积的作用与本质

尺寸为 1×1 的卷积核不具备空间感受野,无法识别空间结构模式;

核心作用是跨通道信息融合与通道数调整,在通道维度做线性组合;

可等价为作用在通道维度的全连接层,是网络中调整通道数、融合特征、降低计算量的常用轻量模块。

6、池化层:下采样与位置鲁棒性

6.1 池化层的核心作用

池化层(Pooling)对卷积输出的特征图进行下采样,核心价值包括:

压缩特征尺寸:减少后续层的参数量与计算量,控制过拟合风险;

提升位置鲁棒性:缓解卷积层对特征精确位置的敏感性,使特征对微小偏移更具不变性;

扩大感受野:通过下采样,让后续层的神经元覆盖更广的原始图像区域。

池化层在每个通道上独立运算,不进行通道间的融合,因此不会改变特征图的通道数

6.2 两种主流池化方式

最大池化(Max Pooling):取感受野范围内的最大特征值作为输出。对边缘、纹理等显著特征保留效果更好,能更好地应对特征的小幅偏移,是最常用的池化方式。

平均池化(Average Pooling):取感受野范围内所有数值的平均值作为输出。对背景信息的保留更平滑,常用于网络末端的全局特征聚合。

二、迁移学习与模型微调

1、 微调的核心思想

卷积神经网络可拆解为特征提取器(底层卷积层) + **分类器(顶层全连接层)**两部分:底层卷积提取边缘、纹理等通用视觉特征,高层卷积提取与数据集强相关的抽象语义特征。

**微调(Fine-tuning)**是迁移学习的核心方法:将在大规模数据集(如 ImageNet)上预训练好的模型,复用其特征提取部分的参数,仅在目标小数据集上调整部分或全部参数,完成任务适配。

2、 微调的核心优势

相比从零开始随机初始化训练,微调具有显著优势:

收敛速度快:模型已有良好的特征提取基础,无需从无到有学习视觉特征;

精度表现更优:预训练学到的通用视觉特征可迁移到目标任务,尤其在小数据集上提升效果显著;

数据门槛更低:无需海量标注数据,即可训练出性能可观的模型。

3 分层冻结的参数策略

通常底层特征通用性强,高层特征与原数据集关联度高,因此微调常采用分层冻结策略:

冻结底层卷积层的参数,不参与梯度更新,保留通用特征提取能力;

微调中层与高层卷积层,适配目标数据集的专属语义特征;

替换并重新训练顶层全连接分类器,适配目标任务的类别数量。

目标数据集越小、与预训练数据集差异越小,可冻结更多底层参数;数据集越大、任务差异越大,则可放开更多层参与微调

相关推荐
redreamSo6 小时前
一天涨 1800 星的 GitHub 榜首:AI 编程瓶颈变成了 token
人工智能·开源·github
wp123_16 小时前
实测数据对飙:COILCRAFT XFL4020-222MEC vs TONEVEE MVL4020-2R2M,2.2µH功率电感参数全解读
人工智能
本末倒置1836 小时前
从 PDF 到向量检索:一个最简单的本地 RAG 入库案例
人工智能
QYR-分析6 小时前
智能化自动化浪潮下,机器人末端执行器行业赛道发展全景解析
人工智能·机器人·自动化
大模型服务器厂商6 小时前
人形机器人年产冲刺 10 万台,算力底座成核心支撑
人工智能·机器人
tyqtyq226 小时前
HarmonyOS AI 应用开发实战:英语口语情景对话系统
人工智能·生活·harmonyos·鸿蒙·宠物
Cloud云卷云舒7 小时前
云卷云舒:HaishanDB的AI原生能力主要应用场景
数据库·人工智能·ai-native·haishandb·移动云长期记忆
梦梦代码精7 小时前
开源AI应用平台BuildingAI解析:插件化架构、应用市场与热门案例
人工智能·机器学习·docker·开源
半个落月7 小时前
用 LangChain 连接远程 MCP:从工具发现到多轮调用闭环
人工智能·后端·node.js