Day39

知识点回顾总结

  1. 图像数据的格式

灰度数据:单通道(1个维度),像素值通常为0~255,表示亮度。

彩色数据:三通道(RGB,3个维度),每个通道代表红、绿、蓝的强度。

  1. 模型的定义

指神经网络的架构,包括层数、每层的神经元数量、激活函数等。

定义方式:通过框架(如PyTorch的nn.Module)构建计算图。

  1. 显存占用的4种地方

a. 模型参数 + 梯度参数:存储权重及反向传播时的梯度。

b. 优化器参数:如Adam优化器会保存动量(momentum)等额外变量。

c. 数据批量所占显存:输入数据(batch)的存储空间。

d. 神经元输出中间状态:前向传播时各层的输出(用于反向传播)。

  1. Batch Size 和训练的关系

增大 Batch Size:

提高训练速度(并行计算更高效)。

可能降低模型泛化能力(梯度估计更精确,但易陷入局部最优)。

显存占用增加(需存储更多数据、中间变量)。

减小 Batch Size:

训练更"噪声大"(梯度波动大,可能帮助逃离局部最优)。

显存占用减少,适合小显存设备。

训练速度变慢(数据利用率低)。

平衡点:需根据硬件(显存)和模型效果调整,通常通过实验选择最佳 batch size。


总结:理解数据格式、模型结构、显存分配和 batch size 的影响,能更高效地训练深度学习模型。

相关推荐
测试19985 小时前
软件测试 - 单元测试总结
自动化测试·软件测试·python·测试工具·职场和发展·单元测试·测试用例
曲幽7 小时前
我用了FastApiAdmin后,连夜把踩过的坑都整理出来了
redis·python·postgresql·vue3·fastapi·web·sqlalchemy·admin·fastapiadmin
前端若水9 小时前
会话管理:创建、切换、删除对话历史
前端·人工智能·python·react.js
涛声依旧-底层原理研究所9 小时前
残差连接与层归一化通俗易懂的详解
人工智能·python·神经网络·transformer
csdn_aspnet10 小时前
Python 算法快闪 LeetCode 编号 70 - 爬楼梯
python·算法·leetcode·职场和发展
fantasy_arch10 小时前
pytorch人脸匹配模型
人工智能·pytorch·python
熊猫_豆豆10 小时前
广义相对论水星近日点进动完整详细数学推导
python·天体·广义相对论
web3.088899910 小时前
1688 图搜接口(item_search_img / 拍立淘) 接入方法
开发语言·python
AI算法沐枫11 小时前
深度学习python代码处理科研测序数据
数据结构·人工智能·python·深度学习·决策树·机器学习·线性回归
X1A0RAN12 小时前
解决Pycharm中部分文件或文件夹被隐藏不展示问题
ide·python·pycharm