pytorch-解决过拟合之动量与学习率衰减

目录

  • [1. momentum动量](#1. momentum动量)
  • [2. pytorch增加momentum](#2. pytorch增加momentum)
  • [3. 学习率衰减](#3. 学习率衰减)
  • [4. 学习率衰减的方式](#4. 学习率衰减的方式)
    • [4.1 loss连续几次无改善衰减](#4.1 loss连续几次无改善衰减)
  • [4.2 步进式衰减](#4.2 步进式衰减)

1. momentum动量

下图给出了梯度公式和增加了动量的梯度公式,β z k z^k zk其中的 z k z^k zk就是上次的梯度,而β决定了 w k + 1 w^{k+1} wk+1更偏向于上次梯度还是本次梯度。也就是说梯度增加了动量后,梯度更新要同时考虑上次的惯性和本次的梯度。

未加动量

加了动量

从两幅图可以看出加了动量比未加动量要平滑的多,未加动量很难找到全局极小值,而加了动量后找到全局极小值的概率要大的多。

2. pytorch增加momentum

如图中SGD优化器增加momentum参数,而Adam优化器是不支持输入动量参数的

3. 学习率衰减

下图为三种学习率模型曲线的不同表现,学习率太低训练比较慢,比如本来4天训完,结果可能10天才能训完,学习率太高loss震荡比较厉害很难找到极小值。

所谓学习率衰减就是开始使用较大的学习率,之后使用一定的策略使学习率不断减小,比如:有60k数据每训练10k学习率减小1/2

4. 学习率衰减的方式

4.1 loss连续几次无改善衰减

torch.optim.lr_scheduler.ReduceLROnPlateau函数的功能是,当loss在patience个连续epoch后没有改善时,就减小学习率factor倍

python 复制代码
CLASS torch.optim.lr_scheduler.ReduceLROnPlateau(optimizer, mode='min', factor=0.1, patience=10, threshold=0.0001, threshold_mode='rel', cooldown=0, min_lr=0, eps=1e-08, verbose='deprecated')

optimizer-优化器

mode-min或max,min:当度量的量停止减小时,减小学习率,max:当度量的量停止增大时,减小学习率,默认min

factor-每次减少倍率

4.2 步进式衰减

比如:每30k衰减0.1

相关推荐
摸爬滚打李上进6 小时前
重生学AI第十六集:线性层nn.Linear
人工智能·pytorch·python·神经网络·机器学习
HuashuiMu花水木6 小时前
PyTorch笔记1----------Tensor(张量):基本概念、创建、属性、算数运算
人工智能·pytorch·笔记
喝过期的拉菲1 天前
如何使用 Pytorch Lightning 启用早停机制
pytorch·lightning·早停机制
kk爱闹1 天前
【挑战14天学完python和pytorch】- day01
android·pytorch·python
Yo_Becky1 天前
【PyTorch】PyTorch预训练模型缓存位置迁移,也可拓展应用于其他文件的迁移
人工智能·pytorch·经验分享·笔记·python·程序人生·其他
xinxiangwangzhi_1 天前
pytorch底层原理学习--PyTorch 架构梳理
人工智能·pytorch·架构
FF-Studio1 天前
【硬核数学 · LLM篇】3.1 Transformer之心:自注意力机制的线性代数解构《从零构建机器学习、深度学习到LLM的数学认知》
人工智能·pytorch·深度学习·线性代数·机器学习·数学建模·transformer
盼小辉丶1 天前
PyTorch实战(14)——条件生成对抗网络(conditional GAN,cGAN)
人工智能·pytorch·生成对抗网络
Gyoku Mint1 天前
深度学习×第4卷:Pytorch实战——她第一次用张量去拟合你的轨迹
人工智能·pytorch·python·深度学习·神经网络·算法·聚类
郭庆汝2 天前
pytorch、torchvision与python版本对应关系
人工智能·pytorch·python