优化算法(SGD,RMSProp,Ada)

概述

优化算法就是专门研究如何优化模型的。

常用优化算法

随机梯度下降(SGD)

损失函数是模型参数的函数。因此可以求出损失函数对于模型参数的梯度。可以沿着梯度方向进行参数更新。

SGD存在的问题

SGD + Momentum

该算法主要是为了解决SGD的抖动问题的。

具体实现:

其实就是在计算本次梯度时,会考虑过去的梯度值。例如将 ρ \rho ρ设置为0.9,那么此刻的梯度有 90 % 90\% 90%的部分来自历史值,剩余 10 % 10\% 10%来自于当前的计算值。这样更新方向就不会乱抖动了。

RMSProp

主要作用:==沿着"陡峭"方向的优化变慢;沿着"平缓"方向的优化加快。==稳定优化速度(更新步长)

SGD我们不是要设定学习率参数麻,而RMS可以在训练过程中动态调整参数。

RMSprop的更新规则如下:

  1. 初始化参数 θ \theta θ,设置学习率 η \eta η,衰减系数 ρ \rho ρ(通常设为0.9),以及数值稳定性的小常数 ϵ \epsilon ϵ(通常设为 1e-8 );
  2. 在每次迭代中,计算参数 θ \theta θ 的梯度 g g g ;
  3. 更新累积平方梯度的指数加权移动平均 r r r : r = ρ r + ( 1 − ρ ) g 2 r = \rho r+(1-\rho)g^2 r=ρr+(1−ρ)g2
  4. 计算参数更新量: Δ θ = η r + ϵ ⋅ g \Delta\theta = \frac{\eta}{\sqrt{r + \epsilon}} \cdot g Δθ=r+ϵ η⋅g
  5. 更新参数 θ \theta θ: θ = θ − Δ θ \theta = \theta - \Delta\theta θ=θ−Δθ

AdaGrad算法

与RMS类似的算法,只不过在处理累计梯度的方法上不同

  1. 初始化参数 θ \theta θ,设置学习率 η \eta η,以及数值稳定性的小常数 ϵ \epsilon ϵ(通常设为 1e-8 );
  2. 在每次迭代中,计算参数 θ \theta θ 的梯度 g g g ;
  3. 更新累积平方梯度的指数加权移动平均 r r r,初始为0 : r = r + g 2 r = r+g^2 r=r+g2
  4. 计算参数更新量: Δ θ = η r + ϵ ⋅ g \Delta\theta = \frac{\eta}{\sqrt{r + \epsilon}} \cdot g Δθ=r+ϵ η⋅g
  5. 更新参数 θ \theta θ: θ = θ − Δ θ \theta = \theta - \Delta\theta θ=θ−Δθ

AdaGrad VS RMSProp

AdaGrad: 累积所有过去的梯度平方(无遗忘因子)。这意味着它会不断地累积梯度信息,导致学习率随着时间逐渐减小,可能在后期变得过小,以至于无法继续有效更新;

RMSprop: 使用指数加权平均来累积过去的梯度平方(有遗忘因子)。这种方式使得算法对最近的梯度给予更多的权重,而对旧的梯度逐渐"遗忘",从而避免了学习率过快减小的问题。

学习率的更新

除了通过优化算法来更新学习率之外,我们也可以手动更新学习率

相关推荐
重生之我是Java开发战士2 分钟前
【优选算法】前缀和:一二维前缀和,寻找数组的中心下标,除自身以外数组的乘积,和为K的子数组,和可被K整除的子数组,连续数组,矩阵区域和
线性代数·算法·矩阵
梵刹古音5 分钟前
【C语言】 循环结构
c语言·开发语言·算法
Jiede16 分钟前
LSTM详细介绍(基于股票收盘价预测场景)
人工智能·rnn·lstm
皮皮哎哟12 分钟前
冒泡排序与数组传递全解析 一维二维指针数组及二级指针应用指南
c语言·算法·冒泡排序·二维数组·指针数组·传参·二级指针
m0_5613596713 分钟前
C++代码冗余消除
开发语言·c++·算法
明月照山海-17 分钟前
机器学习周报三十三
人工智能·机器学习
传说故事21 分钟前
【论文自动阅读】视频生成模型的Inference-time物理对齐 with Latent World Model
人工智能·深度学习·音视频·视频生成
半臻(火白)21 分钟前
Clawbot:重新定义AI的「行动派」革命
人工智能
造夢先森23 分钟前
Clawdbot(OpenClaw)安装部署教程
人工智能·微服务·云原生
近津薪荼24 分钟前
优选算法——滑动窗口1(单调性)
c++·学习·算法