深度学习基础—RMSprop算法与Adam 优化算法

1.RMSprop算法

1.1.算法流程

除了动量梯度下降法,RMSprop算法也可以加快梯度下降,这个算法的算法流程如下:深度学习基础---动量梯度下降法http://t.csdnimg.cn/zeGRo

1.2.算法原理

和动量梯度下降不同的是,对dW和db的变成了平方项,同时权重更新变为了(dW/sqrt(SdW))和(db/sqrt(Sdb)),这样做的原因如下:

如上图,损失函数是关于参数W和b的函数,因此简化为x轴表示W的优化方向,y轴表示b的优化方向。同动量梯度下降,我们希望减少y轴方向的摆动,加快x轴方向的优化,因此有SdW和Sdb。观察微分的方向,可以发现:摆动幅度过大,因此损失函数的斜率在b方向上的分量更多,也就是db更大,相反dW更小。于是SdW更小,Sdb更大。为了让W的变化幅度更大(加速x轴),b的变化幅度更小(减小y轴摆动),因此为W更新公式的dW除以一个较小的数,即sqrt(SdW),b更新公式的db除以更大的数,即sqrt(Sdb),达到削减大梯度的方向的梯度,增加小梯度方向的梯度,从而减小摆动,进而可以选择较大的学习率,加快模型的收敛。

注意:为了防止分母为0的风险,可以给分母+ℇ,即sqrt(SdW)+ℇ,ℇ通常取10^(-8),同理sqrt(Sdb)也是。

2.Adam 优化算法

Adam 优化算法是RMSprop算法和动量梯度下降法的结合版,该算法性能优秀,已被证明能适用多种不同结构的神经网络。该算法的算法流程如下:

本算法有很多超参数:学习率a,动量梯度下降法参数b1,RMSprop算法参数b2,ℇ。对于这些参数,默认b1=0.9,b2=0.999,ℇ=10^(-8)。一般不需要变动,但是学习率需要多次调试找到合适值。

相关推荐
梦想的初衷~4 小时前
Agent2.0驱动的科研全链路实战营;LLM×NotebookLM×本地部署,从数据分析到Sora级视频产出,“圆桌会议“
人工智能·ai科研教程·notebooklm科研·科研agent开发·python科研自动化·文献智能管理
明航咨询_贾老师4 小时前
AI智能体供应链投毒事件深度剖析|从OpenClaw技能包攻击到91% Agent漏洞,企业安全架构必须重构
人工智能·重构·安全架构
小道士写程序4 小时前
自然语言处理NLP - 第11章 从概率到回答:推理与提示词
人工智能·自然语言处理
147API4 小时前
学生模型和教师模型怎样做路由,阈值应该看哪些指标
网络·人工智能·深度学习·机器学习·智能路由器
该逃避避4 小时前
Copilot 能换成本地吗?本地化 AI 编程助手可行性全解析
人工智能·copilot
霸道流氓气质4 小时前
Spring AI Alibaba 系列总结:Java 工程师 AI 能力全景图谱
java·人工智能·spring
俊哥V4 小时前
AI 今日研究简报 · 2026-09-08
人工智能·ai
一切皆是因缘际会4 小时前
具身智能
人工智能·microsoft·生活
微三云生态系统架构师-彭丹4 小时前
区域拆分独立分红池系统设计:解决大盘分红迟滞的四维拆分引擎
大数据·人工智能
吴佳浩 Alben5 小时前
构建企业级 DevOps 排错 Agent:从日志告警到自动化修复 PR
大数据·人工智能·语言模型·架构·自动化·ai编程·devops