6. 网络优化方法之 学习率 优化/衰减策略

1. 学习率优化

如图:学习率=0.01时收敛速度很慢,学习率=0.1时收敛速度变快,学习率越大 收敛速度越快;

学习率=0.2 即学习率较大是会 来回震荡 ,学习率=0.3 即学习率过大时会发生 梯度爆炸(即远远超出所在范围)

结论:
学习率越小,梯度下降越慢;学习率越大,梯度下降越快,可能会越过最小值,造成震荡,甚至不收敛(梯度爆炸);

2. 学习率衰减方法 (衰减策略)

2.1 等间隔学习率衰减方法

2.2 指定间隔学习率衰减方法

2.3 指数间隔学习率衰减方法

2.4 总结:

学习率衰减策略介绍:
1️⃣ 目的: 较之于AdaGrad,RMSProp,Adam方式,我们可以通过 等间隔,指定间隔,指数等方式,来手动控制学习率的调整.

2️⃣ 分类:

    等间隔学习率衰减

    指定间隔学习率衰减

    指数学习率衰减

3️⃣ 等间隔学习率衰减:

    step_size:间隔的轮数,即:多少轮调整一次学习率。

   gamma:学习率衰减系数,即:Lr新=Lr旧*gamma

    优点: 直观,易于调试,适用于大批量数据.

    缺点: 学习率变化较大,可能跳过最优解.

    应用场景: 大型数据集,较为简单的任务。

4️⃣ 指定问隔学习率衰减:

    milestones = 50, 125, 160 里边定义的是要调整学习率的 轮数。

    gamma: 学习率衰减系数,即: lr新 = lr旧 * gamma

    优点:易于调试,稳定训练过程.

    缺点: 在某些情况下可能衰减过快,导致优化提前停滞.

    应用场景: 对训练平稳性要求较高的任务。

5️⃣ 指数间隔学习率衰减:

    前期学习率衰减快,中期慢,后期更慢.更符合梯度下降规律

    公式: Lr新 = Lr旧 * gamma ** epoch

    优点: 平滑,且考虑历史更新,收敛稳定性较强.

    缺点: 超参调节较为复杂,可能需要更多的资源.

    应用场景: 高精度训练,避免过快收敛.

相关推荐
段一凡-华北理工大学15 小时前
AI推动工业智能化转型~系列文章24:钢铁工业 AI 全景图:从原料场到轧机的场景地图
人工智能·深度学习·模型生命周期·钢铁工业·ai全景
chen_zn9517 小时前
《VLA 系列》Human-to-Robot Transfer | 人类视频共训练 | 跨本体涌现迁移 | 论文解析
人工智能·深度学习·transformer·具身智能·vla
CCC:CarCrazeCurator17 小时前
DeepSeek‑Harness Windows 本地快速上手
深度学习·数据挖掘
还不秃顶的计科生18 小时前
具身智能论文学习8:Octo: An Open-Source Generalist Robot Policy
人工智能·深度学习·学习·机器学习·语言模型·vla·vlm
lucas_AI18 小时前
1.2B 小模型赢过 235B 大模型:NaviDC-OCR 把文档解析卷明白了
人工智能·深度学习·算法
杀生丸学AI18 小时前
【稀疏重建】StructSplat:基于非校准稀疏视图的可泛化3DGS
深度学习·3d·音视频·transformer·三维重建·空间智能
qfljg20 小时前
如何学习opencode和openclaw源码
深度学习
zhenaibo52121 小时前
摘要、研究背景、文献综述AI风险高,怎么优化?
人工智能·深度学习·自然语言处理
hhzz1 天前
Tiger AI 平台「手势识别」功能全解析:从数字手势 0–9,到中国手语字母,再到本地视频批量识别——一条链路,三种输入,双模型可同开;双手比划,机器秒懂
人工智能·python·深度学习·aigc·音视频
自学机械人的小白ing1 天前
深度学习系统学习
人工智能·深度学习·学习