机器学习笔记:linear scaling learning rate (学习率 和batch size的关系)

  • 在训练神经网络的过程中,随着batch size的增大,处理相同数据量的速度会越来越快,但是达到相同精度所需要的epoch数量越来越多
    • 换句话说,使用相同的epoch数量时,大batch size训练的模型与小batch size训练的模型相比,验证准确率会减小
  • ------>提出了linear scaling learning rate
    • 在mini-batch SGD训练时,增大batch size不会改变梯度的期望,但是会降低它的方差
    • ------>batch size 增加时,增大学习率来加快收敛
      • eg,batch size为256时选择的学习率是0.1,当我们把batch size变为一个较大的数b时,学习率应该变为 0.1 × b/256
相关推荐
树谷-胡老师几秒前
MaxENT生态位模型的物种适生区预测(全球尺度+中国尺度+省级尺度+市县尺度+保护区尺度)超详细教程!
人工智能
SEO_juper4 分钟前
2026_GEO_AI搜索技术实战_CSDN
人工智能·chrome·目标检测·seo·geo·谷歌优化
暴躁的大熊6 分钟前
机器学习中的知识图谱:概念、核心技术与应用场景
人工智能·机器学习·知识图谱
Pokerhead7 分钟前
如何评价 DeepSeek-V4 的价格?
人工智能·大模型·ai编程·deepseek
aiqianji10 分钟前
有哪些稳定的AI短篇小说写作软件可以推荐?
人工智能·python
蓝速科技12 分钟前
蓝速科技丨AI双屏翻译机:重塑线下接待的从容沟通体验
人工智能·科技
Nomarsgo13 分钟前
研华17寸工业显示器 FPM-217在智能制造产线中的应用方案
人工智能·科技·计算机视觉·视觉检测·电脑
ifenxi爱分析14 分钟前
爱分析发布2026年中国GEO市场研究报告
人工智能
石小石Orz18 分钟前
TRAE SOLO实战:实现一个桌面3D助手
前端·人工智能
武子康28 分钟前
Ask/Allow 不是安全边界:企业 Coding Agent 必须建立四层治理(Policy / Scoped Credential / Sandbox / Provenance)
人工智能·后端·agent