- 在训练神经网络的过程中,随着batch size的增大,处理相同数据量的速度会越来越快,但是达到相同精度所需要的epoch数量越来越多
- 换句话说,使用相同的epoch数量时,大batch size训练的模型与小batch size训练的模型相比,验证准确率会减小
- ------>提出了linear scaling learning rate
- 在mini-batch SGD训练时,增大batch size不会改变梯度的期望,但是会降低它的方差
- ------>batch size 增加时,增大学习率来加快收敛
- eg,batch size为256时选择的学习率是0.1,当我们把batch size变为一个较大的数b时,学习率应该变为
0.1 × b/256
- eg,batch size为256时选择的学习率是0.1,当我们把batch size变为一个较大的数b时,学习率应该变为
机器学习笔记:linear scaling learning rate (学习率 和batch size的关系)
UQI-LIUWJ2023-12-17 19:07
相关推荐
LadiesAndGentlemen几秒前
概览篇:世界模型、空间智能与地理空间智能是什么关系fly76327854 分钟前
免费篮球高光剪辑开源工具爱写代码的小朋友6 分钟前
从工具嵌入到范式重构:人工智能与基础教育融合的深层逻辑与路径审思极新7 分钟前
百度 AI 选择免费:一场关于流量与变现的战略博弈新新学长搞科研14 分钟前
【经济、管理、大数据可接收】第二届人工智能、业务转型和数据科学创新国际学术会议(ICBTDS 2026)向哆哆15 分钟前
中草药检测数据集分享(适用于目标检测任务已标注+划分)摇滚侠18 分钟前
《SpringBoot 3:入门与应用实战》第 7 章 AOP 思想与实现 阅读笔记 13杰瑞学AI18 分钟前
学好AI Agent的6把“金钥匙”百胜软件@百胜软件23 分钟前
董宇辉的尽头是山姆?——个人IP如何转化为零售品牌