- 在训练神经网络的过程中,随着batch size的增大,处理相同数据量的速度会越来越快,但是达到相同精度所需要的epoch数量越来越多
- 换句话说,使用相同的epoch数量时,大batch size训练的模型与小batch size训练的模型相比,验证准确率会减小
- ------>提出了linear scaling learning rate
- 在mini-batch SGD训练时,增大batch size不会改变梯度的期望,但是会降低它的方差
- ------>batch size 增加时,增大学习率来加快收敛
- eg,batch size为256时选择的学习率是0.1,当我们把batch size变为一个较大的数b时,学习率应该变为
0.1 × b/256
- eg,batch size为256时选择的学习率是0.1,当我们把batch size变为一个较大的数b时,学习率应该变为
机器学习笔记:linear scaling learning rate (学习率 和batch size的关系)
UQI-LIUWJ2023-12-17 19:07
相关推荐
豪气的程序猿2 小时前
电商图片工作流怎么选?Lingko AI 对比折叠键盘主图与详情页小刘快学习2 小时前
把 AI 账单拆到部门:企业 AI 网关的精准分账思路米小虾2 小时前
你让监控模型读的思维链,可能是攻击者写好的剧本deepseek233 小时前
Iris 开源搜索智能体拆解:35B 与 397B 中文仅差 0.3 分,上下文管理胜过堆参数ai小陈3 小时前
CUDA Stream实战:让数据传输与GPU计算真正重叠residual_fan3 小时前
【学术论文】航空发动机故障诊断智能体:基于持续对比强化学习的动态优化方法东风破_3 小时前
从 RAG 到 Agentic RAG:第二步,把复杂问题拆开再检索dehuisun3 小时前
第07篇:RAG+Agent 部署架构、资源评估与私有化方案老当益壮梁奶奶3 小时前
51单片机DS18B20温度传感器详解:单总线时序与C51驱动实现米小虾3 小时前
拆给 8 个子智能体,只拿回 2.3 倍信息:多智能体分解的产出守恒律