大模型面试题:当Batch Size增大时,学习率该如何随之变化?

我整理了1000道算法面试题

获取

该问题大答案的理论分析请参考苏剑林的科学空间,地址位于 https://kexue.fm/archives/10542

说下结论:从方差的角度来分析,有两个角度来说明学习率应该和Batch size的关系,一个是呈现根号的关系,也即Batch size增大x倍,学习率增大根号x倍,另一个角度是呈现线性的关系,也即Batch size增大x倍,学习率增大x倍。从损失的角度来分析,学习率随着Batch Size的增加而单调递增但有上界。

  • 方差角度
  1. 作者明确了自2014年的《One weird trick for parallelizing convolutional neural networks》,该论文的推导原理是让SGD增量的方差保持不变。若干个推导明确了通过调整学习率η 让增量的噪声强度即协方差矩阵保持不变,得到了一个是呈现根号的关系,也即Batch size增大x倍,学习率增大根号x倍。

  2. 作者明确了在实践中,Batch size增大x倍且学习率增大根号x倍的表现最好,中间涉及了一些推导,主要是基于梯度的噪声是正态分布的假设开始。

  • 损失角度
  1. 作者说了经典工作是OpenAI的《An Empirical Model of Large-Batch Training》,它通过损失函数的二阶近似来分析SGD的最优学习率,得出"学习率随着Batch Size的增加而单调递增但有上界"的结论。整个推导过程值将学习率也作为待优化的参数写进到损失函数L里面去,然后通过二阶泰勒展开得到n_max,也就是学习率最大的表达式,,可以看到B越大的话,学习率也可以越大,但是最后会饱和。
  • 其它
  1. 实际在训练过程中,先通过海塞矩阵和梯度得到,然后通过小批量的数据得到,然后结合B得到。

  2. 表明数据量越小,那么应该缩小Batch Size,让训练步数更多,才能更有机会达到更优的解。

  • 大模型

    简单说,openai发现,用大batch size配合大的learning rate,和用小batch size和小learning rate最终到达的效果是一样的。当然,后面他们也一直都是这样实践的。

参考

1 https://kexue.fm/archives/10542

相关推荐
mykj15515 小时前
英语单词APP解锁学习新方式,智能高效背单词
学习·英语单词app
kruptos5 小时前
分布式系统怎么“选主“?Raft 共识一次讲清
开发语言·分布式·php·共识算法
吴声子夜歌5 小时前
ApacheCommons——commons-cli(命令行参数解析)
java·开发语言·apache
知识分享小能手5 小时前
深度学习学习教程,从入门到精通,深度学习中的正则化 — 完整知识点与代码示例(7)
人工智能·深度学习·学习
benchmark_cc6 小时前
REST API 和 Python SDK 应该怎么选?量化交易数据接口选型实战
开发语言·python·数据分析·pandas·量化交易·股票数据·quantdash
王的宝库6 小时前
Go 项目结构:从单文件到标准工程布局
开发语言·后端·golang
~kiss~6 小时前
Agent 的 未来吗?String: An Agentic OS Where Every App Is a Markdown File
学习
Tairitsu_H6 小时前
[C++] 深入理解红黑树:封装set与map
开发语言·c++·set·map·红黑树·模拟实现
泡海椒7 小时前
JQuick-Curl 性能分析:并发场景下的性能表现与调优,第三方接口调用不只要快写也要稳跑
java·开发语言·okhttp
小智老师PMP7 小时前
2026深度解析|PMP第八版与NPDP核心侧重点本质区别(管理类证书怎么选)
开发语言·分布式·算法·职场和发展·产品经理