
📖标题:Towards joint scaling laws with optimal batch size schedules
🌐来源:arXiv, 2607.27731v1
🛎️文章简介
🔸研究问题:如何确定最优的动态批大小调度策略,以联合优化学习率与批大小对深度学习训练动力学的影响?
🔸主要贡献:论文推导出了任意给定学习率调度下的闭式最优批大小调度公式,并建立了联合缩放定律,显著提升了大语言模型的训练计算效率。
📝重点思路
🔸基于随机凸优化理论,建立了损失序列与学习率序列、批大小序列之间的映射关系,证明了该表征在通用优化器和模型架构下的实证准确性。
🔸将最后一轮迭代的损失最小化作为目标,在数据或计算预算约束下,通过连续近似求解约束优化问题,推导出最优批大小调度的闭式解。
🔸发现最优批大小调度仅取决于总计算预算和学习率调度的形状(如余弦、线性),而与峰值学习率、权重衰减、模型规模及架构无关,实现了超参数解耦。
🔸构建了联合缩放定律,提出峰值学习率和权重衰减应遵循1/√T缩放,结合无尺度批大小调度,确立了渐近最优的损失收敛率。
🔎分析总结
🔸实验表明,动态批大小调度在固定计算量下 consistently 优于静态批大小基线,在Llama3和Qwen3 MoE模型上分别提升了15%和6%的计算效率。
🔸验证了η/B比率不足以完全决定训练动力学,通过控制变量实验证明,在相同η/B轨迹下,调整学习率调度比调整批大小调度能获得更低的损失。
🔸动态批大小调度保持了通用的训练动力学特性(即超级坍缩现象),使得不同规模模型在归一化后的损失曲线重合,增强了缩放预测的鲁棒性。
🔸在视觉语言模型预训练和数学领域微调的后训练实验中,动态批大小同样展现出优于或持平于静态基线的性能,且无额外计算开销。
💡个人观点
论文打破了传统静态批大小的局限,从理论层面揭示了批大小调度与学习率调度的内在联,无需针对特定模型进行繁琐的超参数搜索。
