Meta:动态批大小提升训练效率

📖标题:Towards joint scaling laws with optimal batch size schedules

🌐来源:arXiv, 2607.27731v1

🛎️文章简介

🔸研究问题:如何确定最优的动态批大小调度策略,以联合优化学习率与批大小对深度学习训练动力学的影响?

🔸主要贡献:论文推导出了任意给定学习率调度下的闭式最优批大小调度公式,并建立了联合缩放定律,显著提升了大语言模型的训练计算效率。

📝重点思路

🔸基于随机凸优化理论,建立了损失序列与学习率序列、批大小序列之间的映射关系,证明了该表征在通用优化器和模型架构下的实证准确性。

🔸将最后一轮迭代的损失最小化作为目标,在数据或计算预算约束下,通过连续近似求解约束优化问题,推导出最优批大小调度的闭式解。

🔸发现最优批大小调度仅取决于总计算预算和学习率调度的形状(如余弦、线性),而与峰值学习率、权重衰减、模型规模及架构无关,实现了超参数解耦。

🔸构建了联合缩放定律,提出峰值学习率和权重衰减应遵循1/√T缩放,结合无尺度批大小调度,确立了渐近最优的损失收敛率。

🔎分析总结

🔸实验表明,动态批大小调度在固定计算量下 consistently 优于静态批大小基线,在Llama3和Qwen3 MoE模型上分别提升了15%和6%的计算效率。

🔸验证了η/B比率不足以完全决定训练动力学,通过控制变量实验证明,在相同η/B轨迹下,调整学习率调度比调整批大小调度能获得更低的损失。

🔸动态批大小调度保持了通用的训练动力学特性(即超级坍缩现象),使得不同规模模型在归一化后的损失曲线重合,增强了缩放预测的鲁棒性。

🔸在视觉语言模型预训练和数学领域微调的后训练实验中,动态批大小同样展现出优于或持平于静态基线的性能,且无额外计算开销。

💡个人观点

论文打破了传统静态批大小的局限,从理论层面揭示了批大小调度与学习率调度的内在联,无需针对特定模型进行繁琐的超参数搜索。

相关推荐
小和尚同志8 小时前
1.8k star 的开源 token 使用量监控神器— TokenTracker
人工智能·ai编程
极客 - L U9 小时前
神经网络 - 激活函数、损失函数、优化器
人工智能·深度学习·神经网络
数字融合9 小时前
透明化视频三维矿山井下照明重建技术
人工智能·python·数码相机
yi0119 小时前
LeetCode 219:存在重复元素 II——哈希表记录“最近一次出现的位置”
数据结构·人工智能·笔记·python·算法·leetcode·哈希表
xiangzhihong89 小时前
创之星花店多端业务闭环拆解
人工智能
奈落2410 小时前
AI 编程从助手到 Agent:基于两份资料看哪些环节可以交出去,哪些必须自己攥住
大数据·人工智能
Joker可视化开发平台10 小时前
AI短剧接棒真人剧:开机量跌七成,普通人进场窗口在收窄
大数据·人工智能
澳鹏Appen10 小时前
澳鹏电子书 | 强化学习环境:为AI智能体打造高保真训练场
人工智能
吴佳浩10 小时前
单卡5090跑125B 大模型:Strata 把服务器级 MoE 拉进普通 PC
人工智能
Data-Miner10 小时前
AI做表格软件哪个好?专业评测:五维对比看清差距
人工智能