技术栈

batchsize

西西弗Sisyphus
6 天前
学习·batchsize·lr·learning rate
模型训练 不同批次大小与学习率下的训练损失对比(2)以ConvNeXt 为例 ConvNeXt 中模型之间的关系flyfishConvNeXt-T / S / B / L / XL 是同一套架构的不同尺寸变体,只有通道数、每个阶段的block数量不同,核心设计(patchify stem、倒置瓶颈、7×7深度卷积、分层结构等)完全一致,参数量和计算量逐级递增。
西西弗Sisyphus
6 天前
学习·batchsize·learning rate
模型训练 不同批次大小与学习率下的训练损失对比(1)batchsize 和 learning rate存在什么关系,可以怎么做flyfishηnew=ηold×BnewBold\eta_{new} = \eta_{old} \times \frac{B_{new}}{B_{old}}ηnew=ηold×BoldBnew 批次扩大多少倍,学习率就同步扩大多少倍。
颹蕭蕭
2 年前
微调·bert·ner·学习率·batchsize
BERT ner 微调参数的选择针对批大小和学习率的组合进行收敛速度测试,结论:画图代码(deepseek生成):微调命令日志
我是有底线的