技术栈
batchsize
西西弗Sisyphus
6 天前
学习
·
batchsize
·
lr
·
learning rate
模型训练 不同批次大小与学习率下的训练损失对比(2)
以ConvNeXt 为例 ConvNeXt 中模型之间的关系flyfishConvNeXt-T / S / B / L / XL 是同一套架构的不同尺寸变体,只有通道数、每个阶段的block数量不同,核心设计(patchify stem、倒置瓶颈、7×7深度卷积、分层结构等)完全一致,参数量和计算量逐级递增。
西西弗Sisyphus
6 天前
学习
·
batchsize
·
learning rate
模型训练 不同批次大小与学习率下的训练损失对比(1)
batchsize 和 learning rate存在什么关系,可以怎么做flyfishηnew=ηold×BnewBold\eta_{new} = \eta_{old} \times \frac{B_{new}}{B_{old}}ηnew=ηold×BoldBnew 批次扩大多少倍,学习率就同步扩大多少倍。
颹蕭蕭
2 年前
微调
·
bert
·
ner
·
学习率
·
batchsize
BERT ner 微调参数的选择
针对批大小和学习率的组合进行收敛速度测试,结论:画图代码(deepseek生成):微调命令日志
我是有底线的