不同层设置不同学习率

Enzo 想砸电脑2023-09-22 2:08

使用预训练模型时，可能需要将

（1）预训练好的 backbone 的参数学习率设置为较小值，

（2）而backbone 之外的部分，需要使用较大的学习率。

python 复制代码

from collections import OrderedDict
import torch.nn as nn
import torch.optim as optim

net = nn.Sequential(OrderedDict([
    ("linear1", nn.Linear(10, 20)),
    ("linear2", nn.Linear(20, 30)),
    ("linear3", nn.Linear(30, 40))]))


linear3_params = list(map(id, net.linear3.parameters()))
base_params = filter(lambda p: id(p) not in linear3_params, net.parameters())

optimizer = optim.SGD([
    {'params': base_params},
    {'params': net.linear3.parameters(), 'lr': 0.0005}],
    lr=0.001, momentum=0.9)


print(optimizer)
print(optimizer.param_groups[0]['lr'])
print(optimizer.param_groups[1]['lr'])

上一篇：【C++】unordered_map与unorder_set的封装（哈希桶）

下一篇：【数据库系统概论】数据库的四个基本概念：数据、数据库、数据库管理系统和数据库系统