pytorch求hessian

首先有个

网络定义

随意定义了,根据自己的情况

python 复制代码
class ANN(nn.Module):
    def __init__(self):
        super(ANN, self).__init__()
        self.fc1 = nn.Linear(10000, 1)
        # self.fc1.bias.data.fill_(0)
        
    def forward(self, data):
        x = self.fc1(data)
        return x

求hessian

autograd这个方法求梯度的时候分子是scalar ,分母是vector的时候,也即scalar对vector求导,得到的梯度向量和vector一样,而对于vector对vector求导,autograd没法求,只能求scalar对vector求导,所以需要循环。

python 复制代码
def getHessian(grads, model, loss_fn, dat, tar ,device):


    loss = loss_fn(model(dat), tar)
    grads_fn = torch.autograd.grad(loss, model.parameters(), retain_graph=True, create_graph=True) # 记录一阶梯度的grad_fn
 	
 	# 这部分是更新一阶梯度的值,因为其实我要计算的一阶梯度的值是grads
    for source, target in zip(grads, grads_fn):
        target.data.copy_(source)

    hessian_params = []
    #第k个梯度
    for k in range(len(grads_fn)):
        # 第i个参数
        for param in model.parameters():
            hess_params = []
            # 第k个梯度的地i行参数
            for i in range(grads_fn[k].size(0)):
                # 判断是w还是b
                if len(grads_fn[k].size()) == 2:
                    # w
                    for j in range(grads_fn[k].size(1)):  
                        hess = torch.autograd.grad(grads_fn[k][i][j], param, retain_graph=True, allow_unused= True)
                        hess_params.append(hess[0].cpu().detach().numpy() if hess[0] is not None else None)
                else:
                    # b
                    hess = torch.autograd.grad(grads_fn[k][i], param, retain_graph=True, allow_unused=True)
                    hess_params.append(hess[0].cpu().detach().numpy() if hess[0] is not None else None)
            hessian_params.append(np.array(hess_params))
    return hessian_params

关于backward和autograd

autograd只计算梯度不反向传播更新model的参数,因为这部分是torch中的优化器进行的,backward()也计算梯度,但获得具体一阶梯度信息需要用这个命令

grad_list = [p.grad.clone() for p in net.parameters()]

而这样得到的一阶梯度是不含grad_fn的,再进行求导的时候报错,虽然我也尝试loss.backward(retain_graph=True)用了这里的参数,但仍然无法解决问题,所以还是用了autograd。但在模型更新的时候两者使用并不冲突

python 复制代码
 net = ANN()
opt = optim.SGD(net.parameters(), lr=1e-4)


 net.load_state_dict(model_state_dict)
 net.to(device)

 opt.load_state_dict(optimizer_state_dict)
 
 opt.zero_grad()
 
 pred = net(inputs)

 loss = loss_fn(pred, targets)


 grads = torch.autograd.grad(loss, net.parameters(), retain_graph=True, create_graph=True) # 计算一阶梯度

 loss.backward(retain_graph=True)
 opt.step()
  
  ·········
  ······
  #之后进行hessian矩阵的计算就可以

参考

1\] [参考这个博客进行pytorch 求hessian](https://blog.csdn.net/Cyril_KI/article/details/124562109) \[2\] [【矩阵的导数运算】标量向量方程对向量求导_分母布局_分子布局](https://www.bilibili.com/video/BV1av4y1b7MM/?spm_id_from=333.999.0.0&vd_source=2c0021dfb98aee58f7a63ef2d9ad3b48) 此系列三个视频 \[3\] [常用矩阵微分公式_老子今晚不加班的博客-CSDN博客](https://blog.csdn.net/hqh45/article/details/50920904) 这里提到的链接,里面也有提到\[4\]的链接 \[4\] [Matrix calculus - Wikipedia](https://en.wikipedia.org/wiki/Matrix_calculus)这里面总结的很好

相关推荐
Java后端的Ai之路12 小时前
【Python 教程15】-Python和Web
python
那个村的李富贵12 小时前
光影魔术师:CANN加速实时图像风格迁移,让每张照片秒变大师画作
人工智能·aigc·cann
冬奇Lab13 小时前
一天一个开源项目(第15篇):MapToPoster - 用代码将城市地图转换为精美的海报设计
python·开源
腾讯云开发者13 小时前
“痛点”到“通点”!一份让 AI 真正落地产生真金白银的实战指南
人工智能
CareyWYR13 小时前
每周AI论文速递(260202-260206)
人工智能
hopsky14 小时前
大模型生成PPT的技术原理
人工智能
禁默15 小时前
打通 AI 与信号处理的“任督二脉”:Ascend SIP Boost 加速库深度实战
人工智能·信号处理·cann
心疼你的一切15 小时前
昇腾CANN实战落地:从智慧城市到AIGC,解锁五大行业AI应用的算力密码
数据仓库·人工智能·深度学习·aigc·智慧城市·cann
AI绘画哇哒哒15 小时前
【干货收藏】深度解析AI Agent框架:设计原理+主流选型+项目实操,一站式学习指南
人工智能·学习·ai·程序员·大模型·产品经理·转行
数据分析能量站15 小时前
Clawdbot(现名Moltbot)-现状分析
人工智能