使用Pytorch自动计算梯度

使用Pytorch自动计算梯度

torch 包内为我们提供了很多有用的函数,让我们无需手动计算梯度:

python 复制代码
import torch

x=torch.tensor([1.,2.,3.,4.])

x.requires_grad_(True)
y=2*torch.dot(x,x)
# tensor(60., grad_fn=<MulBackward0>)

print(x.grad)
# None

y.backward()

print(x.grad)
# tensor([ 4.,  8., 12., 16.])

x.requires_grad_(True) 是为了告诉 torch ,我需要对 x 计算梯度。因为(对于一个有上万/亿参数的函数)计算梯度是非常消耗算力的,所以 torch 默认不会计算梯度,需要我们通过 requires_grad_(True) 显示声明。

但在实践过程中,我们不可能只取一个 x 的值(一个向量)来决定接下来应该如何调整运动轨迹。

如果我们选三个 x 的值,就得到三个梯度:

python 复制代码
import torch

x1 = torch.tensor([1., 2., 3., 4.])
x2 = torch.tensor([1., 3., 3., 1.])
x3 = torch.tensor([5., 2., 1., 4.])

x1.requires_grad_(True)
y1 = 2 * torch.dot(x1, x1)
y1.backward()
print(x1.grad)
# tensor([ 4.,  8., 12., 16.])

x2.requires_grad_(True)
y2 = 2 * torch.dot(x2, x2)
y2.backward()
print(x2.grad)
# tensor([ 4., 12., 12.,  4.])

x3.requires_grad_(True)
y3 = 2 * torch.dot(x3, x3)
y3.backward()
print(x3.grad)
# tensor([20.,  8.,  4., 16.])

但是,我们只需要一个梯度,来决定接下来的运动轨迹。可以选择将梯度相加,或者取平均值之类的方法,来得到一个统一的梯度。

放到数学上来说(数学意义),就是对于一个结果是向量的函数求导:

python 复制代码
import torch

x = torch.tensor([1., 2., 3., 4.])

x.requires_grad_(True)
y = 2 * x * x

print(y)
# tensor([ 2.,  8., 18., 32.], grad_fn=<MulBackward0>)

y.sum().backward()

print(x.grad)
kward0>)

y.sum().backward()

print(x.grad)
# tensor([ 4.,  8., 12., 16.])

我们通过 y.sum() 将函数的结果从向量压缩成标量,然后再求导,就获得了我们想要的梯度

相关推荐
安逸sgr1 小时前
循环神经网络 RNN、LSTM、GRU 是什么?为什么能处理序列?
人工智能·ai·大模型·agent·智能体
猿小猴子1 小时前
主流 AGENT 实战教程「OpenCodex」与「ChatGPT Work」与「Codex Record & Replay」介绍
人工智能·ai·chatgpt·codex·minimax·deepseek·opencodex
shdwak....sad1 小时前
版本管理&迁移kali-vmware&知识库
人工智能·网络安全
阿标的博客1 小时前
Python实训案例(二):输出植物证书
python
鸿芯微控科技2 小时前
压电点胶阀出胶量不稳定怎么排查?驱动波形、背压、点胶重量与Python分析
开发语言·python·压电点胶阀·精密点胶·点胶重量·流体控制
一位正在转型AI全栈的前端工程师2 小时前
从 0 到 1 搭建生产级 RAG 系统:切片、召回与重排序调优实录
python·前端工程化
程序员cxuan2 小时前
OpenAI Linux 版来了!
人工智能·后端·程序员
糖炒栗子03262 小时前
learn-claude-code 简要记录
笔记·python
用户5619035069332 小时前
OpenAI兼容API报401/404/429怎么解决?API Key、Base URL、模型名排查
人工智能