昇思25天学习打卡营第6天|基础知识-函数式自动微分

目录

环境

函数与计算图

微分函数与梯度计算

[Stop Gradient](#Stop Gradient)

[Auxiliary data](#Auxiliary data)

神经网络梯度计算

学习打卡时间


神经网络的训练主要使用反向传播算法,模型预测值(logits)与正确标签(label)送入损失函数(loss function)获得loss,然后进行反向传播计算,求得梯度(gradients),最终更新至模型参数(parameters)。

自动微分能够计算可导函数在某点处的导数值,是反向传播算法的一般化。

自动微分主要解决的问题是将一个复杂的数学运算分解为一系列简单的基本运算,该功能对用户屏蔽了大量的求导细节和过程,大大降低了框架的使用门槛。

MindSpore使用函数式自动微分的设计理念,提供更接近于数学语义的自动微分接口gradvalue_and_grad

环境

python 复制代码
%%capture captured_output
# 实验环境已经预装了mindspore==2.2.14,如需更换mindspore版本,可更改下面mindspore的版本号
!pip uninstall mindspore -y
!pip install -i https://pypi.mirrors.ustc.edu.cn/simple mindspore==2.2.14

导包

python 复制代码
import numpy as np
import mindspore
from mindspore import nn
from mindspore import ops
from mindspore import Tensor, Parameter

函数与计算图

计算图是用图论语言表示数学函数的一种方式,也是深度学习框架表达神经网络模型的统一方法。我们将根据下面的计算图构造计算函数和神经网络。

在这个模型中,𝑥x为输入,𝑦y为正确值,𝑤w和𝑏b是我们需要优化的参数。

python 复制代码
x = ops.ones(5, mindspore.float32)  # input tensor
y = ops.zeros(3, mindspore.float32)  # expected output
w = Parameter(Tensor(np.random.randn(5, 3), mindspore.float32), name='w') # weight
b = Parameter(Tensor(np.random.randn(3,), mindspore.float32), name='b') # bias

我们根据计算图描述的计算过程,构造计算函数。 其中,binary_cross_entropy_with_logits 是一个损失函数,计算预测值和目标值之间的二值交叉熵损失。

python 复制代码
def function(x, y, w, b):
    z = ops.matmul(x, w) + b
    loss = ops.binary_cross_entropy_with_logits(z, y, ops.ones_like(z), ops.ones_like(z))
    return loss

执行计算函数,可以获得计算的loss值。

python 复制代码
loss = function(x, y, w, b)
print(loss)

# Tensor(shape=[], dtype=Float32, value= 0.914285)

微分函数与梯度计算

为了优化模型参数,需要求参数对loss的导数:∂loss/∂𝑤 和 ∂loss/∂𝑏,

调用mindspore.grad函数,来获得function的微分函数。

这里使用了grad函数的两个入参,分别为:

  • fn:待求导的函数。
  • grad_position:指定求导输入位置的索引。

由于我们对𝑤和𝑏求导,因此配置其在function入参对应的位置(2, 3)

使用grad获得微分函数是一种函数变换,即输入为函数,输出也为函数。

python 复制代码
grad_fn = mindspore.grad(function, (2, 3))

执行微分函数,即可获得𝑤w、𝑏b对应的梯度。

python 复制代码
grads = grad_fn(x, y, w, b)
print(grads)

"""
(Tensor(shape=[5, 3], dtype=Float32, value=
[[ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01]]), Tensor(shape=[3], dtype=Float32, value= [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01]))
"""

Stop Gradient

通常情况下,求导时会求loss对参数的导数,因此函数的输出只有loss一项。当我们希望函数输出多项时,微分函数会求所有输出项对参数的导数。此时如果想实现对某个输出项的梯度截断,或消除某个Tensor对梯度的影响,需要用到Stop Gradient操作。

这里我们将function改为同时输出loss和z的function_with_logits,获得微分函数并执行。

python 复制代码
def function_with_logits(x, y, w, b):
    z = ops.matmul(x, w) + b
    loss = ops.binary_cross_entropy_with_logits(z, y, ops.ones_like(z), ops.ones_like(z))
    return loss, z
python 复制代码
grad_fn = mindspore.grad(function_with_logits, (2, 3))
grads = grad_fn(x, y, w, b)
print(grads)

"""
(Tensor(shape=[5, 3], dtype=Float32, value=
[[ 1.03263855e+00,  1.24709988e+00,  1.21991932e+00],
 [ 1.03263855e+00,  1.24709988e+00,  1.21991932e+00],
 [ 1.03263855e+00,  1.24709988e+00,  1.21991932e+00],
 [ 1.03263855e+00,  1.24709988e+00,  1.21991932e+00],
 [ 1.03263855e+00,  1.24709988e+00,  1.21991932e+00]]), Tensor(shape=[3], dtype=Float32, value= [ 1.03263855e+00,  1.24709988e+00,  1.21991932e+00]))
"""

可以看到求得𝑤w、𝑏b对应的梯度值发生了变化。此时如果想要屏蔽掉z对梯度的影响,即仍只求参数对loss的导数,可以使用ops.stop_gradient接口,将梯度在此处截断。我们将function实现加入stop_gradient,并执行。

python 复制代码
def function_stop_gradient(x, y, w, b):
    z = ops.matmul(x, w) + b
    loss = ops.binary_cross_entropy_with_logits(z, y, ops.ones_like(z), ops.ones_like(z))
    return loss, ops.stop_gradient(z)
python 复制代码
grad_fn = mindspore.grad(function_stop_gradient, (2, 3))
grads = grad_fn(x, y, w, b)
print(grads)

"""
(Tensor(shape=[5, 3], dtype=Float32, value=
[[ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01]]), Tensor(shape=[3], dtype=Float32, value= [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01]))
"""

可以看到,求得𝑤w、𝑏b对应的梯度值与初始function求得的梯度值一致。

Auxiliary data

Auxiliary data意为辅助数据,是函数除第一个输出项外的其他输出。通常我们会将函数的loss设置为函数的第一个输出,其他的输出即为辅助数据。

gradvalue_and_grad提供has_aux参数,当其设置为True时,可以自动实现前文手动添加stop_gradient的功能,满足返回辅助数据的同时不影响梯度计算的效果。

下面仍使用function_with_logits,配置has_aux=True,并执行。

python 复制代码
grad_fn = mindspore.grad(function_with_logits, (2, 3), has_aux=True)
python 复制代码
grads, (z,) = grad_fn(x, y, w, b)
print(grads, z)

"""
(Tensor(shape=[5, 3], dtype=Float32, value=
[[ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01]]), Tensor(shape=[3], dtype=Float32, value= [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01])) [-2.2206016  1.0527335  0.6622162]
"""

可以看到,求得𝑤w、𝑏b对应的梯度值与初始function求得的梯度值一致,同时z能够作为微分函数的输出返回。

神经网络梯度计算

前述章节主要根据计算图对应的函数介绍了MindSpore的函数式自动微分,但我们的神经网络构造是继承自面向对象编程范式的nn.Cell。接下来我们通过Cell构造同样的神经网络,利用函数式自动微分来实现反向传播。

首先我们继承nn.Cell构造单层线性变换神经网络。这里我们直接使用前文的𝑤、𝑏作为模型参数,使用mindspore.Parameter进行包装后,作为内部属性,并在construct内实现相同的Tensor操作。

python 复制代码
# Define model
class Network(nn.Cell):
    def __init__(self):
        super().__init__()
        self.w = w
        self.b = b

    def construct(self, x):
        z = ops.matmul(x, self.w) + self.b
        return z

接下来我们实例化模型和损失函数。

python 复制代码
# Instantiate model
model = Network()
# Instantiate loss function
loss_fn = nn.BCEWithLogitsLoss()

完成后,由于需要使用函数式自动微分,需要将神经网络和损失函数的调用封装为一个前向计算函数。

python 复制代码
# Define forward function
def forward_fn(x, y):
    z = model(x)
    loss = loss_fn(z, y)
    return loss

完成后,我们使用value_and_grad接口获得微分函数,用于计算梯度。

由于使用Cell封装神经网络模型,模型参数为Cell的内部属性,此时我们不需要使用grad_position指定对函数输入求导,因此将其配置为None。对模型参数求导时,我们使用weights参数,使用model.trainable_params()方法从Cell中取出可以求导的参数。

python 复制代码
grad_fn = mindspore.value_and_grad(forward_fn, None, weights=model.trainable_params())
python 复制代码
loss, grads = grad_fn(x, y)
print(grads)

"""
(Tensor(shape=[5, 3], dtype=Float32, value=
[[ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01],
 [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01]]), Tensor(shape=[3], dtype=Float32, value= [ 3.26385535e-02,  2.47099832e-01,  2.19919339e-01]))
"""

执行微分函数,可以看到梯度值和前文function求得的梯度值一致。

学习打卡时间

相关推荐
架构文摘JGWZ29 分钟前
Java 23 的12 个新特性!!
java·开发语言·学习
小齿轮lsl33 分钟前
PFC理论基础与Matlab仿真模型学习笔记(1)--PFC电路概述
笔记·学习·matlab
Aic山鱼1 小时前
【如何高效学习数据结构:构建编程的坚实基石】
数据结构·学习·算法
qq11561487071 小时前
Java学习第八天
学习
天玑y1 小时前
算法设计与分析(背包问题
c++·经验分享·笔记·学习·算法·leetcode·蓝桥杯
2301_789985942 小时前
Java语言程序设计基础篇_编程练习题*18.29(某个目录下的文件数目)
java·开发语言·学习
橄榄熊2 小时前
Windows电脑A远程连接电脑B
学习·kind
酱香编程,风雨兼程3 小时前
深度学习——基础知识
人工智能·深度学习
web_learning_3213 小时前
source insight学习笔记
笔记·学习
Lossya3 小时前
【机器学习】参数学习的基本概念以及贝叶斯网络的参数学习和马尔可夫随机场的参数学习
人工智能·学习·机器学习·贝叶斯网络·马尔科夫随机场·参数学习