自动微分模块

多元线性回归是 y=wx+b,x一般充当特征、z充当预测值(相当于上面公式里的y),z如何来的?:x * w + b,得到的是预测值 z,预测值下面会有一个与之对应的 y真实值,想要描述预测值 z和真实值y 之间的关系用 loss损失函数,为了让损失最小,需要求导:之前做求导需要手动计算,现在可以通过自动微分 帮忙求导,算出导数,再反向把值传到下框中,用来更新 w和 b;
为什么叫反向传播 ?:因为从 x - -> w 乘 、b加 - -> 拿到预测值z、结合真实值y - -> 得到损失函数;(绿色标注的、从左往右一直到计算出损失函数的过程叫正向传播),拿到损失函数进行求导,求导的目的是为了让损失最小,所以会将求导结果带入到下框 更新 w和b,更新完 w和b后,再次进行下一轮的正向传播,又可以得到新的预测值,再结合真实值再次计算损失,这个损失值肯定是会一次次降低的,算完后拿着导数(梯度)再次更新 w和b参数,更新完后第二轮传播结束;

第三轮拿着更新后的 w和b,与x一起再次计算预测值,预测值与真实值一起再计算损失求导,拿到导数再次更新 w和b...

所以从前往后叫正向,求导后拿着导数反向更新 w和b的值的动作叫做 BP算法**(Back Propagation 反向传播)**;

相关推荐
ForDreamMusk7 小时前
Transformer Encoder Block
人工智能·深度学习·transformer
打工仔折腾 AI7 小时前
LLaMA 1 到 LLaMA 3 架构演进拆解:从 RoPE、GQA 到词表扩张
人工智能·后端·python·深度学习·langchain·llama
这张生成的图像能检测吗9 小时前
(论文速读)LINN:液体神经网络与脉冲神经元融合的可解释旋转机械故障诊断
人工智能·深度学习·神经网络·故障诊断
东方佑9 小时前
v24 (Hybrid2Fast) 架构与实验报告
人工智能·深度学习·语言模型·自然语言处理·架构
龍德明宇10 小时前
无摩擦的智能与有重力的主体-龍德明宇
人工智能·深度学习·ai哲学·负主体性·ai存在论
成为深度学习高手12 小时前
SEMixer:以随机注意力增强patch语义、渐进混合多尺度的轻量长期时序预测模型
人工智能·深度学习·机器学习·数据挖掘·时间序列
阡陌数智13 小时前
大模型领域自适应微调:小样本场景下过拟合抑制与数据构建方法论
人工智能·深度学习·机器学习
超大青花鱼14 小时前
Ubuntu20.04安装CUDA11.8教程
人工智能·深度学习·计算机视觉
Ivanqhz15 小时前
BURG(自底向上重写生成器)
服务器·数据库·人工智能·深度学习·算法
Ivanqhz1 天前
激活函数在 Transformer 中的作用及各种变体简述
java·linux·数据库·人工智能·深度学习