【mechine learning-九-梯度下降】

梯度下降

上一节讲过,随机的寻找w和b使损失最小不是一种合适的方法,梯度下降算法就是解决解决这个问题的,它不仅可以用于线性回归,还可以用于神经网络等深度学习算法,是目前的通用性算法。

更加通用的梯度下降算法

之前二维关于w和b的损失函数(无特殊说明,均以均方误差成本函数为例)如下:,

但是在更多的例子里,或者说更加复杂的神经网络里面,w是很多个,目前很多模型都是超过几千亿参数:

已经无法使用随机法来解决最小化J这个损失,必须用更加通用的梯度下降算法来解决最小化损失的问题。

算法步骤

假设某一个模型的成本函数也就是Loss fuction如上(不是线性回归也不是均方误差):

如何从这里面找到J的最小值呢?方法如下:

  1. 设定w和b初始值。如图中左边这条线的起点。
  2. 从现在的位置旋转360度,找到J下降最快的点,向下走一步。(这意味着你走的是最快下山的路)
  3. 以下降后的位置,重复上述步骤,直到发现走到了一个局部最小的山谷底,也就是J的具备最小值。

梯度下降有意思的一件事情,假设随机选择的起始点是另外一个位置,比如右面这条线的起始点,那么找到的就是右边这个局部的最低点,这两个是完全不同的最低点。至于具体怎么实现算法留在下一节。

相关推荐
武子康5 分钟前
DeepSeek Harness 为什么不用 messages 数组保存一切
人工智能·llm·agent
bullkingluo7 分钟前
# 大模型意图识别翻车后,我们换掉了词典和分类 Prompt
人工智能
我是慎独9 分钟前
人工智能:现代方法读书笔记(十三)
人工智能·概率论
十三画者10 分钟前
【文献分享】KCFtools:基于k-mer的无比对基因组变异检测与基因型矩阵构建工具
人工智能·深度学习·数据挖掘·数据分析
m0_6380796213 分钟前
2026AI 论文工具测评:主流学术写作工具深度对比与避坑指南
人工智能
吃旺旺雪饼的小男孩13 分钟前
U-Net 语义分割详解:原论文、PyTorch 实现与真实消融实
人工智能·pytorch·python·算法
lucas_AI13 分钟前
35 种开源文档抽取配置,只有 4 个跨过 F1 0.5
人工智能·算法·llm
穿过生命散发芬芳14 分钟前
用 TRAE Work 把零散运维知识,系统化成一本可复用的运维红宝书
人工智能·trae
刘立军15 分钟前
中心化配置与 I18n:严格禁止 AI 魔法值与硬编码参数
人工智能·后端·架构
两万五千个小时21 分钟前
DeepSeek Harness 从 0 开始:18 todo 任务记忆
人工智能·程序员·架构