梯度下降含义

标题:【深度学习优化】梯度下降:从原理到批量/随机/小批量梯度下降

摘要:

梯度下降是深度学习最基础的优化算法:沿着负梯度方向迭代更新参数,使损失函数逐步降低。本文通俗讲解原理、公式与三种常见变体。

一、核心思想

把损失 L(θ)L(\theta)L(θ) 看作高山,梯度是上升最快方向,负梯度是下山最快方向。反复沿负梯度走一步,直到走到谷底(损失最小)。

二、基本公式

θ=θ−η⋅∇L(θ) \theta = \theta - \eta \cdot \nabla L(\theta) θ=θ−η⋅∇L(θ)

  • θ\thetaθ:模型参数(权重/偏置)
  • η\etaη:学习率(步长)
  • ∇L(θ)\nabla L(\theta)∇L(θ):损失对参数的梯度

三、三种常见梯度下降

  1. 批量梯度下降 BGD:全样本算一次梯度,稳定但慢,内存开销大。
  2. 随机梯度下降 SGD:每次只用1个样本算梯度,快、有噪声,易跳出局部最优。
  3. 小批量梯度下降 Mini-batch SGD :每次用一小批(如 32/64/128)样本,速度+稳定性平衡,工业界默认。

四、学习率的影响

  • 太大:参数震荡不收敛
  • 太小:学习极慢、易困在局部最优
  • 常用策略:衰减学习率、自适应优化器(Adam、RMSprop)

小结:

梯度下降本质是迭代式沿负梯度最小化损失。BGD、SGD、Mini-batch 各有优劣,Mini-batch 是现在深度学习主流。

相关推荐
AI大模型-小雄1 小时前
ChatGPT充值后Codex总改无关文件?用AGENTS.md限制项目修改范围
chatgpt·ai编程·codex·chatgpt plus·chatgpt pro·chatgpt充值
ZzT9 小时前
如何降低 Agent 生码不确定性?微软图表中间语言 Flint 有了答案
ai编程
AI大模型-小华10 小时前
Codex 三方充值快速入门指南
java·前端·数据库·chatgpt·ai编程·codex·chatgpt pro
Tsonglew14 小时前
OpenWorker 代码解剖:一个 AI 同事"敢让它干活"的工程学
agent·ai编程
AI编程实验室14 小时前
大模型手搓文件对比工具(6):差异不用再手选
ai编程
极连AI16 小时前
极连AI平台解读、Codex5.6仅需0.01倍率,无需Token焦虑,极速响应
人工智能·gpt·chatgpt·aigc·ai编程·ai写作·gpu算力
leeyi17 小时前
Embedder 接口 + 缓存层源码:一个把 key 撑大 3 倍的实现(第71篇-E57)
aigc·agent·ai编程
小虎AI生活17 小时前
WorkBuddy 加 Remotion,批量视频成本趋近于零
ai编程
极客密码19 小时前
DeepSeek V4-Flash 正式版发布:Agent 基准、价格与 Codex 接入保姆级教程
agent·ai编程·deepseek
音符犹如代码19 小时前
DeepSeek V4 Flash正式版发布
ai·ai编程·deep learning