LLM - 神经网络的训练过程

  1. 对于回归问题,用损失函数来计算预测值和真实值的差异,一种常用的公式是如下图所示(Mean Square Error),如果损失函数的值越小说明神经网络学习越准确,所以神经网络训练目标是减小损失函数的值,
  1. 对于分类问题,损失函数和上面不一样,这里使用交叉熵作为损失函数,神经网络训练目标是最小化交叉熵。
  1. 最小化损失函数的方法(梯度下降法),即将优化步骤拆分成若干个步骤,每次对损失函数的值做小幅缩小,具体过程是对损失函数求该模型参数的梯度,每次迭代对向着梯度变化最快的方向前进一步(这样就可以计算出模型参数,并在此轮迭代后更新模型参数),这样就可以使损失函数值降低一点,每次前进一步的步长称为学习率。
  1. 回归问题的梯度求解过程:输出是标量F(x), 输入是x1,x2,...xn, 对输入求偏导,得到的向量是梯度。
  1. 分类问题的梯度求解过程:输出是向量F(X),有多个输出,让每个输出对输入变量Xx1,x2,..xn求微分,得到的jacobian矩阵是梯度
  1. 求微分时的链式法则:

7.求微分实例:

8.在实际深度学习场景中,对每个参数梯度计算是通过反向传播算法实现的。

9.单个节点梯度的计算过程: downstream_gradient = upstream_gradient * local_gradient****这个公式在实际写算子时会用到。

相关推荐
地平线开发者3 分钟前
MQBench QAT量化实践指南
人工智能·算法·自动驾驶
Είναι η κοπέλα12 分钟前
llama.cpp 与 GGUF 格式:本地大模型的“裸引擎“
开发语言·人工智能·pytorch·python·conda
桃西西呀17 分钟前
Spring AI Alibaba 之二:Spring AI 底座与原子抽象一笔带过,看清 SAA 在之上加了什么编排
人工智能·spring·llm
段一凡-华北理工大学17 分钟前
高炉炼铁机器视觉与智能识别十八讲~系列文章05:炉顶料面识别:装料分布判读与布料制度优化
大数据·人工智能·机器视觉·工业智能化·高炉炼铁智能化·高炉炉顶料面识别
sbjdhjd20 分钟前
智能体开始“动手”之后:OpenAI越权事件、Anthropic算力资本化与开放权重模型竞逐 | AI与SI行业日报整理(9月29日—10月6日)
大数据·人工智能·经验分享·笔记·ai·chatgpt·开源
hsfxuebao23 分钟前
Loop Engineering 已死? 一文带你了解Graph Engineering
人工智能·后端
秦先生在广东26 分钟前
Atlassian 携手 OpenAI 深化合作:以企业知识图谱驱动 AI 智能体在开发全流程中的应用
人工智能
品牌常新33 分钟前
GEO哪家好?2026年服务商选型与能力对比
大数据·人工智能
品牌常新33 分钟前
灵栩栩是做什么的?2026产品能力全景解读
人工智能
海盗123434 分钟前
AI 新闻日报 2026-10-07:智能体迁往云端 / SDK 支持运行中改向 / 机器人进柜台与景区
人工智能·机器人·人工智能aigc