本课学习驻点求解+海塞矩阵极值判定,对应AI训练核心问题:寻找损失函数最小值、区分局部最优/全局最优、识别鞍点。
开篇前简述,二元函数驻点、极值判别、海塞(Hessian)矩阵 + 在大模型中的应用
一、基础概念(二元函数 f(x,y))
-
驻点:一阶偏导数全部为0的点
\frac{\partial f}{\partial x}=0,\quad \frac{\partial f}{\partial y}=0
👉驻点只是坡度=0的平地,不一定是极值,可以是极小、极大、鞍点。
-
海塞矩阵H(二阶偏导构成对称方阵)
H=
\begin{bmatrix}
\frac{\partial^2 f}{\partial x^2} & \frac{\partial^2 f}{\partial x\partial y}4pt
\frac{\partial^2 f}{\partial y\partial x} & \frac{\partial^2 f}{\partial y^2}
\end{bmatrix}
混合偏导连续时 \displaystyle \frac{\partial^2 f}{\partial x\partial y}=\frac{\partial^2 f}{\partial y\partial x},矩阵对称。
行列式:\boldsymbol D=\det(H)=f_{xx}f_{yy}-(f_{xy})^2。
驻点处二阶判别法则
-
D>0,\ f_{xx}>0:H正定 → 局部极小值(碗底)
-
D>0,\ f_{xx}<0:H负定 → 局部极大值(山顶)
-
D<0:H不定 → 鞍点(马鞍点),一个方向向上弯、一个方向向下弯,不是极值
-
D=0:二阶信息失效,无法判断,要看更高阶导数。
几何理解:
梯度(一阶)告诉你往哪走;
海塞矩阵(二阶)描述曲面局部曲率,告诉你脚下地形是碗、山峰、马鞍还是平坦地面。
二、推广到大模型(高维损失函数 L(\boldsymbol w))
大模型损失是百万‑亿维参数\boldsymbol w的标量函数。
梯度\nabla L:一阶,每一个参数的偏导数;
海塞矩阵\boldsymbol H:二阶导数矩阵,尺寸【参数量 × 参数量】,现实中根本无法完整存储(参数量几十亿,矩阵规模爆炸),工程只做近似、海塞‑向量乘积HVP,不构造完整矩阵。
海塞矩阵特征值含义(高维)
全部特征值>0:正定,局部极小;
全部特征值<0:负定,局部极大(高维损失曲面极少出现);
特征值有正有负:不定,鞍点(大模型训练大量遇到);
部分特征值≈0:半定,平坦极小区域,参数改动很多,损失几乎不变。
大模型里面海塞矩阵4个核心原理与应用
- 区分极小值和鞍点(最关键)
梯度等于0,不一定到达谷底,很可能卡在鞍点(马鞍地形)。
普通SGD只看梯度,分不清;海塞矩阵看曲率,识别鞍点。高维空间鞍点数量极多,是训练停滞的重要来源 。
- 区分尖锐极小 vs 平坦极小,关联模型泛化能力
海塞特征值整体大:尖锐谷底,参数稍微扰动损失暴涨;容易过拟合;
大量特征值接近0:平坦谷底,参数扰动损失变化小,泛化能力往往更好。
这是深度学习理论重要结论:模型不一定收敛到"损失最低点",平坦极小往往实际效果更好。
- 二阶优化器(牛顿法为代表)理论基础
梯度下降只利用一阶信息;牛顿法利用海塞矩阵修正更新方向,会根据曲率自适应调整步长。
现实大模型不会直接用完整牛顿法,海塞太大;衍生各类近似二阶优化器。
- 泰勒二次近似
损失函数在参数点附近局部展开:
L(\boldsymbol w+\Delta\boldsymbol w)\approx L(\boldsymbol w)+\nabla L^T\Delta\boldsymbol w+\frac12\Delta\boldsymbol w^T H\Delta\boldsymbol w
海塞矩阵决定二次项,刻画局部弯曲程度,是几乎全部优化理论分析的数学底座。
三、现实工程提醒
大模型不会显式计算完整海塞矩阵,维度爆炸内存装不下。
实际做法:海塞‑向量乘积(HVP),只算矩阵乘向量,不生成完整矩阵,用来做理论分析、近似二阶优化、评估样本影响等。
极简总结记忆
-
梯度=坡度;海塞矩阵=地形曲率;驻点坡度为零,但地形有碗顶、马鞍、平地。
-
二元看行列式D;高维看海塞矩阵特征值符号。
-
大模型损失空间大量鞍点、平坦区域;海塞矩阵是理解训练收敛、泛化能力的数学工具,但工程上只能做近似,不直接构造完整矩阵。
核心知识点
- 驻点定义
梯度 \nabla f(x,y)=(0,0) 的点,即满足:
\begin{cases}
\dfrac{\partial f}{\partial x}=04pt
\dfrac{\partial f}{\partial y}=0
\end{cases}
驻点分三类:极小值点、极大值点、鞍点。
-
海塞矩阵(二元)
H=
\begin{pmatrix}
\dfrac{\partial^2 f}{\partial x^2} & \dfrac{\partial^2 f}{\partial x\partial y}4pt
\dfrac{\partial^2 f}{\partial y\partial x} & \dfrac{\partial^2 f}{\partial y^2}
\end{pmatrix}
判别式 D=\displaystyle \frac{\partial^2 f}{\partial x2}\cdot\frac{\partial2 f}{\partial y2}-\left(\frac{\partial2 f}{\partial x\partial y}\right)^2
-
判定规则
D>0,\ \dfrac{\partial^2 f}{\partial x^2}>0:极小值点(损失最低点,训练目标)
D>0,\ \dfrac{\partial^2 f}{\partial x^2}<0:极大值点
D<0:鞍点(梯度为0,但不是最优,大模型训练易停滞)
D=0:判别失效,无法判定
AI对应逻辑
-
损失函数极小值 = 模型训练收敛目标;
-
鞍点:梯度为0但曲面是马鞍形,普通梯度下降会卡在这;
-
海塞矩阵二阶优化器(牛顿法)能识别鞍点、跳出局部最优。
10道二元极值计算题(步骤+AI工程解读)
题1
f(x,y)=x2+4y2,求驻点并判定极值
-
一阶偏导:f_x=2x,\ f_y=8y
-
令梯度为0:2x=0,\ 8y=0,驻点 (0,0)
-
二阶偏导:f_{xx}=2,\ f_{yy}=8,\ f_{xy}=0
-
D=2\times8 - 0^2=16>0,\ f_{xx}>0
结论:(0,0) 极小值点,极小值 f(0,0)=0
AI解读:标准二维MSE损失,全局唯一极小值,梯度下降一定收敛,无局部最优干扰。
题2
f(x,y)=-x2-3y2+5,求驻点与极值
f_x=-2x,\ f_y=-6y,驻点(0,0)
f_{xx}=-2,\ f_{yy}=-6,\ f_{xy}=0
D=12>0,\ f_{xx}<0,极大值点,极大值5
AI解读:反向损失曲面,现实训练不会出现,仅用于对比凹凸逻辑。
题3
f(x,y)=x2-y2,判别驻点类型
f_x=2x,\ f_y=-2y,驻点(0,0)
f_{xx}=2,\ f_{yy}=-2,\ f_{xy}=0
D=2\times(-2)-0=-4<0
结论:鞍点
AI解读:典型马鞍形损失曲面,梯度归零但不是最优,普通SGD极易卡在鞍点停滞。
题4
f(x,y)=x2+xy+2y2,求驻点并判定
f_x=2x+y,\ f_y=x+4y
联立\begin{cases}2x+y=0\x+4y=0\end{cases},解得驻点(0,0)
f_{xx}=2,\ f_{yy}=4,\ f_{xy}=1
D=2\times4 - 1=7>0,\ f_{xx}>0,极小值点
AI解读:带权重耦合的损失函数,混合偏导不为0,但整体正定,依旧稳定收敛。
题5
f(x,y)=x3-3xy+y3,求全部驻点并判定
f_x=3x^2-3y, f_y=-3x+3y^2
联立:y=x^2, x=y^2
解得驻点(0,0)、(1,1)
-
(0,0):f_{xx}=0,f_{yy}=0,f_{xy}=-3,\ D=0-9=-9<0 → 鞍点
-
(1,1):f_{xx}=6,f_{yy}=6,f_{xy}=-3,\ D=36-9=27>0,f_{xx}>0 → 极小值点
AI解读:存在鞍点+局部极小,模型初始化位置不同,可能收敛到不同结果。
题6
f(x,y)=e{x2+y^2},求驻点判定
f_x=2x e{x2+y^2},\ f_y=2y e{x2+y^2}
驻点(0,0)
f_{xx}=2e{x2+y2}(1+2x2),\ f_{yy}=2e{x2+y2}(1+2y2),\ f_{xy}=4xy e{x2+y^2}
(0,0)处:f_{xx}=2,f_{yy}=2,f_{xy}=0,\ D=4>0,极小值点
AI解读:指数型正则损失,曲面平滑且仅一个全局最小值,训练十分稳定。
题7
f(x,y)=4-x2-xy-y2,驻点极值判断
f_x=-2x-y,\ f_y=-x-2y
联立解得驻点(0,0)
f_{xx}=-2,f_{yy}=-2,f_{xy}=-1
D=4-1=3>0,f_{xx}<0,极大值点
AI解读:负向损失曲面,无实际训练意义,用于区分极大/极小判定逻辑。
题8
f(x,y)=xy,驻点类型判定
f_x=y,\ f_y=x,驻点(0,0)
f_{xx}=0,f_{yy}=0,f_{xy}=1
D=0-1=-1<0,鞍点
AI解读:纯权重交叉项损失,全局无最小值,训练会持续震荡无法收敛。
题9
f(x,y)=x2+2y2-2x+4y,求驻点、极小值
f_x=2x-2,\ f_y=4y+4
令梯度为0:x=1,\ y=-1,驻点(1,-1)
f_{xx}=2,f_{yy}=4,f_{xy}=0,\ D=8>0,极小值点,极小值f(1,-1)=-3
AI解读:带偏移参数的二维损失,存在唯一全局最低点,梯度下降可稳定收敛。
题10 压轴综合
f(x,y)=x^2 e^{y}-2y,求驻点并判定极值
一阶偏导:
f_x=2x e^y,\quad f_y=x^2 e^y -2
联立方程:
2x e^y=0 \Rightarrow x=0
代入第二式:0-2=0,方程无解
结论:无驻点,函数无极大、极小值
AI解读:特殊复合损失曲面,不存在梯度归零的位置,模型训练会持续迭代,永远无法完全收敛。
课程核心总结(衔接第38课梯度下降完整数学推导)
-
驻点是梯度为0的位置,分为极小、极大、鞍点三类;
-
海塞判别式D是区分鞍点与极值的核心工具;
-
AI训练目标是找到损失函数极小值点,鞍点会造成训练停滞;
-
若不存在驻点,代表损失无下限,模型会持续发散震荡。
训练大模型时经常遇到卡在鞍点、局部最优的问题,你知道哪些优化算法可以缓解这个现象?欢迎评论区交流!