AI大模型与数学 第37课二元函数驻点、极值判别:海塞矩阵基础判定(10道多元极值计算题)

本课学习驻点求解+海塞矩阵极值判定,对应AI训练核心问题:寻找损失函数最小值、区分局部最优/全局最优、识别鞍点。

开篇前简述,二元函数驻点、极值判别、海塞(Hessian)矩阵 + 在大模型中的应用

一、基础概念(二元函数 f(x,y))

  1. 驻点:一阶偏导数全部为0的点

    \frac{\partial f}{\partial x}=0,\quad \frac{\partial f}{\partial y}=0

    👉驻点只是坡度=0的平地,不一定是极值,可以是极小、极大、鞍点。

  2. 海塞矩阵H(二阶偏导构成对称方阵)

    H=

    \begin{bmatrix}

    \frac{\partial^2 f}{\partial x^2} & \frac{\partial^2 f}{\partial x\partial y}4pt

    \frac{\partial^2 f}{\partial y\partial x} & \frac{\partial^2 f}{\partial y^2}

    \end{bmatrix}

    混合偏导连续时 \displaystyle \frac{\partial^2 f}{\partial x\partial y}=\frac{\partial^2 f}{\partial y\partial x},矩阵对称。

    行列式:\boldsymbol D=\det(H)=f_{xx}f_{yy}-(f_{xy})^2。

    驻点处二阶判别法则

  3. D>0,\ f_{xx}>0:H正定 → 局部极小值(碗底)

  4. D>0,\ f_{xx}<0:H负定 → 局部极大值(山顶)

  5. D<0:H不定 → 鞍点(马鞍点),一个方向向上弯、一个方向向下弯,不是极值

  6. D=0:二阶信息失效,无法判断,要看更高阶导数。

    几何理解:

    梯度(一阶)告诉你往哪走;

    海塞矩阵(二阶)描述曲面局部曲率,告诉你脚下地形是碗、山峰、马鞍还是平坦地面。

二、推广到大模型(高维损失函数 L(\boldsymbol w))

大模型损失是百万‑亿维参数\boldsymbol w的标量函数。

梯度\nabla L:一阶,每一个参数的偏导数;

海塞矩阵\boldsymbol H:二阶导数矩阵,尺寸【参数量 × 参数量】,现实中根本无法完整存储(参数量几十亿,矩阵规模爆炸),工程只做近似、海塞‑向量乘积HVP,不构造完整矩阵。

海塞矩阵特征值含义(高维)

全部特征值>0:正定,局部极小;

全部特征值<0:负定,局部极大(高维损失曲面极少出现);

特征值有正有负:不定,鞍点(大模型训练大量遇到);

部分特征值≈0:半定,平坦极小区域,参数改动很多,损失几乎不变。

大模型里面海塞矩阵4个核心原理与应用

  1. 区分极小值和鞍点(最关键)

梯度等于0,不一定到达谷底,很可能卡在鞍点(马鞍地形)。

普通SGD只看梯度,分不清;海塞矩阵看曲率,识别鞍点。高维空间鞍点数量极多,是训练停滞的重要来源 。

  1. 区分尖锐极小 vs 平坦极小,关联模型泛化能力

海塞特征值整体大:尖锐谷底,参数稍微扰动损失暴涨;容易过拟合;

大量特征值接近0:平坦谷底,参数扰动损失变化小,泛化能力往往更好。

这是深度学习理论重要结论:模型不一定收敛到"损失最低点",平坦极小往往实际效果更好。

  1. 二阶优化器(牛顿法为代表)理论基础

梯度下降只利用一阶信息;牛顿法利用海塞矩阵修正更新方向,会根据曲率自适应调整步长。

现实大模型不会直接用完整牛顿法,海塞太大;衍生各类近似二阶优化器。

  1. 泰勒二次近似

损失函数在参数点附近局部展开:

L(\boldsymbol w+\Delta\boldsymbol w)\approx L(\boldsymbol w)+\nabla L^T\Delta\boldsymbol w+\frac12\Delta\boldsymbol w^T H\Delta\boldsymbol w

海塞矩阵决定二次项,刻画局部弯曲程度,是几乎全部优化理论分析的数学底座。

三、现实工程提醒

大模型不会显式计算完整海塞矩阵,维度爆炸内存装不下。

实际做法:海塞‑向量乘积(HVP),只算矩阵乘向量,不生成完整矩阵,用来做理论分析、近似二阶优化、评估样本影响等。

极简总结记忆

  1. 梯度=坡度;海塞矩阵=地形曲率;驻点坡度为零,但地形有碗顶、马鞍、平地。

  2. 二元看行列式D;高维看海塞矩阵特征值符号。

  3. 大模型损失空间大量鞍点、平坦区域;海塞矩阵是理解训练收敛、泛化能力的数学工具,但工程上只能做近似,不直接构造完整矩阵。

核心知识点

  1. 驻点定义

梯度 \nabla f(x,y)=(0,0) 的点,即满足:

\begin{cases}

\dfrac{\partial f}{\partial x}=04pt

\dfrac{\partial f}{\partial y}=0

\end{cases}

驻点分三类:极小值点、极大值点、鞍点。

  1. 海塞矩阵(二元)

    H=

    \begin{pmatrix}

    \dfrac{\partial^2 f}{\partial x^2} & \dfrac{\partial^2 f}{\partial x\partial y}4pt

    \dfrac{\partial^2 f}{\partial y\partial x} & \dfrac{\partial^2 f}{\partial y^2}

    \end{pmatrix}

    判别式 D=\displaystyle \frac{\partial^2 f}{\partial x2}\cdot\frac{\partial2 f}{\partial y2}-\left(\frac{\partial2 f}{\partial x\partial y}\right)^2

  2. 判定规则

    D>0,\ \dfrac{\partial^2 f}{\partial x^2}>0:极小值点(损失最低点,训练目标)

    D>0,\ \dfrac{\partial^2 f}{\partial x^2}<0:极大值点

    D<0:鞍点(梯度为0,但不是最优,大模型训练易停滞)

    D=0:判别失效,无法判定

AI对应逻辑

  1. 损失函数极小值 = 模型训练收敛目标;

  2. 鞍点:梯度为0但曲面是马鞍形,普通梯度下降会卡在这;

  3. 海塞矩阵二阶优化器(牛顿法)能识别鞍点、跳出局部最优。

10道二元极值计算题(步骤+AI工程解读)

题1

f(x,y)=x2+4y2,求驻点并判定极值

  1. 一阶偏导:f_x=2x,\ f_y=8y

  2. 令梯度为0:2x=0,\ 8y=0,驻点 (0,0)

  3. 二阶偏导:f_{xx}=2,\ f_{yy}=8,\ f_{xy}=0

  4. D=2\times8 - 0^2=16>0,\ f_{xx}>0

结论:(0,0) 极小值点,极小值 f(0,0)=0

AI解读:标准二维MSE损失,全局唯一极小值,梯度下降一定收敛,无局部最优干扰。

题2

f(x,y)=-x2-3y2+5,求驻点与极值

f_x=-2x,\ f_y=-6y,驻点(0,0)

f_{xx}=-2,\ f_{yy}=-6,\ f_{xy}=0

D=12>0,\ f_{xx}<0,极大值点,极大值5

AI解读:反向损失曲面,现实训练不会出现,仅用于对比凹凸逻辑。

题3

f(x,y)=x2-y2,判别驻点类型

f_x=2x,\ f_y=-2y,驻点(0,0)

f_{xx}=2,\ f_{yy}=-2,\ f_{xy}=0

D=2\times(-2)-0=-4<0

结论:鞍点

AI解读:典型马鞍形损失曲面,梯度归零但不是最优,普通SGD极易卡在鞍点停滞。

题4

f(x,y)=x2+xy+2y2,求驻点并判定

f_x=2x+y,\ f_y=x+4y

联立\begin{cases}2x+y=0\x+4y=0\end{cases},解得驻点(0,0)

f_{xx}=2,\ f_{yy}=4,\ f_{xy}=1

D=2\times4 - 1=7>0,\ f_{xx}>0,极小值点

AI解读:带权重耦合的损失函数,混合偏导不为0,但整体正定,依旧稳定收敛。

题5

f(x,y)=x3-3xy+y3,求全部驻点并判定

f_x=3x^2-3y, f_y=-3x+3y^2

联立:y=x^2, x=y^2

解得驻点(0,0)、(1,1)

  1. (0,0):f_{xx}=0,f_{yy}=0,f_{xy}=-3,\ D=0-9=-9<0 → 鞍点

  2. (1,1):f_{xx}=6,f_{yy}=6,f_{xy}=-3,\ D=36-9=27>0,f_{xx}>0 → 极小值点

AI解读:存在鞍点+局部极小,模型初始化位置不同,可能收敛到不同结果。

题6

f(x,y)=e{x2+y^2},求驻点判定

f_x=2x e{x2+y^2},\ f_y=2y e{x2+y^2}

驻点(0,0)

f_{xx}=2e{x2+y2}(1+2x2),\ f_{yy}=2e{x2+y2}(1+2y2),\ f_{xy}=4xy e{x2+y^2}

(0,0)处:f_{xx}=2,f_{yy}=2,f_{xy}=0,\ D=4>0,极小值点

AI解读:指数型正则损失,曲面平滑且仅一个全局最小值,训练十分稳定。

题7

f(x,y)=4-x2-xy-y2,驻点极值判断

f_x=-2x-y,\ f_y=-x-2y

联立解得驻点(0,0)

f_{xx}=-2,f_{yy}=-2,f_{xy}=-1

D=4-1=3>0,f_{xx}<0,极大值点

AI解读:负向损失曲面,无实际训练意义,用于区分极大/极小判定逻辑。

题8

f(x,y)=xy,驻点类型判定

f_x=y,\ f_y=x,驻点(0,0)

f_{xx}=0,f_{yy}=0,f_{xy}=1

D=0-1=-1<0,鞍点

AI解读:纯权重交叉项损失,全局无最小值,训练会持续震荡无法收敛。

题9

f(x,y)=x2+2y2-2x+4y,求驻点、极小值

f_x=2x-2,\ f_y=4y+4

令梯度为0:x=1,\ y=-1,驻点(1,-1)

f_{xx}=2,f_{yy}=4,f_{xy}=0,\ D=8>0,极小值点,极小值f(1,-1)=-3

AI解读:带偏移参数的二维损失,存在唯一全局最低点,梯度下降可稳定收敛。

题10 压轴综合

f(x,y)=x^2 e^{y}-2y,求驻点并判定极值

一阶偏导:

f_x=2x e^y,\quad f_y=x^2 e^y -2

联立方程:

2x e^y=0 \Rightarrow x=0

代入第二式:0-2=0,方程无解

结论:无驻点,函数无极大、极小值

AI解读:特殊复合损失曲面,不存在梯度归零的位置,模型训练会持续迭代,永远无法完全收敛。

课程核心总结(衔接第38课梯度下降完整数学推导)

  1. 驻点是梯度为0的位置,分为极小、极大、鞍点三类;

  2. 海塞判别式D是区分鞍点与极值的核心工具;

  3. AI训练目标是找到损失函数极小值点,鞍点会造成训练停滞;

  4. 若不存在驻点,代表损失无下限,模型会持续发散震荡。

训练大模型时经常遇到卡在鞍点、局部最优的问题,你知道哪些优化算法可以缓解这个现象?欢迎评论区交流!

相关推荐
SomeB1oody1 小时前
【RustyML入门】6.0. 数学工具
开发语言·后端·机器学习·rust·教程
V哥AI增长1 小时前
宠物行业GEO机制:AI如何推荐医院与产品
人工智能·搜索引擎·宠物
baidu_259339571 小时前
智慧消防管理系统平台(基于物联网与大数据的城市消防安全解决方案)
大数据·人工智能·物联网·云计算·智慧消防·力安科技·gdliontech.cn
欧阳天羲1 小时前
【升级版】AI毫米波雷达扫描+视觉双鉴激光灭蚊机器人|360°全域侦测+超低误杀+人体安全防护(ESP32+YOLOv8全套开源)
人工智能·安全·机器人
fthux1 小时前
装闭 RenoPit 源码解析(14):Demo模式、健康检查与Docker部署
人工智能·ai·开源·github·open source·renopit
IT_陈寒2 小时前
为什么我的JavaScript闭包总是漏掉那个变量?
前端·人工智能·后端
蜘蛛小助理2 小时前
生鲜冷链批次效期与多仓调拨损耗管控|低代码搭建生鲜供应链台账
人工智能·低代码·ai·erp·多维表格·蜘蛛表格·生鲜
ASKED_20192 小时前
从 ASR+LLM+TTS 到 GPT‑Live:解读语音智能新范式
人工智能·gpt·语音识别
DS随心转APP2 小时前
AI生成的word怎么下载?AI导出鸭技术架构深度测评
人工智能·ai·架构·word·deepseek·ai导出鸭
9i编程2 小时前
4. AI编写的SKILL,坑我一一试过,这次我自己改写:换个工具,照样不按SKILL写文档
人工智能·openai·ai编程