基础知识补充

1 对数交叉熵损失函数Cross-Entropy Loss

衡量模型预测的概率分布与真实标签的概率分布之间的差异

  1. 二分类 Binary Cross-Entropy
    真实标签 yyy :000 或 111。
    模型输出 y^\hat{y}y^(Sigmoid 函数激活)是一个 000 到 111 之间的概率值,表示样本属于类别 111 的概率。
    对于单个样本,L=−ylog⁡(y\^)+(1−y)log⁡(1−y\^)L = - y \\log(\\hat{y}) + (1 - y) \\log(1 - \\hat{y})L=−ylog(y\^)+(1−y)log(1−y\^)
    • 当真实标签 y=1y = 1y=1 时:L=−log⁡(y^)L = - \log(\hat{y})L=−log(y^)
      • 如果模型预测 y^\hat{y}y^ 接近 111(预测对了),−log⁡(y^)-\log(\hat{y})−log(y^) 接近 000,损失很小。
      • 如果模型预测 y^\hat{y}y^ 接近 000(预测错了),−log⁡(y^)-\log(\hat{y})−log(y^) 会趋近于正无穷,给予模型巨大的惩罚。
    • 当真实标签 y=0y = 0y=0 时:L=−log⁡(1−y^)L = - \log(1 - \hat{y})L=−log(1−y^)
      • 如果模型预测 y^\hat{y}y^ 接近 000(预测对了),1−y^1-\hat{y}1−y^ 接近 111,损失接近 000。
      • 如果模型预测 y^\hat{y}y^ 接近 111(预测错了),1−y^1-\hat{y}1−y^ 接近 000,损失趋近于正无穷。
    • sigmod:y^=σ(z)=11+e−z\hat{y} = \sigma(z) = \frac{1}{1 + e^{-z}}y^=σ(z)=1+e−z1
      • 求导:∂L∂z=y^−y\frac{\partial L}{\partial z} = \hat{y} - y∂z∂L=y^−y
  2. 多分类 Multi-Class Cross-Entropy
    真实标签 yyy 通常是一个 One-Hot 编码的向量,
    模型输出 y^\hat{y}y^(Softmax 函数激活)是一个概率分布向量,所有类别的预测概率之和为 100%。
    对于单个样本,L=−∑c=1Myclog⁡(y^c)L = - \sum_{c=1}^{M} y_c \log(\hat{y}_c)L=−c=1∑Myclog(y^c)MMM:总类别数
    ycy_cyc:如果样本属于第 ccc 类,则 yc=1y_c = 1yc=1,否则 yc=0y_c = 0yc=0
    y^c\hat{y}_cy^c:模型预测样本属于第 ccc 类 的概率
    • 除了真实类别外,其他的 ycy_cyc 全都是 000,所以多分类损失在本质上只关心模型在那个正确类别上的预测概率。正确类别的预测概率越接近 111,整体损失就越低。
    • Softmax:y^i=ezi∑k=1Mezk\hat{y}i = \frac{e^{z_i}}{\sum{k=1}^{M} e^{z_k}}y^i=∑k=1Mezkezi
      求导:∂L∂zi=y^i−yi\frac{\partial L}{\partial z_i} = \hat{y}_i - y_i∂zi∂L=y^i−yi
  3. 求导:∂L∂z=y^−y\frac{\partial L}{\partial \mathbf{z}} = \mathbf{\hat{y}} - \mathbf{y}∂z∂L=y^−y

为什么分类问题不用均方误差(MSE)

在回归问题中,我们常用均方误差(MSE=(y−y^)2MSE = (y - \hat{y})^2MSE=(y−y^)2)。为什么分类问题要大费周章地用对数交叉熵呢?

  • 对错误惩罚更严厉(梯度消失问题):分类模型的最后一层通常是 Sigmoid 或 Softmax。如果使用 MSE,当模型预测完全错误(真值为 111,预测为 000)时,Sigmoid 的导数会趋于 000,导致梯度消失,模型很难通过反向传播来纠错。而交叉熵由于引入了 log⁡\loglog,求导后可以完美抵消 Sigmoid 的导数项,使得预测差异越大,梯度越大,模型学得越快。
  • 符合概率最大似然估计:从统计学角度来看,最小化交叉熵损失,实际上等价于最大化样本数据的似然函数,具有严谨的数学理论支撑。
相关推荐
MartinYeung52 小时前
[论文学习]Poser:通过操纵内部结构揭示对齐伪装的大语言模型
人工智能·学习·语言模型
Feynman’s boom2 小时前
PDF解析复盘
数据库·人工智能·算法·pdf解析
其实防守也摸鱼3 小时前
推荐一个自动化教育SRC漏洞挖掘系统--AutoHunter
运维·开发语言·人工智能·学习·安全·web安全·自动化
振浩微433射频芯片3 小时前
从门锁到考勤,VRC522B如何在近场读卡场景中“稳坐C位”?
网络·人工智能·单片机·物联网
码视野3 小时前
多宠 RFID 颈圈识别与湿粮半导体制冷保鲜分餐喂食器解决方案(软硬件一体化)
大数据·人工智能·python
九硕智慧建筑一体化厂家3 小时前
智慧建筑高效管控!楼宇自控系统赋能新能源园区智能运维
运维·人工智能·笔记·智慧城市
2601_954526754 小时前
2026 生成式搜索引擎底层技术演进与 GEO优化服务商推荐:大模型检索增强(RAG)管道与语义对齐工程实战
大数据·人工智能·搜索引擎
我有满天星辰4 小时前
Spring AI Prompt 实战:System Prompt、User Prompt 与 PromptTemplate
人工智能·spring·prompt
A15362554 小时前
WMS 仓储管理系统推荐:企业如何选适配的仓储管理系统
大数据·人工智能
学习中.........4 小时前
Transformer 训练资源估算:以 CS336 GPT-2 XL 配置为例
人工智能·python·算法·机器学习·自然语言处理