深度学习学习教程,从入门到精通,概率与信息论 — 知识点详解(3)

概率与信息论 --- 知识点详解


一、为什么要使用概率

1.1 概率的必要性

  • 机器学习中必须处理不确定性 ,来源包括:
    • 内在随机性:量子力学等客观随机过程
    • 不完全观测:无法观测所有相关变量(如医生无法看到患者所有生理指标)
    • 不完美建模:模型对现实的简化必然引入近似误差

1.2 概率的两种主要诠释

诠释 核心思想 典型应用
频率派概率(Frequentist) 重复实验中某事件发生的频率极限 抛硬币正面朝上的概率为0.5
贝叶斯概率(Bayesian) 对某命题的置信程度(degree of belief) 医生对患者患病的确信程度

1.3 频率派与贝叶斯派的关键区别

  • 频率派:概率是客观的,描述事件本身的性质
  • 贝叶斯派:概率是主观的,描述观察者的知识状态,会随新证据更新
  • 深度学习中两种观点都有使用,贝叶斯方法在处理先验知识和小样本时尤为重要

二、随机变量

2.1 定义

  • 随机变量(Random Variable):可以取不同值的变量,其取值具有不确定性
  • 用小写字母表示取值(如 xxx),大写字母表示随机变量本身(如 XXX)

2.2 分类

  • 离散型随机变量 :取值为有限或可数无限多个(如掷骰子的结果 {1,2,3,4,5,6}\{1,2,3,4,5,6\}{1,2,3,4,5,6})
  • 连续型随机变量:取值为实数域上的连续值(如身高、温度)

三、概率分布

3.1 离散型变量 --- 概率质量函数(PMF)

  • 概率质量函数(Probability Mass Function, PMF) :P(x)P(x)P(x) 或 P(X=x)P(X=x)P(X=x)
  • 性质:
    • P(x)∈0,1P(x) \in 0, 1P(x)∈0,1 对所有 xxx
    • ∑x∈XP(x)=1\sum_{x \in \mathcal{X}} P(x) = 1∑x∈XP(x)=1
  • 示例:公平骰子 P(X=i)=16P(X=i) = \frac{1}{6}P(X=i)=61,i=1,2,...,6i=1,2,...,6i=1,2,...,6

3.2 连续型变量 --- 概率密度函数(PDF)

  • 概率密度函数(Probability Density Function, PDF) :p(x)p(x)p(x)
  • 性质:
    • p(x)≥0p(x) \geq 0p(x)≥0 对所有 xxx(注意不要求 ≤1\leq 1≤1)
    • ∫−∞+∞p(x)dx=1\int_{-\infty}^{+\infty} p(x) dx = 1∫−∞+∞p(x)dx=1
  • xxx 落在区间 a,ba,ba,b 内的概率:P(x∈a,b)=∫abp(x)dxP(x \in a,b) = \int_a^b p(x) dxP(x∈a,b)=∫abp(x)dx
  • PDF 值本身不是概率,而是概率密度;只有积分后才是概率

3.3 联合概率分布

  • 多个随机变量同时取特定值的概率分布
  • 记为 P(X=x,Y=y)P(X=x, Y=y)P(X=x,Y=y) 或 p(x,y)p(x, y)p(x,y)
  • 对离散变量:P(X=x,Y=y)P(X=x, Y=y)P(X=x,Y=y)
  • 对连续变量:满足 ∫∫p(x,y) dx dy=1\int \int p(x,y) \, dx \, dy = 1∫∫p(x,y)dxdy=1

四、边缘概率

4.1 定义

  • 已知联合分布 P(X,Y)P(X, Y)P(X,Y),求单个变量的概率分布,称为边缘概率分布(Marginal Probability Distribution)

4.2 计算方法

离散型 (求和法则 / sum rule):

P(X=x)=∑yP(X=x,Y=y)P(X=x) = \sum_y P(X=x, Y=y)P(X=x)=y∑P(X=x,Y=y)

连续型 (积分法则):

p(x)=∫p(x,y) dyp(x) = \int p(x, y) \, dyp(x)=∫p(x,y)dy

4.3 直觉理解

  • "边缘"一词来源于:在联合概率表格的边缘处填入求和后的值
  • 本质上是"消去"不关心的变量

五、条件概率

5.1 定义

  • 在事件 Y=yY=yY=y 已知的条件下,事件 X=xX=xX=x 发生的概率:
    P(X=x∣Y=y)=P(X=x,Y=y)P(Y=y),P(Y=y)>0P(X=x \mid Y=y) = \frac{P(X=x, Y=y)}{P(Y=y)}, \quad P(Y=y) > 0P(X=x∣Y=y)=P(Y=y)P(X=x,Y=y),P(Y=y)>0

5.2 关键注意

  • 条件概率本身是关于 xxx 的合法概率分布:
    • ∑xP(X=x∣Y=y)=1\sum_x P(X=x \mid Y=y) = 1∑xP(X=x∣Y=y)=1
    • P(X=x∣Y=y)≥0P(X=x \mid Y=y) \geq 0P(X=x∣Y=y)≥0
  • 条件概率不要求 XXX 与 YYY 之间存在因果关系

5.3 与联合概率的关系

P(X,Y)=P(X∣Y)⋅P(Y)P(X, Y) = P(X \mid Y) \cdot P(Y)P(X,Y)=P(X∣Y)⋅P(Y)


六、条件概率的链式法则(乘法法则)

6.1 两个变量

P(X,Y)=P(X∣Y)⋅P(Y)=P(Y∣X)⋅P(X)P(X, Y) = P(X \mid Y) \cdot P(Y) = P(Y \mid X) \cdot P(X)P(X,Y)=P(X∣Y)⋅P(Y)=P(Y∣X)⋅P(X)

6.2 多变量推广

对于 nnn 个随机变量 X1,X2,...,XnX_1, X_2, ..., X_nX1,X2,...,Xn 的联合分布:

P(X1,X2,...,Xn)=P(X1)⋅P(X2∣X1)⋅P(X3∣X1,X2)⋯P(Xn∣X1,...,Xn−1)P(X_1, X_2, ..., X_n) = P(X_1) \cdot P(X_2 \mid X_1) \cdot P(X_3 \mid X_1, X_2) \cdots P(X_n \mid X_1, ..., X_{n-1})P(X1,X2,...,Xn)=P(X1)⋅P(X2∣X1)⋅P(X3∣X1,X2)⋯P(Xn∣X1,...,Xn−1)

6.3 紧凑记法

P(X1,...,Xn)=∏i=1nP(Xi∣X1,...,Xi−1)P(X_1, ..., X_n) = \prod_{i=1}^{n} P(X_i \mid X_1, ..., X_{i-1})P(X1,...,Xn)=i=1∏nP(Xi∣X1,...,Xi−1)

6.4 意义

  • 链式法则在概率图模型、自回归模型(如语言模型)中有广泛应用
  • 它表明任意联合分布可以分解为一系列条件分布的乘积

七、独立性和条件独立性

7.1 独立性(Independence)

  • 若 XXX 与 YYY 相互独立:
    P(X,Y)=P(X)⋅P(Y)P(X, Y) = P(X) \cdot P(Y)P(X,Y)=P(X)⋅P(Y)
  • 等价地:P(X∣Y)=P(X)P(X \mid Y) = P(X)P(X∣Y)=P(X),P(Y∣X)=P(Y)P(Y \mid X) = P(Y)P(Y∣X)=P(Y)
  • 记为 X⊥YX \perp YX⊥Y

7.2 条件独立性(Conditional Independence)

  • 若在给定 ZZZ 的条件下,XXX 与 YYY 相互独立:
    P(X,Y∣Z)=P(X∣Z)⋅P(Y∣Z)P(X, Y \mid Z) = P(X \mid Z) \cdot P(Y \mid Z)P(X,Y∣Z)=P(X∣Z)⋅P(Y∣Z)
  • 等价地:P(X∣Y,Z)=P(X∣Z)P(X \mid Y, Z) = P(X \mid Z)P(X∣Y,Z)=P(X∣Z)
  • 记为 X⊥Y∣ZX \perp Y \mid ZX⊥Y∣Z

7.3 重要区别

  • 独立性 ⇏\not\Rightarrow⇒ 条件独立性
  • 条件独立性 ⇏\not\Rightarrow⇒ 独立性
  • 示例:下雨与地面湿(独立时可能有关联,但控制"是否洒水"后可能条件独立)

八、期望、方差和协方差

8.1 期望(Expectation)

离散型

Ex∼Pf(x)=∑xP(x)f(x)\mathbb{E}_{x \sim P}f(x) = \sum_x P(x) f(x)Ex∼Pf(x)=x∑P(x)f(x)

连续型

Ex∼pf(x)=∫p(x)f(x) dx\mathbb{E}_{x \sim p}f(x) = \int p(x) f(x) \, dxEx∼pf(x)=∫p(x)f(x)dx

性质

  • 线性性 :Eαf(x)+βg(x)=αEf(x)+βEg(x)\mathbb{E}\\alpha f(x) + \\beta g(x) = \alpha \mathbb{E}f(x) + \beta \mathbb{E}g(x)Eαf(x)+βg(x)=αEf(x)+βEg(x)
  • 常数的期望等于常数本身:Ec=c\mathbb{E}c = cEc=c

8.2 方差(Variance)

Var(X)=E(X−E\[X)2]\text{Var}(X) = \mathbb{E}\left(X - \\mathbb{E}\[X)^2\right]Var(X)=E(X−E\[X)2]

等价计算公式

Var(X)=EX2−(EX)2\text{Var}(X) = \mathbb{E}X\^2 - (\mathbb{E}X)^2Var(X)=EX2−(EX)2

性质

  • Var(X)≥0\text{Var}(X) \geq 0Var(X)≥0
  • Var(aX+b)=a2Var(X)\text{Var}(aX + b) = a^2 \text{Var}(X)Var(aX+b)=a2Var(X)
  • 方差衡量随机变量的分散程度
  • 标准差 :SD(X)=Var(X)\text{SD}(X) = \sqrt{\text{Var}(X)}SD(X)=Var(X)

8.3 协方差(Covariance)

Cov(X,Y)=E(X−E\[X)(Y−EY)]\text{Cov}(X, Y) = \mathbb{E}(X - \\mathbb{E}\[X)(Y - \mathbb{E}Y)]Cov(X,Y)=E(X−E\[X)(Y−EY)]

等价计算

Cov(X,Y)=EXY−EXEY\text{Cov}(X, Y) = \mathbb{E}XY - \mathbb{E}X\mathbb{E}YCov(X,Y)=EXY−EXEY

性质

  • Cov(X,Y)>0\text{Cov}(X, Y) > 0Cov(X,Y)>0:XXX 与 YYY 正相关(倾向于同方向变化)
  • Cov(X,Y)<0\text{Cov}(X, Y) < 0Cov(X,Y)<0:XXX 与 YYY 负相关
  • Cov(X,Y)=0\text{Cov}(X, Y) = 0Cov(X,Y)=0:XXX 与 YYY 不相关(但不一定独立
  • 独立 ⇒\Rightarrow⇒ 不相关,但不相关 ⇏\not\Rightarrow⇒ 独立
  • Cov(X,X)=Var(X)\text{Cov}(X, X) = \text{Var}(X)Cov(X,X)=Var(X)

8.4 协方差矩阵

Cov(x)i,j=Cov(xi,xj)\text{Cov}(\mathbf{x})_{i,j} = \text{Cov}(x_i, x_j)Cov(x)i,j=Cov(xi,xj)

  • 协方差矩阵 C∈Rn×n\mathbf{C} \in \mathbb{R}^{n \times n}C∈Rn×n
  • 性质:
    • 对称矩阵:Cij=CjiC_{ij} = C_{ji}Cij=Cji
    • 半正定:对任意 v\mathbf{v}v,vTCv≥0\mathbf{v}^T \mathbf{C} \mathbf{v} \geq 0vTCv≥0
    • 对角线元素为各变量的方差

8.5 相关系数(Correlation)

Corr(X,Y)=Cov(X,Y)SD(X)⋅SD(Y)\text{Corr}(X, Y) = \frac{\text{Cov}(X,Y)}{\text{SD}(X) \cdot \text{SD}(Y)}Corr(X,Y)=SD(X)⋅SD(Y)Cov(X,Y)

  • 归一化到 −1,1-1, 1−1,1 区间,便于比较

九、常用概率分布

9.1 离散分布

(1)伯努利分布(Bernoulli Distribution)
  • 单次二值实验
  • P(X=1)=ϕP(X=1) = \phiP(X=1)=ϕ,P(X=0)=1−ϕP(X=0) = 1 - \phiP(X=0)=1−ϕ
  • 均值:ϕ\phiϕ,方差:ϕ(1−ϕ)\phi(1-\phi)ϕ(1−ϕ)
(2)多类别分布(Multinoulli / Categorical Distribution)
  • kkk 个可能取值,参数向量 p=p1,p2,...,pk\mathbf{p} = p_1, p_2, ..., p_kp=p1,p2,...,pk,∑ipi=1\sum_i p_i = 1∑ipi=1
  • 是伯努利分布对多类别的推广

9.2 连续分布

(1)均匀分布(Uniform Distribution)
  • U(a,b)\text{U}(a, b)U(a,b):p(x)=1b−ap(x) = \frac{1}{b-a}p(x)=b−a1,x∈a,bx \in a, bx∈a,b
  • 均值:a+b2\frac{a+b}{2}2a+b,方差:(b−a)212\frac{(b-a)^2}{12}12(b−a)2
(2)正态分布 / 高斯分布(Normal / Gaussian Distribution)

p(x)=12πσ2exp⁡(−(x−μ)22σ2)p(x) = \frac{1}{\sqrt{2\pi\sigma^2}} \exp\left(-\frac{(x-\mu)^2}{2\sigma^2}\right)p(x)=2πσ2 1exp(−2σ2(x−μ)2)

  • 记为 N(x;μ,σ2)\mathcal{N}(x; \mu, \sigma^2)N(x;μ,σ2)
  • 均值 μ\muμ,方差 σ2\sigma^2σ2
  • 中心极限定理:大量独立同分布随机变量之和趋向于正态分布
  • 在已知均值和方差的情况下,正态分布是最大熵分布
  • 标准正态分布 :N(0,1)\mathcal{N}(0, 1)N(0,1)
  • 多维正态分布:N(x;μ,Σ)\mathcal{N}(\mathbf{x}; \boldsymbol{\mu}, \boldsymbol{\Sigma})N(x;μ,Σ)
    p(x)=1(2π)ndet⁡(Σ)exp⁡(−12(x−μ)TΣ−1(x−μ))p(\mathbf{x}) = \frac{1}{\sqrt{(2\pi)^n \det(\boldsymbol{\Sigma})}} \exp\left(-\frac{1}{2}(\mathbf{x}-\boldsymbol{\mu})^T \boldsymbol{\Sigma}^{-1}(\mathbf{x}-\boldsymbol{\mu})\right)p(x)=(2π)ndet(Σ) 1exp(−21(x−μ)TΣ−1(x−μ))
(3)指数分布(Exponential Distribution)

p(x;λ)=λ1x≥0exp⁡(−λx)p(x; \lambda) = \lambda \mathbf{1}_{x \geq 0} \exp(-\lambda x)p(x;λ)=λ1x≥0exp(−λx)

  • 在 x=0x=0x=0 处取得最大值
  • 均值:1/λ1/\lambda1/λ,方差:1/λ21/\lambda^21/λ2
  • 常用于建模"等待时间"
(4)拉普拉斯分布(Laplace Distribution)

p(x;μ,γ)=12γexp⁡(−∣x−μ∣γ)p(x; \mu, \gamma) = \frac{1}{2\gamma} \exp\left(-\frac{|x - \mu|}{\gamma}\right)p(x;μ,γ)=2γ1exp(−γ∣x−μ∣)

  • 均值 μ\muμ,方差 2γ22\gamma^22γ2
  • 在 μ\muμ 处形成尖峰,比正态分布更集中
  • 常用于正则化(L1 正则化等价于拉普拉斯先验)
(5)狄拉克分布 / 狄拉克δ函数(Dirac Delta Function)

p(x)=δ(x−μ)p(x) = \delta(x - \mu)p(x)=δ(x−μ)

  • 所有质量集中在 μ\muμ 点
  • 用于将概率质量集中到某个点
  • 经验分布可以用狄拉克分布的混合表示:p(x)=1m∑i=1mδ(x−x(i))p(\mathbf{x}) = \frac{1}{m}\sum_{i=1}^{m} \delta(\mathbf{x} - \mathbf{x}^{(i)})p(x)=m1∑i=1mδ(x−x(i))
(6)经验分布(Empirical Distribution)
  • 将概率质量 1/m1/m1/m 分配给 mmm 个数据点
  • 训练集上的数据分布即为经验分布

9.3 重要混合分布

(1)高斯混合模型(Gaussian Mixture Model, GMM)

p(x)=∑i=1KπiN(x;μi,Σi)p(\mathbf{x}) = \sum_{i=1}^{K} \pi_i \mathcal{N}(\mathbf{x}; \boldsymbol{\mu}_i, \boldsymbol{\Sigma}_i)p(x)=i=1∑KπiN(x;μi,Σi)

  • 混合系数 πi≥0\pi_i \geq 0πi≥0,∑iπi=1\sum_i \pi_i = 1∑iπi=1
  • 能表达多峰分布(Multimodal Distribution)
  • 是一种潜变量模型 :引入变量 z∈{1,...,K}z \in \{1,...,K\}z∈{1,...,K} 表示选择了哪个高斯分量
  • 能力强大:只要有足够的混合成分,可以近似任意平滑密度

十、常用函数的有用性质

10.1 Logistic Sigmoid 函数

σ(x)=11+e−x\sigma(x) = \frac{1}{1 + e^{-x}}σ(x)=1+e−x1

性质

  • 输出范围 (0,1)(0, 1)(0,1),适合表示概率
  • σ(x)=1−σ(−x)\sigma(x) = 1 - \sigma(-x)σ(x)=1−σ(−x)(关于原点对称)
  • 导数:σ′(x)=σ(x)(1−σ(x))\sigma'(x) = \sigma(x)(1 - \sigma(x))σ′(x)=σ(x)(1−σ(x))
  • 当 x→+∞x \to +\inftyx→+∞ 时 σ(x)→1\sigma(x) \to 1σ(x)→1;x→−∞x \to -\inftyx→−∞ 时 σ(x)→0\sigma(x) \to 0σ(x)→0
  • log⁡σ(x)=−ζ(−x)\log \sigma(x) = -\zeta(-x)logσ(x)=−ζ(−x)(见下方 softplus)
  • 常用于二分类问题的输出层、门控机制(LSTM, GRU)

10.2 Softplus 函数

ζ(x)=log⁡(1+ex)\zeta(x) = \log(1 + e^x)ζ(x)=log(1+ex)

性质

  • 是 x+x^+x+(正部函数)的平滑近似
  • ζ(x)≈max⁡(0,x)\zeta(x) \approx \max(0, x)ζ(x)≈max(0,x)
  • 输出范围 (0,+∞)(0, +\infty)(0,+∞)
  • 导数:ζ′(x)=σ(x)\zeta'(x) = \sigma(x)ζ′(x)=σ(x)(恰好等于 sigmoid!)
  • log⁡σ(x)=−ζ(−x)\log \sigma(x) = -\zeta(-x)logσ(x)=−ζ(−x)
  • 可用于保证方差等正实数值的参数化

10.3 性质汇总表

函数 公式 定义域 值域 导数
Sigmoid 11+e−x\frac{1}{1+e^{-x}}1+e−x1 R\mathbb{R}R (0,1)(0,1)(0,1) σ(x)(1−σ(x))\sigma(x)(1-\sigma(x))σ(x)(1−σ(x))
Softplus log⁡(1+ex)\log(1+e^x)log(1+ex) R\mathbb{R}R (0,+∞)(0,+\infty)(0,+∞) σ(x)\sigma(x)σ(x)
Tanh ex−e−xex+e−x\frac{e^x - e^{-x}}{e^x + e^{-x}}ex+e−xex−e−x R\mathbb{R}R (−1,1)(-1,1)(−1,1) 1−tanh⁡2(x)1 - \tanh^2(x)1−tanh2(x)

十一、贝叶斯规则(Bayes' Rule)

11.1 推导

由条件概率定义:

P(Y∣X)=P(X,Y)P(X)=P(X∣Y)P(Y)P(X)P(Y \mid X) = \frac{P(X, Y)}{P(X)} = \frac{P(X \mid Y) P(Y)}{P(X)}P(Y∣X)=P(X)P(X,Y)=P(X)P(X∣Y)P(Y)

其中 P(X)P(X)P(X) 可以用全概率公式展开:

P(X)=∑yP(X∣Y=y)P(Y=y)P(X) = \sum_y P(X \mid Y=y) P(Y=y)P(X)=y∑P(X∣Y=y)P(Y=y)

11.2 贝叶斯公式

P(Y∣X)=P(X∣Y)P(Y)∑yP(X∣Y=y)P(Y=y)P(Y \mid X) = \frac{P(X \mid Y) P(Y)}{\sum_y P(X \mid Y=y) P(Y=y)}P(Y∣X)=∑yP(X∣Y=y)P(Y=y)P(X∣Y)P(Y)

11.3 术语对应

术语 符号 含义
后验概率 P(Y∣X)P(Y \mid X)P(Y∣X) 观测到 XXX 后对 YYY 的更新信念
先验概率 P(Y)P(Y)P(Y) 观测前对 YYY 的信念
似然 P(X∣Y)P(X \mid Y)P(X∣Y) 在 YYY 成立的条件下观测到 XXX 的概率
证据/归一化常数 P(X)P(X)P(X) 保证后验是合法概率的分母

11.4 直觉理解

后验∝似然×先验\text{后验} \propto \text{似然} \times \text{先验}后验∝似然×先验

  • 贝叶斯规则是信念更新的数学框架
  • 在机器学习中用于:
    • 朴素贝叶斯分类器
    • 贝叶斯线性回归
    • 贝叶斯神经网络
    • 超参数选择

十二、连续型变量的技术细节

12.1 测度论(Measure Theory)基础

  • 为严格处理连续型概率,需要测度论
  • σ-代数(σ-algebra):定义在样本空间上的一组子集,用于描述"可测量"的事件集合
  • 测度(Measure):对集合赋予非负值的函数,概率测度要求全空间测度为 1

12.2 概率密度函数的合法性

  • 一个函数 p(x)p(\mathbf{x})p(x) 是合法的 PDF 当且仅当:
    1. p(x)p(\mathbf{x})p(x) 对所有 x\mathbf{x}x 可测
    2. p(x)≥0p(\mathbf{x}) \geq 0p(x)≥0 几乎处处成立
    3. ∫p(x)dx=1\int p(\mathbf{x}) d\mathbf{x} = 1∫p(x)dx=1

12.3 零测度集(Measure Zero Sets)

  • 概率为零的事件不一定不可能
  • 例:连续分布中 P(X=a)=0P(X=a) = 0P(X=a)=0,但 X=aX=aX=a 并非不可能事件
  • 几乎处处(almost everywhere):除测度为零的集合外处处成立

12.4 变量变换(Change of Variables)

若 y=f(x)y = f(x)y=f(x),fff 为可逆可微函数:

pY(y)=pX(f−1(y))∣det⁡(∂f−1∂y)∣p_Y(y) = p_X(f^{-1}(y)) \left| \det\left(\frac{\partial f^{-1}}{\partial y}\right) \right|pY(y)=pX(f−1(y)) det(∂y∂f−1)

  • 雅可比行列式的绝对值确保概率质量守恒
  • 在正则化流(Normalizing Flows)中有重要应用

十三、信息论

13.1 自信息(Self-Information)

I(x)=−log⁡P(x)I(x) = -\log P(x)I(x)=−logP(x)

直觉

  • 发生概率越低的事件,携带的信息量越大
  • 确定发生的事(P=1P=1P=1):I=0I = 0I=0(无信息)
  • 单位取决于对数底数:底为 2 时单位为 bit ,底为 eee 时单位为 nat

13.2 香农熵(Shannon Entropy)

H(X)=Ex∼PI(x)=−∑xP(x)log⁡P(x)H(X) = \mathbb{E}_{x \sim P}I(x) = -\sum_x P(x) \log P(x)H(X)=Ex∼PI(x)=−x∑P(x)logP(x)

性质

  • 衡量随机变量的不确定性信息的平均量
  • 对确定性分布(PPP 为退化分布):H=0H = 0H=0
  • 对均匀分布(nnn 个等可能结果):H=log⁡nH = \log nH=logn(最大值)
  • H(X)≥0H(X) \geq 0H(X)≥0 恒成立

13.3 KL 散度(Kullback-Leibler Divergence)

DKL(P∥Q)=Ex∼Plog⁡P(x)Q(x)=∑xP(x)log⁡P(x)Q(x)D_{KL}(P \| Q) = \mathbb{E}_{x \sim P}\left\\log \\frac{P(x)}{Q(x)}\\right = \sum_x P(x) \log \frac{P(x)}{Q(x)}DKL(P∥Q)=Ex∼PlogQ(x)P(x)=x∑P(x)logQ(x)P(x)

性质

  • 衡量用分布 QQQ 近似分布 PPP 时损失的信息量
  • DKL(P∥Q)≥0D_{KL}(P \| Q) \geq 0DKL(P∥Q)≥0(Gibbs 不等式
  • DKL(P∥Q)=0D_{KL}(P \| Q) = 0DKL(P∥Q)=0 当且仅当 P=QP = QP=Q(几乎处处)
  • 非对称 :DKL(P∥Q)≠DKL(Q∥P)D_{KL}(P \| Q) \neq D_{KL}(Q \| P)DKL(P∥Q)=DKL(Q∥P),因此不是真正的距离度量
  • 在机器学习中:最小化 DKL(Pdata∥Pmodel)D_{KL}(P_{\text{data}} \| P_{\text{model}})DKL(Pdata∥Pmodel) 等价于最大似然估计

13.4 KL 散度与交叉熵的关系

H(P,Q)=H(P)+DKL(P∥Q)H(P, Q) = H(P) + D_{KL}(P \| Q)H(P,Q)=H(P)+DKL(P∥Q)

其中交叉熵

H(P,Q)=−Ex∼Plog⁡Q(x)H(P, Q) = -\mathbb{E}_{x \sim P}\\log Q(x)H(P,Q)=−Ex∼PlogQ(x)

  • 最小化交叉熵 ⇔\Leftrightarrow⇔ 最小化 KL 散度(因 H(P)H(P)H(P) 固定)
  • 深度学习中常用的交叉熵损失函数的理论基础

13.5 交叉熵(Cross-Entropy)

H(P,Q)=−∑xP(x)log⁡Q(x)H(P, Q) = -\sum_x P(x) \log Q(x)H(P,Q)=−x∑P(x)logQ(x)

  • 用分布 QQQ 编码来自分布 PPP 的样本所需的平均比特数
  • 分类任务中,PPP 为真实标签的 one-hot 分布,QQQ 为模型预测概率

13.6 互信息(Mutual Information)

I(X;Y)=DKL(P(X,Y)∥P(X)P(Y))I(X; Y) = D_{KL}(P(X, Y) \| P(X)P(Y))I(X;Y)=DKL(P(X,Y)∥P(X)P(Y))

=H(X)−H(X∣Y)=H(Y)−H(Y∣X)= H(X) - H(X \mid Y) = H(Y) - H(Y \mid X)=H(X)−H(X∣Y)=H(Y)−H(Y∣X)

  • 衡量知道 YYY 后对 XXX 不确定性减少的程度
  • I(X;Y)≥0I(X; Y) \geq 0I(X;Y)≥0,且 I(X;Y)=0I(X; Y) = 0I(X;Y)=0 当且仅当 X⊥YX \perp YX⊥Y

13.7 信息论关键公式汇总

公式 含义
自信息 I(x)=−log⁡P(x)I(x) = -\log P(x)I(x)=−logP(x) 单个事件的信息量
H(X)=−∑P(x)log⁡P(x)H(X) = -\sum P(x)\log P(x)H(X)=−∑P(x)logP(x) 平均不确定性
交叉熵 H(P,Q)=−∑P(x)log⁡Q(x)H(P,Q) = -\sum P(x)\log Q(x)H(P,Q)=−∑P(x)logQ(x) 用 QQQ 编码 PPP 的代价
KL散度 DKL(P∣Q)=∑P(x)log⁡P(x)Q(x)D_{KL}(P|Q) = \sum P(x)\log\frac{P(x)}{Q(x)}DKL(P∣Q)=∑P(x)logQ(x)P(x) 信息损失
互信息 I(X;Y)=DKL(P(X,Y)∣P(X)P(Y))I(X;Y) = D_{KL}(P(X,Y)|P(X)P(Y))I(X;Y)=DKL(P(X,Y)∣P(X)P(Y)) 变量间的依赖程度

十四、结构化概率模型

14.1 动机

  • 当随机变量很多时,联合分布 P(X1,X2,...,Xn)P(X_1, X_2, ..., X_n)P(X1,X2,...,Xn) 的表示和计算非常昂贵
  • 利用变量间的条件独立性,可以大幅简化表示

14.2 有向图模型(Directed Graphical Models / 贝叶斯网络)

  • 用**有向无环图(DAG)**表示变量间的依赖关系

  • 每个节点对应一个随机变量

  • 联合分布分解为条件概率的乘积:

    P(X1,...,Xn)=∏i=1nP(Xi∣Pa(Xi))P(X_1, ..., X_n) = \prod_{i=1}^{n} P(X_i \mid \text{Pa}(X_i))P(X1,...,Xn)=i=1∏nP(Xi∣Pa(Xi))

    其中 Pa(Xi)\text{Pa}(X_i)Pa(Xi) 是 XiX_iXi 的父节点集合

  • 图示例

    复制代码
    A → B → C

    若 A⊥C∣BA \perp C \mid BA⊥C∣B(BBB 阻断了 AAA 到 CCC 的路径)

14.3 无向图模型(Undirected Graphical Models / 马尔可夫随机场)

  • 无向图表示变量间的关系

  • 联合分布通过势函数(Potential Functions / Factors) 表示:

    P(X1,...,Xn)=1Z∏团CϕC(xC)P(X_1, ..., X_n) = \frac{1}{Z} \prod_{\text{团}C} \phi_C(\mathbf{x}_C)P(X1,...,Xn)=Z1团C∏ϕC(xC)

    • ϕC\phi_CϕC 是定义在团 CCC 上的非负势函数
    • Z=∑x∏CϕC(xC)Z = \sum_{\mathbf{x}} \prod_C \phi_C(\mathbf{x}_C)Z=∑x∏CϕC(xC) 是归一化常数(配分函数)

14.4 条件独立性与图分离

在有向图模型中,三种基本结构:

结构 名称 条件独立性
A→B→CA \to B \to CA→B→C 链式(Chain) A⊥C∣BA \perp C \mid BA⊥C∣B
A←B→CA \leftarrow B \to CA←B→C 分叉(Fork) A⊥C∣BA \perp C \mid BA⊥C∣B
A→B←CA \to B \leftarrow CA→B←C 对撞(Collider/V-structure) A⊥̸CA \not\perp CA⊥C(无条件),但 A⊥C∣BA \perp C \mid BA⊥C∣B 不成立;反而在不观测 B 时 A 与 C 独立

d-分离(d-separation):系统判断图中任意两个节点集是否条件独立的准则

14.5 结构化概率模型的优势

  • 减少参数数量:从指数级降为多项式级
  • 高效推理:变量消元、信念传播等算法
  • 编码领域知识:通过图结构表达变量间的因果或依赖关系
  • 应用:隐马尔可夫模型(HMM)、条件随机场(CRF)、贝叶斯网络、马尔可夫随机场等

知识点总结导图

复制代码
概率与信息论
├── 概率基础
│   ├── 两种诠释:频率派 vs 贝叶斯派
│   ├── 随机变量:离散型 vs 连续型
│   ├── 概率分布:PMF vs PDF
│   ├── 边缘概率(求和/积分消去变量)
│   ├── 条件概率 → 链式法则
│   ├── 独立性与条件独立性
│   └── 期望、方差、协方差、相关系数
│
├── 常用概率分布
│   ├── 离散:伯努利、Multinoulli
│   ├── 连续:均匀、正态、指数、拉普拉斯、狄拉克
│   └── 混合:高斯混合模型(GMM)
│
├── 常用函数
│   ├── Sigmoid:输出(0,1),导数σ(1-σ)
│   └── Softplus:ReLU的平滑版本,导数为σ
│
├── 贝叶斯规则
│   └── 后验 = 似然 × 先验 / 证据
│
├── 连续型变量的技术细节
│   ├── 测度论基础
│   ├── 零测度集
│   └── 变量变换(雅可比行列式)
│
├── 信息论
│   ├── 自信息、熵、KL散度
│   ├── 交叉熵(深度学习损失函数基础)
│   └── 互信息
│
└── 结构化概率模型
    ├── 有向图模型(贝叶斯网络)
    ├── 无向图模型(马尔可夫随机场)
    ├── d-分离与条件独立性
    └── 对撞结构的"解释消除"现象

以上涵盖了本章所有知识点的核心定义、数学公式、性质、直觉理解和相互关联。这些内容是理解深度学习中概率建模、损失函数设计、生成模型等后续章节的数学基础。

相关推荐
俊哥V1 小时前
每日 AI 研究简报 · 2026-09-01
人工智能·ai
Wendy不吃榴莲1 小时前
# AI短剧教程 - 《后西游记》开播后,AI影视为什么更考验“连续讲故事”?
人工智能·笔记·学习·ai·视频
木圭的AI时代指南1 小时前
AI江湖录①·斩杀线
人工智能·ai
Agudamu11611 小时前
B站学习视频怎么变笔记:用 Ai好记 + Obsidian 搭建个人知识库的完整教程
人工智能·笔记·学习·音视频
麦豆GEO1 小时前
GEO优化流量密码:吃透4大用户提问模型,精准拿捏AI自然流量
大数据·人工智能
dh2711987791 小时前
南京企业AI搜索“可见度之战”:GEO服务商竞合格局与选型逻辑
大数据·人工智能
Dawson Zhu1 小时前
多Agent系统共享记忆架构:从存储范式到分布式共识的技术剖析
人工智能·语言模型·架构·aigc·agi
小道士写程序1 小时前
自然语言处理NLP - 第4章 NLP任务地图:先定义输出再挑模型
人工智能
具身AGI1 小时前
模型懂物理吗?物理AI 物理推理 的新赛点
人工智能·深度学习·计算机视觉