从数据中推断未知规律,是统计学永恒的主题。
我们观察到的是样本,而真正关心的是隐藏在样本背后的参数、分布和规律。
所谓"估计(Estimation)",就是利用有限的数据,对未知对象进行合理推断。
在统计学的发展过程中,人们提出了许多估计方法,其中最经典、最常用的包括:
- 最大似然估计(Maximum Likelihood Estimation,MLE)
- 最大后验估计(Maximum A Posteriori Estimation,MAP)
- 最小二乘估计(Least Squares Estimation,LSE)
- 最优线性无偏估计(Best Linear Unbiased Estimator,BLUE)
- 贝叶斯估计(Bayesian Estimation)
- 核密度估计(Kernel Density Estimation,KDE)
这些方法看似不同,但本质上都在回答一个问题:
如何利用已有信息,对未知规律做出最合理的猜测?
本文将从数学形式、计算过程以及直观理解三个层面介绍这些方法。
1. 估计问题的基本形式
假设我们观察到一组数据:
X={x1,x2,...,xn} X=\{x_1,x_2,\ldots,x_n\} X={x1,x2,...,xn}
这些数据来自某个未知分布:
X∼P(x∣θ) X\sim P(x|\theta) X∼P(x∣θ)
其中:
- XXX:观测数据
- θ\thetaθ:未知参数
- P(x∣θ)P(x|\theta)P(x∣θ):数据生成模型
我们的目标是:
根据 X 推断 θ \text{根据 }X\text{ 推断 }\theta 根据 X 推断 θ
例如:
问题1:估计平均身高
假设:
X∼N(μ,σ2) X\sim N(\mu,\sigma^2) X∼N(μ,σ2)
我们不知道:
- 平均身高 μ\muμ
- 方差 σ2\sigma^2σ2
通过样本:
x1,x2,...,xn x_1,x_2,...,x_n x1,x2,...,xn
估计:
μ^ \hat{\mu} μ^
问题2:预测房价
假设:
y=f(x)+ϵ y=f(x)+\epsilon y=f(x)+ϵ
我们希望找到:
f^(x) \hat{f}(x) f^(x)
不同估计方法,就是不同的"推断哲学"。
2. 最大似然估计(MLE)
2.1 核心思想
最大似然估计的思想非常简单:
哪个参数最可能产生当前观察到的数据,就选择哪个参数。
换句话说:
假设世界存在一个参数 θ\thetaθ。
我们不知道它是多少。
那么:
尝试不同的 θ\thetaθ:
- 如果这个参数产生当前数据的概率很大
- 那么它更可信
数学表达:
θ^MLE=argmaxθP(X∣θ) \hat{\theta}{MLE} = \arg\max\theta P(X|\theta) θ^MLE=argθmaxP(X∣θ)
其中:
P(X∣θ) P(X|\theta) P(X∣θ)
叫做似然函数(Likelihood)。
2.2 为什么使用对数似然?
通常:
P(X∣θ)=∏i=1nP(xi∣θ) P(X|\theta) = \prod_{i=1}^{n}P(x_i|\theta) P(X∣θ)=i=1∏nP(xi∣θ)
多个概率相乘容易计算困难。
因此取对数:
L(θ)=logP(X∣θ) L(\theta) = \log P(X|\theta) L(θ)=logP(X∣θ)
因为:
log(x) \log(x) log(x)
是单调函数,所以最大值位置不变:
θ^=argmaxθL(θ) \hat{\theta} = \arg\max_\theta L(\theta) θ^=argθmaxL(θ)
2.3 举例:估计硬币正面概率
假设:
硬币正面概率:
P(head)=p P(head)=p P(head)=p
实验 100 次:
正面 60 次。
那么:
L(p)=p60(1−p)40 L(p)=p^{60}(1-p)^{40} L(p)=p60(1−p)40
最大化:
logL(p)=60logp+40log(1−p) \log L(p) = 60\log p+40\log(1-p) logL(p)=60logp+40log(1−p)
求导:
60p−401−p=0 \frac{60}{p}-\frac{40}{1-p}=0 p60−1−p40=0
得到:
p=0.6 p=0.6 p=0.6
所以:
p^=0.6 \hat p=0.6 p^=0.6
2.4 MLE本质理解
最大似然其实是在问:
如果世界按照某个参数运行,出现现在数据的可能性最大吗?
它是一种:
- 数据驱动
- 频率派思想
- 不考虑先验知识
优点:
- 简单
- 通用
- 大样本性质优秀
缺点:
- 数据少时容易过拟合
- 不利用已有经验
3. 最大后验估计(MAP)
3.1 从 MLE 到 MAP
MLE:
只考虑:
P(X∣θ) P(X|\theta) P(X∣θ)
但是现实中:
我们往往知道一些先验知识。
例如:
一个硬币通常大概率接近公平。
于是加入:
P(θ) P(\theta) P(θ)
表示:
参数本身出现的概率。
3.2 贝叶斯公式
根据贝叶斯公式:
::contentReferenceoaicite:0{index=0}
忽略:
P(X) P(X) P(X)
得到:
P(θ∣X)∝P(X∣θ)P(θ) P(\theta|X) \propto P(X|\theta)P(\theta) P(θ∣X)∝P(X∣θ)P(θ)
MAP寻找:
后验概率最大的参数:
θ^MAP=argmaxθP(X∣θ)P(θ) \hat{\theta}{MAP} = \arg\max\theta P(X|\theta)P(\theta) θ^MAP=argθmaxP(X∣θ)P(θ)
取对数:
=argmaxθlogP(X∣θ)+logP(θ) = \arg\max_\theta \\log P(X\|\\theta) + \\log P(\\theta) =argθmaxlogP(X∣θ)+logP(θ)
3.3 MAP本质理解
MAP=MLE+先验约束
可以理解为:
MLE:
"只相信数据。"
MAP:
"相信数据,同时参考过去经验。"
例如:
MLE:
100 次投硬币:
60 次正面
认为:
p=0.6 p=0.6 p=0.6
MAP:
知道:
普通硬币一般接近:
p=0.5 p=0.5 p=0.5
最终可能得到:
p=0.55 p=0.55 p=0.55
4. 最小二乘估计(LSE)
4.1 核心思想
最小二乘法:
找一个模型,让预测值和真实值之间的误差平方和最小。
假设:
线性模型:
y=wx+b y=wx+b y=wx+b
预测:
y^i=wxi+b \hat y_i=wx_i+b y^i=wxi+b
误差:
ei=yi−y^i e_i=y_i-\hat y_i ei=yi−y^i
目标:
min∑iei2 \min \sum_i e_i^2 mini∑ei2
即:
min∑i(yi−wxi−b)2 \min \sum_i (y_i-wx_i-b)^2 mini∑(yi−wxi−b)2
4.2 为什么平方误差?
原因:
1. 消除正负抵消
如果直接:
∑ei \sum e_i ∑ei
正负误差可能抵消。
2. 放大大误差
平方:
大错误惩罚更严重。
4.3 矩阵形式
线性模型:
Y=Xβ+ϵ Y=X\beta+\epsilon Y=Xβ+ϵ
目标:
min∣∣Y−Xβ∣∣2 \min ||Y-X\beta||^2 min∣∣Y−Xβ∣∣2
求导:
得到:
β^=(XTX)−1XTY \hat\beta = (X^TX)^{-1}X^TY β^=(XTX)−1XTY
4.4 最小二乘本质
最小二乘不是概率思想。
它关注:
几何距离最小。
从空间角度:
寻找一个预测平面,使所有数据点到该平面的距离平方最小。
5. 最优线性无偏估计(BLUE)
5.1 什么是 BLUE?
BLUE:
Best Linear Unbiased Estimator
中文:
最佳线性无偏估计。
它来自高斯-马尔可夫定理。
假设:
Y=Xβ+ϵ Y=X\beta+\epsilon Y=Xβ+ϵ
满足:
- 线性
β^=AY \hat\beta=AY β^=AY
- 无偏:
E(β^)=β E(\hat\beta)=\beta E(β^)=β
- 方差最小:
Var(β^) Var(\hat\beta) Var(β^)
最低。
那么:
β^ \hat\beta β^
就是 BLUE。
5.2 与最小二乘关系
在线性回归满足:
- 误差均值为 0
- 同方差
- 不相关
条件下:
普通最小二乘估计:
OLS
就是:
BLUE。
5.3 本质理解
BLUE回答:
在所有线性估计方法中,谁最稳定?
它关注:
不是找到一个参数。
而是:
找到一个:
- 不偏
- 方差最低
的估计。
6. 贝叶斯估计
6.1 核心思想
频率派:参数固定,数据随机。
贝叶斯派:参数也是随机变量。
因此:
P(θ) P(\theta) P(θ)
表示参数的不确定性。
6.2 贝叶斯推断过程
先验:
P(θ) P(\theta) P(θ)
观察数据:
P(X∣θ) P(X|\theta) P(X∣θ)
得到后验:
P(θ∣X) P(\theta|X) P(θ∣X)
公式:
P(θ∣X)=P(X∣θ)P(θ)P(X) P(\theta|X) = \frac{ P(X|\theta)P(\theta) }{ P(X) } P(θ∣X)=P(X)P(X∣θ)P(θ)
6.3 贝叶斯估计结果
最终估计:
可以选择:
后验均值
E(θ∣X) E(\theta|X) E(θ∣X)
后验最大值
即:
MAP。
6.4 本质理解
贝叶斯方法认为:
世界中的未知量,本身也具有不确定性。
所以它输出的不是:
一个答案:
θ=5 \theta=5 θ=5
而是:
一个分布:
P(θ∣X) P(\theta|X) P(θ∣X)
告诉你:
哪些可能性更高。
7. 核密度估计(KDE)
7.1 KDE解决什么问题?
前面的估计:
主要估计参数。
例如:
平均值:
μ \mu μ
但是:
如果不知道数据分布形式怎么办?
例如:
不知道数据是不是:
- 正态分布
- 指数分布
- 多峰分布
这时候使用:
KDE。
7.2 KDE思想
KDE:
Kernel Density Estimation
核心:
每个数据点贡献一个"小山峰",所有山峰叠加形成概率密度。
公式:
f^(x)=1nh∑i=1nK(x−xih) \hat{f}{(x)}= \frac1{nh} \sum_{i=1}^{n} K ( \frac{x-x_i}{h} ) f^(x)=nh1i=1∑nK(hx−xi)
其中:
- KKK:核函数
- hhh:带宽
7.3 常用核函数
高斯核:
K(x)=12πe−x2/2 K(x)=\frac1{\sqrt{2\pi}} e^{-x^2/2} K(x)=2π 1e−x2/2
意味着:
每个样本点附近放一个高斯小曲线。
7.4 带宽h的重要性
h太小:
数据点 → 原样复制
结果:
过拟合。
h太大:
曲线 → 过度平滑
结果:
丢失结构。
7.5 KDE本质理解
KDE:
不是估计参数。
而是在估计:
整个概率分布。
它回答:
数据真正的分布形状是什么?
8. 六种估计方法对比
| 方法 | 核心思想 | 是否需要模型 | 输出 |
|---|---|---|---|
| MLE | 最大化数据可能性 | 是 | 参数 |
| MAP | 最大化后验概率 | 是 | 参数 |
| 最小二乘 | 最小化误差 | 通常线性 | 参数 |
| BLUE | 最优无偏线性估计 | 线性模型 | 参数 |
| 贝叶斯估计 | 更新参数分布 | 是 | 参数分布 |
| KDE | 平滑样本点 | 否 | 概率密度 |
9. 六种方法之间的关系
MLE 与 MAP
$$
MAP
MLE+Prior
$$
MAP加入了先验。
MLE 与 贝叶斯
MLE:
取最大:
θ \theta θ
贝叶斯:
保留:
P(θ∣X) P(\theta|X) P(θ∣X)
最小二乘 与 MLE
如果:
误差服从:
N(0,σ2) N(0,\sigma^2) N(0,σ2)
那么:
最大似然估计等价于:
最小二乘。
OLS 与 BLUE
满足:
高斯-马尔可夫条件:
OLS=BLUE OLS=BLUE OLS=BLUE
10. 总结:统计估计的哲学
六种方法其实代表六种不同思想:
最大似然
找最能解释数据的参数。
最大后验
数据重要,但经验也重要。
最小二乘
找距离数据最近的模型。
BLUE
在公平估计中寻找最稳定方案。
贝叶斯
不确定性本身也是信息。
KDE
不假设模型,让数据告诉我们分布。
最终:
统计学的核心并不是计算一个数字。
而是在:
有限信息、不确定世界中,建立一个合理的认知模型。
这也是各种估计方法存在的意义。