统计学中的六大估计方法:从最大似然到核密度估计的本质理解

从数据中推断未知规律,是统计学永恒的主题。

我们观察到的是样本,而真正关心的是隐藏在样本背后的参数、分布和规律。

所谓"估计(Estimation)",就是利用有限的数据,对未知对象进行合理推断。

在统计学的发展过程中,人们提出了许多估计方法,其中最经典、最常用的包括:

  • 最大似然估计(Maximum Likelihood Estimation,MLE)
  • 最大后验估计(Maximum A Posteriori Estimation,MAP)
  • 最小二乘估计(Least Squares Estimation,LSE)
  • 最优线性无偏估计(Best Linear Unbiased Estimator,BLUE)
  • 贝叶斯估计(Bayesian Estimation)
  • 核密度估计(Kernel Density Estimation,KDE)

这些方法看似不同,但本质上都在回答一个问题:

如何利用已有信息,对未知规律做出最合理的猜测?

本文将从数学形式、计算过程以及直观理解三个层面介绍这些方法。


1. 估计问题的基本形式

假设我们观察到一组数据:

X={x1,x2,...,xn} X=\{x_1,x_2,\ldots,x_n\} X={x1,x2,...,xn}

这些数据来自某个未知分布:

X∼P(x∣θ) X\sim P(x|\theta) X∼P(x∣θ)

其中:

  • XXX:观测数据
  • θ\thetaθ:未知参数
  • P(x∣θ)P(x|\theta)P(x∣θ):数据生成模型

我们的目标是:

根据 X 推断 θ \text{根据 }X\text{ 推断 }\theta 根据 X 推断 θ

例如:

问题1:估计平均身高

假设:

X∼N(μ,σ2) X\sim N(\mu,\sigma^2) X∼N(μ,σ2)

我们不知道:

  • 平均身高 μ\muμ
  • 方差 σ2\sigma^2σ2

通过样本:

x1,x2,...,xn x_1,x_2,...,x_n x1,x2,...,xn

估计:

μ^ \hat{\mu} μ^


问题2:预测房价

假设:

y=f(x)+ϵ y=f(x)+\epsilon y=f(x)+ϵ

我们希望找到:

f^(x) \hat{f}(x) f^(x)

不同估计方法,就是不同的"推断哲学"。


2. 最大似然估计(MLE)

2.1 核心思想

最大似然估计的思想非常简单:

哪个参数最可能产生当前观察到的数据,就选择哪个参数。

换句话说:

假设世界存在一个参数 θ\thetaθ。

我们不知道它是多少。

那么:

尝试不同的 θ\thetaθ:

  • 如果这个参数产生当前数据的概率很大
  • 那么它更可信

数学表达:

θ^MLE=arg⁡max⁡θP(X∣θ) \hat{\theta}{MLE} = \arg\max\theta P(X|\theta) θ^MLE=argθmaxP(X∣θ)

其中:

P(X∣θ) P(X|\theta) P(X∣θ)

叫做似然函数(Likelihood)。


2.2 为什么使用对数似然?

通常:

P(X∣θ)=∏i=1nP(xi∣θ) P(X|\theta) = \prod_{i=1}^{n}P(x_i|\theta) P(X∣θ)=i=1∏nP(xi∣θ)

多个概率相乘容易计算困难。

因此取对数:

L(θ)=log⁡P(X∣θ) L(\theta) = \log P(X|\theta) L(θ)=logP(X∣θ)

因为:

log⁡(x) \log(x) log(x)

是单调函数,所以最大值位置不变:

θ^=arg⁡max⁡θL(θ) \hat{\theta} = \arg\max_\theta L(\theta) θ^=argθmaxL(θ)


2.3 举例:估计硬币正面概率

假设:

硬币正面概率:

P(head)=p P(head)=p P(head)=p

实验 100 次:

正面 60 次。

那么:

L(p)=p60(1−p)40 L(p)=p^{60}(1-p)^{40} L(p)=p60(1−p)40

最大化:

log⁡L(p)=60log⁡p+40log⁡(1−p) \log L(p) = 60\log p+40\log(1-p) logL(p)=60logp+40log(1−p)

求导:

60p−401−p=0 \frac{60}{p}-\frac{40}{1-p}=0 p60−1−p40=0

得到:

p=0.6 p=0.6 p=0.6

所以:

p^=0.6 \hat p=0.6 p^=0.6


2.4 MLE本质理解

最大似然其实是在问:

如果世界按照某个参数运行,出现现在数据的可能性最大吗?

它是一种:

  • 数据驱动
  • 频率派思想
  • 不考虑先验知识

优点:

  • 简单
  • 通用
  • 大样本性质优秀

缺点:

  • 数据少时容易过拟合
  • 不利用已有经验

3. 最大后验估计(MAP)

3.1 从 MLE 到 MAP

MLE:

只考虑:

P(X∣θ) P(X|\theta) P(X∣θ)

但是现实中:

我们往往知道一些先验知识。

例如:

一个硬币通常大概率接近公平。

于是加入:

P(θ) P(\theta) P(θ)

表示:

参数本身出现的概率。


3.2 贝叶斯公式

根据贝叶斯公式:

::contentReferenceoaicite:0{index=0}

忽略:

P(X) P(X) P(X)

得到:

P(θ∣X)∝P(X∣θ)P(θ) P(\theta|X) \propto P(X|\theta)P(\theta) P(θ∣X)∝P(X∣θ)P(θ)

MAP寻找:

后验概率最大的参数:

θ^MAP=arg⁡max⁡θP(X∣θ)P(θ) \hat{\theta}{MAP} = \arg\max\theta P(X|\theta)P(\theta) θ^MAP=argθmaxP(X∣θ)P(θ)

取对数:

=arg⁡max⁡θlog⁡P(X∣θ)+log⁡P(θ) = \arg\max_\theta \\log P(X\|\\theta) + \\log P(\\theta) =argθmaxlogP(X∣θ)+logP(θ)


3.3 MAP本质理解

MAP=MLE+先验约束

可以理解为:

MLE:

"只相信数据。"

MAP:

"相信数据,同时参考过去经验。"

例如:

MLE:

100 次投硬币:

60 次正面

认为:

p=0.6 p=0.6 p=0.6

MAP:

知道:

普通硬币一般接近:

p=0.5 p=0.5 p=0.5

最终可能得到:

p=0.55 p=0.55 p=0.55


4. 最小二乘估计(LSE)

4.1 核心思想

最小二乘法:

找一个模型,让预测值和真实值之间的误差平方和最小。

假设:

线性模型:

y=wx+b y=wx+b y=wx+b

预测:

y^i=wxi+b \hat y_i=wx_i+b y^i=wxi+b

误差:

ei=yi−y^i e_i=y_i-\hat y_i ei=yi−y^i

目标:

min⁡∑iei2 \min \sum_i e_i^2 mini∑ei2

即:

min⁡∑i(yi−wxi−b)2 \min \sum_i (y_i-wx_i-b)^2 mini∑(yi−wxi−b)2


4.2 为什么平方误差?

原因:

1. 消除正负抵消

如果直接:

∑ei \sum e_i ∑ei

正负误差可能抵消。

2. 放大大误差

平方:

大错误惩罚更严重。


4.3 矩阵形式

线性模型:

Y=Xβ+ϵ Y=X\beta+\epsilon Y=Xβ+ϵ

目标:

min⁡∣∣Y−Xβ∣∣2 \min ||Y-X\beta||^2 min∣∣Y−Xβ∣∣2

求导:

得到:

β^=(XTX)−1XTY \hat\beta = (X^TX)^{-1}X^TY β^=(XTX)−1XTY


4.4 最小二乘本质

最小二乘不是概率思想。

它关注:

几何距离最小。

从空间角度:

寻找一个预测平面,使所有数据点到该平面的距离平方最小。


5. 最优线性无偏估计(BLUE)

5.1 什么是 BLUE?

BLUE:

Best Linear Unbiased Estimator

中文:

最佳线性无偏估计。

它来自高斯-马尔可夫定理。


假设:

Y=Xβ+ϵ Y=X\beta+\epsilon Y=Xβ+ϵ

满足:

  1. 线性

β^=AY \hat\beta=AY β^=AY

  1. 无偏:

E(β^)=β E(\hat\beta)=\beta E(β^)=β

  1. 方差最小:

Var(β^) Var(\hat\beta) Var(β^)

最低。

那么:

β^ \hat\beta β^

就是 BLUE。


5.2 与最小二乘关系

在线性回归满足:

  • 误差均值为 0
  • 同方差
  • 不相关

条件下:

普通最小二乘估计:

OLS

就是:

BLUE。


5.3 本质理解

BLUE回答:

在所有线性估计方法中,谁最稳定?

它关注:

不是找到一个参数。

而是:

找到一个:

  • 不偏
  • 方差最低

的估计。


6. 贝叶斯估计

6.1 核心思想

频率派:参数固定,数据随机。

贝叶斯派:参数也是随机变量。

因此:

P(θ) P(\theta) P(θ)

表示参数的不确定性。


6.2 贝叶斯推断过程

先验:

P(θ) P(\theta) P(θ)

观察数据:

P(X∣θ) P(X|\theta) P(X∣θ)

得到后验:

P(θ∣X) P(\theta|X) P(θ∣X)

公式:

P(θ∣X)=P(X∣θ)P(θ)P(X) P(\theta|X) = \frac{ P(X|\theta)P(\theta) }{ P(X) } P(θ∣X)=P(X)P(X∣θ)P(θ)


6.3 贝叶斯估计结果

最终估计:

可以选择:

后验均值

E(θ∣X) E(\theta|X) E(θ∣X)

后验最大值

即:

MAP。


6.4 本质理解

贝叶斯方法认为:

世界中的未知量,本身也具有不确定性。

所以它输出的不是:

一个答案:

θ=5 \theta=5 θ=5

而是:

一个分布:

P(θ∣X) P(\theta|X) P(θ∣X)

告诉你:

哪些可能性更高。


7. 核密度估计(KDE)

7.1 KDE解决什么问题?

前面的估计:

主要估计参数。

例如:

平均值:

μ \mu μ

但是:

如果不知道数据分布形式怎么办?

例如:

不知道数据是不是:

  • 正态分布
  • 指数分布
  • 多峰分布

这时候使用:

KDE。


7.2 KDE思想

KDE:

Kernel Density Estimation

核心:

每个数据点贡献一个"小山峰",所有山峰叠加形成概率密度。

公式:

f^(x)=1nh∑i=1nK(x−xih) \hat{f}{(x)}= \frac1{nh} \sum_{i=1}^{n} K ( \frac{x-x_i}{h} ) f^(x)=nh1i=1∑nK(hx−xi)

其中:

  • KKK:核函数
  • hhh:带宽

7.3 常用核函数

高斯核:

K(x)=12πe−x2/2 K(x)=\frac1{\sqrt{2\pi}} e^{-x^2/2} K(x)=2π 1e−x2/2

意味着:

每个样本点附近放一个高斯小曲线。


7.4 带宽h的重要性

h太小:

复制代码
数据点 → 原样复制

结果:

过拟合。

h太大:

复制代码
曲线 → 过度平滑

结果:

丢失结构。


7.5 KDE本质理解

KDE:

不是估计参数。

而是在估计:

整个概率分布。

它回答:

数据真正的分布形状是什么?


8. 六种估计方法对比

方法 核心思想 是否需要模型 输出
MLE 最大化数据可能性 参数
MAP 最大化后验概率 参数
最小二乘 最小化误差 通常线性 参数
BLUE 最优无偏线性估计 线性模型 参数
贝叶斯估计 更新参数分布 参数分布
KDE 平滑样本点 概率密度

9. 六种方法之间的关系

MLE 与 MAP

$$

MAP

MLE+Prior

$$

MAP加入了先验。


MLE 与 贝叶斯

MLE:

取最大:

θ \theta θ

贝叶斯:

保留:

P(θ∣X) P(\theta|X) P(θ∣X)


最小二乘 与 MLE

如果:

误差服从:

N(0,σ2) N(0,\sigma^2) N(0,σ2)

那么:

最大似然估计等价于:

最小二乘。


OLS 与 BLUE

满足:

高斯-马尔可夫条件:

OLS=BLUE OLS=BLUE OLS=BLUE


10. 总结:统计估计的哲学

六种方法其实代表六种不同思想:

最大似然

找最能解释数据的参数。

最大后验

数据重要,但经验也重要。

最小二乘

找距离数据最近的模型。

BLUE

在公平估计中寻找最稳定方案。

贝叶斯

不确定性本身也是信息。

KDE

不假设模型,让数据告诉我们分布。

最终:

统计学的核心并不是计算一个数字。

而是在:

有限信息、不确定世界中,建立一个合理的认知模型。

这也是各种估计方法存在的意义。

相关推荐
热心网友俣先生2 小时前
2026年高教社杯数模国赛A题:五年命题规律与预测
算法·机器学习·数学建模
2601_953988074 小时前
Ricon组态实时监控 - 毫秒级数据可视化
前端·物联网·数学建模·信息可视化·架构·前端框架
统计学小王子4 小时前
数学建模国赛倒计时 2 天 ——《缺失值处理一(R语言)》
开发语言·数学建模·r语言
HineMusk4 小时前
如何使用 Codex 为数学建模论文高效绘图:以 2023 国赛 C 题为例
数学建模·流程图·画图
乱七八糟的屋子5 小时前
NLopt 超详细实战教程(C++版)算法选型|多目标优化|批量寻优|动态约束|闭环仿真控制
数学建模·非线性优化·nlopt·多目标优化·机器人算法·工业仿真·c++优化
统计学小王子5 小时前
数学建模国赛倒计时 2 天 ——《异常值的处理(R语言)》
开发语言·数学建模·r语言
建模小刘1 天前
(急急急)2026数学建模国赛最后三天准备!!!!
数学建模·2026数学建模国赛
统计学小王子1 天前
数学建模国赛倒计时 3 天 ——《统计模型精讲(分位数回归R语言实现二)》
数学建模·回归·r语言
统计学小王子2 天前
数学建模国赛倒计时4天——《统计模型精讲(混合效应模型R语言实现)》
开发语言·数学建模·r语言