估计量的评选标准
一、无偏性
设 X 1 , X 2 , ⋯ , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是总体 X X X 的一个样本, θ ∈ Θ \theta \in \Theta θ∈Θ 是包含在总体 X X X 的分布中的待估参数,这里 Θ \Theta Θ 是 θ \theta θ 的取值范围。
无偏性 若估计量 θ ^ = θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta} = \hat{\theta}(X_1, X_2, \cdots, X_n) θ^=θ^(X1,X2,⋯,Xn) 的数学期望 E ( θ ^ ) E(\hat{\theta}) E(θ^) 存在,且对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ 有
E ( θ ^ ) = θ E(\hat{\theta}) = \theta E(θ^)=θ
则称 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的无偏估计量。
估计量的无偏性是说对于某些样本值,由这一估计量得到的估计值相对于真值来说偏大,有些则偏小。反复将这一估计量使用多次,就"平均"来说其偏差为零。在科学技术中 E ( θ ^ ) − θ E(\hat{\theta}) - \theta E(θ^)−θ 称为以 θ ^ \hat{\theta} θ^ 作为 θ \theta θ 的估计的系统误差。无偏估计的实际意义就是无系统误差。
θ ^ \hat\theta θ^是一个随机变量,是 X 1 , ⋯ , X n X_1,\cdots,X_n X1,⋯,Xn的函数
无偏性保证:在大量重复抽样(每次样本量固定为n)的情况下,估计值的平均稳定于系统参数。换而言之,这个统计量的期望恰好等于系统参数。
无论 X X X服从什么分布,其样本均值 X ˉ \bar X Xˉ和样本方差 S 2 S^2 S2均是总体的无偏估计量。证明见此文第三部分开篇(正态总体的样本均值与样样本方差的分布)
一个未知参数 θ \theta θ 可以有不同的无偏估计量。
例一 X ∼ E ( θ ) X \sim E(\theta) X∼E(θ)(这里使用的是倒数定义 θ = 1 λ \theta = \frac{1}{\lambda} θ=λ1), 则 X ˉ \bar X Xˉ和 Z = n ⋅ m i n { X 1 , X 2 , ⋯ , X n } Z = n \cdot min\{X_1,X_2,\cdots , X_n\} Z=n⋅min{X1,X2,⋯,Xn}都是 θ \theta θ的无偏估计量
下面来证明 E ( Z ) = θ E(Z) = \theta E(Z)=θ :
由第一顺序统计量性质可得
F Z ( z ) = 1 − 1 − F X ( z n ) n = 1 − e − z θ , z > 0 F_Z(z) = 1 - 1 - F_X(\\frac{z}{n})^n = 1 - e^{-\frac{z}{\theta}} \quad ,z\gt 0 FZ(z)=1−1−FX(nz)n=1−e−θz,z>0
由此得 f Z ( z ) = e − z θ \displaystyle f_Z(z) = e^{-\frac{z}{\theta}} fZ(z)=e−θz, 于是
E ( Z ) = ∫ 0 + ∞ z ⋅ f Z ( z ) d z = θ E(Z) = \int_{0}^{+\infty} z\cdot f_Z(z) dz = \theta E(Z)=∫0+∞z⋅fZ(z)dz=θ
二、有效性
有效性 设 θ ^ 1 = θ ^ 1 ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}_1 = \hat{\theta}_1(X_1, X_2, \cdots, X_n) θ^1=θ^1(X1,X2,⋯,Xn) 与 θ ^ 2 = θ ^ 2 ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}_2 = \hat{\theta}_2(X_1, X_2, \cdots, X_n) θ^2=θ^2(X1,X2,⋯,Xn) 都是 θ \theta θ 的无偏估计量,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ,有
D ( θ ^ 1 ) ≤ D ( θ ^ 2 ) D(\hat{\theta}_1) \leq D(\hat{\theta}_2) D(θ^1)≤D(θ^2)
且至少对于某一个 θ ∈ Θ \theta \in \Theta θ∈Θ 上式中的不等号成立,则称 θ ^ 1 \hat{\theta}_1 θ^1 较 θ ^ 2 \hat{\theta}_2 θ^2 有效。
- 有效性可以保证重复抽样(样本容量为 n)的结果更稳定
三、相合性
相合性 设 θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 为参数 θ \theta θ 的估计量,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ,当 n → ∞ n \to \infty n→∞ 时 θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 依概率收敛于 θ \theta θ,则称 θ ^ \hat{\theta} θ^ 为 θ \theta θ 的 相合估计量。
即,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ 都满足:对于任意 ε > 0 \varepsilon > 0 ε>0,有
lim n → ∞ P { ∣ θ ^ − θ ∣ < ε } = 1 , \lim_{n \to \infty} P\{|\hat{\theta} - \theta| < \varepsilon\} = 1, n→∞limP{∣θ^−θ∣<ε}=1,
则称 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的 相合估计量。
- 相合性保证的是大样本下的可靠性,即样本越大,估计量撞上真值的概率就越高。只要数据足够多,估计值几乎肯定能无限接近真实参数。
四、均方误差
设 θ ^ = θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta} = \hat{\theta}(X_1, X_2, \cdots, X_n) θ^=θ^(X1,X2,⋯,Xn) 是总体参数 θ \theta θ 的一个估计量,则 θ ^ \hat{\theta} θ^ 的均方误差 为
MSE ( θ ^ ) = E ( θ \^ − θ ) 2 = D ( θ ^ ) + E ( θ \^ ) − θ 2 \begin{align} \operatorname{MSE}(\hat{\theta}) &= E\left(\\hat{\\theta} - \\theta)\^2\\right \\ &= D(\hat{\theta}) + \leftE(\\hat{\\theta}) - \\theta\\right^2 \end{align} MSE(θ^)=E(θ\^−θ)2=D(θ^)+E(θ\^)−θ2
若 MSE ( θ 1 ^ ) ≤ MSE ( θ 2 ^ ) \operatorname{MSE}(\hat{\theta_1}) \le \operatorname{MSE}(\hat{\theta_2}) MSE(θ1^)≤MSE(θ2^),对一切 θ ∈ Θ \theta \in \Theta θ∈Θ都成立,且至少存在一个 θ ∈ Θ \theta \in \Theta θ∈Θ使得不等号成立,则称 θ ^ 1 \hat \theta_1 θ^1在均方误差准则下优于 θ ^ 2 \hat \theta_2 θ^2。
在实际应用中均方误差准则要优于其他准则
- 在大样本下,极大似然估计的渐近分布为正态分布,而正态分布的"中心"恰好对应最小化平方损失。这使得MSE自然而然地成为大样本理论中的核心标准。
- 在机器学习中,当你的目标变量服从正态分布时,最小化MSE等同于极大似然估计,是有理论最优保证的。
对均方误差的推导过程如下E ( θ \^ − θ ) 2 = E ( ( θ \^ − E ( θ \^ ) ) + ( E ( θ \^ ) − θ ) ) 2 = E ( θ \^ − E ( θ \^ ) ) 2 + 2 ( θ \^ − E ( θ \^ ) ) ( E ( θ \^ ) − θ ) + ( E ( θ \^ ) − θ ) 2 = E ( θ \^ − E ( θ \^ ) ) 2 + 2 E ( θ \^ − E ( θ \^ ) ) ( E ( θ \^ ) − θ ) + E ( E ( θ \^ ) − θ ) 2 = D ( θ ^ ) + 2 ( E ( θ ^ ) − θ ) E θ \^ − E ( θ \^ ) + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + 2 ( E ( θ ^ ) − θ ) ( E ( θ ^ ) − E ( θ ^ ) ) + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + 0 + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + E ( θ \^ ) − θ 2 \begin{align} E\left(\\hat{\\theta} - \\theta)\^2\\right &= E\left\\left((\\hat{\\theta} - E(\\hat{\\theta})) + (E(\\hat{\\theta}) - \\theta)\\right)\^2\\right \\ &= E\left(\\hat{\\theta} - E(\\hat{\\theta}))\^2 + 2(\\hat{\\theta} - E(\\hat{\\theta}))(E(\\hat{\\theta}) - \\theta) + (E(\\hat{\\theta}) - \\theta)\^2\\right \\ &= E\left(\\hat{\\theta} - E(\\hat{\\theta}))\^2\\right + 2E\left(\\hat{\\theta} - E(\\hat{\\theta}))(E(\\hat{\\theta}) - \\theta)\\right + E\left(E(\\hat{\\theta}) - \\theta)\^2\\right \\ &= D(\hat{\theta}) + 2(E(\hat{\theta}) - \theta)E\left\\hat{\\theta} - E(\\hat{\\theta})\\right + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + 2(E(\hat{\theta}) - \theta)(E(\hat{\theta}) - E(\hat{\theta})) + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + 0 + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + \leftE(\\hat{\\theta}) - \\theta\\right^2 \end{align} E(θ\^−θ)2=E((θ\^−E(θ\^))+(E(θ\^)−θ))2=E(θ\^−E(θ\^))2+2(θ\^−E(θ\^))(E(θ\^)−θ)+(E(θ\^)−θ)2=E(θ\^−E(θ\^))2+2E(θ\^−E(θ\^))(E(θ\^)−θ)+E(E(θ\^)−θ)2=D(θ^)+2(E(θ^)−θ)Eθ\^−E(θ\^)+(E(θ^)−θ)2=D(θ^)+2(E(θ^)−θ)(E(θ^)−E(θ^))+(E(θ^)−θ)2=D(θ^)+0+(E(θ^)−θ)2=D(θ^)+E(θ\^)−θ2
- 注意, θ \theta θ是一个常数
均方误差的性质
- 若 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的无偏估计量 ,即 E ( θ ^ ) = θ E(\hat{\theta}) = \theta E(θ^)=θ,则
MSE ( θ ^ ) = D ( θ ^ ) \operatorname{MSE}(\hat{\theta}) = D(\hat{\theta}) MSE(θ^)=D(θ^)
此时,最小化 MSE 等价于最小化方差,这也正是"有效性"比较的基础。
- 当样本量 n → ∞ n \to \infty n→∞ 时,
lim n → ∞ MSE ( θ ^ n ) = 0 \lim_{n \to \infty} \operatorname{MSE}(\hat{\theta}_n) = 0 n→∞limMSE(θ^n)=0
则称 θ ^ n \hat{\theta}_n θ^n 为均方相合估计量。
由分解公式可知,均方相合等价于同时满足:
- lim n → ∞ Var ( θ ^ n ) = 0 \lim_{n \to \infty} \operatorname{Var}(\hat{\theta}_n) = 0 limn→∞Var(θ^n)=0(方差趋于 0);
- lim n → ∞ E ( θ ^ n ) = θ \lim_{n \to \infty} E(\hat{\theta}_n) = \theta limn→∞E(θ^n)=θ(偏差趋于 0,即渐进无偏)。
均方相合是比普通相合(依概率收敛)更强的收敛形式。