16-估计量的评选标准[无偏性,有效性,相合性,均方误差准则]

估计量的评选标准

一、无偏性

设 X 1 , X 2 , ⋯   , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是总体 X X X 的一个样本, θ ∈ Θ \theta \in \Theta θ∈Θ 是包含在总体 X X X 的分布中的待估参数,这里 Θ \Theta Θ 是 θ \theta θ 的取值范围。

无偏性 若估计量 θ ^ = θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta} = \hat{\theta}(X_1, X_2, \cdots, X_n) θ^=θ^(X1,X2,⋯,Xn) 的数学期望 E ( θ ^ ) E(\hat{\theta}) E(θ^) 存在,且对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ 有

E ( θ ^ ) = θ E(\hat{\theta}) = \theta E(θ^)=θ

则称 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的无偏估计量。

估计量的无偏性是说对于某些样本值,由这一估计量得到的估计值相对于真值来说偏大,有些则偏小。反复将这一估计量使用多次,就"平均"来说其偏差为零。在科学技术中 E ( θ ^ ) − θ E(\hat{\theta}) - \theta E(θ^)−θ 称为以 θ ^ \hat{\theta} θ^ 作为 θ \theta θ 的估计的系统误差。无偏估计的实际意义就是无系统误差。

  • θ ^ \hat\theta θ^是一个随机变量,是 X 1 , ⋯   , X n X_1,\cdots,X_n X1,⋯,Xn的函数

  • 无偏性保证:在大量重复抽样(每次样本量固定为n)的情况下,估计值的平均稳定于系统参数。换而言之,这个统计量的期望恰好等于系统参数。

  • 无论 X X X服从什么分布,其样本均值 X ˉ \bar X Xˉ和样本方差 S 2 S^2 S2均是总体的无偏估计量。证明见此文第三部分开篇(正态总体的样本均值与样样本方差的分布)

  • 一个未知参数 θ \theta θ 可以有不同的无偏估计量。

    例一 X ∼ E ( θ ) X \sim E(\theta) X∼E(θ)(这里使用的是倒数定义 θ = 1 λ \theta = \frac{1}{\lambda} θ=λ1), 则 X ˉ \bar X Xˉ和 Z = n ⋅ m i n { X 1 , X 2 , ⋯   , X n } Z = n \cdot min\{X_1,X_2,\cdots , X_n\} Z=n⋅min{X1,X2,⋯,Xn}都是 θ \theta θ的无偏估计量

    下面来证明 E ( Z ) = θ E(Z) = \theta E(Z)=θ :

    由第一顺序统计量性质可得

    F Z ( z ) = 1 − 1 − F X ( z n ) n = 1 − e − z θ , z > 0 F_Z(z) = 1 - 1 - F_X(\\frac{z}{n})^n = 1 - e^{-\frac{z}{\theta}} \quad ,z\gt 0 FZ(z)=1−1−FX(nz)n=1−e−θz,z>0

    由此得 f Z ( z ) = e − z θ \displaystyle f_Z(z) = e^{-\frac{z}{\theta}} fZ(z)=e−θz, 于是

    E ( Z ) = ∫ 0 + ∞ z ⋅ f Z ( z ) d z = θ E(Z) = \int_{0}^{+\infty} z\cdot f_Z(z) dz = \theta E(Z)=∫0+∞z⋅fZ(z)dz=θ

二、有效性

有效性 设 θ ^ 1 = θ ^ 1 ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}_1 = \hat{\theta}_1(X_1, X_2, \cdots, X_n) θ^1=θ^1(X1,X2,⋯,Xn) 与 θ ^ 2 = θ ^ 2 ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}_2 = \hat{\theta}_2(X_1, X_2, \cdots, X_n) θ^2=θ^2(X1,X2,⋯,Xn) 都是 θ \theta θ 的无偏估计量,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ,有

D ( θ ^ 1 ) ≤ D ( θ ^ 2 ) D(\hat{\theta}_1) \leq D(\hat{\theta}_2) D(θ^1)≤D(θ^2)

且至少对于某一个 θ ∈ Θ \theta \in \Theta θ∈Θ 上式中的不等号成立,则称 θ ^ 1 \hat{\theta}_1 θ^1 较 θ ^ 2 \hat{\theta}_2 θ^2 有效。

  • 有效性可以保证重复抽样(样本容量为 n)的结果更稳定

三、相合性

相合性 设 θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 为参数 θ \theta θ 的估计量,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ,当 n → ∞ n \to \infty n→∞ 时 θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 依概率收敛于 θ \theta θ,则称 θ ^ \hat{\theta} θ^ 为 θ \theta θ 的 相合估计量。

即,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ 都满足:对于任意 ε > 0 \varepsilon > 0 ε>0,有

lim ⁡ n → ∞ P { ∣ θ ^ − θ ∣ < ε } = 1 , \lim_{n \to \infty} P\{|\hat{\theta} - \theta| < \varepsilon\} = 1, n→∞limP{∣θ^−θ∣<ε}=1,

则称 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的 相合估计量。

  • 相合性保证的是大样本下的可靠性,即样本越大,估计量撞上真值的概率就越高。只要数据足够多,估计值几乎肯定能无限接近真实参数。

四、均方误差

设 θ ^ = θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta} = \hat{\theta}(X_1, X_2, \cdots, X_n) θ^=θ^(X1,X2,⋯,Xn) 是总体参数 θ \theta θ 的一个估计量,则 θ ^ \hat{\theta} θ^ 的均方误差 为

MSE ⁡ ( θ ^ ) = E ( θ \^ − θ ) 2 = D ( θ ^ ) + E ( θ \^ ) − θ 2 \begin{align} \operatorname{MSE}(\hat{\theta}) &= E\left(\\hat{\\theta} - \\theta)\^2\\right \\ &= D(\hat{\theta}) + \leftE(\\hat{\\theta}) - \\theta\\right^2 \end{align} MSE(θ^)=E(θ\^−θ)2=D(θ^)+E(θ\^)−θ2

若 MSE ⁡ ( θ 1 ^ ) ≤ MSE ⁡ ( θ 2 ^ ) \operatorname{MSE}(\hat{\theta_1}) \le \operatorname{MSE}(\hat{\theta_2}) MSE(θ1^)≤MSE(θ2^),对一切 θ ∈ Θ \theta \in \Theta θ∈Θ都成立,且至少存在一个 θ ∈ Θ \theta \in \Theta θ∈Θ使得不等号成立,则称 θ ^ 1 \hat \theta_1 θ^1在均方误差准则下优于 θ ^ 2 \hat \theta_2 θ^2。

在实际应用中均方误差准则要优于其他准则

  • 在大样本下,极大似然估计的渐近分布为正态分布,而正态分布的"中心"恰好对应最小化平方损失。这使得MSE自然而然地成为大样本理论中的核心标准。
  • 在机器学习中,当你的目标变量服从正态分布时,最小化MSE等同于极大似然估计,是有理论最优保证的。
    对均方误差的推导过程如下

E ( θ \^ − θ ) 2 = E ( ( θ \^ − E ( θ \^ ) ) + ( E ( θ \^ ) − θ ) ) 2 = E ( θ \^ − E ( θ \^ ) ) 2 + 2 ( θ \^ − E ( θ \^ ) ) ( E ( θ \^ ) − θ ) + ( E ( θ \^ ) − θ ) 2 = E ( θ \^ − E ( θ \^ ) ) 2 + 2 E ( θ \^ − E ( θ \^ ) ) ( E ( θ \^ ) − θ ) + E ( E ( θ \^ ) − θ ) 2 = D ( θ ^ ) + 2 ( E ( θ ^ ) − θ ) E θ \^ − E ( θ \^ ) + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + 2 ( E ( θ ^ ) − θ ) ( E ( θ ^ ) − E ( θ ^ ) ) + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + 0 + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + E ( θ \^ ) − θ 2 \begin{align} E\left(\\hat{\\theta} - \\theta)\^2\\right &= E\left\\left((\\hat{\\theta} - E(\\hat{\\theta})) + (E(\\hat{\\theta}) - \\theta)\\right)\^2\\right \\ &= E\left(\\hat{\\theta} - E(\\hat{\\theta}))\^2 + 2(\\hat{\\theta} - E(\\hat{\\theta}))(E(\\hat{\\theta}) - \\theta) + (E(\\hat{\\theta}) - \\theta)\^2\\right \\ &= E\left(\\hat{\\theta} - E(\\hat{\\theta}))\^2\\right + 2E\left(\\hat{\\theta} - E(\\hat{\\theta}))(E(\\hat{\\theta}) - \\theta)\\right + E\left(E(\\hat{\\theta}) - \\theta)\^2\\right \\ &= D(\hat{\theta}) + 2(E(\hat{\theta}) - \theta)E\left\\hat{\\theta} - E(\\hat{\\theta})\\right + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + 2(E(\hat{\theta}) - \theta)(E(\hat{\theta}) - E(\hat{\theta})) + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + 0 + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + \leftE(\\hat{\\theta}) - \\theta\\right^2 \end{align} E(θ\^−θ)2=E((θ\^−E(θ\^))+(E(θ\^)−θ))2=E(θ\^−E(θ\^))2+2(θ\^−E(θ\^))(E(θ\^)−θ)+(E(θ\^)−θ)2=E(θ\^−E(θ\^))2+2E(θ\^−E(θ\^))(E(θ\^)−θ)+E(E(θ\^)−θ)2=D(θ^)+2(E(θ^)−θ)Eθ\^−E(θ\^)+(E(θ^)−θ)2=D(θ^)+2(E(θ^)−θ)(E(θ^)−E(θ^))+(E(θ^)−θ)2=D(θ^)+0+(E(θ^)−θ)2=D(θ^)+E(θ\^)−θ2

  • 注意, θ \theta θ是一个常数

均方误差的性质

  • 若 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的无偏估计量 ,即 E ( θ ^ ) = θ E(\hat{\theta}) = \theta E(θ^)=θ,则

MSE ⁡ ( θ ^ ) = D ( θ ^ ) \operatorname{MSE}(\hat{\theta}) = D(\hat{\theta}) MSE(θ^)=D(θ^)

此时,最小化 MSE 等价于最小化方差,这也正是"有效性"比较的基础。

  • 当样本量 n → ∞ n \to \infty n→∞ 时,
    lim ⁡ n → ∞ MSE ⁡ ( θ ^ n ) = 0 \lim_{n \to \infty} \operatorname{MSE}(\hat{\theta}_n) = 0 n→∞limMSE(θ^n)=0
    则称 θ ^ n \hat{\theta}_n θ^n 为均方相合估计量。

由分解公式可知,均方相合等价于同时满足:

  • lim ⁡ n → ∞ Var ⁡ ( θ ^ n ) = 0 \lim_{n \to \infty} \operatorname{Var}(\hat{\theta}_n) = 0 limn→∞Var(θ^n)=0(方差趋于 0);
  • lim ⁡ n → ∞ E ( θ ^ n ) = θ \lim_{n \to \infty} E(\hat{\theta}_n) = \theta limn→∞E(θ^n)=θ(偏差趋于 0,即渐进无偏)。

均方相合是比普通相合(依概率收敛)更强的收敛形式。

相关推荐
信马堂5 分钟前
WorkBuddy 接入第三方模型 API 全流程:安装与配置实录
人工智能·大模型·token·ai算力·workbuddy
朝朝辞暮i1 小时前
VLA 系统学习第 4 课:一个 Batch 进入神经网络后,模型到底是怎么“学会”的?
人工智能·python·神经网络·vla
IT古董1 小时前
《FDE前沿部署工程师实战教程》33 - Enterprise AI Observability:从Agent Trace到全链路智能运维
数据库·人工智能
xsd202411182 小时前
地网腐蚀AI识别算法全解析:从锈蚀图像到地下腐蚀快速定位
人工智能
oooost2 小时前
pytorch学习笔记2(transformer)
人工智能·机器学习
云杂项2 小时前
Exploring Model Inversion Attacks in the Black-box Setting(个人笔记)
人工智能
还卿一钵无情泪2 小时前
Unsloth 微调 构建自己的大模型 没有GPU也能微调
linux·开发语言·人工智能·python·大模型·nlp·unsloth
冬奇Lab3 小时前
LLM 驱动的自动化测试系列(06):移动端自动化(二)——DroidRun/Mobilerun 的角色级模型拆分
人工智能·测试
冬奇Lab4 小时前
一天一个开源项目(第230篇):HandRaw-Style —— 把 327 种手绘风格、165 种排版、36 种配色编号化,让 AI 画图不再每次都飘
人工智能·开源·资讯
罗西的思考4 小时前
从陶哲轩的访谈看:AI 数学研究方法论 & 给其它行业的启示
人工智能