16-估计量的评选标准[无偏性,有效性,相合性,均方误差准则]

估计量的评选标准

一、无偏性

设 X 1 , X 2 , ⋯   , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是总体 X X X 的一个样本, θ ∈ Θ \theta \in \Theta θ∈Θ 是包含在总体 X X X 的分布中的待估参数,这里 Θ \Theta Θ 是 θ \theta θ 的取值范围。

无偏性 若估计量 θ ^ = θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta} = \hat{\theta}(X_1, X_2, \cdots, X_n) θ^=θ^(X1,X2,⋯,Xn) 的数学期望 E ( θ ^ ) E(\hat{\theta}) E(θ^) 存在,且对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ 有

E ( θ ^ ) = θ E(\hat{\theta}) = \theta E(θ^)=θ

则称 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的无偏估计量

估计量的无偏性是说对于某些样本值,由这一估计量得到的估计值相对于真值来说偏大,有些则偏小。反复将这一估计量使用多次,就"平均"来说其偏差为零。在科学技术中 E ( θ ^ ) − θ E(\hat{\theta}) - \theta E(θ^)−θ 称为以 θ ^ \hat{\theta} θ^ 作为 θ \theta θ 的估计的系统误差。无偏估计的实际意义就是无系统误差。

  • θ ^ \hat\theta θ^是一个随机变量,是 X 1 , ⋯   , X n X_1,\cdots,X_n X1,⋯,Xn的函数

  • 无偏性保证:在大量重复抽样(每次样本量固定为n)的情况下,估计值的平均稳定于系统参数。换而言之,这个统计量的期望恰好等于系统参数。

  • 无论 X X X服从什么分布,其样本均值 X ˉ \bar X Xˉ和样本方差 S 2 S^2 S2均是总体的无偏估计量。证明见此文第三部分开篇(正态总体的样本均值与样样本方差的分布)

  • 一个未知参数 θ \theta θ 可以有不同的无偏估计量。

    例一 X ∼ E ( θ ) X \sim E(\theta) X∼E(θ)(这里使用的是倒数定义 θ = 1 λ \theta = \frac{1}{\lambda} θ=λ1), 则 X ˉ \bar X Xˉ和 Z = n ⋅ m i n { X 1 , X 2 , ⋯   , X n } Z = n \cdot min\{X_1,X_2,\cdots , X_n\} Z=n⋅min{X1,X2,⋯,Xn}都是 θ \theta θ的无偏估计量

    下面来证明 E ( Z ) = θ E(Z) = \theta E(Z)=θ :

    由第一顺序统计量性质可得

    F Z ( z ) = 1 − 1 − F X ( z n ) n = 1 − e − z θ , z > 0 F_Z(z) = 1 - 1 - F_X(\\frac{z}{n})^n = 1 - e^{-\frac{z}{\theta}} \quad ,z\gt 0 FZ(z)=1−1−FX(nz)n=1−e−θz,z>0

    由此得 f Z ( z ) = e − z θ \displaystyle f_Z(z) = e^{-\frac{z}{\theta}} fZ(z)=e−θz, 于是

    E ( Z ) = ∫ 0 + ∞ z ⋅ f Z ( z ) d z = θ E(Z) = \int_{0}^{+\infty} z\cdot f_Z(z) dz = \theta E(Z)=∫0+∞z⋅fZ(z)dz=θ

二、有效性

有效性 设 θ ^ 1 = θ ^ 1 ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}_1 = \hat{\theta}_1(X_1, X_2, \cdots, X_n) θ^1=θ^1(X1,X2,⋯,Xn) 与 θ ^ 2 = θ ^ 2 ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}_2 = \hat{\theta}_2(X_1, X_2, \cdots, X_n) θ^2=θ^2(X1,X2,⋯,Xn) 都是 θ \theta θ 的无偏估计量,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ,有

D ( θ ^ 1 ) ≤ D ( θ ^ 2 ) D(\hat{\theta}_1) \leq D(\hat{\theta}_2) D(θ^1)≤D(θ^2)

且至少对于某一个 θ ∈ Θ \theta \in \Theta θ∈Θ 上式中的不等号成立,则称 θ ^ 1 \hat{\theta}_1 θ^1 较 θ ^ 2 \hat{\theta}_2 θ^2 有效。

  • 有效性可以保证重复抽样(样本容量为 n)的结果更稳定

三、相合性

相合性 设 θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 为参数 θ \theta θ 的估计量,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ,当 n → ∞ n \to \infty n→∞ 时 θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 依概率收敛于 θ \theta θ,则称 θ ^ \hat{\theta} θ^ 为 θ \theta θ 的 相合估计量

即,若对于任意 θ ∈ Θ \theta \in \Theta θ∈Θ 都满足:对于任意 ε > 0 \varepsilon > 0 ε>0,有

lim ⁡ n → ∞ P { ∣ θ ^ − θ ∣ < ε } = 1 , \lim_{n \to \infty} P\{|\hat{\theta} - \theta| < \varepsilon\} = 1, n→∞limP{∣θ^−θ∣<ε}=1,

则称 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的 相合估计量

  • 相合性保证的是大样本下的可靠性,即样本越大,估计量撞上真值的概率就越高。只要数据足够多,估计值几乎肯定能无限接近真实参数。

四、均方误差

设 θ ^ = θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta} = \hat{\theta}(X_1, X_2, \cdots, X_n) θ^=θ^(X1,X2,⋯,Xn) 是总体参数 θ \theta θ 的一个估计量,则 θ ^ \hat{\theta} θ^ 的均方误差

MSE ⁡ ( θ ^ ) = E ( θ \^ − θ ) 2 = D ( θ ^ ) + E ( θ \^ ) − θ 2 \begin{align} \operatorname{MSE}(\hat{\theta}) &= E\left(\\hat{\\theta} - \\theta)\^2\\right \\ &= D(\hat{\theta}) + \leftE(\\hat{\\theta}) - \\theta\\right^2 \end{align} MSE(θ^)=E(θ\^−θ)2=D(θ^)+E(θ\^)−θ2

若 MSE ⁡ ( θ 1 ^ ) ≤ MSE ⁡ ( θ 2 ^ ) \operatorname{MSE}(\hat{\theta_1}) \le \operatorname{MSE}(\hat{\theta_2}) MSE(θ1^)≤MSE(θ2^),对一切 θ ∈ Θ \theta \in \Theta θ∈Θ都成立,且至少存在一个 θ ∈ Θ \theta \in \Theta θ∈Θ使得不等号成立,则称 θ ^ 1 \hat \theta_1 θ^1在均方误差准则下优于 θ ^ 2 \hat \theta_2 θ^2。

在实际应用中均方误差准则要优于其他准则

  • 在大样本下,极大似然估计的渐近分布为正态分布,而正态分布的"中心"恰好对应最小化平方损失。这使得MSE自然而然地成为大样本理论中的核心标准。
  • 机器学习中,当你的目标变量服从正态分布时,最小化MSE等同于极大似然估计,是有理论最优保证的。
    对均方误差的推导过程如下

E ( θ \^ − θ ) 2 = E ( ( θ \^ − E ( θ \^ ) ) + ( E ( θ \^ ) − θ ) ) 2 = E ( θ \^ − E ( θ \^ ) ) 2 + 2 ( θ \^ − E ( θ \^ ) ) ( E ( θ \^ ) − θ ) + ( E ( θ \^ ) − θ ) 2 = E ( θ \^ − E ( θ \^ ) ) 2 + 2 E ( θ \^ − E ( θ \^ ) ) ( E ( θ \^ ) − θ ) + E ( E ( θ \^ ) − θ ) 2 = D ( θ ^ ) + 2 ( E ( θ ^ ) − θ ) E θ \^ − E ( θ \^ ) + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + 2 ( E ( θ ^ ) − θ ) ( E ( θ ^ ) − E ( θ ^ ) ) + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + 0 + ( E ( θ ^ ) − θ ) 2 = D ( θ ^ ) + E ( θ \^ ) − θ 2 \begin{align} E\left(\\hat{\\theta} - \\theta)\^2\\right &= E\left\\left((\\hat{\\theta} - E(\\hat{\\theta})) + (E(\\hat{\\theta}) - \\theta)\\right)\^2\\right \\ &= E\left(\\hat{\\theta} - E(\\hat{\\theta}))\^2 + 2(\\hat{\\theta} - E(\\hat{\\theta}))(E(\\hat{\\theta}) - \\theta) + (E(\\hat{\\theta}) - \\theta)\^2\\right \\ &= E\left(\\hat{\\theta} - E(\\hat{\\theta}))\^2\\right + 2E\left(\\hat{\\theta} - E(\\hat{\\theta}))(E(\\hat{\\theta}) - \\theta)\\right + E\left(E(\\hat{\\theta}) - \\theta)\^2\\right \\ &= D(\hat{\theta}) + 2(E(\hat{\theta}) - \theta)E\left\\hat{\\theta} - E(\\hat{\\theta})\\right + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + 2(E(\hat{\theta}) - \theta)(E(\hat{\theta}) - E(\hat{\theta})) + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + 0 + (E(\hat{\theta}) - \theta)^2 \\ &= D(\hat{\theta}) + \leftE(\\hat{\\theta}) - \\theta\\right^2 \end{align} E(θ\^−θ)2=E((θ\^−E(θ\^))+(E(θ\^)−θ))2=E(θ\^−E(θ\^))2+2(θ\^−E(θ\^))(E(θ\^)−θ)+(E(θ\^)−θ)2=E(θ\^−E(θ\^))2+2E(θ\^−E(θ\^))(E(θ\^)−θ)+E(E(θ\^)−θ)2=D(θ^)+2(E(θ^)−θ)Eθ\^−E(θ\^)+(E(θ^)−θ)2=D(θ^)+2(E(θ^)−θ)(E(θ^)−E(θ^))+(E(θ^)−θ)2=D(θ^)+0+(E(θ^)−θ)2=D(θ^)+E(θ\^)−θ2

  • 注意, θ \theta θ是一个常数

均方误差的性质

  • 若 θ ^ \hat{\theta} θ^ 是 θ \theta θ 的无偏估计量 ,即 E ( θ ^ ) = θ E(\hat{\theta}) = \theta E(θ^)=θ,则

MSE ⁡ ( θ ^ ) = D ( θ ^ ) \operatorname{MSE}(\hat{\theta}) = D(\hat{\theta}) MSE(θ^)=D(θ^)

此时,最小化 MSE 等价于最小化方差,这也正是"有效性"比较的基础。

  • 当样本量 n → ∞ n \to \infty n→∞ 时,
    lim ⁡ n → ∞ MSE ⁡ ( θ ^ n ) = 0 \lim_{n \to \infty} \operatorname{MSE}(\hat{\theta}_n) = 0 n→∞limMSE(θ^n)=0
    则称 θ ^ n \hat{\theta}_n θ^n 为均方相合估计量

由分解公式可知,均方相合等价于同时满足:

  • lim ⁡ n → ∞ Var ⁡ ( θ ^ n ) = 0 \lim_{n \to \infty} \operatorname{Var}(\hat{\theta}_n) = 0 limn→∞Var(θ^n)=0(方差趋于 0);
  • lim ⁡ n → ∞ E ( θ ^ n ) = θ \lim_{n \to \infty} E(\hat{\theta}_n) = \theta limn→∞E(θ^n)=θ(偏差趋于 0,即渐进无偏)。

均方相合是比普通相合(依概率收敛)更强的收敛形式。

相关推荐
心运软件1 小时前
基于机器学习的智能邮件分类系统:从数据采集到模型部署全流程实战
人工智能·python·算法·随机森林·机器学习·分类·scikit-learn
苏灿烤鱼1 小时前
GitHub Trending 榜首|GitHub #1 拆解|为什么「持久工作台」比临时沙箱更值得关注?(08.06)技术拆解
人工智能·typescript·agent
武子康1 小时前
MCP 无状态核心之后:身份、任务、幂等与审计状态到底放在哪里
人工智能
gqk011 小时前
WINDOWS下搭建深度学习推理+训练环境
人工智能
D2aZXN3FhrDa7e2121 小时前
中小企业对比美诚等获客系统,依据自动分级与销售人力节省需求
大数据·人工智能·佛山美诚科技有限公司
七牛开发者1 小时前
“打透” Harness:用 GitHub Copilot 跑通从原型、规划到实现与评审的 AI Coding 工作流
人工智能·github·copilot
神奇霸王龙1 小时前
Agent 5 场景屠夫:跨厂商基座横评
人工智能·windows·ai·dubbo·agent·ai编程·阿里
用户7562101332531 小时前
00. pixelle-video + comfyUI 生成视频
人工智能
SelectDB技术团队1 小时前
Apache Doris 4.1:面向 AI & Search 的统一数据底座怎么选?向量检索 + 全文搜索 + 100MB JSON 完整能力拆解
人工智能·json·apache doris