15-参数的点估计方法[矩估计,极大似然估计]

参数的点估计方法

一、点估计问题

问题描述 设总体 X X X 的分布函数 F ( x ; θ ) F(x; \theta) F(x;θ) 的形式为已知, θ \theta θ 是待估参数。 X 1 , X 2 , ⋯   , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是 X X X 的一个样本, x 1 , x 2 , ⋯   , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 是相应的一个样本值。点估计问题就是要构造一个适当的统计量 θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn),用它的观测值 θ ^ ( x 1 , x 2 , ⋯   , x n ) \hat{\theta}(x_1, x_2, \cdots, x_n) θ^(x1,x2,⋯,xn) 作为未知参数 θ \theta θ 的近似值。我们称 θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 为 θ \theta θ 的估计量 ,称 θ ^ ( x 1 , x 2 , ⋯   , x n ) \hat{\theta}(x_1, x_2, \cdots, x_n) θ^(x1,x2,⋯,xn) 为 θ \theta θ 的估计值 。在不致混淆的情况下统称估计量和估计值为估计 ,并都简记为 θ ^ \hat{\theta} θ^。由于估计量是样本的函数,因此对于不同的样本值, θ \theta θ 的估计值一般是不相同的。

  • θ \theta θ是总体 X X X的未知参数向量

  • 点估计问题的简要描述如下

    设总体 X X X的分布函数形式已知,但其一个或多个参数未知(分布已知而参数未知)。把借助总体 X X X的一个样本来估计总体未知参数的值的问题称为参数的点估计问题

点估计问题的估计方法

  1. 矩估计法
  2. 极大似然估计法
1.1 矩估计法

矩估计法先将总体矩(即所考虑随机变量幂次的期望值)表示为待求参数 θ \theta θ的函数,然后再建立样本矩与总体矩的方程,从而估计参数 θ = θ ^ \theta = \hat{\theta} θ=θ^。

设 X X X 为连续型随机变量,其概率密度为 f ( x ; θ 1 , θ 2 , ⋯   , θ k ) f(x; \theta_1, \theta_2, \cdots, \theta_k) f(x;θ1,θ2,⋯,θk),或 X X X 为离散型随机变量,其分布律为 P ( X = x ) = p ( x ; θ 1 , θ 2 , ⋯   , θ k ) P(X = x) = p(x; \theta_1, \theta_2, \cdots, \theta_k) P(X=x)=p(x;θ1,θ2,⋯,θk),其中 θ 1 , θ 2 , ⋯   , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk 为待估参数, X 1 , X 2 , ⋯   , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是来自 X X X 的样本。假设总体 X X X 的前 k k k 阶矩

μ l = E ( X l ) = ∫ − ∞ ∞ x l f ( x ; θ 1 , θ 2 , ⋯   , θ k )   d x ( X 连续型 ) \mu_l = E(X^l) = \int_{-\infty}^{\infty} x^l f(x; \theta_1, \theta_2, \cdots, \theta_k) \, dx \quad (X \text{ 连续型}) μl=E(Xl)=∫−∞∞xlf(x;θ1,θ2,⋯,θk)dx(X 连续型)

μ l = E ( X l ) = ∑ x ∈ R X x l p ( x ; θ 1 , θ 2 , ⋯   , θ k ) ( X 离散型 ) l = 1 , 2 , ⋯   , k \begin{align} \mu_l = E(X^l) = \sum_{x \in R_X} x^l p(x; \theta_1, \theta_2, \cdots, \theta_k) \quad &(X \text{ 离散型}) \\ &l = 1,2,\cdots,k \end{align} μl=E(Xl)=x∈RX∑xlp(x;θ1,θ2,⋯,θk)(X 离散型)l=1,2,⋯,k

一般来说,它们是 θ 1 , θ 2 , ⋯   , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk 的函数。基于样本矩

A l = 1 n ∑ i = 1 n X i l A_l = \frac{1}{n} \sum_{i=1}^n X_i^l Al=n1i=1∑nXil

依概率收敛于相应的总体矩 μ l \mu_l μl( l = 1 , 2 , ⋯   , k l = 1, 2, \cdots, k l=1,2,⋯,k),样本矩的连续函数依概率收敛于相应的总体矩的连续函数,我们就用样本矩作为相应的总体矩的估计量,而以样本矩的连续函数作为相应的总体矩的连续函数的估计量。这种估计方法称为矩估计法。

矩估计法的具体做法如下:

{ μ 1 = μ 1 ( θ 1 , θ 2 , ⋯   , θ k ) , μ 2 = μ 2 ( θ 1 , θ 2 , ⋯   , θ k ) , ⋮ μ k = μ k ( θ 1 , θ 2 , ⋯   , θ k ) . \begin{cases} \mu_1 = \mu_1(\theta_1, \theta_2, \cdots, \theta_k), \\ \mu_2 = \mu_2(\theta_1, \theta_2, \cdots, \theta_k), \\ \vdots \\ \mu_k = \mu_k(\theta_1, \theta_2, \cdots, \theta_k). \end{cases} ⎩ ⎨ ⎧μ1=μ1(θ1,θ2,⋯,θk),μ2=μ2(θ1,θ2,⋯,θk),⋮μk=μk(θ1,θ2,⋯,θk).

这是一个包含 k k k 个未知参数 θ 1 , θ 2 , ⋯   , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk 的联立方程组。一般来说,可以从中解出 θ 1 , θ 2 , ⋯   , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk,得到

{ θ 1 = θ 1 ( μ 1 , μ 2 , ⋯   , μ k ) , θ 2 = θ 2 ( μ 1 , μ 2 , ⋯   , μ k ) , ⋮ θ k = θ k ( μ 1 , μ 2 , ⋯   , μ k ) . \begin{cases} \theta_1 = \theta_1(\mu_1, \mu_2, \cdots, \mu_k), \\ \theta_2 = \theta_2(\mu_1, \mu_2, \cdots, \mu_k), \\ \vdots \\ \theta_k = \theta_k(\mu_1, \mu_2, \cdots, \mu_k). \end{cases} ⎩ ⎨ ⎧θ1=θ1(μ1,μ2,⋯,μk),θ2=θ2(μ1,μ2,⋯,μk),⋮θk=θk(μ1,μ2,⋯,μk).

以 A i A_i Ai 分别代替上式中的 μ i \mu_i μi, i = 1 , 2 , ⋯   , k i = 1, 2, \cdots, k i=1,2,⋯,k,就以

θ ^ i = θ i ( A 1 , A 2 , ⋯   , A k ) , i = 1 , 2 , ⋯   , k \hat{\theta}_i = \theta_i(A_1, A_2, \cdots, A_k), \quad i = 1, 2, \cdots, k θ^i=θi(A1,A2,⋯,Ak),i=1,2,⋯,k

分别作为 θ i \theta_i θi, i = 1 , 2 , ⋯   , k i = 1, 2, \cdots, k i=1,2,⋯,k 的估计量,这种估计量称为矩估计量 。矩估计量的观察值称为矩估计值

1.2 极大似然估计法

在学习极大似然估计之前,先来看一个例子

引例 罐子里有黑白 ( B & W ) (B\&W) (B&W)两种小球,两种小球的数量的比例未知。现在,我们进行一次有放回抽样: { B , W , B , B , B } \{B,W,B,B,B\} {B,W,B,B,B}。试问,如何估计抽到黑球的概率p为?

根据题设,我们可以令

X = { 1 , Black 0 , White X = \begin{cases} 1 &, \text{Black} \\ 0 &, \text{White} \end{cases} X={10,Black,White

显然 X ∼ B ( 1 , p ) X \sim B(1,p) X∼B(1,p),记事件 A A A为{一次抽样中,出现4黑1白的抽样结果},于是

P { A } = p 4 ⋅ ( 1 − p ) P\{A\} = p^4\cdot(1-p) P{A}=p4⋅(1−p)

这个时候,我告诉你,黑白两球的比例是这两个值 { 1 5 , 4 5 } \{\frac{1}{5}, \frac{4}{5} \} {51,54}之中的一个。于是,你分别代入发现,如果 p = 1 4 p=\frac{1}{4} p=41,那么事件 A A A发生的概率为 1 625 ≈ 1 % \frac{1}{625} ≈ 1\% 6251≈1%,而 p = 4 5 p = \frac{4}{5} p=54时, P { A } ≈ 8 % P\{A\} ≈ 8\% P{A}≈8%.

显然,参数 p p p更应该取 4 5 \frac{4}{5} 54 ,因为这样才能事件 A A A更有可能发生(让这次抽样的结果更具说服力)。同时,事件 A A A发生的概率本身就是一个关于参数 p p p的一元函数,若对其求导,不难发现,在 0 , 1 0,1 0,1上其存在唯一极大值 M a x { p } = 4 5 Max\{p\} = \frac{4}{5} Max{p}=54。基于这种思想,我们就引入了极大似然估计法

极大似然估计法(Maximum Likelihood Estimation,MLE)是利用观测样本构造待求参数 θ \theta θ的似然函数,并选择使似然函数取得最大值的参数作为总体参数的估计值。

设 X 1 , X 2 , ⋯   , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是来自 X X X 的样本, x 1 , x 2 , ⋯   , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 是相应于样本 X 1 , X 2 , ⋯   , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 的一个样本值,又设总体的分布已知,而参数 θ \theta θ未知,于是我们可以其概率取值的形式:

P ( X = x ) = { p ( x ; θ ) , X为离散型 f ( x ; θ ) d x , X为连续型 P(X = x) = \begin{cases} p(x;\theta) \quad ,\text{X为离散型} \\ f(x;\theta)dx \quad ,\text{X为连续型} \end{cases} P(X=x)={p(x;θ),X为离散型f(x;θ)dx,X为连续型

p ( x ; θ ) p(x;\theta) p(x;θ)(或 f ( x ; θ ) f(x;\theta) f(x;θ))是已知形式而参数未知的X的 PMF(PDF)

比如,已知总体 X X X服从参数为 θ \theta θ的均匀分布,则

f ( x ; θ ) = { 1 1 − θ , θ ≤ x ≤ 1 0 , 其他 f(x;\theta) = \begin{cases} \frac{1}{1 - \theta} \quad, \theta \le x \le 1 \\ \\ 0 \quad , 其他 \end{cases} f(x;θ)=⎩ ⎨ ⎧1−θ1,θ≤x≤10,其他

接着,我们定义样本 ​ X 1 , X 2 , ⋯   , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 取到观测值 ​ x 1 , x 2 , ⋯   , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 的概率,亦即事件 ​ { X 1 = x 1 , X 2 = x 2 , ⋯   , X n = x n } \{X_1 = x_1, X_2 = x_2, \cdots, X_n = x_n\} {X1=x1,X2=x2,⋯,Xn=xn} 发生的概率为

L ( θ ) = L ( x 1 , x 2 , ⋯   , x n ; θ ) = { ∏ i = 1 n p ( x i ; θ ) , X为离散型 ∏ i = 1 n f ( x i ; θ ) , X为连续型 L(\theta) = L(x_1, x_2, \cdots, x_n; \theta) = \begin{cases} \displaystyle \prod_{i=1}^n p(x_i;\theta) &\quad, \text{X为离散型} \\ \\ \displaystyle \prod_{i=1}^n f(x_i;\theta) &\quad, \text{X为连续型} \end{cases} L(θ)=L(x1,x2,⋯,xn;θ)=⎩ ⎨ ⎧i=1∏np(xi;θ)i=1∏nf(xi;θ),X为离散型,X为连续型

这一概率随 θ \theta θ 的取值而变化,它是 θ \theta θ 的函数, L ( θ ) L(\theta) L(θ) 称为样本的似然函数 (注意,这里 x 1 , x 2 , ⋯   , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 是已知的样本值,它们都是常数)。

由费希尔(R. A. Fisher)引进的最大似然估计法,就是固定样本观察值 x 1 , x 2 , ⋯   , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn,在 θ \theta θ 取值的可能范围 Θ \Theta Θ 内挑选使似然函数 L ( x 1 , x 2 , ⋯   , x n ; θ ) L(x_1, x_2, \cdots, x_n; \theta) L(x1,x2,⋯,xn;θ) 达到最大的参数值 θ ^ \hat{\theta} θ^,作为参数 θ \theta θ 的估计值,即取 θ ^ \hat{\theta} θ^ 使

L ( x 1 , x 2 , ⋯   , x n ; θ ^ ) = max ⁡ θ ∈ Θ L ( x 1 , x 2 , ⋯   , x n ; θ ) . L(x_1, x_2, \cdots, x_n; \hat{\theta}) = \max_{\theta \in \Theta} L(x_1, x_2, \cdots, x_n; \theta). L(x1,x2,⋯,xn;θ^)=θ∈ΘmaxL(x1,x2,⋯,xn;θ).

这样得到的 θ ^ \hat{\theta} θ^ 与样本值 x 1 , x 2 , ⋯   , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 有关,常记为 θ ^ ( x 1 , x 2 , ⋯   , x n ) \hat{\theta}(x_1, x_2, \cdots, x_n) θ^(x1,x2,⋯,xn),称为参数 θ \theta θ 的最大似然估计值 ,而相应的统计量 θ ^ ( X 1 , X 2 , ⋯   , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 称为参数 θ \theta θ 的最大似然估计量{某些情况下,我们可能不需要事先进行抽样而是先建立一个关于随机变量 X i X_i Xi的似然函数 L ( X i ; θ ) L(X_i;\theta) L(Xi;θ)}

在很多情形下, p ( x ; θ ) p(x; \theta) p(x;θ) 和 f ( x ; θ ) f(x; \theta) f(x;θ) 关于 θ \theta θ 可微,这时 θ ^ \hat{\theta} θ^ 常可从方程

d d θ L ( θ ) = 0 \frac{d}{d\theta} L(\theta) = 0 dθdL(θ)=0

解得。又因 L ( θ ) L(\theta) L(θ) 与 ln ⁡ L ( θ ) \ln L(\theta) lnL(θ) 在同一 θ \theta θ 处取到极值,因此 θ \theta θ 的最大似然估计 θ ^ \hat{\theta} θ^ 也可以从方程

d d θ ln ⁡ L ( θ ) = 0 \frac{d}{d\theta} \ln L(\theta) = 0 dθdlnL(θ)=0

求得,而从后一方程求解往往比较方便。上式被称为对数似然方程

相关推荐
RFID固定资产管理系统1 小时前
适配媒体行业的固定资产管理软件有哪些功能与核心优势
大数据·人工智能·python·媒体
575771 小时前
GEO效果监测实战:用第三方工具交叉验证AI提及率
人工智能·chatgpt
AndrewHZ1 小时前
【LLM技术全景】阶段总结:技术原理篇核心知识回顾
人工智能·深度学习·算法·语言模型·大模型·llm·芯片开发
古一木2 小时前
opencv 形态学操作
人工智能·opencv·计算机视觉
KK不Battle2 小时前
AI 配图缺的不是模型,是工程:开源 skill social-illustrator 上手教程
人工智能
2601_963749102 小时前
越华环保集团污水监测云边协同架构:数字化污水治理Modbus-MQTT链路实现方案
人工智能·架构
u0103055272 小时前
Java实用类应用精讲
人工智能·1024程序员节
城事漫游Molly2 小时前
用AI评估文献可靠性——相关性、可靠性、时效性三维框架
人工智能·ai for science·文献综述·文献阅读·科研方法·博士生必读·文献评估
聚铭网络2 小时前
狂飙的AI,失控的安全……
人工智能·安全