参数的点估计方法
一、点估计问题
问题描述 设总体 X X X 的分布函数 F ( x ; θ ) F(x; \theta) F(x;θ) 的形式为已知, θ \theta θ 是待估参数。 X 1 , X 2 , ⋯ , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是 X X X 的一个样本, x 1 , x 2 , ⋯ , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 是相应的一个样本值。点估计问题就是要构造一个适当的统计量 θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn),用它的观测值 θ ^ ( x 1 , x 2 , ⋯ , x n ) \hat{\theta}(x_1, x_2, \cdots, x_n) θ^(x1,x2,⋯,xn) 作为未知参数 θ \theta θ 的近似值。我们称 θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 为 θ \theta θ 的估计量 ,称 θ ^ ( x 1 , x 2 , ⋯ , x n ) \hat{\theta}(x_1, x_2, \cdots, x_n) θ^(x1,x2,⋯,xn) 为 θ \theta θ 的估计值 。在不致混淆的情况下统称估计量和估计值为估计 ,并都简记为 θ ^ \hat{\theta} θ^。由于估计量是样本的函数,因此对于不同的样本值, θ \theta θ 的估计值一般是不相同的。
θ \theta θ是总体 X X X的未知参数向量
点估计问题的简要描述如下
设总体 X X X的分布函数形式已知,但其一个或多个参数未知(分布已知而参数未知)。把借助总体 X X X的一个样本来估计总体未知参数的值的问题称为参数的点估计问题
点估计问题的估计方法
1.1 矩估计法
矩估计法先将总体矩(即所考虑随机变量幂次的期望值)表示为待求参数 θ \theta θ的函数,然后再建立样本矩与总体矩的方程,从而估计参数 θ = θ ^ \theta = \hat{\theta} θ=θ^。
设 X X X 为连续型随机变量,其概率密度为 f ( x ; θ 1 , θ 2 , ⋯ , θ k ) f(x; \theta_1, \theta_2, \cdots, \theta_k) f(x;θ1,θ2,⋯,θk),或 X X X 为离散型随机变量,其分布律为 P ( X = x ) = p ( x ; θ 1 , θ 2 , ⋯ , θ k ) P(X = x) = p(x; \theta_1, \theta_2, \cdots, \theta_k) P(X=x)=p(x;θ1,θ2,⋯,θk),其中 θ 1 , θ 2 , ⋯ , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk 为待估参数, X 1 , X 2 , ⋯ , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是来自 X X X 的样本。假设总体 X X X 的前 k k k 阶矩
μ l = E ( X l ) = ∫ − ∞ ∞ x l f ( x ; θ 1 , θ 2 , ⋯ , θ k ) d x ( X 连续型 ) \mu_l = E(X^l) = \int_{-\infty}^{\infty} x^l f(x; \theta_1, \theta_2, \cdots, \theta_k) \, dx \quad (X \text{ 连续型}) μl=E(Xl)=∫−∞∞xlf(x;θ1,θ2,⋯,θk)dx(X 连续型)
或
μ l = E ( X l ) = ∑ x ∈ R X x l p ( x ; θ 1 , θ 2 , ⋯ , θ k ) ( X 离散型 ) l = 1 , 2 , ⋯ , k \begin{align} \mu_l = E(X^l) = \sum_{x \in R_X} x^l p(x; \theta_1, \theta_2, \cdots, \theta_k) \quad &(X \text{ 离散型}) \\ &l = 1,2,\cdots,k \end{align} μl=E(Xl)=x∈RX∑xlp(x;θ1,θ2,⋯,θk)(X 离散型)l=1,2,⋯,k
一般来说,它们是 θ 1 , θ 2 , ⋯ , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk 的函数。基于样本矩
A l = 1 n ∑ i = 1 n X i l A_l = \frac{1}{n} \sum_{i=1}^n X_i^l Al=n1i=1∑nXil
依概率收敛于相应的总体矩 μ l \mu_l μl( l = 1 , 2 , ⋯ , k l = 1, 2, \cdots, k l=1,2,⋯,k),样本矩的连续函数依概率收敛于相应的总体矩的连续函数,我们就用样本矩作为相应的总体矩的估计量,而以样本矩的连续函数作为相应的总体矩的连续函数的估计量。这种估计方法称为矩估计法。
矩估计法的具体做法如下:
{ μ 1 = μ 1 ( θ 1 , θ 2 , ⋯ , θ k ) , μ 2 = μ 2 ( θ 1 , θ 2 , ⋯ , θ k ) , ⋮ μ k = μ k ( θ 1 , θ 2 , ⋯ , θ k ) . \begin{cases} \mu_1 = \mu_1(\theta_1, \theta_2, \cdots, \theta_k), \\ \mu_2 = \mu_2(\theta_1, \theta_2, \cdots, \theta_k), \\ \vdots \\ \mu_k = \mu_k(\theta_1, \theta_2, \cdots, \theta_k). \end{cases} ⎩ ⎨ ⎧μ1=μ1(θ1,θ2,⋯,θk),μ2=μ2(θ1,θ2,⋯,θk),⋮μk=μk(θ1,θ2,⋯,θk).
这是一个包含 k k k 个未知参数 θ 1 , θ 2 , ⋯ , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk 的联立方程组。一般来说,可以从中解出 θ 1 , θ 2 , ⋯ , θ k \theta_1, \theta_2, \cdots, \theta_k θ1,θ2,⋯,θk,得到
{ θ 1 = θ 1 ( μ 1 , μ 2 , ⋯ , μ k ) , θ 2 = θ 2 ( μ 1 , μ 2 , ⋯ , μ k ) , ⋮ θ k = θ k ( μ 1 , μ 2 , ⋯ , μ k ) . \begin{cases} \theta_1 = \theta_1(\mu_1, \mu_2, \cdots, \mu_k), \\ \theta_2 = \theta_2(\mu_1, \mu_2, \cdots, \mu_k), \\ \vdots \\ \theta_k = \theta_k(\mu_1, \mu_2, \cdots, \mu_k). \end{cases} ⎩ ⎨ ⎧θ1=θ1(μ1,μ2,⋯,μk),θ2=θ2(μ1,μ2,⋯,μk),⋮θk=θk(μ1,μ2,⋯,μk).
以 A i A_i Ai 分别代替上式中的 μ i \mu_i μi, i = 1 , 2 , ⋯ , k i = 1, 2, \cdots, k i=1,2,⋯,k,就以
θ ^ i = θ i ( A 1 , A 2 , ⋯ , A k ) , i = 1 , 2 , ⋯ , k \hat{\theta}_i = \theta_i(A_1, A_2, \cdots, A_k), \quad i = 1, 2, \cdots, k θ^i=θi(A1,A2,⋯,Ak),i=1,2,⋯,k
分别作为 θ i \theta_i θi, i = 1 , 2 , ⋯ , k i = 1, 2, \cdots, k i=1,2,⋯,k 的估计量,这种估计量称为矩估计量 。矩估计量的观察值称为矩估计值。
1.2 极大似然估计法
在学习极大似然估计之前,先来看一个例子
引例 罐子里有黑白 ( B & W ) (B\&W) (B&W)两种小球,两种小球的数量的比例未知。现在,我们进行一次有放回抽样: { B , W , B , B , B } \{B,W,B,B,B\} {B,W,B,B,B}。试问,如何估计抽到黑球的概率p为?
根据题设,我们可以令
X = { 1 , Black 0 , White X = \begin{cases} 1 &, \text{Black} \\ 0 &, \text{White} \end{cases} X={10,Black,White
显然 X ∼ B ( 1 , p ) X \sim B(1,p) X∼B(1,p),记事件 A A A为{一次抽样中,出现4黑1白的抽样结果},于是
P { A } = p 4 ⋅ ( 1 − p ) P\{A\} = p^4\cdot(1-p) P{A}=p4⋅(1−p)
这个时候,我告诉你,黑白两球的比例是这两个值 { 1 5 , 4 5 } \{\frac{1}{5}, \frac{4}{5} \} {51,54}之中的一个。于是,你分别代入发现,如果 p = 1 4 p=\frac{1}{4} p=41,那么事件 A A A发生的概率为 1 625 ≈ 1 % \frac{1}{625} ≈ 1\% 6251≈1%,而 p = 4 5 p = \frac{4}{5} p=54时, P { A } ≈ 8 % P\{A\} ≈ 8\% P{A}≈8%.
显然,参数 p p p更应该取 4 5 \frac{4}{5} 54 ,因为这样才能事件 A A A更有可能发生(让这次抽样的结果更具说服力)。同时,事件 A A A发生的概率本身就是一个关于参数 p p p的一元函数,若对其求导,不难发现,在 0 , 1 0,1 0,1上其存在唯一极大值 M a x { p } = 4 5 Max\{p\} = \frac{4}{5} Max{p}=54。基于这种思想,我们就引入了极大似然估计法
极大似然估计法(Maximum Likelihood Estimation,MLE)是利用观测样本构造待求参数 θ \theta θ的似然函数,并选择使似然函数取得最大值的参数作为总体参数的估计值。
设 X 1 , X 2 , ⋯ , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 是来自 X X X 的样本, x 1 , x 2 , ⋯ , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 是相应于样本 X 1 , X 2 , ⋯ , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 的一个样本值,又设总体的分布已知,而参数 θ \theta θ未知,于是我们可以其概率取值的形式:
P ( X = x ) = { p ( x ; θ ) , X为离散型 f ( x ; θ ) d x , X为连续型 P(X = x) = \begin{cases} p(x;\theta) \quad ,\text{X为离散型} \\ f(x;\theta)dx \quad ,\text{X为连续型} \end{cases} P(X=x)={p(x;θ),X为离散型f(x;θ)dx,X为连续型
p ( x ; θ ) p(x;\theta) p(x;θ)(或 f ( x ; θ ) f(x;\theta) f(x;θ))是已知形式而参数未知的X的 PMF(PDF)
比如,已知总体 X X X服从参数为 θ \theta θ的均匀分布,则
f ( x ; θ ) = { 1 1 − θ , θ ≤ x ≤ 1 0 , 其他 f(x;\theta) = \begin{cases} \frac{1}{1 - \theta} \quad, \theta \le x \le 1 \\ \\ 0 \quad , 其他 \end{cases} f(x;θ)=⎩ ⎨ ⎧1−θ1,θ≤x≤10,其他
接着,我们定义样本 X 1 , X 2 , ⋯ , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 取到观测值 x 1 , x 2 , ⋯ , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 的概率,亦即事件 { X 1 = x 1 , X 2 = x 2 , ⋯ , X n = x n } \{X_1 = x_1, X_2 = x_2, \cdots, X_n = x_n\} {X1=x1,X2=x2,⋯,Xn=xn} 发生的概率为
L ( θ ) = L ( x 1 , x 2 , ⋯ , x n ; θ ) = { ∏ i = 1 n p ( x i ; θ ) , X为离散型 ∏ i = 1 n f ( x i ; θ ) , X为连续型 L(\theta) = L(x_1, x_2, \cdots, x_n; \theta) = \begin{cases} \displaystyle \prod_{i=1}^n p(x_i;\theta) &\quad, \text{X为离散型} \\ \\ \displaystyle \prod_{i=1}^n f(x_i;\theta) &\quad, \text{X为连续型} \end{cases} L(θ)=L(x1,x2,⋯,xn;θ)=⎩ ⎨ ⎧i=1∏np(xi;θ)i=1∏nf(xi;θ),X为离散型,X为连续型
这一概率随 θ \theta θ 的取值而变化,它是 θ \theta θ 的函数, L ( θ ) L(\theta) L(θ) 称为样本的似然函数 (注意,这里 x 1 , x 2 , ⋯ , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 是已知的样本值,它们都是常数)。
由费希尔(R. A. Fisher)引进的最大似然估计法,就是固定样本观察值 x 1 , x 2 , ⋯ , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn,在 θ \theta θ 取值的可能范围 Θ \Theta Θ 内挑选使似然函数 L ( x 1 , x 2 , ⋯ , x n ; θ ) L(x_1, x_2, \cdots, x_n; \theta) L(x1,x2,⋯,xn;θ) 达到最大的参数值 θ ^ \hat{\theta} θ^,作为参数 θ \theta θ 的估计值,即取 θ ^ \hat{\theta} θ^ 使
L ( x 1 , x 2 , ⋯ , x n ; θ ^ ) = max θ ∈ Θ L ( x 1 , x 2 , ⋯ , x n ; θ ) . L(x_1, x_2, \cdots, x_n; \hat{\theta}) = \max_{\theta \in \Theta} L(x_1, x_2, \cdots, x_n; \theta). L(x1,x2,⋯,xn;θ^)=θ∈ΘmaxL(x1,x2,⋯,xn;θ).
这样得到的 θ ^ \hat{\theta} θ^ 与样本值 x 1 , x 2 , ⋯ , x n x_1, x_2, \cdots, x_n x1,x2,⋯,xn 有关,常记为 θ ^ ( x 1 , x 2 , ⋯ , x n ) \hat{\theta}(x_1, x_2, \cdots, x_n) θ^(x1,x2,⋯,xn),称为参数 θ \theta θ 的最大似然估计值 ,而相应的统计量 θ ^ ( X 1 , X 2 , ⋯ , X n ) \hat{\theta}(X_1, X_2, \cdots, X_n) θ^(X1,X2,⋯,Xn) 称为参数 θ \theta θ 的最大似然估计量 。注{某些情况下,我们可能不需要事先进行抽样而是先建立一个关于随机变量 X i X_i Xi的似然函数 L ( X i ; θ ) L(X_i;\theta) L(Xi;θ)}
在很多情形下, p ( x ; θ ) p(x; \theta) p(x;θ) 和 f ( x ; θ ) f(x; \theta) f(x;θ) 关于 θ \theta θ 可微,这时 θ ^ \hat{\theta} θ^ 常可从方程
d d θ L ( θ ) = 0 \frac{d}{d\theta} L(\theta) = 0 dθdL(θ)=0
解得。又因 L ( θ ) L(\theta) L(θ) 与 ln L ( θ ) \ln L(\theta) lnL(θ) 在同一 θ \theta θ 处取到极值,因此 θ \theta θ 的最大似然估计 θ ^ \hat{\theta} θ^ 也可以从方程
d d θ ln L ( θ ) = 0 \frac{d}{d\theta} \ln L(\theta) = 0 dθdlnL(θ)=0
求得,而从后一方程求解往往比较方便。上式被称为对数似然方程。