从统计决策到贝叶斯估计
统计决策问题的基本要素(统计决策引入风险)
在统计决策理论中,统计决策问题(Statistical decision problem)通常包含三个基本要素:
-
样本空间(Sample space)与样本分布族(Family of distributions)
- 样本所有可能的取值构成样本空间 X\mathscr{X}X。
- 样本X=(X1,X2,⋯ ,Xn)⊤∈X\boldsymbol X = \left(X_1, X_2, \cdots, X_n\right)^{\top} \in \mathscr{X}X=(X1,X2,⋯,Xn)⊤∈X的联合分布属于一族分布{Fθ(x):x∈X,θ∈Θ}\{F_\theta\left(\boldsymbol x\right) : \boldsymbol x \in \mathscr{X}, \theta \in \varTheta\}{Fθ(x):x∈X,θ∈Θ},其中θ\thetaθ是未知参数,Θ\varThetaΘ为参数空间。
-
决策空间(Decision space)A\mathscr{A}A:全体决策aaa组成的集合。
-
损失函数L(θ,a)L\left(\theta, a\right)L(θ,a):当真实参数为θ\thetaθ,而做出决策aaa时,所付出的代价。定义在Θ×A\varTheta \times \mathscr{A}Θ×A上的二元非负函数
L(θ,a)⩾0,∀θ∈Θ, a∈A L\left(\theta, a\right) \geqslant 0, \quad \forall \theta \in \varTheta, \, a \in \mathscr{A} L(θ,a)⩾0,∀θ∈Θ,a∈A
类比L(y,f(x))⩾0L\left(y, f\left(\boldsymbol x\right)\right) \geqslant 0L(y,f(x))⩾0
决策函数
给定统计决策问题的三个基本要素:样本空间X\mathscr{X}X及样本分布族{Fθ(x):θ∈Θ}\{F_\theta\left(\boldsymbol x\right): \theta \in \varTheta\}{Fθ(x):θ∈Θ},决策空间A\mathscr{A}A及损失函数L(θ,a)L\left(\theta, a\right)L(θ,a)。
统计决策是在某种准则下寻找一个函数fff,对每一个样本观测值x=(x1,x2,⋯ ,xn)⊤∈X\boldsymbol x = \left(x_1, x_2, \cdots, x_n\right)^{\top} \in \mathscr{X}x=(x1,x2,⋯,xn)⊤∈X,确定一个决策a∈Aa \in \mathscr{A}a∈A。称这个函数为统计决策函数 ,简称决策函数 (Decision function)或判决规则(Decision rule)。决策函数是从样本空间X\mathscr{X}X到决策空间A\mathscr{A}A的映射f:X→Af: \mathscr{X} \to \mathscr{A}f:X→A,将样本x\boldsymbol xx映射到决策a=f(x)a = f\left(\boldsymbol x\right)a=f(x)。对于样本X=(X1,X2,⋯ ,Xn)⊤\boldsymbol X = \left(X_1, X_2, \cdots, X_n\right)^{\top}X=(X1,X2,⋯,Xn)⊤,决策函数f(X)=f(X1,X2,⋯ ,Xn)f\left(\boldsymbol X\right) = f\left(X_1, X_2, \cdots, X_n\right)f(X)=f(X1,X2,⋯,Xn)是一个统计量,它是样本的函数。
决策函数f(x)f\left(x\right)f(x)是所给定的统计决策问题的一个解,决定如何根据观测数据做出最优决策。常见的统计决策准则有贝叶斯决策(最小化期望损失)、Neyman-Pearson(N-P)决策、最小最大决策、一致最优决策等。
风险函数
为了评价决策函数fff的性能,定义风险函数(Risk Function)。在损失函数L(θ,a)L\left(\theta, a\right)L(θ,a)的基础上,风险函数 R(θ,f)R\left(\theta, f\right)R(θ,f)定义为损失函数关于样本分布(似然函数)p(x∣θ)p\left(\boldsymbol x\mid \theta\right)p(x∣θ)的数学期望:
R(θ,f)=EX∣θL(θ,f(X))∣θ=∫XL(θ,f(x))p(x∣θ) dx R\left(\theta, f\right) = {E}{\boldsymbol X\mid \theta}L\\left(\\theta, f\\left(\\boldsymbol X\\right)\\right) \\mid \\theta = \int{\mathscr{X}} L\left(\theta, f\left(\boldsymbol x\right)\right) p\left(\boldsymbol x\mid \theta\right)\,{\rm d} \boldsymbol x R(θ,f)=EX∣θL(θ,f(X))∣θ=∫XL(θ,f(x))p(x∣θ)dx
R(θ,f)R\left(\theta, f\right)R(θ,f)是θ\thetaθ的函数,表示在真实参数固定为参数θ\thetaθ的前提下,使用决策函数fff所产生的期望损失(平均损失)。
贝叶斯风险(贝叶斯引入先验)
不同于经典统计推断中仅依赖数据,在贝叶斯推断中,参数θ\thetaθ被视为随机变量,服从先验分布π(θ)\pi\left(\theta\right)π(θ),贝叶斯推断使用先验信息 + 数据做出最优决策。
贝叶斯风险(Bayes Risk) Rπ(f)R_\pi\left(f\right)Rπ(f)是风险函数R(θ,f)R\left(\theta, f\right)R(θ,f)关于先验分布π(θ)\pi\left(\theta\right)π(θ)的期望:
Rπ(f)=Eθ∼πR(θ,f)=∫ΘR(θ,f)π(θ) dθ R_\pi\left(f\right) = {E}{\theta\sim\pi}R\\left(\\theta, f\\right) = \int{\varTheta} R\left(\theta, f\right) \pi\left(\theta\right)\,{\rm d}\theta Rπ(f)=Eθ∼πR(θ,f)=∫ΘR(θ,f)π(θ)dθ
或者直接写为
Rπ(f)=EL(θ,f(X)) R_\pi\left(f\right) = {E}L\\left(\\theta, f\\left(\\boldsymbol X\\right)\\right) Rπ(f)=EL(θ,f(X))
其中期望是关于联合分布π(θ)p(x∣θ)\pi\left(\theta\right) p\left(\boldsymbol x\mid \theta\right)π(θ)p(x∣θ)的。
贝叶斯风险Rπ(f)R_\pi\left(f\right)Rπ(f)是在所有可能的θ\thetaθ上,决策函数fff带来的平均损失。
后验期望损失
将风险函数R(θ,f)R\left(\theta, f\right)R(θ,f)的定义代入式(3),并利用联合概率密度p(x,θ)=p(x∣θ)π(θ)=h(θ∣x)m(x)p\left(\boldsymbol {x}, \theta\right) = p\left(\boldsymbol {x}\mid \theta\right)\pi\left(\theta\right) = h\left(\theta\mid \boldsymbol {x}\right)m\left(\boldsymbol {x}\right)p(x,θ)=p(x∣θ)π(θ)=h(θ∣x)m(x)(其中m(x)m\left(\boldsymbol {x}\right)m(x)是样本的边缘分布),通过交换积分顺序,贝叶斯风险可以重写为:
Rπ(f)=∫X∫ΘL(θ,f(x))h(θ∣x)dθm(x)dx R_\pi\left(f\right) = \int_{\mathscr{X}} \left \\int_{\\varTheta} L\\left(\\theta, f\\left(\\boldsymbol {x}\\right)\\right) h\\left(\\theta\\mid \\boldsymbol {x}\\right) {\\rm d}\\theta \\right m\left(\boldsymbol {x}\right) {\rm d}\boldsymbol {x} Rπ(f)=∫X∫ΘL(θ,f(x))h(θ∣x)dθm(x)dx
方括号内的部分称为后验期望损失(Posterior Expected Loss) ,记为R(a∣x)R\left(a \mid \boldsymbol x\right)R(a∣x),定义为
R(a∣x)=Eθ∣X∼hL(θ,a)∣X=x=∫ΘL(θ,a)h(θ∣x) dθ R\left(a \mid \boldsymbol x\right) ={\operatorname {E}}{{\theta \mid \boldsymbol X}\sim h}L\\left(\\theta, a\\right) \\mid \\boldsymbol X = \\boldsymbol x= \int{\varTheta} L\left(\theta, a\right) h\left(\theta \mid \boldsymbol x\right)\,{\rm d}\theta R(a∣x)=Eθ∣X∼hL(θ,a)∣X=x=∫ΘL(θ,a)h(θ∣x)dθ
其中期望是关于后验分布h(θ∣x)h\left(\theta\mid \boldsymbol {x}\right)h(θ∣x)的。后验期望损失R(a∣x)R\left(a \mid \boldsymbol x\right)R(a∣x)是损失函数关于后验分布的期望。是由后验分布计算出的期望损失,它表示在观测到样本x\boldsymbol xx的条件下,采取决策aaa所带来的平均损失,也称为后验风险("后验风险"一词更侧重于从决策规则的角度来描述这一期望损失)。
贝叶斯估计(贝叶斯决策函数)
使得贝叶斯风险达到最小的决策函数,是贝叶斯最优解 。最优的决策函数称为贝叶斯决策函数 或贝叶斯决策规则,也称为贝叶斯估计(Bayes estimator)。
根据上述推导,由于边缘分布m(x)m\left(x\right)m(x)非负且与决策函数fff无关,使贝叶斯风险最小化,等价于对每一个可能的样本观测值x\boldsymbol xx,都最小化其后验期望损失R(a∣x)R\left(a \mid \boldsymbol x\right)R(a∣x)。
给定观测值x\boldsymbol xx,根据后验分布h(θ∣x)h\left(\theta\mid \boldsymbol x\right)h(θ∣x)计算每个可能决策aaa的后验期望损失,寻找使后验期望损失最小化的决策aaa。最优决策f∗(x)f^*\left(x\right)f∗(x)可表示为
f∗(x)=argmina∈AR(a∣x) f^*\left(\boldsymbol {x}\right) = \arg\min_{a \in \mathscr{A}} R\left(a \mid \boldsymbol x\right) f∗(x)=arga∈AminR(a∣x)
常用损失函数下的贝叶斯参数估计
根据上述贝叶斯决策函数的定义,选择不同的损失函数L(θ,a)L\left(\theta, a\right)L(θ,a)会产生不同的最优决策fB(x)f_B\left(x\right)fB(x)。在不同的损失函数L(θ,a)L\left(\theta, a\right)L(θ,a)下寻找aaa 使后验期望损失最小化。
(1) 平方误差损失(Squared Error Loss)
L(θ,a)=(θ−a)2 L\left(\theta, a\right) = \left(\theta - a\right)^2 L(θ,a)=(θ−a)2
平方误差损失是最常用的损失函数,随误差平方增长,对较大误差的惩罚也较大。
最小化后验期望损失:
R(a∣x)=E(θ−a)2∣x=Eθ2∣x−2aEθ∣x+a2 R\left(a\mid \boldsymbol {x}\right) = {\operatorname {E}}\\left(\\theta - a\\right)\^2 \\mid \\boldsymbol {x} = {\operatorname {E}}\\theta\^2 \\mid \\boldsymbol {x} - 2a{\operatorname {E}}\\theta \\mid \\boldsymbol {x} + a^2 R(a∣x)=E(θ−a)2∣x=Eθ2∣x−2aEθ∣x+a2
上式是aaa 的二次凸函数。一阶最优性条件给出:
∂R∂a=−2Eθ∣x+2a=0 \frac{\partial R}{\partial a} = -2{\operatorname {E}}\\theta \\mid \\boldsymbol {x} + 2a = 0 ∂a∂R=−2Eθ∣x+2a=0
解得:
a∗=Eθ∣x a^* = {\operatorname {E}}\\theta \\mid \\boldsymbol {x} a∗=Eθ∣x
另一种推导
最小化后验期望损失:
R(a∣x)=∫Θ(θ−a)2h(θ∣x)dθ R\left(a\mid \boldsymbol {x}\right) = \int_{\varTheta} \left(\theta - a\right)^2 h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta R(a∣x)=∫Θ(θ−a)2h(θ∣x)dθ
对aaa求导并令其等于 0:
∂R(a∣x)∂a=∫Θ2(θ−a)(−1)h(θ∣x)dθ=−2∫Θθh(θ∣x)dθ−a∫Θh(θ∣x)dθ=0 \frac{\partial R\left(a\mid \boldsymbol {x}\right)}{\partial a} = \int_{\varTheta} 2\left(\theta - a\right)\left(-1\right) h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta = -2 \left \\int_{\\varTheta} \\theta h\\left(\\theta\\mid \\boldsymbol {x}\\right) {\\rm d}\\theta - a \\int_{\\varTheta} h\\left(\\theta\\mid \\boldsymbol {x}\\right) {\\rm d}\\theta \\right = 0 ∂a∂R(a∣x)=∫Θ2(θ−a)(−1)h(θ∣x)dθ=−2∫Θθh(θ∣x)dθ−a∫Θh(θ∣x)dθ=0
由于后验分布是概率密度,满足∫Θh(θ∣x)dθ=1\int_{\varTheta} h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta = 1∫Θh(θ∣x)dθ=1,因此:
a∗=∫Θθh(θ∣x)dθ=Eθ∣x a^* = \int_{\varTheta} \theta h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta = \operatorname {E}\\theta\\mid \\boldsymbol {x} a∗=∫Θθh(θ∣x)dθ=Eθ∣x
二阶导数∂2R∂a2=2>0\frac{\partial^2 R}{\partial a^2} = 2 > 0∂a2∂2R=2>0,证明该点为极小值。
在平方误差损失下,贝叶斯决策函数是后验分布的均值(后验均值 (posterior mean)),即 fB(x)=Eθ∣xf_B\left(\boldsymbol {x}\right) = \operatorname {E}\\theta\\mid \\boldsymbol {x}fB(x)=Eθ∣x。
在平方损失下最小后验期望损失等于后验方差。
当取估计值a=E(θ∣x)a = \operatorname {E}\left(\theta \mid \boldsymbol{x}\right)a=E(θ∣x)时:
minaE(θ−a)2∣x=E(θ−E(θ∣x))2∣x=Var(θ∣x) \min_a \operatorname {E}\\left(\\theta - a\\right)\^2 \\mid \\boldsymbol{x} = \operatorname {E}\\left(\\theta - \\operatorname {E}\\left(\\theta \\mid \\boldsymbol{x}\\right)\\right)\^2 \\mid \\boldsymbol{x} = \text{Var}\left(\theta \mid \boldsymbol{x}\right) aminE(θ−a)2∣x=E(θ−E(θ∣x))2∣x=Var(θ∣x)
对于任意估计值aaa,后验期望损失恒等于:
E(θ−a)2∣x=Var(θ∣x)⏟方差+a−E(θ∣x)2⏟偏差平方 \operatorname {E}\\left(\\theta - a\\right)\^2 \\mid \\boldsymbol{x} = \underbrace{\text{Var}\left(\theta \mid \boldsymbol{x}\right)}{\text{方差}} + \underbrace{a - \\operatorname {E}\\left(\\theta \\mid \\boldsymbol{x}\\right)^2}{\text{偏差平方}} E(θ−a)2∣x=方差 Var(θ∣x)+偏差平方 a−E(θ∣x)2
- 左边:采取任意aaa时的平均损失
- 右边第一项:后验方差(数据本身的不确定性)
- 右边第二项:估计偏离最优值的程度
使平方损失期望风险最小的点估计,正好是后验分布的均值(数学期望),而这个最小平均损失恰好是后验方差。
(2) 绝对误差损失(Absolute Error Loss)
L(θ,a)=∣θ−a∣ L\left(\theta, a\right) = | \theta - a| L(θ,a)=∣θ−a∣
绝对值损失对偏差的惩罚是线性增长的,相比平方损失,它对大误差的惩罚较小,因此对异常值不很敏感。
最小化后验期望损失:
R(a∣x)=E∣θ−a∣∣x=∫Θ∣θ−a∣h(θ∣x)dθ R\left(a \mid \boldsymbol {x}\right) = {\operatorname {E}}\|\\theta - a\|\\mid \\boldsymbol {x} = \int_{\varTheta} | \theta - a| h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta R(a∣x)=E∣θ−a∣∣x=∫Θ∣θ−a∣h(θ∣x)dθ
将积分在aaa 处拆分:
R=∫−∞a(a−θ)h(θ∣x)dθ+∫a+∞(θ−a)h(θ∣x)dθ R = \int_{-\infty}^{a} \left(a - \theta\right) h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta + \int_{a}^{+\infty} \left(\theta - a\right) h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta R=∫−∞a(a−θ)h(θ∣x)dθ+∫a+∞(θ−a)h(θ∣x)dθ
利用莱布尼茨积分法则对aaa求导:
∂R(a∣x)∂a=∫−∞ah(θ∣x)dθ−∫a+∞h(θ∣x)dθ=F(a)−(1−F(a))=2F(a)−1 \frac{\partial R\left(a\mid \boldsymbol {x}\right)}{\partial a} = \int_{-\infty}^{a} h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta - \int_{a}^{+\infty} h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta = F\left(a\right) - \left(1 - F\left(a\right)\right) = 2F\left(a\right) - 1 ∂a∂R(a∣x)=∫−∞ah(θ∣x)dθ−∫a+∞h(θ∣x)dθ=F(a)−(1−F(a))=2F(a)−1
其中F(a)F\left(a\right)F(a) 是后验分布的累积分布函数。令导数为零:
2F(a)−1=0⟹F(a)=12 2F\left(a\right) - 1 = 0 \quad \Longrightarrow \quad F\left(a\right) = \frac{1}{2} 2F(a)−1=0⟹F(a)=21
因此,a∗a^*a∗ 是后验分布的中位数(使后验分布两侧概率相等的点),即满足P(θ⩽a∗∣x)⩾1/2P\left(\theta \leqslant a^* \mid \boldsymbol {x}\right) \geqslant 1/2P(θ⩽a∗∣x)⩾1/2 且P(θ≥a∗∣x)⩾1/2P\left(\theta \ge a^* \mid \boldsymbol {x}\right) \geqslant 1/2P(θ≥a∗∣x)⩾1/2 的点。
在绝对误差损失下,贝叶斯决策函数是后验分布的中位数(后验中位数 (posterior median)),即 fB(x)=Median(θ∣x)f_B\left(\boldsymbol {x}\right) = \text{Median}\left(\theta\mid \boldsymbol {x}\right)fB(x)=Median(θ∣x)。
(3) 0-1 损失(0-1 Loss)
离散参数情形:
L(θ,a)={0,θ=a1,θ≠a L\left(\theta, a\right) = \begin{cases} 0, & \theta = a \\ 1, & \theta \neq a \end{cases} L(θ,a)={0,1,θ=aθ=a
此损失函数常用于分类或假设检验等离散决策问题,它不关心误差的大小,只关心判断是否正确。正确估计无损失,错误估计有损失。
R(a∣x)=E1θ≠a∣x=P(θ≠a∣x)=1−P(θ=a∣x) R\left(a \mid \boldsymbol {x}\right) = {\operatorname {E}}\\mathbf{1}_{\\theta \\neq a} \\mid \\boldsymbol {x} = P\left(\theta \neq a \mid \boldsymbol {x}\right) = 1 - P\left(\theta = a \mid \boldsymbol {x}\right) R(a∣x)=E1θ=a∣x=P(θ=a∣x)=1−P(θ=a∣x)
最小化R(a∣x)R\left(a \mid \boldsymbol {x}\right)R(a∣x) 等价于最大化P(θ=a∣x)P\left(\theta = a \mid \boldsymbol {x}\right)P(θ=a∣x),因此:
a∗=argmaxθ∈Θh(θ∣x) a^* = \arg\max_{\theta \in \varTheta} h\left(\theta \mid \boldsymbol {x}\right) a∗=argθ∈Θmaxh(θ∣x)
即在离散参数空间中,最优决策是选取后验概率最大的点,即后验众数。
连续参数情形:
在连续参数空间中,任意单点的后验概率均为零,因此上述定义失效。此时考虑0-1损失的推广形式------ϵ\epsilonϵ-邻域损失 (当ϵ→0+\epsilon \to 0^+ϵ→0+时的极限情况):
Lϵ(θ,a)={0,∣θ−a∣⩽ϵ1,∣θ−a∣>ϵ L_\epsilon\left(\theta, a\right) = \begin{cases} 0, & |\theta - a| \leqslant \epsilon \\ 1, & |\theta - a| > \epsilon \end{cases} Lϵ(θ,a)={0,1,∣θ−a∣⩽ϵ∣θ−a∣>ϵ
其对应的后验期望损失为:
Rϵ(a∣x)=P(∣θ−a∣>ϵ∣x)=∫∣θ−a∣>ϵ1⋅h(θ∣x)dθ=1−∫a−ϵa+ϵh(θ∣x)dθ R_\epsilon\left(a \mid \boldsymbol {x}\right) = P\left(|\theta - a| > \epsilon \mid \boldsymbol {x}\right) = \int_{| \theta - a| > \epsilon} 1 \cdot h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta = 1 - \int_{a-\epsilon}^{a+\epsilon} h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta Rϵ(a∣x)=P(∣θ−a∣>ϵ∣x)=∫∣θ−a∣>ϵ1⋅h(θ∣x)dθ=1−∫a−ϵa+ϵh(θ∣x)dθ
最小化该损失等价于最大化后验分布落在区间a−ϵ,a+ϵa-\\epsilon, a+\\epsilona−ϵ,a+ϵ 内的概率∫a−ϵa+ϵh(θ∣x)dθ\int_{a-\epsilon}^{a+\epsilon} h\left(\theta\mid \boldsymbol {x}\right) {\rm d}\theta∫a−ϵa+ϵh(θ∣x)dθ。当ϵ→0+\epsilon \to 0^+ϵ→0+ 时,该区间不断收缩到点aaa 附近,最优决策趋近于使后验密度函数h(θ∣x)h\left(\theta\mid \boldsymbol {x}\right)h(θ∣x)取最大值(峰值)的点------即后验众数(假设后验分布为单峰分布)。
0-1损失(或其极限形式)下,贝叶斯决策函数是后验分布的众数,即 fB(x)=argmaxθ∈Θh(θ∣x)f_B\left(\boldsymbol {x}\right) = \arg \max\limits_{\theta\in \varTheta} h\left(\theta\mid \boldsymbol {x}\right)fB(x)=argθ∈Θmaxh(θ∣x) ,即最大后验估计(Maximum A Posteriori, MAP)。
在参数空间内部,当先验分布为均匀分布(常数)(均匀先验)时,MAP退化成经典统计学中的极大似然估计 (MLE) 。
| 损失函数 | 数学形式 | 贝叶斯估计量 | 后验分布特征量 |
|---|---|---|---|
| 平方损失 | (θ−a)2\left(\theta - a\right)^2(θ−a)2 | Eθ∣x{\operatorname {E}}\\theta \\mid \\boldsymbol {x}Eθ∣x | 后验均值 |
| 绝对值损失 | ∣θ−a∣\vert \theta - a \vert∣θ−a∣ | 满足F(a)=1/2F\left(a\right)=1/2F(a)=1/2 的点 | 后验中位数 |
| 0-1损失 | 1θ≠a\mathbf{1}{\theta \neq a}1θ=a(离散)或limϵ→01∣θ−a∣>ϵ\lim{\epsilon \to 0} \mathbf{1}_{\vert\theta-a\vert>\epsilon}limϵ→01∣θ−a∣>ϵ(连续) | argmaxθh(θ∣x)\arg\max_{\theta} h\left(\theta \mid \boldsymbol {x}\right)argmaxθh(θ∣x) | 后验众数(MAP) |