Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 37 | 矩母函数

目录

    • 前言
    • [1. 引言](#1. 引言)
    • [2. 定义矩](#2. 定义矩)
    • [3. 定义矩生成函数](#3. 定义矩生成函数)
    • [4. MGF 与 n 阶矩的关系定理](#4. MGF 与 n 阶矩的关系定理)
    • [5. 示例:泊松分布](#5. 示例:泊松分布)
    • [6. 示例:正态分布](#6. 示例:正态分布)
    • [7. 示例:指数分布](#7. 示例:指数分布)
    • [8. 结语](#8. 结语)
    • 结语
    • 参考

前言

学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第三十七讲:矩母函数,记录下个人学习笔记,和大家一起分享交流😄

videohttps://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V

1. 引言

今天我将为大家介绍概率论中一个非常精彩的概念 --- 矩生成函数,简而言之,矩生成函数是一个强大的工具,它能通过简洁的公式帮助我们计算各类矩 --- 无论是期望、方差这类基础指标,还是偏度、峰度等更高阶特征。这个函数在证明概率论与统计学核心定理时也起着关键作用,比如中心极限定理的论证就离不开它。

2. 定义矩

那么,矩到底是什么?在概率论中,概率分布的矩是指随机变量 X X X、 X 2 X^2 X2 或 X n X^n Xn 的期望值,因此实际上矩的个数是无限的,存在一阶矩、二阶矩、三阶矩、四阶矩,以此类推直至无穷,这些矩就是随机变量 n n n 次幂的期望值。

我们已经见过许多实例,证明这一点至关重要,均值就是一阶矩:

E ( X ) = μ \mathbb{E}(X) = \mu E(X)=μ

该分布的平均值即为一阶矩。

而分布的方差与二阶矩密切相关:

E ( X 2 ) − ( E ( X ) ) 2 = σ 2 \mathbb{E}(X^2) - \left( \mathbb{E}(X) \right)^2 = \sigma^2 E(X2)−(E(X))2=σ2

方差等于二阶矩减去一阶矩的平方。

这些概念至关重要,用于描述概率分布函数特征,因此,若已知我的分布是正态分布(或称高斯分布)随机变量 X X X ,那么该分布完全由一阶矩和二阶矩决定,因此,一阶矩和二阶矩共同决定了分布的均值和标准差。

但高阶矩实际上同样重要,许多分布需要更多矩才能唯一确定其形态,因此,三阶矩,即 X 3 X^3 X3 的期望值,被称为分布的偏度,如果某个分布呈现不对称形态,比如略微偏向一侧,就会表现出一定的偏度,以泊松分布为例,该分布就具有非零偏度的特性。

若某分布存在较厚的尾部特征,就需要考察四阶矩,即 X 4 X^4 X4 的期望值,也就是峰度指标,可能存在某种分布形态:整体近似正态分布,但在尾部区域出现若干突起波动,则该分布会呈现特定的四阶矩或峰度特征。

这些矩是概率分布的唯一性标识,这很像泰勒级数展开中函数的导数,若想用泰勒级数逼近函数,只需收集该函数的所有 n n n 阶导数,即可为解析函数唯一地写出泰勒展开式。

概率分布也遵循相同的基本原理,通过这种无穷矩序列,可以唯一确定累积分布函数,有时还能确定概率密度函数,这就像是概率统计领域的泰勒级数,这是极其基础且极为实用的核心概念。

3. 定义矩生成函数

现在我们来定义矩生成函数,它能让我们高效地计算这些矩,矩生成函数将基于一个全新的变量来定义,通常这些函数都是基于变量 X X X 来定义的,这里我们引入新变量,是因为要将概率空间转换到矩生成函数空间。

其定义如下,我将分别针对离散型随机变量 X X X 和连续型随机变量 X X X 进行说明。

对于离散型随机变量 X X X ,其定义为:

m ( t ) = ∑ x e t x P ( X = x ) m(t) = \sum_x e^{tx} P(X=x) m(t)=x∑etxP(X=x)

对 X X X 所有可能取值求和,即 e t x e^{tx} etx 乘以概率质量函数 P ( X = x ) P(X=x) P(X=x) 的总和,此定义适用于离散型随机变量 X X X ,这正是它的定义方式,稍后我会解释这样定义的原因及其具体应用。

对于连续型随机变量 X X X ,例如正态分布、指数分布或 Gamma 分布,其定义为:

m ( t ) = ∫ − ∞ ∞ e t x f ( x ) d x m(t) = \int_{-\infty}^{\infty} e^{tx}f(x)dx m(t)=∫−∞∞etxf(x)dx

对所有可能的 X X X 值进行积分,其中 f ( x ) f(x) f(x) 是概率密度函数。首先,学过微积分、控制理论或动态系统的同学会立刻认出,这正是概率密度函数的拉普拉斯变换,这个用于近似计算各阶矩的实用函数,竟然恰好是概率密度函数的拉普拉斯变换,实在令人惊叹。

其实仔细想来,这或许并不意外,拉普拉斯正是现代概率论与统计学的奠基人之一,事实上,贝叶斯统计学也源自他的思想,虽然贝叶斯早几年提出了这一理论,但拉普拉斯不仅独立发现了它,更将其发展到了全新高度,因此这门学科理应被称为贝叶斯·拉普拉斯统计学。

因此,我们现代关于测量误差、概率与统计的理论体系及思维方式,很大程度上都应归功于拉普拉斯的奠基性贡献,由此可见,拉普拉斯当时必然是从概率论与微分方程这两个维度同步推进变换理论的研究。

若以放射性衰变这类随机过程为例,我们就能发现其中蕴含着极为深刻的关联性,这里存在一个微分方程,对应的概率密度函数也存在,对两者进行拉普拉斯变换后,其数学意义便会显现,由此可见,其中蕴含着诸多深刻的内在联系。

不过从宏观来看,矩生成函数本身是可计算的工具,作为概率密度函数的拉普拉斯变换,矩生成函数具有极其实用的特性:它能便捷地推导出随机变量 X X X 的各阶矩,包括高阶矩。

接下来我们来具体说明其推导过程,这个定理我将在下期课程中予以证明,现在先陈述其内容。

4. MGF 与 n 阶矩的关系定理

根据定理,矩生成函数在零处的 n n n 阶导数值等于随机变量 X X X 的 n n n 阶矩,即:

m ( n ) ( 0 ) = E ( X n ) m^{(n)}(0) = \mathbb{E}(X^n) m(n)(0)=E(Xn)

这一特性具有极高的实用价值。若取该函数的一阶导数并在零点求值,所得即为期望值,也就是均值。若取该函数的二阶导数并在零点求值,所得即为 X 2 X^2 X2 的期望值,三阶导数在零点处的取值与偏度相关,四阶导数则与峰度相关。

因此,所有矩量均可通过该矩生成函数便捷地推导得出,这极其有用,因为通常计算这些矩量相当困难,而有了这个函数,计算过程就会变得简单许多。

同样地,这一特性将实现唯一性表征:矩生成函数 m ( t ) m(t) m(t) 唯一决定累积概率分布,具体而言,是指随机变量 X X X 小于等于某个特定值 x x x 的概率,这一点我们稍后会详细探讨。请注意,我此次所指并非概率密度函数(PDF),这里指的是累积分布函数(CDF)。

我之所以经常讨论累积分布函数而非概率密度函数,自有其缘由,稍后我会解释。简言之,矩生成函数唯一确定了概率分布的特性,它在计算矩量时极为实用,这些矩量如同概率分布的指纹,或者说,构成了分布的泰勒级数近似,这些矩量唯一地决定了概率分布的特性。

OK,下面我通过几个具体实例来说明,正态分布的情况该怎么处理,指数函数该怎么处理,下节课我将证明这个定理:所有矩都可以从该矩生成函数中推导出来。

矩能唯一确定概率分布,并且可以通过一种神奇的矩生成函数来提取,这种函数恰好是概率密度函数的拉普拉斯变换,这确实是非常深刻且强大的工具。

我们来看几个具体例子,接下来我将以泊松分布、正态分布和指数分布为例进行说明。

5. 示例:泊松分布

OK,我们先从泊松分布开始举例。

假设随机变量 X X X 服从参数为 λ \lambda λ 的泊松分布,当然,这意味着它的概率密度函数会是:

λ k e − λ k ! \frac{\lambda^k e^{-\lambda}}{k!} k!λke−λ

这正是泊松分布的概率密度函数。

因此,矩生成函数可表示为:

m ( t ) = ∑ k e t k λ k e − λ k ! m(t) = \sum_k e^{tk}\frac{\lambda^k e^{-\lambda}}{k!} m(t)=k∑etkk!λke−λ

这就是我的矩生成函数 m ( t ) m(t) m(t) 。

关键就在于这个表达式本身,稍作推导就能得出简洁的表达式:

m ( t ) = ∑ k e t k λ k e − λ k ! = e − λ ∑ k ( e t λ ) k k ! = e − λ e λ e t = e λ ( e t − 1 ) \begin{align*} m(t) &= \sum_k e^{tk}\frac{\lambda^k e^{-\lambda}}{k!} \\ &= e^{-\lambda} \sum_k \frac{(e^t\lambda)^k}{k!} \\ &= e^{-\lambda}e^{\lambda e^t} \\ &= e^{\lambda(e^t-1)} \end{align*} m(t)=k∑etkk!λke−λ=e−λk∑k!(etλ)k=e−λeλet=eλ(et−1)

将 e − λ e^{-\lambda} e−λ 提出求和符号外,因为求和是针对 k k k 进行的,现在来看这个表达式:括号内内容的 k k k 次方除以 k ! k! k! 之和,这正是自然指数函数 e e e 的幂级数定义形式。

因此,这个表达式等于 e − λ e λ e t e^{-\lambda}e^{\lambda e^t} e−λeλet ,这个关于 k k k 的求和式,正是括号内 e t λ e^t\lambda etλ 这个表达式的指数函数定义形式,最终结果等于 e λ ( e t − 1 ) e^{\lambda(e^t-1)} eλ(et−1) ,这就是泊松分布的矩生成函数 m ( t ) m(t) m(t) 。

我可以通过求一阶导数并在零点取值来得到均值,通过求二阶导数并在零点计算,可以得到与方差相关的量,依此类推。这个函数用起来很方便,这就是计算泊松这类离散随机变量矩生成函数的方法。

6. 示例:正态分布

OK,再来看另一个例子,我们以正态分布为例,假设随机变量 X X X 服从正态分布,为简化推导过程,设其均值为零,标准差为一,我们不妨从最简单的标准正态分布入手。

接下来我们展开推导,这个推导并不复杂,后续计算高阶矩时,这个方法能帮我们节省大量时间,这对中心极限定理也具有重要意义。

该概率密度函数的矩生成函数是:

m ( t ) = ∫ − ∞ ∞ e t x f ( x ) d x m(t) = \int_{-\infty}^{\infty} e^{tx} f(x)dx m(t)=∫−∞∞etxf(x)dx

e t x e^{tx} etx 与概率密度函数乘积在负无穷到正无穷区间的积分,接着将概率密度函数 f ( x ) f(x) f(x) 代入有:

m ( t ) = ∫ − ∞ ∞ e t x f ( x ) d x = 1 2 π ∫ − ∞ ∞ e t x e − x 2 2 d x = 1 2 π ∫ − ∞ ∞ e − 1 2 ( x − t ) 2 + 1 2 t 2 d x = e 1 2 t 2 1 2 π ∫ − ∞ ∞ e − 1 2 ( x − t ) 2 d x = e 1 2 t 2 \begin{align*} m(t) &= \int_{-\infty}^{\infty} e^{tx} f(x)dx \\ &= \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{\infty} e^{tx} e^{-\frac{x^2}{2}} dx \\ &= \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{\infty} e^{-\frac{1}{2}(x-t)^2+\frac{1}{2}t^2} dx \\ &= e^{\frac{1}{2}t^2} \boxed{\frac{1}{\sqrt{2\pi}} \int_{-\infty}^{\infty} e^{-\frac{1}{2}(x-t)^2} dx} \\ &= e^{\frac{1}{2}t^2} \end{align*} m(t)=∫−∞∞etxf(x)dx=2π 1∫−∞∞etxe−2x2dx=2π 1∫−∞∞e−21(x−t)2+21t2dx=e21t22π 1∫−∞∞e−21(x−t)2dx=e21t2

这里我将高斯正态分布的归一化因子单独提出,而当前进行的是拉普拉斯变换的积分运算,这就是我需要计算的表达式。

操作非常简单,我需要合并这些指数项,进行基础代数运算后直接积分即可,这里有个关键技巧:

x 2 2 − t x = 1 2 ( x 2 − 2 t x ) = 1 2 ( x − t ) 2 − 1 2 t 2 \frac{x^2}{2} - tx = \frac{1}{2}(x^2- 2tx)=\frac{1}{2}(x-t)^2 - \frac{1}{2}t^2 2x2−tx=21(x2−2tx)=21(x−t)2−21t2

这个推导非常简单,只需要展开多项式运算即可,这其实是一个恒等变换,将指数项展开后,通过配方法重组为平方形式,这样处理起来会更简便。

现在进行积分运算,现在我可以将这些积分拆分开来,将与 x x x 无关的常数项 e 1 2 t 2 e^{\frac{1}{2}t^2} e21t2 提到积分外,注意,此时如果我们仔细观察,会发现方框内的这个表达式恰好表示的是均值为 t t t 、方差为 1 的正态分布概率密度函数。

因此该表达式的积分概率等于 1,根据全概率定律,该函数在负无穷到正无穷的积分等于 1,因此我们的矩生成函数就是 e 1 2 t 2 e^{\frac{1}{2}t^2} e21t2 外侧这个表达式,对于正态分布而言,这就是我的矩生成函数,很简单,对吧?

中间虽然涉及了些复杂的数学推导,但我想你应该能跟上思路,这是微积分的内容,很简单,我们都知道怎么做。现在我们得到了一个非常简洁的矩生成函数表达式,某种程度上,这个函数比概率密度函数更简洁实用,两者密切相关,但这个函数不需要进行归一化处理。

7. 示例:指数分布

OK,在结束前我们再来看一个例子,最后一个例子我们来看指数分布。

指数分布随机变量与放射性衰减等现象密切相关,若想深入研究这个问题,就需要用到常微分方程和拉普拉斯变换的知识。此时矩生成函数同样表示为积分形式:

m ( t ) = ∫ 0 ∞ e s t λ e − λ t d t m(t) = \int_0^{\infty} e^{st} \lambda e^{-\lambda t} dt m(t)=∫0∞estλe−λtdt

由于指数分布仅定义在正实数域,因此积分区间为 0 到无穷大,这里我将引入输出变量 s s s 来表示拉普拉斯变换,由于指数分布已使用变量 t t t ,继续使用会造成混淆。

现在对这个表达式进行关于 t t t 的积分运算,现在我的矩生成函数实际上是以辅助变量 s s s 表示的,这实际上更接近于拉普拉斯变换的形式,由于指数函数中我们已经使用了变量 t t t ,现在对 d t dt dt 进行积分运算,将 s s s 作为拉普拉斯变量,最终得到以 s s s 表示的矩生成函数。

这个计算过程非常简单:

m ( t ) = ∫ 0 ∞ e s t λ e − λ t d t = λ ∫ 0 ∞ e ( s − λ ) t d t = λ s − λ e ( s − λ ) t 0 ∞ = λ λ − s \begin{align*} m(t) &= \int_0^{\infty} e^{st} \lambda e^{-\lambda t} dt \\ &= \lambda \int_0^{\infty} e^{(s-\lambda)t}dt \\ &= \left \\frac{\\lambda}{s-\\lambda} e\^{(s-\\lambda)t} \\right_{0}^{\infty} \\ &= \frac{\lambda}{\lambda-s} \end{align*} m(t)=∫0∞estλe−λtdt=λ∫0∞e(s−λ)tdt=s−λλe(s−λ)t0∞=λ−sλ

那么我可以把 λ \lambda λ 提出来,得到关于指数函数 e e e 的积分表达式,这个积分其实很容易计算,这就是拉普拉斯变换的通用计算方法。

因此,仅当 s < λ s < \lambda s<λ 时该积分表达式才有定义,若 s > λ s > \lambda s>λ ,该式将发散至无穷大,目前我们假设 s s s 为实数值,因此必须满足 s < λ s < \lambda s<λ 该式才成立。

当 s < λ s < \lambda s<λ 时,无穷大边界项趋近于零,而零边界项趋近于 -1,因此最终结果为 λ λ − s \frac{\lambda}{\lambda-s} λ−sλ ,这就是指数分布的矩生成函数,其定义域取决于参数 λ \lambda λ 的取值。

以上是计算矩生成函数的三个不同示例,对于离散型变量,计算过程相当简单,而对于连续型变量,所涉及的函数也并不复杂,借助这些工具,你可以计算各类概率分布的矩、期望、方差、偏度、峰度等特征量,从而全面把握分布的核心特性。

8. 结语

最后要强调的是,当我们开始证明中心极限定理时,矩生成函数将发挥重要作用:若将 n n n 个独立同分布的随机变量相加,这些同分布随机变量的总和将逐渐收敛于正态分布。

我们将借助矩生成函数来完成这一定理的证明,我们将证明:随着随机变量数量增加,其和的矩生成函数会逐渐收敛至正态分布的矩生成函数,我们将运用这一结论来证明中心极限定理。

结语

矩母函数(MGF)是概率论工具链中最优雅的 "元工具"---它不直接回答概率问题,而是让你能够 批量生成 回答概率问题所需的所有矩。其定义 m ( t ) = E ( e t X ) m(t) = \mathbb{E}(e^{tX}) m(t)=E(etX) 直接将概率世界与拉普拉斯变换的微积分世界桥接在一起:离散侧是 ∑ e t x P ( x ) \sum e^{tx}P(x) ∑etxP(x) ,连续侧是 ∫ e t x f ( x ) d x \int e^{tx}f(x)dx ∫etxf(x)dx 。正如 Brunton 所言,拉普拉斯既是现代概率论的奠基人也是拉普拉斯变换的命名者---MGF 恰好坐落在他的两条学术长河的交汇处,这种历史与数学的双重对称性令人着迷。

核心定理 m ( n ) ( 0 ) = E ( X n ) m^{(n)}(0) = \mathbb{E}(X^n) m(n)(0)=E(Xn) 揭示了 MGF 的设计智慧: e t X e^{tX} etX 在 t = 0 t=0 t=0 处的泰勒展开 1 + t X + t 2 2 ! X 2 + ⋯ 1 + tX + \frac{t^2}{2!}X^2 + \cdots 1+tX+2!t2X2+⋯ ,求期望后即 1 + t E ( X ) + t 2 2 ! E ( X 2 ) + ⋯ 1 + t\mathbb{E}(X) + \frac{t^2}{2!}\mathbb{E}(X^2) + \cdots 1+tE(X)+2!t2E(X2)+⋯---n n n 阶导在零点的取值恰好剔除了所有低阶和高阶项,仅保留第 n n n 阶矩 。这一定理将繁琐的逐项积分/求和求矩转化为对 MGF 求导再代入 t = 0 t=0 t=0 的机械操作,极大降低了高阶矩的计算门槛。

三个经典分布的 MGF 推导展示了不同技巧的运用:泊松分布利用 ∑ ( e t λ ) k k ! = e e t λ \sum \frac{(e^t\lambda)^k}{k!} = e^{e^t\lambda} ∑k!(etλ)k=eetλ 将求和吸收进指数函数;标准正态分布通过配方法 x 2 / 2 − t x = ( x − t ) 2 / 2 − t 2 / 2 x^2/2 - tx = (x-t)^2/2 - t^2/2 x2/2−tx=(x−t)2/2−t2/2 将积分转化为平移后正态密度的全概率积分(=1),留下干净的 e t 2 / 2 e^{t^2/2} et2/2 ;指数分布则是最基础的拉普拉斯积分 ∫ 0 ∞ e ( s − λ ) t d t \int_0^\infty e^{(s-\lambda)t}dt ∫0∞e(s−λ)tdt 。这三种模式------级数求和吸收、配方平移归一化、基础拉普拉斯积分---覆盖了大多数常见分布 MGF 的求解策略。

MGF 的终极使命是 中心极限定理的证明 :对于独立同分布随机变量的标准化和,其 MGF 为各独立 MGF 的乘积 ∏ m ( t / n σ ) \prod m(t/\sqrt{n}\sigma) ∏m(t/n σ) ,当 n → ∞ n\to\infty n→∞ 时该乘积收敛于 e t 2 / 2 e^{t^2/2} et2/2---标准正态的 MGF。MGF 的逐点收敛等价于分布收敛,CLT 由此得证。这一证明策略将在后续课程中完整展开,本讲为该证明做好了全部工具准备 🤗。

参考

相关推荐
爱听歌的周童鞋14 天前
Steve Brunton | Probability Bootcamp | 笔记 | 第一部分:概率导论 | Lecture 8 | 条件概率
statistics·steve brunton·probability·conditionalprob
爱听歌的周童鞋14 天前
Steve Brunton | Probability Bootcamp | 笔记 | 第一部分:概率导论 | Lecture 7 | 二项分布与多项分布
statistics·multinomial·steve brunton·probability·binomial
xcLeigh6 个月前
Python入门:Python3 statistics模块全面学习教程
开发语言·python·学习·模块·python3·statistics
头发没了还会再长8 个月前
Basic statistics - 12. One-way ANOVA Basics
统计学·statistics
头发没了还会再长8 个月前
Basic statistics - 10. The unpaired t-test | Independent samples t-test
统计学·statistics
头发没了还会再长8 个月前
Basic statistics -11. The paired t-test | explained with a sample example
统计学·statistics
头发没了还会再长8 个月前
Basic statistics - 07. The degrees of freedom - explained with a simple example
统计学·statistics
头发没了还会再长8 个月前
Basic statistics - 05. Confidence intervals
statistics
头发没了还会再长8 个月前
Basic statistics - 02. The Normal distribution
统计学·statistics