目录
前言
学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第三十五讲:大数定律,记录下个人学习笔记,和大家一起分享交流😄
video :https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
1. 引言
现在我们进入了概率论短期课程中一个激动人心的阶段,能够对大量随机变量作出普适性结论了。这些定理被称为极限定理,第一个定理是大数定律,它非常直观,你们可能之前已经接触过,今天我们先阐述这个定理,之后会以此为基础,逐步引出更强大的中心极限定理。
这是关于随机变量序列在 n n n 极限(即随机变量数量趋于无穷)下的首个且最基础的极限表述。
那么我们现在开始讲解,在证明过程中,我们将借助马尔可夫不等式与切比雪夫不等式,我先陈述定理内容,随后会逐步解释其成立的原因。
假设存在一组相互独立的随机变量序列,这可以是 n n n 次独立的抛硬币实验,也就是 n n n 个伯努利随机变量,当然也可以是其他分布的 n n n 个随机变量。
假设这些随机变量都具有相同的均值 μ \mu μ 以及相同的标准差 σ \sigma σ(即方差为 σ 2 \sigma^2 σ2),那么,大数定律的内容可以表述如下:
2. 大数定律的陈述
基于这个随机变量序列,我们可以定义一个称为样本均值的统计量,样本均值,顾名思义就是所有样本观测值的算术平均值,假设我无法获知这个模型的概率密度分布,我无法确定它究竟是伯努利分布、二项分布还是泊松分布,虽然缺乏理论模型,但我采集了大量实际观测数据,样本均值定义为:
X ˉ = 1 n ∑ i = 1 n X i \bar{X} = \frac{1}{n} \sum_{i=1}^n X_i Xˉ=n1i=1∑nXi
其中 X i X_i Xi 表示第 i i i 次独立试验的观测值。
当样本容量 n → ∞ n \rightarrow \infty n→∞ 时,样本均值 X ˉ \bar{X} Xˉ 将收敛于总体分布的数学期望 μ \mu μ 。
这是一个相当直观的结论,这一点应该很容易理解,当一组随机变量具有相同的期望值 μ \mu μ 和相同方差时,随着数据量的持续增加,样本均值应当收敛于分布的真实均值,当 n → ∞ n \rightarrow \infty n→∞ 时,这个结论直观上应该成立。
我们现在可以严格证明其正确性,利用之前推导的切比雪夫不等式,接下来我将以严谨的数学表述方式来说明。
我将通过两种方法来证明这个结论,我先简要说明这个结论为何成立,随后会给出严谨的数学证明。
3. 大数定律收敛的形式化定义
因此严格来说,这意味着样本均值与真实均值之差的绝对值概率,当 n → ∞ n \rightarrow \infty n→∞ 时,该差值大于 ε \varepsilon ε 的概率趋近于零,即:
P ( ∣ X ˉ − μ ∣ > ε ) → n → ∞ 0 P\left( |\bar{X} - \mu| > \varepsilon \right) \xrightarrow{n\to\infty} 0 P(∣Xˉ−μ∣>ε)n→∞ 0
这就是样本均值收敛于 μ \mu μ 的含义:样本均值与 μ \mu μ 的偏差超过 ε \varepsilon ε 的概率趋近于零。严谨来说,我们可以这样表述:随着 n n n 趋近于无穷大,我的样本均值将无限逼近实际均值的任意 ε \varepsilon ε 邻域内。
OK,我们将在计算机上实际演示这一过程,接下来我们将很快从概率模块过渡到统计学模块,在统计学的短期课程中,我们将实际处理真实采集的数据,我们将在计算机上进行实验,我们将生成实验数据,我们将观测样本均值 X ˉ \bar{X} Xˉ 向总体均值 μ \mu μ 收敛的速度。
我们将进行这项实验,接下来我们将通过计算机使用真实数据进行演示,我们稍后会通过编程实现这个实验,不过目前仍处于概率理论的范畴。我们将证明这个结论的正确性,先帮助大家建立直观理解,之后会逐步展开更复杂的极限定理。
4. 大数定律的证明(非正式)
那么我们究竟该如何证明这个结论呢?下面开始证明。
既然这些 X X X 相互独立,我们对 X X X 的期望值就有很多可用信息,我们知道可以计算 X X X 的期望值,它应该等于这些期望值的总和,这非常有用。
由于这些 X X X 相互独立,因此样本均值 X ˉ \bar{X} Xˉ 的期望值等于各独立随机变量期望值的总和,即:
E ( X ˉ ) = 1 n ∑ i = 1 n E ( X i ) = 1 n ∑ i = 1 n μ = μ \mathbb{E}(\bar{X}) = \frac{1}{n} \sum_{i=1}^n \mathbb{E}(X_i) = \frac{1}{n} \sum_{i=1}^n \mu = \mu E(Xˉ)=n1i=1∑nE(Xi)=n1i=1∑nμ=μ
我们知道 X i X_i Xi 这些随机变量的期望值都等于 μ \mu μ ,对吧?因此样本均值的期望值等于 1 n \frac{1}{n} n1 乘以 n n n 个 μ \mu μ 的总和,等于 μ \mu μ 。
至少我们现在可以确定,样本均值的期望值等于总体均值 μ \mu μ ,当该定理的实际含义远不止样本均值期望等于 μ \mu μ 这么简单。
这表明随着样本量 n n n 的增大,样本均值 X ˉ \bar{X} Xˉ 围绕总体均值 μ \mu μ 的波动会不断减小,这听起来与切比雪夫不等式非常相似,稍后我们会用到这个不等式,不过现在我想换个角度来说明。
让我们直接计算这个统计量的方差,看看效果如何,那么样本均值 X ˉ \bar{X} Xˉ 的方差为:
V a r ( X ˉ ) = 1 n 2 ∑ i = 1 n V a r ( X i ) = 1 n 2 ∑ i = 1 n σ 2 = σ 2 n Var(\bar{X}) = \frac{1}{n^2} \sum_{i=1}^n Var(X_i) = \frac{1}{n^2} \sum_{i=1}^n \sigma^2 = \frac{\sigma^2}{n} Var(Xˉ)=n21i=1∑nVar(Xi)=n21i=1∑nσ2=nσ2
由于这些随机变量相互独立,我们可以直接对方差进行求和,由于每个随机变量方差都是 σ 2 \sigma^2 σ2 ,因此,最终结果等于 σ 2 n \frac{\sigma^2}{n} nσ2 。
我有 n n n 个方差为 σ 2 \sigma^2 σ2 的副本,但根据方差求和规则,前面会出现 1 n 2 \frac{1}{n^2} n21 的系数,如果你不记得这个结论,可以回顾下之前关于方差的讲座内容,你会想起:当我对 n n n 个方差为 σ 2 \sigma^2 σ2 的量求和时,总和的方差就是上面这个结果。
这样很好,因为表达式里出现了 1 n \frac{1}{n} n1 这个因子, σ 2 \sigma^2 σ2 是常数,而 1 n \frac{1}{n} n1 会随着 n n n 增大而趋近于零。由此可见,当 n → ∞ n \rightarrow \infty n→∞ 时,样本均值的方差显然会趋近于零。
这意味着我对 X ˉ \bar{X} Xˉ 的预期结果存在一个概率分布,随着 n n n 趋近于无穷大,样本均值 X ˉ \bar{X} Xˉ 的方差会不断缩小,最终收敛于期望值 μ \mu μ 。
这正是我们在前面所表达的观点,随着样本量的增加,样本均值会逐渐收敛于真实均值 μ \mu μ ,而样本均值的方差则会不断减小,这意味着随着数据量的积累,我们得到的结果会越来越接近真实的 μ \mu μ 值。
虽然这并非必然成立,但确实是个令人安心且实用的性质,样本均值具有向真实均值收敛的特性,且其方差会持续减小。
5. 大数定律的证明(正式)
若要严格证明这一论断 --- 虽然目前只是粗略的定性描述,我尚未给出精确的数学证明,若要进行严格证明,我会采用切比雪夫不等式。
因此,从形式上说,我们可以这样表述:
P ( ∣ X ˉ − μ ∣ ≥ ε ) ≤ V a r ( X ˉ ) ε 2 = σ 2 n ε 2 P\left( |\bar{X} - \mu| \ge \varepsilon \right) \le \frac{Var(\bar{X})}{\varepsilon^2} = \frac{\sigma^2}{n \varepsilon^2} P(∣Xˉ−μ∣≥ε)≤ε2Var(Xˉ)=nε2σ2
变量 X ˉ − μ \bar{X} - \mu Xˉ−μ 的绝对值大于等于 ε \varepsilon ε 的概率,应当小于等于样本均值的方差除以 ε 2 \varepsilon^2 ε2 的结果,这正是切比雪夫不等式,非常实用。
现在需要证明当 n → ∞ n \rightarrow \infty n→∞ 时,这个表达式会趋近于零,该表达式等于 σ 2 n ε 2 \frac{\sigma^2}{n \varepsilon^2} nε2σ2 ,显然当 n n n 趋近于无穷大时,该表达式趋近于零。
这样的表述更为严谨,我们实际上是在证明这样一个严谨定义:当样本容量 n n n 趋近于无穷大时,样本均值与真实均值 μ \mu μ 的偏差超过 ε \varepsilon ε 的概率,而切比雪夫不等式为这个结论提供了严格的理论支撑,这个概念非常实用。
或许我该用图示来说明:

这个原理同样极具实用性:假设真实均值为 μ \mu μ ,当我收集大量随机样本 X X X 时,这些样本并不需要服从高斯分布,无论是伯努利分布、泊松分布、指数分布还是 Gamma 分布,几乎所有分布类型都适用。
当我收集大量此类随机变量并计算其平均值时,样本均值的分布会逐渐在真实参数 μ \mu μ 附近形成峰值。当样本量较小时,分布会呈现较宽的峰值形态,样本均值会存在一定程度的方差,但随着样本量不断增加,分布曲线会变得越来越陡峭,越来越紧密地聚集在真实均值 μ \mu μ 周围。
6. 结语
这个结论具有非常重要的实用价值,而接下来的结论将证明中心极限定理 --- 这个概率论与统计学中最核心、最重要的定理之一。
该定理进一步指出:当我们持续收集随机变量并计算其平均值时,其均值都会逐渐趋近于正态分布,无论这些独立随机变量原本服从何种分布,它们的和都将逐渐收敛于一个具有特定均值与标准差的高斯分布(即正态分布)。
这个定理具有极其强大的普适性,这正是蒙特卡洛方法的理论基础:通过随机采样和统计调查采样,从小规模样本中推理大规模群体的特征。
概率论与统计学中最核心的概念当属大数定律,而作为其进阶形态的中心极限定理 --- 我们即将探讨的内容 --- 更堪称这一领域的擎天巨柱。
结语
大数定律(LLN)是 L33--L34 不等式链条的第一个冠冕时刻---经过马尔可夫→切比雪夫的两级铺垫,终于在本讲收获了概率论第一个普适性极限定理。定理陈述极其简洁: n n n 个独立同分布(i.i.d.)随机变量的样本均值 X ˉ n = 1 n ∑ X i \bar{X}_n = \frac{1}{n}\sum X_i Xˉn=n1∑Xi 依概率收敛于总体期望 μ \mu μ,即 P ( ∣ X ˉ n − μ ∣ > ε ) → n → ∞ 0 P(|\bar{X}_n - \mu| > \varepsilon) \xrightarrow{n\to\infty} 0 P(∣Xˉn−μ∣>ε)n→∞ 0。这一收敛的数学引擎正是上一讲的切比雪夫不等式: Var ( X ˉ n ) = σ 2 / n \text{Var}(\bar{X}_n) = \sigma^2/n Var(Xˉn)=σ2/n(独立性和方差求和规则的关键推论),代入切比雪夫立即得到 P ( ∣ X ˉ n − μ ∣ ≥ ε ) ≤ σ 2 n ε 2 → n → ∞ 0 P(|\bar{X}_n - \mu| \ge \varepsilon) \le \frac{\sigma^2}{n\varepsilon^2} \xrightarrow{n\to\infty} 0 P(∣Xˉn−μ∣≥ε)≤nε2σ2n→∞ 0---证明仅需一行不等号。
Brunton 在正式证明之前先用 "非正式直觉" 铺垫了关键的两步计算:(1) E ( X ˉ n ) = μ \mathbb{E}(\bar{X}_n) = \mu E(Xˉn)=μ---样本均值无偏;(2) Var ( X ˉ n ) = σ 2 / n \text{Var}(\bar{X}_n) = \sigma^2/n Var(Xˉn)=σ2/n---方差随 n n n 以 1 / n 1/n 1/n 速率衰减。这两个结果各自依赖 L29 的期望线性性(无条件)和 L30 的独立变量方差加法性(需独立性),是整个 LLN 论证中唯二需要 "概率计算" 的步骤,其余部分被切比雪夫不等式一行吸收。这种 "计算 + 不等式 = 极限定理" 的证明范式在现代概率论中反复出现,LLN 是其最简也最典型的实例。
LLN 的哲学意义远超其数学形式:它首次形式化了 "频率趋近概率" 这一直觉---抛硬币的正向频率终将稳定在 p p p ,样本均值终将揭示真实的 μ \mu μ 。它为统计学中一切 "用样本推断总体" 的操作提供了最根本的理论许可证:如果没有 LLN,从 1000 人的身高样本推断 3 亿人总体均值的操作将毫无数学依据。但 LLN 并未回答 "收敛速度多快?" "极限分布形态如何?"---这两个问题恰好留给下一讲的重磅定理:中心极限定理 🤗。