Steve Brunton | Probability Bootcamp | 笔记 | 第三部分:高级概率 | Lecture 43 | 概率中的尾和公式

目录

    • 前言
    • [1. 引言](#1. 引言)
    • [2. 定义尾和公式](#2. 定义尾和公式)
    • [3. 证明尾和公式](#3. 证明尾和公式)
    • [4. 结语](#4. 结语)
    • 结语
    • 参考

前言

学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第四十三讲:概率中的尾和公式,记录下个人学习笔记,和大家一起分享交流😄

videohttps://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V

1. 引言

OK,在之前的系列课程中,我们证明了一些相当重要的结论和随机变量及其函数(如期望值、方差等)的性质,今天我想介绍一个有趣的性质 --- 尾和公式。

这个公式推导起来相当简单,不仅实用性强,结果也颇有些出人意料,那么我们现在开始。

这里讨论的是随机变量 X X X 的期望值,需要特别说明的是,我们假设 X X X 始终取非负值,因此我们设定 X X X 为非负随机变量,例如,对于离散型随机变量 X X X ,其取值可以是 0,1,2,...(以此类推),不会出现负值如 -1、-2 等情况。

例如抛硬币一百次,正面朝上的次数就是一个非负随机变量,因此,若 X X X 服从二项分布,这便是一个典型案例。事实上我们见过的大多数例子中, X X X 都取非负值,这个性质非常实用。

2. 定义尾和公式

根据尾和公式,随机变量 X X X 的期望值等于其累积分布概率的总和:

E ( X ) = ∑ k = 1 n P ( X ≥ k ) \mathbb{E}(X) = \sum_{k=1}^n P(X \ge k) E(X)=k=1∑nP(X≥k)

该公式表示:随机变量 X X X 的期望值等于所有 P ( X ≥ k ) P(X \ge k) P(X≥k) 的总和,这里的 k k k 是指可能取值序列中的某个特定数值。具体而言,这相当于 1 减去累积分布函数在 k k k 处的取值。

那么,为什么这个结论成立呢?这个结论绝非显而易见,期望值通常有完全不同的表达形式,接下来我将逐步演示:先用传统方式写出期望值的表达式,再证明它能推导出与这种新计算方法等效的结果。

其核心思想在于:期望值通常可表示为求和形式:

E ( X ) = ∑ k = 1 n k P ( X = k ) \mathbb{E}(X) = \sum_{k=1}^n kP(X=k) E(X)=k=1∑nkP(X=k)

在本例中,由于从 0 开始计数,求和范围可设为从 k = 1 k=1 k=1 到 n n n ,(具体起止点并不影响核心原理),即随机变量 X X X 取值为 k k k 的概率乘以 k k k 的求和,这正是随机变量 X X X 的期望值定义。

通常针对离散型随机变量而言, X X X 的期望值等于所有可能取值的加权求和,每个可能取值乘以其对应的概率 P ( X = x ) P(X=x) P(X=x) ,因此我们可以将其表示为:

E ( X ) = ∑ k = 1 n k P ( X = k ) = 1 p 1 + 2 p 2 + 3 p 3 + ... + n p n \mathbb{E}(X) = \sum_{k=1}^n kP(X=k) = 1 p_1 + 2p_2 + 3p_3 + \ldots + n p_n E(X)=k=1∑nkP(X=k)=1p1+2p2+3p3+...+npn

这是对期望值传统定义的一种直接展开方式。

3. 证明尾和公式

现在来看尾和公式,这才是真正精彩的部分。这里我们要引入一个几何直观的理解方式:

∑ k = 0 n k P ( X = k ) = 1 ⋅ p 1 + 2 p 2 + 3 p 3 + ⋯ + ( n − 1 ) p n − 1 + n p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 ⋱ = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n \begin{aligned} \sum_{k=0}^{n} kP(X=k) &= 1\cdot p_1 +2p_2 +3p_3 +\cdots +(n-1)p_{n-1} +np_n \\0.8em &= p_1 +p_2 +p_3 +\cdots +p_{n-1} +p_n \\0.4em &\phantom{={}} \hphantom{p_1} \mathbin{+}p_2 +p_3 +\cdots +p_{n-1} +p_n \\0.4em &\phantom{={}} \hphantom{p_1+p_2} \mathbin{+}p_3 +\cdots +p_{n-1} +p_n \\-0.1em &\phantom{={}} \hphantom{p_1+p_2+p_3} \ddots \\0.2em &\phantom{={}} \hphantom{p_1+p_2+p_3+\cdots} \mathbin{+}p_{n-1} +p_n \\0.4em &\phantom{={}} \hphantom{p_1+p_2+p_3+\cdots+p_{n-1}} \mathbin{+}p_n \end{aligned} k=0∑nkP(X=k)=1⋅p1+2p2+3p3+⋯+(n−1)pn−1+npn=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3⋱=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3+⋯+pn−1+pn

这个表达式等于 p 1 + p 2 + ⋯ + p n − 1 + p n p_1 + p_2 + \cdots + p_{n-1} + p_n p1+p2+⋯+pn−1+pn ,这样每个项我只计算了一次,这样所有的 p 1 p_1 p1 就都统计在内了,因为它只有一个。

但 p 2 p_2 p2 有两个,所以加上 p 2 + p 3 + ⋯ + p n − 1 + p n p_2+p_3+\cdots+p_{n-1}+p_n p2+p3+⋯+pn−1+pn ,现在我有两个 p 2 p_2 p2 项了,但我有三个 p 3 p_3 p3 项,因此还需要加上 p 3 + ⋯ + p n − 1 + p n p_3+\cdots+p_{n-1}+p_n p3+⋯+pn−1+pn ,依此类推,最后加上 p n − 1 + p n p_{n-1}+p_n pn−1+pn 再加上 p n p_n pn 。

通过这种方式,由于存在一个 p 1 p_1 p1、两个 p 2 p_2 p2、三个 p 3 p_3 p3、...、 n − 1 n-1 n−1 个 p n − 1 p_{n-1} pn−1 以及 n n n 个 p n p_n pn ,我们可以列出这种三角求和式,从而精确统计其中的所有项,这样就把这个式子分解成了单项求和的形式。

接下来就是精妙之处了, p n p_n pn 表示随机变量 X ≥ n X \ge n X≥n 的概率, p n − 1 + p n p_{n-1} +p_n pn−1+pn 表示随机变量 X ≥ n − 1 X \ge n-1 X≥n−1 的概率,依此类推, p 2 + p 3 + ⋯ + p n − 1 + p n p_2+p_3+\cdots+p_{n-1}+p_n p2+p3+⋯+pn−1+pn 表示随机变量 X ≥ 2 X \ge 2 X≥2 的概率, p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n p_1+p_2+p_3+\cdots+p_{n-1}+p_n p1+p2+p3+⋯+pn−1+pn 表示随机变量 X ≥ 1 X \ge 1 X≥1 的概率。

因此,计算期望值的传统方法就是这种概率的三角形求和,每一行代表 X X X 大于等于该行索引值的概率,因此总和来看,这个总和:

E ( X ) = ∑ k = 1 n k P ( X = k ) = P ( X ≥ 1 ) + P ( X ≥ 2 ) + ⋯ + P ( X ≥ n − 1 ) + P ( X ≥ n ) = ∑ k = 1 n P ( X ≥ k ) \mathbb{E}(X) = \sum_{k=1}^n kP(X=k) = P(X \ge 1) + P(X\ge 2) + \cdots + P(X \ge n-1) + P(X \ge n) = \sum_{k=1}^n P(X \ge k) E(X)=k=1∑nkP(X=k)=P(X≥1)+P(X≥2)+⋯+P(X≥n−1)+P(X≥n)=k=1∑nP(X≥k)

恰好等于前面的求和式,这就是所有 k k k 值(所有非负或正整数 k k k)对应的 X X X 大于等于某个 k k k 的概率总和。

这与累积分布函数的性质恰好相反:

P ( X ≥ k ) = 1 − P ( X < k ) P(X \ge k) = 1 - P(X < k) P(X≥k)=1−P(X<k)

X ≥ k X \ge k X≥k 的概率本质上等于 1 减去 X < k X < k X<k 的概率,而后者正是累积分布函数,而实际上期望值正是所有这些互补累积分布函数(CCDF)的总和,这确实非常有趣。

这具有一种很直观的几何解释,我们在研究泊松分布、指数分布等概率分布时,已经接触过这类求和形式,这些分布呈现出有趣的几何模式特征,而此方法为我们提供了一种计算或表示期望值的新思路。

4. 结语

这是传统方法,但通过巧妙的数学变换,我们可以用累积分布函数来重新表达它,今天我想向大家展示的就是这个既实用又精妙的期望值计算公式 --- 尾和公式。

结语

尾和公式 E ( X ) = ∑ k = 1 ∞ P ( X ≥ k ) \mathbb{E}(X) = \sum_{k=1}^{\infty} P(X \ge k) E(X)=∑k=1∞P(X≥k)( X ≥ 0 X \ge 0 X≥0)是期望值计算工具箱中一个既优雅又实用的 "隐藏武器"。它的证明本身就是一个精巧的组合恒等式演示:标准定义 E ( X ) = ∑ k P ( X = k ) \mathbb{E}(X) = \sum k P(X=k) E(X)=∑kP(X=k) 中, p k p_k pk 的系数 k k k 恰好是该 k k k 在三角阵列中出现的次数--- p 1 p_1 p1 出现 1 次、 p 2 p_2 p2 出现 2 次、 p 3 p_3 p3 出现 3 次......将求和按列重新排列后,每一行恰好收缩为一个尾概率:第一行 = p 1 + p 2 + ⋯ + p n = P ( X ≥ 1 ) p_1 + p_2 + \cdots + p_n = P(X \ge 1) p1+p2+⋯+pn=P(X≥1) ,第二行 = p 2 + ⋯ + p n = P ( X ≥ 2 ) p_2 + \cdots + p_n = P(X \ge 2) p2+⋯+pn=P(X≥2) ,以此类推。这种 "三角求和 → 尾概率累加" 的重排技巧,本质上是对 分部求和(summation by parts,离散版分部积分)的一次直观演练。

尾和公式的另一等价形式揭示了它与 CDF 的直接关联: P ( X ≥ k ) = 1 − F ( k − 1 ) P(X \ge k) = 1 - F(k-1) P(X≥k)=1−F(k−1) ,因此 E ( X ) = ∑ k = 1 ∞ ( 1 − F ( k − 1 ) ) \mathbb{E}(X) = \sum_{k=1}^{\infty} (1 - F(k-1)) E(X)=∑k=1∞(1−F(k−1))---期望值 = 所有 "生存概率"(即 CDF 的补,CCDF)的总和。这为仅知晓 CCDF 而不知 PMF 的情形提供了计算期望的替代路径,也在寿险精算(生命表)、可靠性工程(故障时间)和排队论中有着直接的应用:若已知设备在时刻 k k k 仍存活的概率,期望寿命恰为所有时间点上生存概率之和。

该公式的连续化推广--- E ( X ) = ∫ 0 ∞ P ( X > t ) d t = ∫ 0 ∞ ( 1 − F ( t ) ) d t \mathbb{E}(X) = \int_0^{\infty} P(X > t) dt = \int_0^{\infty} (1 - F(t)) dt E(X)=∫0∞P(X>t)dt=∫0∞(1−F(t))dt---在指数分布、伽马分布等非负连续分布中同样成立,且与分部积分 ∫ 0 ∞ t f ( t ) d t = t F ( t ) 0 ∞ − ∫ 0 ∞ F ( t ) d t \int_0^{\infty} t f(t) dt = t F(t)_0^{\infty} - \int_0^{\infty} F(t) dt ∫0∞tf(t)dt=tF(t)0∞−∫0∞F(t)dt 形成完美呼应。尾和公式虽然简单,却是沟通 PMF/CDF、期望值与尾部概率三者之间关系的核心桥梁 🤗。

参考

相关推荐
爱听歌的周童鞋5 小时前
Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 41 | 协方差与相关性
statistics·steve brunton·probability·covariance·correlation
爱听歌的周童鞋8 小时前
Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 37 | 矩母函数
moments·statistics·steve brunton·probability·mgf
爱听歌的周童鞋1 天前
Steve Brunton | Probability Bootcamp | 笔记 | 第四部分:高级统计 | Lecture 35 | 大数定律
statistics·steve brunton·probability·lln·sample mean
爱听歌的周童鞋14 天前
Steve Brunton | Probability Bootcamp | 笔记 | 第一部分:概率导论 | Lecture 8 | 条件概率
statistics·steve brunton·probability·conditionalprob
爱听歌的周童鞋14 天前
Steve Brunton | Probability Bootcamp | 笔记 | 第一部分:概率导论 | Lecture 7 | 二项分布与多项分布
statistics·multinomial·steve brunton·probability·binomial
xcLeigh6 个月前
Python入门:Python3 statistics模块全面学习教程
开发语言·python·学习·模块·python3·statistics
头发没了还会再长8 个月前
Basic statistics - 12. One-way ANOVA Basics
统计学·statistics
头发没了还会再长8 个月前
Basic statistics - 10. The unpaired t-test | Independent samples t-test
统计学·statistics
头发没了还会再长8 个月前
Basic statistics -11. The paired t-test | explained with a sample example
统计学·statistics