目录
前言
学习 Steven Brunton 讲授的概率与统计入门概述视频,本篇文章记录第四十三讲:概率中的尾和公式,记录下个人学习笔记,和大家一起分享交流😄
video :https://www.youtube.com/playlist?list=PLMrJAkhIeNNR3sNYvfgiKgcStwuPSts9V
1. 引言
OK,在之前的系列课程中,我们证明了一些相当重要的结论和随机变量及其函数(如期望值、方差等)的性质,今天我想介绍一个有趣的性质 --- 尾和公式。
这个公式推导起来相当简单,不仅实用性强,结果也颇有些出人意料,那么我们现在开始。
这里讨论的是随机变量 X X X 的期望值,需要特别说明的是,我们假设 X X X 始终取非负值,因此我们设定 X X X 为非负随机变量,例如,对于离散型随机变量 X X X ,其取值可以是 0,1,2,...(以此类推),不会出现负值如 -1、-2 等情况。
例如抛硬币一百次,正面朝上的次数就是一个非负随机变量,因此,若 X X X 服从二项分布,这便是一个典型案例。事实上我们见过的大多数例子中, X X X 都取非负值,这个性质非常实用。
2. 定义尾和公式
根据尾和公式,随机变量 X X X 的期望值等于其累积分布概率的总和:
E ( X ) = ∑ k = 1 n P ( X ≥ k ) \mathbb{E}(X) = \sum_{k=1}^n P(X \ge k) E(X)=k=1∑nP(X≥k)
该公式表示:随机变量 X X X 的期望值等于所有 P ( X ≥ k ) P(X \ge k) P(X≥k) 的总和,这里的 k k k 是指可能取值序列中的某个特定数值。具体而言,这相当于 1 减去累积分布函数在 k k k 处的取值。
那么,为什么这个结论成立呢?这个结论绝非显而易见,期望值通常有完全不同的表达形式,接下来我将逐步演示:先用传统方式写出期望值的表达式,再证明它能推导出与这种新计算方法等效的结果。
其核心思想在于:期望值通常可表示为求和形式:
E ( X ) = ∑ k = 1 n k P ( X = k ) \mathbb{E}(X) = \sum_{k=1}^n kP(X=k) E(X)=k=1∑nkP(X=k)
在本例中,由于从 0 开始计数,求和范围可设为从 k = 1 k=1 k=1 到 n n n ,(具体起止点并不影响核心原理),即随机变量 X X X 取值为 k k k 的概率乘以 k k k 的求和,这正是随机变量 X X X 的期望值定义。
通常针对离散型随机变量而言, X X X 的期望值等于所有可能取值的加权求和,每个可能取值乘以其对应的概率 P ( X = x ) P(X=x) P(X=x) ,因此我们可以将其表示为:
E ( X ) = ∑ k = 1 n k P ( X = k ) = 1 p 1 + 2 p 2 + 3 p 3 + ... + n p n \mathbb{E}(X) = \sum_{k=1}^n kP(X=k) = 1 p_1 + 2p_2 + 3p_3 + \ldots + n p_n E(X)=k=1∑nkP(X=k)=1p1+2p2+3p3+...+npn
这是对期望值传统定义的一种直接展开方式。
3. 证明尾和公式
现在来看尾和公式,这才是真正精彩的部分。这里我们要引入一个几何直观的理解方式:
∑ k = 0 n k P ( X = k ) = 1 ⋅ p 1 + 2 p 2 + 3 p 3 + ⋯ + ( n − 1 ) p n − 1 + n p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 ⋱ = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n = p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n \begin{aligned} \sum_{k=0}^{n} kP(X=k) &= 1\cdot p_1 +2p_2 +3p_3 +\cdots +(n-1)p_{n-1} +np_n \\0.8em &= p_1 +p_2 +p_3 +\cdots +p_{n-1} +p_n \\0.4em &\phantom{={}} \hphantom{p_1} \mathbin{+}p_2 +p_3 +\cdots +p_{n-1} +p_n \\0.4em &\phantom{={}} \hphantom{p_1+p_2} \mathbin{+}p_3 +\cdots +p_{n-1} +p_n \\-0.1em &\phantom{={}} \hphantom{p_1+p_2+p_3} \ddots \\0.2em &\phantom{={}} \hphantom{p_1+p_2+p_3+\cdots} \mathbin{+}p_{n-1} +p_n \\0.4em &\phantom{={}} \hphantom{p_1+p_2+p_3+\cdots+p_{n-1}} \mathbin{+}p_n \end{aligned} k=0∑nkP(X=k)=1⋅p1+2p2+3p3+⋯+(n−1)pn−1+npn=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3⋱=p1+p2+p3+⋯+pn−1+pn=p1+p2+p3+⋯+pn−1+pn
这个表达式等于 p 1 + p 2 + ⋯ + p n − 1 + p n p_1 + p_2 + \cdots + p_{n-1} + p_n p1+p2+⋯+pn−1+pn ,这样每个项我只计算了一次,这样所有的 p 1 p_1 p1 就都统计在内了,因为它只有一个。
但 p 2 p_2 p2 有两个,所以加上 p 2 + p 3 + ⋯ + p n − 1 + p n p_2+p_3+\cdots+p_{n-1}+p_n p2+p3+⋯+pn−1+pn ,现在我有两个 p 2 p_2 p2 项了,但我有三个 p 3 p_3 p3 项,因此还需要加上 p 3 + ⋯ + p n − 1 + p n p_3+\cdots+p_{n-1}+p_n p3+⋯+pn−1+pn ,依此类推,最后加上 p n − 1 + p n p_{n-1}+p_n pn−1+pn 再加上 p n p_n pn 。
通过这种方式,由于存在一个 p 1 p_1 p1、两个 p 2 p_2 p2、三个 p 3 p_3 p3、...、 n − 1 n-1 n−1 个 p n − 1 p_{n-1} pn−1 以及 n n n 个 p n p_n pn ,我们可以列出这种三角求和式,从而精确统计其中的所有项,这样就把这个式子分解成了单项求和的形式。
接下来就是精妙之处了, p n p_n pn 表示随机变量 X ≥ n X \ge n X≥n 的概率, p n − 1 + p n p_{n-1} +p_n pn−1+pn 表示随机变量 X ≥ n − 1 X \ge n-1 X≥n−1 的概率,依此类推, p 2 + p 3 + ⋯ + p n − 1 + p n p_2+p_3+\cdots+p_{n-1}+p_n p2+p3+⋯+pn−1+pn 表示随机变量 X ≥ 2 X \ge 2 X≥2 的概率, p 1 + p 2 + p 3 + ⋯ + p n − 1 + p n p_1+p_2+p_3+\cdots+p_{n-1}+p_n p1+p2+p3+⋯+pn−1+pn 表示随机变量 X ≥ 1 X \ge 1 X≥1 的概率。
因此,计算期望值的传统方法就是这种概率的三角形求和,每一行代表 X X X 大于等于该行索引值的概率,因此总和来看,这个总和:
E ( X ) = ∑ k = 1 n k P ( X = k ) = P ( X ≥ 1 ) + P ( X ≥ 2 ) + ⋯ + P ( X ≥ n − 1 ) + P ( X ≥ n ) = ∑ k = 1 n P ( X ≥ k ) \mathbb{E}(X) = \sum_{k=1}^n kP(X=k) = P(X \ge 1) + P(X\ge 2) + \cdots + P(X \ge n-1) + P(X \ge n) = \sum_{k=1}^n P(X \ge k) E(X)=k=1∑nkP(X=k)=P(X≥1)+P(X≥2)+⋯+P(X≥n−1)+P(X≥n)=k=1∑nP(X≥k)
恰好等于前面的求和式,这就是所有 k k k 值(所有非负或正整数 k k k)对应的 X X X 大于等于某个 k k k 的概率总和。
这与累积分布函数的性质恰好相反:
P ( X ≥ k ) = 1 − P ( X < k ) P(X \ge k) = 1 - P(X < k) P(X≥k)=1−P(X<k)
X ≥ k X \ge k X≥k 的概率本质上等于 1 减去 X < k X < k X<k 的概率,而后者正是累积分布函数,而实际上期望值正是所有这些互补累积分布函数(CCDF)的总和,这确实非常有趣。
这具有一种很直观的几何解释,我们在研究泊松分布、指数分布等概率分布时,已经接触过这类求和形式,这些分布呈现出有趣的几何模式特征,而此方法为我们提供了一种计算或表示期望值的新思路。
4. 结语
这是传统方法,但通过巧妙的数学变换,我们可以用累积分布函数来重新表达它,今天我想向大家展示的就是这个既实用又精妙的期望值计算公式 --- 尾和公式。
结语
尾和公式 E ( X ) = ∑ k = 1 ∞ P ( X ≥ k ) \mathbb{E}(X) = \sum_{k=1}^{\infty} P(X \ge k) E(X)=∑k=1∞P(X≥k)( X ≥ 0 X \ge 0 X≥0)是期望值计算工具箱中一个既优雅又实用的 "隐藏武器"。它的证明本身就是一个精巧的组合恒等式演示:标准定义 E ( X ) = ∑ k P ( X = k ) \mathbb{E}(X) = \sum k P(X=k) E(X)=∑kP(X=k) 中, p k p_k pk 的系数 k k k 恰好是该 k k k 在三角阵列中出现的次数--- p 1 p_1 p1 出现 1 次、 p 2 p_2 p2 出现 2 次、 p 3 p_3 p3 出现 3 次......将求和按列重新排列后,每一行恰好收缩为一个尾概率:第一行 = p 1 + p 2 + ⋯ + p n = P ( X ≥ 1 ) p_1 + p_2 + \cdots + p_n = P(X \ge 1) p1+p2+⋯+pn=P(X≥1) ,第二行 = p 2 + ⋯ + p n = P ( X ≥ 2 ) p_2 + \cdots + p_n = P(X \ge 2) p2+⋯+pn=P(X≥2) ,以此类推。这种 "三角求和 → 尾概率累加" 的重排技巧,本质上是对 分部求和(summation by parts,离散版分部积分)的一次直观演练。
尾和公式的另一等价形式揭示了它与 CDF 的直接关联: P ( X ≥ k ) = 1 − F ( k − 1 ) P(X \ge k) = 1 - F(k-1) P(X≥k)=1−F(k−1) ,因此 E ( X ) = ∑ k = 1 ∞ ( 1 − F ( k − 1 ) ) \mathbb{E}(X) = \sum_{k=1}^{\infty} (1 - F(k-1)) E(X)=∑k=1∞(1−F(k−1))---期望值 = 所有 "生存概率"(即 CDF 的补,CCDF)的总和。这为仅知晓 CCDF 而不知 PMF 的情形提供了计算期望的替代路径,也在寿险精算(生命表)、可靠性工程(故障时间)和排队论中有着直接的应用:若已知设备在时刻 k k k 仍存活的概率,期望寿命恰为所有时间点上生存概率之和。
该公式的连续化推广--- E ( X ) = ∫ 0 ∞ P ( X > t ) d t = ∫ 0 ∞ ( 1 − F ( t ) ) d t \mathbb{E}(X) = \int_0^{\infty} P(X > t) dt = \int_0^{\infty} (1 - F(t)) dt E(X)=∫0∞P(X>t)dt=∫0∞(1−F(t))dt---在指数分布、伽马分布等非负连续分布中同样成立,且与分部积分 ∫ 0 ∞ t f ( t ) d t = t F ( t ) 0 ∞ − ∫ 0 ∞ F ( t ) d t \int_0^{\infty} t f(t) dt = t F(t)_0^{\infty} - \int_0^{\infty} F(t) dt ∫0∞tf(t)dt=tF(t)0∞−∫0∞F(t)dt 形成完美呼应。尾和公式虽然简单,却是沟通 PMF/CDF、期望值与尾部概率三者之间关系的核心桥梁 🤗。