指数分布的完整推导

下面从"每个很短时间段内都有一个很小的到达概率"开始,把指数分布完整推导出来。

1. 先把连续时间切成小段

设订单平均到达速率是:

λ次/单位时间 \lambda\quad \text{次/单位时间} λ次/单位时间

例如:

λ=2 次/天 \lambda=2\text{ 次/天} λ=2 次/天

表示平均每天2笔订单。

把一天切成长度为 Δt\Delta tΔt 的小时间段。在一个足够短的时间段内,订单到达概率近似为:

p=λΔt p=\lambda\Delta t p=λΔt

所以没有订单到达的概率是:

1−p=1−λΔt 1-p=1-\lambda\Delta t 1−p=1−λΔt

注意,λ\lambdaλ 是"速率",单位是:

1时间 \frac{1}{\text{时间}} 时间1

而 λΔt\lambda\Delta tλΔt 才是没有单位的概率。


2. 为什么一定要令 p=λΔtp=\lambda\Delta tp=λΔt

假如把时间段缩短,而每个时间段的到达概率 ppp 仍然保持不变,那么单位时间内的小时间段数量将趋于无穷。

例如,每个小时间段都有1%的订单概率:

  • 每小时分成60段,得到60次机会;
  • 每小时分成3600段,得到3600次机会;
  • 当 Δt→0\Delta t\to0Δt→0 时,单位时间内将有无穷多次机会。

这会导致事件立即发生,甚至形成无限到达率。

所以,当时间段缩短时,每段发生概率必须按比例缩小:

p=λΔt p=\lambda\Delta t p=λΔt

这样无论怎样划分时间,单位时间的平均到达次数仍然保持为 λ\lambdaλ。

更严格地可以写成:

p(Δt)=λΔt+o(Δt) p(\Delta t)=\lambda\Delta t+o(\Delta t) p(Δt)=λΔt+o(Δt)

其中 o(Δt)o(\Delta t)o(Δt) 表示比 Δt\Delta tΔt 更快趋近于0的高阶小量。


3. 时间 ttt 可以分成多少个小段

每一小段长度为 Δt\Delta tΔt,总时间为 ttt,所以小段数量为:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

暂时假设 t/Δtt/\Delta tt/Δt 是整数。

例如:

  • 总时间 t=1t=1t=1 天;
  • 每段 Δt=0.01\Delta t=0.01Δt=0.01 天;
  • 一共有 n=100n=100n=100 个小时间段。

4. 连续多个时间段都没有订单

假设不同小时间段内是否有订单相互独立。

单个时间段没有订单的概率是:

1−λΔt 1-\lambda\Delta t 1−λΔt

连续两个时间段都没有订单的概率是:

(1−λΔt)2 (1-\lambda\Delta t)^2 (1−λΔt)2

连续 nnn 个时间段都没有订单的概率是:

(1−λΔt)n (1-\lambda\Delta t)^n (1−λΔt)n

因为:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

所以经过时间 ttt 仍然没有订单的概率为:

P(T>t)=(1−λΔt)t/Δt P(T>t)=(1-\lambda\Delta t)^{t/\Delta t} P(T>t)=(1−λΔt)t/Δt

这里 TTT 表示等待下一笔订单的时间。

"T>tT>tT>t"表示等待时间超过了 ttt,也就是时间 ttt 内仍然没有订单。


5. 令时间间隔趋近于0

现在让:

Δt→0 \Delta t\to0 Δt→0

得到:

P(T>t)=lim⁡Δt→0(1−λΔt)t/Δt P(T>t)=\lim_{\Delta t\to0}(1-\lambda\Delta t)^{t/\Delta t} P(T>t)=Δt→0lim(1−λΔt)t/Δt

为了计算这个极限,令:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

则:

Δt=tn \Delta t=\frac{t}{n} Δt=nt

当 Δt→0\Delta t\to0Δt→0 时:

n→∞ n\to\infty n→∞

代入原式:

P(T>t)=lim⁡n→∞(1−λtn)n P(T>t)=\lim_{n\to\infty}\left(1-\lambda\frac{t}{n}\right)^n P(T>t)=n→∞lim(1−λnt)n

即:

P(T>t)=lim⁡n→∞(1−λtn)n P(T>t)=\lim_{n\to\infty}\left(1-\frac{\lambda t}{n}\right)^n P(T>t)=n→∞lim(1−nλt)n

使用指数函数的基本极限:

lim⁡n→∞(1+xn)n=ex \lim_{n\to\infty}\left(1+\frac{x}{n}\right)^n=e^x n→∞lim(1+nx)n=ex

令:

x=−λt x=-\lambda t x=−λt

于是:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

这就是指数分布的尾概率,也叫生存函数。


6. 用对数进一步证明这个极限

设:

Ln=(1−λtn)n L_n=\left(1-\frac{\lambda t}{n}\right)^n Ln=(1−nλt)n

两边取自然对数:

ln⁡Ln=nln⁡(1−λtn) \ln L_n=n\ln\left(1-\frac{\lambda t}{n}\right) lnLn=nln(1−nλt)

使用泰勒展开:

ln⁡(1−u)=−u−u22−u33−⋯ \ln(1-u)=-u-\frac{u^2}{2}-\frac{u^3}{3}-\cdots ln(1−u)=−u−2u2−3u3−⋯

令:

u=λtn u=\frac{\lambda t}{n} u=nλt

则:

ln⁡Ln=n−λtn−(λt)22n2−(λt)33n3−⋯  \ln L_n=n\left-\\frac{\\lambda t}{n}-\\frac{(\\lambda t)\^2}{2n\^2}-\\frac{(\\lambda t)\^3}{3n\^3}-\\cdots\\right lnLn=n−nλt−2n2(λt)2−3n3(λt)3−⋯

把 nnn 乘进去:

ln⁡Ln=−λt−(λt)22n−(λt)33n2−⋯ \ln L_n=-\lambda t-\frac{(\lambda t)^2}{2n}-\frac{(\lambda t)^3}{3n^2}-\cdots lnLn=−λt−2n(λt)2−3n2(λt)3−⋯

当 n→∞n\to\inftyn→∞ 时,后面的项全部趋近于0:

lim⁡n→∞ln⁡Ln=−λt \lim_{n\to\infty}\ln L_n=-\lambda t n→∞limlnLn=−λt

因此:

lim⁡n→∞Ln=e−λt \lim_{n\to\infty}L_n=e^{-\lambda t} n→∞limLn=e−λt

即:

lim⁡n→∞(1−λtn)n=e−λt \lim_{n\to\infty}\left(1-\frac{\lambda t}{n}\right)^n=e^{-\lambda t} n→∞lim(1−nλt)n=e−λt


7. 数值上怎样逼近 e−1e^{-1}e−1

令:

λ=1 次/天,t=1 天 \lambda=1\text{ 次/天},\qquad t=1\text{ 天} λ=1 次/天,t=1 天

那么:

P(T>1)=lim⁡Δt→0(1−Δt)1/Δt P(T>1)=\lim_{\Delta t\to0}(1-\Delta t)^{1/\Delta t} P(T>1)=Δt→0lim(1−Δt)1/Δt

不同时间划分得到:

Δt\Delta tΔt 时间段数量 一天没有订单的概率
0.50.50.5 2 0.52=0.25000.5^2=0.25000.52=0.2500
0.10.10.1 10 0.910=0.34870.9^{10}=0.34870.910=0.3487
0.010.010.01 100 0.99100=0.36600.99^{100}=0.36600.99100=0.3660
0.0010.0010.001 1000 0.9991000=0.36770.999^{1000}=0.36770.9991000=0.3677
Δt→0\Delta t\to0Δt→0 n→∞n\to\inftyn→∞ e−1=0.367879e^{-1}=0.367879e−1=0.367879

所以当时间划分越来越细:

(1−Δt)1/Δt⟶e−1 (1-\Delta t)^{1/\Delta t}\longrightarrow e^{-1} (1−Δt)1/Δt⟶e−1


8. 从尾概率得到累积分布函数

现在已经得到:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

它表示经过时间 ttt 还没有等到订单的概率。

那么在时间 ttt 以内等到订单的概率是:

P(T≤t)=1−P(T>t) P(T\le t)=1-P(T>t) P(T≤t)=1−P(T>t)

因此指数分布的累积分布函数为:

F(t)=P(T≤t)=1−e−λt F(t)=P(T\le t)=1-e^{-\lambda t} F(t)=P(T≤t)=1−e−λt

例如 λ=1\lambda=1λ=1 次/天:

P(T≤1)=1−e−1≈0.6321 P(T\le1)=1-e^{-1}\approx0.6321 P(T≤1)=1−e−1≈0.6321

即一天内等到订单的概率约为63.21%。


9. 从累积分布函数得到概率密度

概率密度是累积分布函数的导数:

f(t)=dF(t)dt f(t)=\frac{dF(t)}{dt} f(t)=dtdF(t)

因为:

F(t)=1−e−λt F(t)=1-e^{-\lambda t} F(t)=1−e−λt

所以:

f(t)=ddt(1−e−λt) f(t)=\frac{d}{dt}\left(1-e^{-\lambda t}\right) f(t)=dtd(1−e−λt)

利用:

ddte−λt=−λe−λt \frac{d}{dt}e^{-\lambda t}=-\lambda e^{-\lambda t} dtde−λt=−λe−λt

得到:

f(t)=λe−λt,t≥0 f(t)=\lambda e^{-\lambda t},\qquad t\ge0 f(t)=λe−λt,t≥0

这才是指数分布的概率密度函数。

因此需要区分:

类型 公式
尾概率 P(T>t)=e−λtP(T>t)=e^{-\lambda t}P(T>t)=e−λt
累积分布函数 F(t)=1−e−λtF(t)=1-e^{-\lambda t}F(t)=1−e−λt
概率密度函数 f(t)=λe−λtf(t)=\lambda e^{-\lambda t}f(t)=λe−λt

它们都含有指数函数,所以称为指数分布。


10. 也可以从微分方程推导

设:

S(t)=P(T>t) S(t)=P(T>t) S(t)=P(T>t)

表示等待超过 ttt 的概率。

如果经过时间 ttt 仍然没有订单,那么在接下来的 Δt\Delta tΔt 内仍然没有订单的概率约为:

1−λΔt 1-\lambda\Delta t 1−λΔt

因此:

S(t+Δt)=S(t)(1−λΔt) S(t+\Delta t)=S(t)(1-\lambda\Delta t) S(t+Δt)=S(t)(1−λΔt)

展开:

S(t+Δt)−S(t)=−λS(t)Δt S(t+\Delta t)-S(t)=-\lambda S(t)\Delta t S(t+Δt)−S(t)=−λS(t)Δt

两边除以 Δt\Delta tΔt:

S(t+Δt)−S(t)Δt=−λS(t) \frac{S(t+\Delta t)-S(t)}{\Delta t}=-\lambda S(t) ΔtS(t+Δt)−S(t)=−λS(t)

令 Δt→0\Delta t\to0Δt→0:

S′(t)=−λS(t) S'(t)=-\lambda S(t) S′(t)=−λS(t)

初始时刻肯定还没有等待超过负时间,因此:

S(0)=1 S(0)=1 S(0)=1

解这个微分方程:

S′(t)S(t)=−λ \frac{S'(t)}{S(t)}=-\lambda S(t)S′(t)=−λ

从时间 000 积分到时间 ttt:

∫0tS′(u)S(u) du=−λ∫0tdu \int_{0}^{t}\frac{S'(u)}{S(u)}\,du=-\lambda\int_{0}^{t}du ∫0tS(u)S′(u)du=−λ∫0tdu

因此:

ln⁡S(t)−ln⁡S(0)=−λt \ln S(t)-\ln S(0)=-\lambda t lnS(t)−lnS(0)=−λt

代入初始条件 S(0)=1S(0)=1S(0)=1:

ln⁡S(t)=−λt \ln S(t)=-\lambda t lnS(t)=−λt

两边取指数:

S(t)=e−λt S(t)=e^{-\lambda t} S(t)=e−λt

所以:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

从这个角度看,指数分布就是"概率以恒定比例衰减"的分布。


11. 为什么产生无记忆性

指数分布满足:

P(T>s+t∣T>s)=P(T>s+t)P(T>s) P(T>s+t \mid T>s)=\frac{P(T>s+t)}{P(T>s)} P(T>s+t∣T>s)=P(T>s)P(T>s+t)

代入尾概率:

P(T>s+t∣T>s)=e−λ(s+t)e−λs P(T>s+t \mid T>s)=\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}} P(T>s+t∣T>s)=e−λse−λ(s+t)

因为:

e−λ(s+t)=e−λse−λt e^{-\lambda(s+t)}=e^{-\lambda s}e^{-\lambda t} e−λ(s+t)=e−λse−λt

所以:

P(T>s+t∣T>s)=e−λt P(T>s+t \mid T>s)=e^{-\lambda t} P(T>s+t∣T>s)=e−λt

而:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

因此:

P(T>s+t∣T>s)=P(T>t) P(T>s+t \mid T>s)=P(T>t) P(T>s+t∣T>s)=P(T>t)

这说明已经等待了 sss 时间,不会改变未来还需要等待多久的分布。


最核心的推导链条

小时间段发生概率:

p=λΔt p=\lambda\Delta t p=λΔt

小时间段不发生概率:

1−p=1−λΔt 1-p=1-\lambda\Delta t 1−p=1−λΔt

时间 ttt 包含的小段数:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

经过时间 ttt 仍然没有事件的概率:

P(T>t)=lim⁡Δt→0(1−λΔt)t/Δt=e−λt P(T>t)=\lim_{\Delta t\to0}(1-\lambda\Delta t)^{t/\Delta t}=e^{-\lambda t} P(T>t)=Δt→0lim(1−λΔt)t/Δt=e−λt

因此指数分布的本质是:

大量极短、相互独立的时间段中,每一段都以与时间长度成正比的小概率发生事件;等待第一次事件的时间就服从指数分布。

相关推荐
嘿丨嘿1 天前
VLA 入门(二、三):机器人动作到底是什么?从关节空间到 Action Chunk
深度学习·机器学习·机器人
爱刷碗的苏泓舒1 天前
平方根信息滤波:矩阵推导及 GNSS 参数估计应用
线性代数·算法·矩阵·gnss·参数估计·测量平差·平方根信息滤波
larance1 天前
机器学习特征预处理之删移除无关特征
人工智能·机器学习·数据挖掘
lisw051 天前
【计算机科学技术】从晶圆制备到芯片出厂的流程
人工智能·机器学习·制造
lisw051 天前
【计算机科学技术】晶圆是什么回事?与芯片的区别与联系!
机器学习·制造
All The Way North-1 天前
【TorchMetrics精通系列①】核心设计哲学 + Accuracy 超详解
机器学习·分类·模型评估·accuracy·准确率·评估指标·torchmetrics
湘美书院--湘美谈教育1 天前
湘美谈教育湘美书院成功学系列:标准即是文明,AI时代的走向
大数据·人工智能·深度学习·机器学习·生活
AI科技星1 天前
光速螺旋时空曲率挠率拓扑统一场论——四大力全域闭环求导、精算验证与第一性原理完备证明
线性代数·算法·决策树·机器学习·常温超导·ai科技星
迷途呀1 天前
conda使用指南
python·深度学习·机器学习·pycharm·conda