下面从"每个很短时间段内都有一个很小的到达概率"开始,把指数分布完整推导出来。
1. 先把连续时间切成小段
设订单平均到达速率是:
λ次/单位时间 \lambda\quad \text{次/单位时间} λ次/单位时间
例如:
λ=2 次/天 \lambda=2\text{ 次/天} λ=2 次/天
表示平均每天2笔订单。
把一天切成长度为 Δt\Delta tΔt 的小时间段。在一个足够短的时间段内,订单到达概率近似为:
p=λΔt p=\lambda\Delta t p=λΔt
所以没有订单到达的概率是:
1−p=1−λΔt 1-p=1-\lambda\Delta t 1−p=1−λΔt
注意,λ\lambdaλ 是"速率",单位是:
1时间 \frac{1}{\text{时间}} 时间1
而 λΔt\lambda\Delta tλΔt 才是没有单位的概率。
2. 为什么一定要令 p=λΔtp=\lambda\Delta tp=λΔt
假如把时间段缩短,而每个时间段的到达概率 ppp 仍然保持不变,那么单位时间内的小时间段数量将趋于无穷。
例如,每个小时间段都有1%的订单概率:
- 每小时分成60段,得到60次机会;
- 每小时分成3600段,得到3600次机会;
- 当 Δt→0\Delta t\to0Δt→0 时,单位时间内将有无穷多次机会。
这会导致事件立即发生,甚至形成无限到达率。
所以,当时间段缩短时,每段发生概率必须按比例缩小:
p=λΔt p=\lambda\Delta t p=λΔt
这样无论怎样划分时间,单位时间的平均到达次数仍然保持为 λ\lambdaλ。
更严格地可以写成:
p(Δt)=λΔt+o(Δt) p(\Delta t)=\lambda\Delta t+o(\Delta t) p(Δt)=λΔt+o(Δt)
其中 o(Δt)o(\Delta t)o(Δt) 表示比 Δt\Delta tΔt 更快趋近于0的高阶小量。
3. 时间 ttt 可以分成多少个小段
每一小段长度为 Δt\Delta tΔt,总时间为 ttt,所以小段数量为:
n=tΔt n=\frac{t}{\Delta t} n=Δtt
暂时假设 t/Δtt/\Delta tt/Δt 是整数。
例如:
- 总时间 t=1t=1t=1 天;
- 每段 Δt=0.01\Delta t=0.01Δt=0.01 天;
- 一共有 n=100n=100n=100 个小时间段。
4. 连续多个时间段都没有订单
假设不同小时间段内是否有订单相互独立。
单个时间段没有订单的概率是:
1−λΔt 1-\lambda\Delta t 1−λΔt
连续两个时间段都没有订单的概率是:
(1−λΔt)2 (1-\lambda\Delta t)^2 (1−λΔt)2
连续 nnn 个时间段都没有订单的概率是:
(1−λΔt)n (1-\lambda\Delta t)^n (1−λΔt)n
因为:
n=tΔt n=\frac{t}{\Delta t} n=Δtt
所以经过时间 ttt 仍然没有订单的概率为:
P(T>t)=(1−λΔt)t/Δt P(T>t)=(1-\lambda\Delta t)^{t/\Delta t} P(T>t)=(1−λΔt)t/Δt
这里 TTT 表示等待下一笔订单的时间。
"T>tT>tT>t"表示等待时间超过了 ttt,也就是时间 ttt 内仍然没有订单。
5. 令时间间隔趋近于0
现在让:
Δt→0 \Delta t\to0 Δt→0
得到:
P(T>t)=limΔt→0(1−λΔt)t/Δt P(T>t)=\lim_{\Delta t\to0}(1-\lambda\Delta t)^{t/\Delta t} P(T>t)=Δt→0lim(1−λΔt)t/Δt
为了计算这个极限,令:
n=tΔt n=\frac{t}{\Delta t} n=Δtt
则:
Δt=tn \Delta t=\frac{t}{n} Δt=nt
当 Δt→0\Delta t\to0Δt→0 时:
n→∞ n\to\infty n→∞
代入原式:
P(T>t)=limn→∞(1−λtn)n P(T>t)=\lim_{n\to\infty}\left(1-\lambda\frac{t}{n}\right)^n P(T>t)=n→∞lim(1−λnt)n
即:
P(T>t)=limn→∞(1−λtn)n P(T>t)=\lim_{n\to\infty}\left(1-\frac{\lambda t}{n}\right)^n P(T>t)=n→∞lim(1−nλt)n
使用指数函数的基本极限:
limn→∞(1+xn)n=ex \lim_{n\to\infty}\left(1+\frac{x}{n}\right)^n=e^x n→∞lim(1+nx)n=ex
令:
x=−λt x=-\lambda t x=−λt
于是:
P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt
这就是指数分布的尾概率,也叫生存函数。
6. 用对数进一步证明这个极限
设:
Ln=(1−λtn)n L_n=\left(1-\frac{\lambda t}{n}\right)^n Ln=(1−nλt)n
两边取自然对数:
lnLn=nln(1−λtn) \ln L_n=n\ln\left(1-\frac{\lambda t}{n}\right) lnLn=nln(1−nλt)
使用泰勒展开:
ln(1−u)=−u−u22−u33−⋯ \ln(1-u)=-u-\frac{u^2}{2}-\frac{u^3}{3}-\cdots ln(1−u)=−u−2u2−3u3−⋯
令:
u=λtn u=\frac{\lambda t}{n} u=nλt
则:
lnLn=n−λtn−(λt)22n2−(λt)33n3−⋯ \ln L_n=n\left-\\frac{\\lambda t}{n}-\\frac{(\\lambda t)\^2}{2n\^2}-\\frac{(\\lambda t)\^3}{3n\^3}-\\cdots\\right lnLn=n−nλt−2n2(λt)2−3n3(λt)3−⋯
把 nnn 乘进去:
lnLn=−λt−(λt)22n−(λt)33n2−⋯ \ln L_n=-\lambda t-\frac{(\lambda t)^2}{2n}-\frac{(\lambda t)^3}{3n^2}-\cdots lnLn=−λt−2n(λt)2−3n2(λt)3−⋯
当 n→∞n\to\inftyn→∞ 时,后面的项全部趋近于0:
limn→∞lnLn=−λt \lim_{n\to\infty}\ln L_n=-\lambda t n→∞limlnLn=−λt
因此:
limn→∞Ln=e−λt \lim_{n\to\infty}L_n=e^{-\lambda t} n→∞limLn=e−λt
即:
limn→∞(1−λtn)n=e−λt \lim_{n\to\infty}\left(1-\frac{\lambda t}{n}\right)^n=e^{-\lambda t} n→∞lim(1−nλt)n=e−λt
7. 数值上怎样逼近 e−1e^{-1}e−1
令:
λ=1 次/天,t=1 天 \lambda=1\text{ 次/天},\qquad t=1\text{ 天} λ=1 次/天,t=1 天
那么:
P(T>1)=limΔt→0(1−Δt)1/Δt P(T>1)=\lim_{\Delta t\to0}(1-\Delta t)^{1/\Delta t} P(T>1)=Δt→0lim(1−Δt)1/Δt
不同时间划分得到:
| Δt\Delta tΔt | 时间段数量 | 一天没有订单的概率 |
|---|---|---|
| 0.50.50.5 | 2 | 0.52=0.25000.5^2=0.25000.52=0.2500 |
| 0.10.10.1 | 10 | 0.910=0.34870.9^{10}=0.34870.910=0.3487 |
| 0.010.010.01 | 100 | 0.99100=0.36600.99^{100}=0.36600.99100=0.3660 |
| 0.0010.0010.001 | 1000 | 0.9991000=0.36770.999^{1000}=0.36770.9991000=0.3677 |
| Δt→0\Delta t\to0Δt→0 | n→∞n\to\inftyn→∞ | e−1=0.367879e^{-1}=0.367879e−1=0.367879 |
所以当时间划分越来越细:
(1−Δt)1/Δt⟶e−1 (1-\Delta t)^{1/\Delta t}\longrightarrow e^{-1} (1−Δt)1/Δt⟶e−1
8. 从尾概率得到累积分布函数
现在已经得到:
P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt
它表示经过时间 ttt 还没有等到订单的概率。
那么在时间 ttt 以内等到订单的概率是:
P(T≤t)=1−P(T>t) P(T\le t)=1-P(T>t) P(T≤t)=1−P(T>t)
因此指数分布的累积分布函数为:
F(t)=P(T≤t)=1−e−λt F(t)=P(T\le t)=1-e^{-\lambda t} F(t)=P(T≤t)=1−e−λt
例如 λ=1\lambda=1λ=1 次/天:
P(T≤1)=1−e−1≈0.6321 P(T\le1)=1-e^{-1}\approx0.6321 P(T≤1)=1−e−1≈0.6321
即一天内等到订单的概率约为63.21%。
9. 从累积分布函数得到概率密度
概率密度是累积分布函数的导数:
f(t)=dF(t)dt f(t)=\frac{dF(t)}{dt} f(t)=dtdF(t)
因为:
F(t)=1−e−λt F(t)=1-e^{-\lambda t} F(t)=1−e−λt
所以:
f(t)=ddt(1−e−λt) f(t)=\frac{d}{dt}\left(1-e^{-\lambda t}\right) f(t)=dtd(1−e−λt)
利用:
ddte−λt=−λe−λt \frac{d}{dt}e^{-\lambda t}=-\lambda e^{-\lambda t} dtde−λt=−λe−λt
得到:
f(t)=λe−λt,t≥0 f(t)=\lambda e^{-\lambda t},\qquad t\ge0 f(t)=λe−λt,t≥0
这才是指数分布的概率密度函数。
因此需要区分:
| 类型 | 公式 |
|---|---|
| 尾概率 | P(T>t)=e−λtP(T>t)=e^{-\lambda t}P(T>t)=e−λt |
| 累积分布函数 | F(t)=1−e−λtF(t)=1-e^{-\lambda t}F(t)=1−e−λt |
| 概率密度函数 | f(t)=λe−λtf(t)=\lambda e^{-\lambda t}f(t)=λe−λt |
它们都含有指数函数,所以称为指数分布。
10. 也可以从微分方程推导
设:
S(t)=P(T>t) S(t)=P(T>t) S(t)=P(T>t)
表示等待超过 ttt 的概率。
如果经过时间 ttt 仍然没有订单,那么在接下来的 Δt\Delta tΔt 内仍然没有订单的概率约为:
1−λΔt 1-\lambda\Delta t 1−λΔt
因此:
S(t+Δt)=S(t)(1−λΔt) S(t+\Delta t)=S(t)(1-\lambda\Delta t) S(t+Δt)=S(t)(1−λΔt)
展开:
S(t+Δt)−S(t)=−λS(t)Δt S(t+\Delta t)-S(t)=-\lambda S(t)\Delta t S(t+Δt)−S(t)=−λS(t)Δt
两边除以 Δt\Delta tΔt:
S(t+Δt)−S(t)Δt=−λS(t) \frac{S(t+\Delta t)-S(t)}{\Delta t}=-\lambda S(t) ΔtS(t+Δt)−S(t)=−λS(t)
令 Δt→0\Delta t\to0Δt→0:
S′(t)=−λS(t) S'(t)=-\lambda S(t) S′(t)=−λS(t)
初始时刻肯定还没有等待超过负时间,因此:
S(0)=1 S(0)=1 S(0)=1
解这个微分方程:
S′(t)S(t)=−λ \frac{S'(t)}{S(t)}=-\lambda S(t)S′(t)=−λ
从时间 000 积分到时间 ttt:
∫0tS′(u)S(u) du=−λ∫0tdu \int_{0}^{t}\frac{S'(u)}{S(u)}\,du=-\lambda\int_{0}^{t}du ∫0tS(u)S′(u)du=−λ∫0tdu
因此:
lnS(t)−lnS(0)=−λt \ln S(t)-\ln S(0)=-\lambda t lnS(t)−lnS(0)=−λt
代入初始条件 S(0)=1S(0)=1S(0)=1:
lnS(t)=−λt \ln S(t)=-\lambda t lnS(t)=−λt
两边取指数:
S(t)=e−λt S(t)=e^{-\lambda t} S(t)=e−λt
所以:
P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt
从这个角度看,指数分布就是"概率以恒定比例衰减"的分布。
11. 为什么产生无记忆性
指数分布满足:
P(T>s+t∣T>s)=P(T>s+t)P(T>s) P(T>s+t \mid T>s)=\frac{P(T>s+t)}{P(T>s)} P(T>s+t∣T>s)=P(T>s)P(T>s+t)
代入尾概率:
P(T>s+t∣T>s)=e−λ(s+t)e−λs P(T>s+t \mid T>s)=\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}} P(T>s+t∣T>s)=e−λse−λ(s+t)
因为:
e−λ(s+t)=e−λse−λt e^{-\lambda(s+t)}=e^{-\lambda s}e^{-\lambda t} e−λ(s+t)=e−λse−λt
所以:
P(T>s+t∣T>s)=e−λt P(T>s+t \mid T>s)=e^{-\lambda t} P(T>s+t∣T>s)=e−λt
而:
P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt
因此:
P(T>s+t∣T>s)=P(T>t) P(T>s+t \mid T>s)=P(T>t) P(T>s+t∣T>s)=P(T>t)
这说明已经等待了 sss 时间,不会改变未来还需要等待多久的分布。
最核心的推导链条
小时间段发生概率:
p=λΔt p=\lambda\Delta t p=λΔt
小时间段不发生概率:
1−p=1−λΔt 1-p=1-\lambda\Delta t 1−p=1−λΔt
时间 ttt 包含的小段数:
n=tΔt n=\frac{t}{\Delta t} n=Δtt
经过时间 ttt 仍然没有事件的概率:
P(T>t)=limΔt→0(1−λΔt)t/Δt=e−λt P(T>t)=\lim_{\Delta t\to0}(1-\lambda\Delta t)^{t/\Delta t}=e^{-\lambda t} P(T>t)=Δt→0lim(1−λΔt)t/Δt=e−λt
因此指数分布的本质是:
大量极短、相互独立的时间段中,每一段都以与时间长度成正比的小概率发生事件;等待第一次事件的时间就服从指数分布。