指数分布的完整推导

下面从"每个很短时间段内都有一个很小的到达概率"开始,把指数分布完整推导出来。

1. 先把连续时间切成小段

设订单平均到达速率是:

λ次/单位时间 \lambda\quad \text{次/单位时间} λ次/单位时间

例如:

λ=2 次/天 \lambda=2\text{ 次/天} λ=2 次/天

表示平均每天2笔订单。

把一天切成长度为 Δt\Delta tΔt 的小时间段。在一个足够短的时间段内,订单到达概率近似为:

p=λΔt p=\lambda\Delta t p=λΔt

所以没有订单到达的概率是:

1−p=1−λΔt 1-p=1-\lambda\Delta t 1−p=1−λΔt

注意,λ\lambdaλ 是"速率",单位是:

1时间 \frac{1}{\text{时间}} 时间1

而 λΔt\lambda\Delta tλΔt 才是没有单位的概率。


2. 为什么一定要令 p=λΔtp=\lambda\Delta tp=λΔt

假如把时间段缩短,而每个时间段的到达概率 ppp 仍然保持不变,那么单位时间内的小时间段数量将趋于无穷。

例如,每个小时间段都有1%的订单概率:

  • 每小时分成60段,得到60次机会;
  • 每小时分成3600段,得到3600次机会;
  • 当 Δt→0\Delta t\to0Δt→0 时,单位时间内将有无穷多次机会。

这会导致事件立即发生,甚至形成无限到达率。

所以,当时间段缩短时,每段发生概率必须按比例缩小:

p=λΔt p=\lambda\Delta t p=λΔt

这样无论怎样划分时间,单位时间的平均到达次数仍然保持为 λ\lambdaλ。

更严格地可以写成:

p(Δt)=λΔt+o(Δt) p(\Delta t)=\lambda\Delta t+o(\Delta t) p(Δt)=λΔt+o(Δt)

其中 o(Δt)o(\Delta t)o(Δt) 表示比 Δt\Delta tΔt 更快趋近于0的高阶小量。


3. 时间 ttt 可以分成多少个小段

每一小段长度为 Δt\Delta tΔt,总时间为 ttt,所以小段数量为:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

暂时假设 t/Δtt/\Delta tt/Δt 是整数。

例如:

  • 总时间 t=1t=1t=1 天;
  • 每段 Δt=0.01\Delta t=0.01Δt=0.01 天;
  • 一共有 n=100n=100n=100 个小时间段。

4. 连续多个时间段都没有订单

假设不同小时间段内是否有订单相互独立。

单个时间段没有订单的概率是:

1−λΔt 1-\lambda\Delta t 1−λΔt

连续两个时间段都没有订单的概率是:

(1−λΔt)2 (1-\lambda\Delta t)^2 (1−λΔt)2

连续 nnn 个时间段都没有订单的概率是:

(1−λΔt)n (1-\lambda\Delta t)^n (1−λΔt)n

因为:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

所以经过时间 ttt 仍然没有订单的概率为:

P(T>t)=(1−λΔt)t/Δt P(T>t)=(1-\lambda\Delta t)^{t/\Delta t} P(T>t)=(1−λΔt)t/Δt

这里 TTT 表示等待下一笔订单的时间。

"T>tT>tT>t"表示等待时间超过了 ttt,也就是时间 ttt 内仍然没有订单。


5. 令时间间隔趋近于0

现在让:

Δt→0 \Delta t\to0 Δt→0

得到:

P(T>t)=lim⁡Δt→0(1−λΔt)t/Δt P(T>t)=\lim_{\Delta t\to0}(1-\lambda\Delta t)^{t/\Delta t} P(T>t)=Δt→0lim(1−λΔt)t/Δt

为了计算这个极限,令:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

则:

Δt=tn \Delta t=\frac{t}{n} Δt=nt

当 Δt→0\Delta t\to0Δt→0 时:

n→∞ n\to\infty n→∞

代入原式:

P(T>t)=lim⁡n→∞(1−λtn)n P(T>t)=\lim_{n\to\infty}\left(1-\lambda\frac{t}{n}\right)^n P(T>t)=n→∞lim(1−λnt)n

即:

P(T>t)=lim⁡n→∞(1−λtn)n P(T>t)=\lim_{n\to\infty}\left(1-\frac{\lambda t}{n}\right)^n P(T>t)=n→∞lim(1−nλt)n

使用指数函数的基本极限:

lim⁡n→∞(1+xn)n=ex \lim_{n\to\infty}\left(1+\frac{x}{n}\right)^n=e^x n→∞lim(1+nx)n=ex

令:

x=−λt x=-\lambda t x=−λt

于是:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

这就是指数分布的尾概率,也叫生存函数。


6. 用对数进一步证明这个极限

设:

Ln=(1−λtn)n L_n=\left(1-\frac{\lambda t}{n}\right)^n Ln=(1−nλt)n

两边取自然对数:

ln⁡Ln=nln⁡(1−λtn) \ln L_n=n\ln\left(1-\frac{\lambda t}{n}\right) lnLn=nln(1−nλt)

使用泰勒展开:

ln⁡(1−u)=−u−u22−u33−⋯ \ln(1-u)=-u-\frac{u^2}{2}-\frac{u^3}{3}-\cdots ln(1−u)=−u−2u2−3u3−⋯

令:

u=λtn u=\frac{\lambda t}{n} u=nλt

则:

ln⁡Ln=n−λtn−(λt)22n2−(λt)33n3−⋯  \ln L_n=n\left-\\frac{\\lambda t}{n}-\\frac{(\\lambda t)\^2}{2n\^2}-\\frac{(\\lambda t)\^3}{3n\^3}-\\cdots\\right lnLn=n−nλt−2n2(λt)2−3n3(λt)3−⋯

把 nnn 乘进去:

ln⁡Ln=−λt−(λt)22n−(λt)33n2−⋯ \ln L_n=-\lambda t-\frac{(\lambda t)^2}{2n}-\frac{(\lambda t)^3}{3n^2}-\cdots lnLn=−λt−2n(λt)2−3n2(λt)3−⋯

当 n→∞n\to\inftyn→∞ 时,后面的项全部趋近于0:

lim⁡n→∞ln⁡Ln=−λt \lim_{n\to\infty}\ln L_n=-\lambda t n→∞limlnLn=−λt

因此:

lim⁡n→∞Ln=e−λt \lim_{n\to\infty}L_n=e^{-\lambda t} n→∞limLn=e−λt

即:

lim⁡n→∞(1−λtn)n=e−λt \lim_{n\to\infty}\left(1-\frac{\lambda t}{n}\right)^n=e^{-\lambda t} n→∞lim(1−nλt)n=e−λt


7. 数值上怎样逼近 e−1e^{-1}e−1

令:

λ=1 次/天,t=1 天 \lambda=1\text{ 次/天},\qquad t=1\text{ 天} λ=1 次/天,t=1 天

那么:

P(T>1)=lim⁡Δt→0(1−Δt)1/Δt P(T>1)=\lim_{\Delta t\to0}(1-\Delta t)^{1/\Delta t} P(T>1)=Δt→0lim(1−Δt)1/Δt

不同时间划分得到:

Δt\Delta tΔt 时间段数量 一天没有订单的概率
0.50.50.5 2 0.52=0.25000.5^2=0.25000.52=0.2500
0.10.10.1 10 0.910=0.34870.9^{10}=0.34870.910=0.3487
0.010.010.01 100 0.99100=0.36600.99^{100}=0.36600.99100=0.3660
0.0010.0010.001 1000 0.9991000=0.36770.999^{1000}=0.36770.9991000=0.3677
Δt→0\Delta t\to0Δt→0 n→∞n\to\inftyn→∞ e−1=0.367879e^{-1}=0.367879e−1=0.367879

所以当时间划分越来越细:

(1−Δt)1/Δt⟶e−1 (1-\Delta t)^{1/\Delta t}\longrightarrow e^{-1} (1−Δt)1/Δt⟶e−1


8. 从尾概率得到累积分布函数

现在已经得到:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

它表示经过时间 ttt 还没有等到订单的概率。

那么在时间 ttt 以内等到订单的概率是:

P(T≤t)=1−P(T>t) P(T\le t)=1-P(T>t) P(T≤t)=1−P(T>t)

因此指数分布的累积分布函数为:

F(t)=P(T≤t)=1−e−λt F(t)=P(T\le t)=1-e^{-\lambda t} F(t)=P(T≤t)=1−e−λt

例如 λ=1\lambda=1λ=1 次/天:

P(T≤1)=1−e−1≈0.6321 P(T\le1)=1-e^{-1}\approx0.6321 P(T≤1)=1−e−1≈0.6321

即一天内等到订单的概率约为63.21%。


9. 从累积分布函数得到概率密度

概率密度是累积分布函数的导数:

f(t)=dF(t)dt f(t)=\frac{dF(t)}{dt} f(t)=dtdF(t)

因为:

F(t)=1−e−λt F(t)=1-e^{-\lambda t} F(t)=1−e−λt

所以:

f(t)=ddt(1−e−λt) f(t)=\frac{d}{dt}\left(1-e^{-\lambda t}\right) f(t)=dtd(1−e−λt)

利用:

ddte−λt=−λe−λt \frac{d}{dt}e^{-\lambda t}=-\lambda e^{-\lambda t} dtde−λt=−λe−λt

得到:

f(t)=λe−λt,t≥0 f(t)=\lambda e^{-\lambda t},\qquad t\ge0 f(t)=λe−λt,t≥0

这才是指数分布的概率密度函数。

因此需要区分:

类型 公式
尾概率 P(T>t)=e−λtP(T>t)=e^{-\lambda t}P(T>t)=e−λt
累积分布函数 F(t)=1−e−λtF(t)=1-e^{-\lambda t}F(t)=1−e−λt
概率密度函数 f(t)=λe−λtf(t)=\lambda e^{-\lambda t}f(t)=λe−λt

它们都含有指数函数,所以称为指数分布。


10. 也可以从微分方程推导

设:

S(t)=P(T>t) S(t)=P(T>t) S(t)=P(T>t)

表示等待超过 ttt 的概率。

如果经过时间 ttt 仍然没有订单,那么在接下来的 Δt\Delta tΔt 内仍然没有订单的概率约为:

1−λΔt 1-\lambda\Delta t 1−λΔt

因此:

S(t+Δt)=S(t)(1−λΔt) S(t+\Delta t)=S(t)(1-\lambda\Delta t) S(t+Δt)=S(t)(1−λΔt)

展开:

S(t+Δt)−S(t)=−λS(t)Δt S(t+\Delta t)-S(t)=-\lambda S(t)\Delta t S(t+Δt)−S(t)=−λS(t)Δt

两边除以 Δt\Delta tΔt:

S(t+Δt)−S(t)Δt=−λS(t) \frac{S(t+\Delta t)-S(t)}{\Delta t}=-\lambda S(t) ΔtS(t+Δt)−S(t)=−λS(t)

令 Δt→0\Delta t\to0Δt→0:

S′(t)=−λS(t) S'(t)=-\lambda S(t) S′(t)=−λS(t)

初始时刻肯定还没有等待超过负时间,因此:

S(0)=1 S(0)=1 S(0)=1

解这个微分方程:

S′(t)S(t)=−λ \frac{S'(t)}{S(t)}=-\lambda S(t)S′(t)=−λ

从时间 000 积分到时间 ttt:

∫0tS′(u)S(u) du=−λ∫0tdu \int_{0}^{t}\frac{S'(u)}{S(u)}\,du=-\lambda\int_{0}^{t}du ∫0tS(u)S′(u)du=−λ∫0tdu

因此:

ln⁡S(t)−ln⁡S(0)=−λt \ln S(t)-\ln S(0)=-\lambda t lnS(t)−lnS(0)=−λt

代入初始条件 S(0)=1S(0)=1S(0)=1:

ln⁡S(t)=−λt \ln S(t)=-\lambda t lnS(t)=−λt

两边取指数:

S(t)=e−λt S(t)=e^{-\lambda t} S(t)=e−λt

所以:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

从这个角度看,指数分布就是"概率以恒定比例衰减"的分布。


11. 为什么产生无记忆性

指数分布满足:

P(T>s+t∣T>s)=P(T>s+t)P(T>s) P(T>s+t \mid T>s)=\frac{P(T>s+t)}{P(T>s)} P(T>s+t∣T>s)=P(T>s)P(T>s+t)

代入尾概率:

P(T>s+t∣T>s)=e−λ(s+t)e−λs P(T>s+t \mid T>s)=\frac{e^{-\lambda(s+t)}}{e^{-\lambda s}} P(T>s+t∣T>s)=e−λse−λ(s+t)

因为:

e−λ(s+t)=e−λse−λt e^{-\lambda(s+t)}=e^{-\lambda s}e^{-\lambda t} e−λ(s+t)=e−λse−λt

所以:

P(T>s+t∣T>s)=e−λt P(T>s+t \mid T>s)=e^{-\lambda t} P(T>s+t∣T>s)=e−λt

而:

P(T>t)=e−λt P(T>t)=e^{-\lambda t} P(T>t)=e−λt

因此:

P(T>s+t∣T>s)=P(T>t) P(T>s+t \mid T>s)=P(T>t) P(T>s+t∣T>s)=P(T>t)

这说明已经等待了 sss 时间,不会改变未来还需要等待多久的分布。


最核心的推导链条

小时间段发生概率:

p=λΔt p=\lambda\Delta t p=λΔt

小时间段不发生概率:

1−p=1−λΔt 1-p=1-\lambda\Delta t 1−p=1−λΔt

时间 ttt 包含的小段数:

n=tΔt n=\frac{t}{\Delta t} n=Δtt

经过时间 ttt 仍然没有事件的概率:

P(T>t)=lim⁡Δt→0(1−λΔt)t/Δt=e−λt P(T>t)=\lim_{\Delta t\to0}(1-\lambda\Delta t)^{t/\Delta t}=e^{-\lambda t} P(T>t)=Δt→0lim(1−λΔt)t/Δt=e−λt

因此指数分布的本质是:

大量极短、相互独立的时间段中,每一段都以与时间长度成正比的小概率发生事件;等待第一次事件的时间就服从指数分布。

相关推荐
逻辑君14 小时前
ANNA 7.2 方块机器人实验技术报告
人工智能·深度学习·机器学习·机器人
SomeB1oody14 小时前
【RustyML入门】2.9. MeanShift
开发语言·后端·机器学习·rust·教程
WHS-_-202218 小时前
基于网络感知自适应树与辅助路由加速地理分布式机器学习
网络·分布式·机器学习
databook19 小时前
用递归消除法优化“特征子集”
python·机器学习·scikit-learn
liulilittle19 小时前
归一化:激活函数
人工智能·算法·机器学习·llm
过期的秋刀鱼!20 小时前
倾斜数据集的错误指标-混淆矩阵
人工智能·python·深度学习·机器学习·概率论·模型评估
大鹏的NLP博客20 小时前
大模型 Tokenizer:从字符到 Byte,再到大词表
深度学习·机器学习·大模型·分词
硅谷秋水1 天前
WAM-Nav:用于统一视觉导航的非对称潜世界动作建模
深度学习·机器学习·计算机视觉·语言模型·机器人
别动我齐刘海1 天前
“三层同步审计”判定掉帧缺失
c语言·c++·人工智能·深度学习·学习·机器学习·机器人
wuyk5551 天前
第1章:无刷电机核心原理与运行机制
c语言·开发语言·stm32·单片机·嵌入式硬件·机器学习