泊松分布( X ∼ P o i s ( λ ) X\sim Pois(\lambda) X∼Pois(λ))
定义
若一个随机变量的概率质量函数( P M F PMF PMF)形如
P ( X = k ) = e − λ ⋅ λ k k ! ( k = 0 , 1 , ⋯ ) P(X=k)={e^{-\lambda}\cdot \lambda^k\over k!}(k=0,1,\cdots) P(X=k)=k!e−λ⋅λk(k=0,1,⋯)
则称 X X X服从参数为 λ \lambda λ的泊松分布,记为 X ∼ P o i s ( λ ) X\sim Pois(\lambda) X∼Pois(λ)。
- 由泰勒级数 ∑ k = 0 ∞ λ k k ! = e λ \sum_{k=0}^∞{\lambda^k\over k!}=e^{\lambda} ∑k=0∞k!λk=eλ可得上述 X X X的 P M F PMF PMF是有效的。
期望与方差
- 设 X ∼ P o i s ( λ ) X\sim Pois(\lambda) X∼Pois(λ)
- E ( X ) E(X) E(X):
E ( X ) = ∑ k = 0 ∞ k ⋅ e − λ ⋅ λ k k ! = ∑ k = 1 ∞ e − λ ⋅ λ k ( k − 1 ) ! = λ ⋅ ∑ k = 1 ∞ e − λ ⋅ λ k − 1 ( k − 1 ) ! = λ ⋅ e − λ ⋅ e λ = λ E(X)=\sum_{k=0}^∞ k\cdot {e^{-\lambda}\cdot \lambda^k\over k!}=\sum_{k=1}^∞{e^{-\lambda}\cdot \lambda^k\over (k-1)!}=\lambda\cdot\sum_{k=1}^∞{e^{-\lambda}\cdot \lambda^{k-1}\over (k-1)!}=\lambda\cdot e^{-\lambda}\cdot e^{\lambda}=\lambda E(X)=k=0∑∞k⋅k!e−λ⋅λk=k=1∑∞(k−1)!e−λ⋅λk=λ⋅k=1∑∞(k−1)!e−λ⋅λk−1=λ⋅e−λ⋅eλ=λ - V a r ( X ) Var(X) Var(X):
L O T U S → E ( X 2 ) = ∑ k = 0 ∞ k 2 ⋅ e − λ ⋅ λ k k ! = e − λ ⋅ ∑ k = 1 ∞ k 2 ⋅ λ k k ! (1) LOTUS\rightarrow E(X^2)=\sum_{k=0}^∞k^2\cdot {e^{-\lambda}\cdot \lambda^k\over k!}=e^{-\lambda}\cdot \sum_{k=1}^∞k^2\cdot {\lambda^k\over k!}\tag{1} LOTUS→E(X2)=k=0∑∞k2⋅k!e−λ⋅λk=e−λ⋅k=1∑∞k2⋅k!λk(1)
f ( λ ) = ∑ k = 0 ∞ λ k k ! = e λ → f ′ ( λ ) = ∑ k = 0 ∞ k ⋅ λ k − 1 k ! = e λ → g ( λ ) = ∑ k = 1 ∞ k ⋅ λ k k ! = λ ⋅ e λ f(\lambda)=\sum_{k=0}^∞{\lambda^k\over k!}=e^\lambda\rightarrow f'(\lambda)=\sum_{k=0}^∞k\cdot{\lambda^{k-1}\over k!}=e^{\lambda}\rightarrow g(\lambda)=\sum_{k=1}^∞k\cdot{\lambda^k\over k!}=\lambda\cdot e^{\lambda} f(λ)=k=0∑∞k!λk=eλ→f′(λ)=k=0∑∞k⋅k!λk−1=eλ→g(λ)=k=1∑∞k⋅k!λk=λ⋅eλ
→ g ′ ( λ ) = ∑ k = 1 ∞ k 2 ⋅ λ k − 1 k ! = ( 1 + λ ) ⋅ e λ → ∑ k = 1 ∞ k 2 ⋅ λ k k ! = λ ( 1 + λ ) e λ → ( 1 ) E ( X 2 ) = λ 2 + λ \rightarrow g'(\lambda)=\sum_{k=1}^∞k^2\cdot{\lambda^{k-1}\over k!}=(1+\lambda)\cdot e^{\lambda}\rightarrow \sum_{k=1}^∞k^2\cdot{\lambda^k\over k!}=\lambda(1+\lambda)e^\lambda\xrightarrow{(1)}E(X^2)=\lambda^2+\lambda →g′(λ)=k=1∑∞k2⋅k!λk−1=(1+λ)⋅eλ→k=1∑∞k2⋅k!λk=λ(1+λ)eλ(1) E(X2)=λ2+λ
V a r ( X ) = E ( X 2 ) − ( E ( X ) ) 2 = λ 2 + λ − λ 2 = λ Var(X)=E(X^2)-(E(X))^2=\lambda^2+\lambda-\lambda^2=\lambda Var(X)=E(X2)−(E(X))2=λ2+λ−λ2=λ
泊松范式
- 泊松分布被应用在一定区域或时间间隔内"成功"的数量,以及进行大量的实验 且成功概率很小 时,计算成功次数的情况。
E g Eg Eg:你在 1 h 1h 1h内收到的电子邮件数量。 1 h = 3.6 × 10 6 m s 1h=3.6×10^6ms 1h=3.6×106ms,若指定某一 m s ms ms,在该 m s ms ms收到邮件的概率比很低,但一个小时内可能会收到 10 10 10封邮件。
设 A 1 , A 2 , ⋯ , A n A_1,A_2,\cdots,A_n A1,A2,⋯,An为事件,其中 p j = P ( A j ) p_j=P(A_j) pj=P(Aj), p j p_j pj非常小, n n n非常大,并且 A j A_j Aj之间相互独立或者弱相关。设 X = ∑ j = 1 n I ( A j ) X=\sum_{j=1}^n I(A_j) X=∑j=1nI(Aj)表示 { A 1 , A 2 , ⋯ , A n } \{A_1,A_2,\cdots,A_n\} {A1,A2,⋯,An}中发生的事件数量,其中 I ( A j ) I(A_j) I(Aj)为事件 A j A_j Aj的示性随机变量,则 X X X近似服从参数为 λ = ∑ j = 1 n p j \lambda=\sum_{j=1}^np_j λ=∑j=1npj的泊松分布。
- 如果 A j A_j Aj之间是相互独立的, N ∼ P o i s ( λ ) N\sim Pois(\lambda) N∼Pois(λ),且 B B B是任意的非负整数集,则有
∣ P ( x ∈ B ) − P ( N ∈ B ) ∣ ≤ m i n ( 1 , 1 λ ) ∑ j = 1 n p j 2 |P(x\in B)-P(N\in B)|\leq min\left(1,{1\over\lambda}\right)\sum_{j=1}^np_j^2 ∣P(x∈B)−P(N∈B)∣≤min(1,λ1)j=1∑npj2 - 泊松范式给出了利用泊松分布去近似大量小概率事件时地误差上界。泊松分布不仅是对 X X X的 P M F PMF PMF的近似,也是对 X X X为任意集合的近似。此外该定理精确地指出, p j p_j pj应该有多小(我们希望 p j p_j pj尽可能地小或者相比于 λ \lambda λ非常小)。泊松范式也叫做稀有事件定律,其中的"稀有"指的是 p j p_j pj很小,并非指的是 λ \lambda λ很小。
泊松分布与二项分布之间的联系
- 如果 X ∼ P o i s ( λ 1 ) , Y ∼ P o i s ( λ 2 ) X\sim Pois(\lambda_1),Y\sim Pois(\lambda_2) X∼Pois(λ1),Y∼Pois(λ2)且 X X X和 Y Y Y相互独立,则有 X + Y ∼ P o i s ( λ 1 + λ 2 ) X+Y\sim Pois(\lambda_1+\lambda_2) X+Y∼Pois(λ1+λ2):
P ( X + Y = k ) = ∑ j = 0 k P ( X + Y = k ∣ X = j ) P ( X = j ) P(X+Y=k)=\sum_{j=0}^kP(X+Y=k|X=j)P(X=j) P(X+Y=k)=j=0∑kP(X+Y=k∣X=j)P(X=j)
= ∑ j = 0 k P ( X = j ) P ( Y = k − j ) =\sum_{j=0}^kP(X=j)P(Y=k-j) =j=0∑kP(X=j)P(Y=k−j)
= ∑ j = 0 k e − λ 1 ⋅ λ 1 j j ! ⋅ e − λ 2 ⋅ λ 2 k − j ( k − j ) ! =\sum_{j=0}^k{e^{-\lambda_1}\cdot\lambda_1^j\over j!}\cdot{e^{-\lambda_2}\cdot\lambda_2^{k-j}\over (k-j)!} =j=0∑kj!e−λ1⋅λ1j⋅(k−j)!e−λ2⋅λ2k−j
= e − ( λ 1 + λ 2 ) ⋅ ∑ j = 0 k λ 1 j j ! λ 2 k − j ( k − j ) ! =e^{-(\lambda_1+\lambda_2)}\cdot\sum_{j=0}^k{\lambda_1^j\over j!}{\lambda_2^{k-j}\over(k-j)!} =e−(λ1+λ2)⋅j=0∑kj!λ1j(k−j)!λ2k−j
= e − ( λ 1 + λ 2 ) k ! ⋅ ∑ j = 0 k ( k j ) ⋅ λ 1 j ⋅ λ 2 k − j ← ( k j ) = k ! ( k − j ) ! ⋅ j ! ={e^{-(\lambda_1+\lambda_2)}\over k!}\cdot\sum_{j=0}^k\left(\begin{matrix}k\\j\end{matrix}\right)\cdot \lambda_1^j\cdot\lambda_2^{k-j}\leftarrow \left(\begin{matrix}k\\j\end{matrix}\right)={k!\over (k-j)!\cdot j!} =k!e−(λ1+λ2)⋅j=0∑k(kj)⋅λ1j⋅λ2k−j←(kj)=(k−j)!⋅j!k!
= e − ( λ 1 + λ 2 ) ⋅ ( λ 1 + λ 2 ) k k ! ={e^{-(\lambda_1+\lambda_2)}\cdot (\lambda_1+\lambda_2)^k\over k!} =k!e−(λ1+λ2)⋅(λ1+λ2)k - 类似于二项分布( X ∼ B i n ( n , p ) X\sim Bin(n,p) X∼Bin(n,p))与超几何分布( X ∼ H G e o m ( w , b , n ) X\sim HGeom(w,b,n) X∼HGeom(w,b,n))之间的联系。可以通过条件作用将泊松分布转化为二项分布,也可以通过取极限使二项分布转化成泊松分布。
- 如果 X ∼ P o i s ( λ 1 ) X\sim Pois(\lambda_1) X∼Pois(λ1), Y ∼ P o i s ( λ 2 ) Y\sim Pois(\lambda_2) Y∼Pois(λ2)且 X X X和 Y Y Y相互独立,则给定条件 X + Y = n X+Y=n X+Y=n的条件下, X X X的条件分布为 X ∼ B i n ( n , λ 1 λ 1 + λ 2 ) X\sim Bin(n,{\lambda_1\over\lambda_1+\lambda_2}) X∼Bin(n,λ1+λ2λ1)。
- 如果 X ∼ B i n ( n , p ) X\sim Bin(n,p) X∼Bin(n,p),并令 n → ∞ , p → 0 n\rightarrow ∞,p\rightarrow 0 n→∞,p→0,使得 λ = n p \lambda=np λ=np固定,则 X X X的概率质量函数收敛于 P o i s ( λ ) Pois(\lambda) Pois(λ)的概率质量函数。更一般地,如果 n → ∞ , p → 0 n\rightarrow ∞,p\rightarrow 0 n→∞,p→0,使得 n p → λ np\rightarrow \lambda np→λ,则有相同的结论成立。