f ( x ) = { 1 b − a , a < x < b 0 , 其他 f(x) = \begin{cases} \frac{1}{b-a} & ,a \lt x \lt b \\ 0 &, \text{其他} \end{cases} f(x)={b−a10,a<x<b,其他
则称 X X X在区间 ( a , b ) (a,b) (a,b)上服从均匀分布 , 记为 X ∼ U ( a , b ) X \sim U(a,b) X∼U(a,b)
对任意长度为 l l l 的子区间 ( c , c + l ) (c,c + l) (c,c+l), a ≤ c < c + l ≤ b a \le c \lt c + l \le b a≤c<c+l≤b,有
P { c < X ≤ c + l } = ∫ c c + l 1 b − a d x = l b − 1 P \{c \lt X \le c + l \} = \int_c^{c + l}\frac{1}{b-a} dx = \frac{l}{b-1} P{c<X≤c+l}=∫cc+lb−a1dx=b−1l
这表明随机变量 X X X落在区间 ( a , b ) (a,b) (a,b)中任意等长子区间内的概率只依赖与子区间的长度而与其位置无关。因为其概率密度在区间内不变
由均匀分布的概率密度函数可得均匀分布的分布函数为
F ( x ) = { 0 , x < a x − a b − a , a ≤ x < b 1 , x ≥ b F(x) = \begin{cases} 0 & ,x \lt a \\ \frac{x - a}{b-a} &,a \le x \lt b \\ 1 &, x \ge b \end{cases} F(x)=⎩ ⎨ ⎧0b−ax−a1,x<a,a≤x<b,x≥b
其概率密度函数和分布函数的图形如下
由期望和方差的定义
E ( X ) = ∫ − ∞ + ∞ x f ( x ) d x = ∫ a b x b − a d x = a + b 2 D ( X ) = E ( X 2 ) − E ( X ) 2 = ∫ a b x 2 b − a d x − ( a + b 2 ) 2 = ( b − a ) 2 12 \begin{align} &E(X) = \int_{-\infty}^{+\infty} xf(x)dx = \int_{a}^{b} \frac{x}{b - a} dx = \frac{a + b}{2} \\ &D(X) = E(X^2) - E(X)^2 = \int_{a}^{b} \frac{x^2}{b - a} dx - (\frac{a + b}{2})^2 = \frac{(b - a)^2}{12} \end{align} E(X)=∫−∞+∞xf(x)dx=∫abb−axdx=2a+bD(X)=E(X2)−E(X)2=∫abb−ax2dx−(2a+b)2=12(b−a)2
2.2 指数分布 E ( λ ) E(\lambda) E(λ)
若连续型随机变量 X X X具有概率密度
f ( x ) = { λ e − λ x , x > 0 0 , 其他 f(x) = \begin{cases} \lambda e^{-\lambda x} &, x \gt 0 \\ 0 &,其他 \end{cases} f(x)={λe−λx0,x>0,其他
其中, λ > 0 \lambda \gt 0 λ>0为常数,则称 X X X 服从参数为 λ \lambda λ的指数分布 ,记作 X ∼ E ( λ ) X \sim E(\lambda) X∼E(λ)
由指数分布的概率密度函数可得指数分布的分布函数为
F ( x ) = { 1 − e − λ x , x ≥ 0 0 , 其他 F(x) = \begin{cases} 1 - e^{-\lambda x} & ,x \ge 0 \\ 0 &, 其他 \end{cases} F(x)={1−e−λx0,x≥0,其他
其概率密度函数和分布函数的图形如下
指数分布的性质(无记忆性 ): 对 任意 s , t > 0 s, t > 0 s,t>0,有
P { X > s + t ∣ X > s } = P { X > t } P\{X > s + t | X > s\} = P\{X > t \} P{X>s+t∣X>s}=P{X>t}
因为
P { X > s + t ∣ X > s } = P { ( X > s + t ) ∩ ( X > s ) } P { X > s } = P { ( X > s + t ) } P { X > s } = 1 − F ( s + t ) } 1 − F ( s ) = e − λ ( s + t ) e − λ ( s ) = e − λ ( t ) = P { X > t } \begin{align} P\{X > s + t | X > s\} &= \frac{P\{(X > s + t) \cap (X > s)\}}{P\{X > s \}} \\ &= \frac{P\{(X > s + t)\}}{P\{X > s \}} \\ &= \frac{1 - F(s + t)\}}{1 - F(s)} \\ &= \frac{e^{-\lambda (s + t)}}{e^{-\lambda (s)}} = e^{-\lambda (t)} \\ &= P\{X > t\} \end{align} P{X>s+t∣X>s}=P{X>s}P{(X>s+t)∩(X>s)}=P{X>s}P{(X>s+t)}=1−F(s)1−F(s+t)}=e−λ(s)e−λ(s+t)=e−λ(t)=P{X>t}
比如说在理想情况下,"等待地铁到站"和 "元件失效"这两类模型都具备无记忆性且能应用指数分布
由期望和方差的定义
E ( X ) = ∫ − ∞ + ∞ x f ( x ) d x = ∫ 0 + ∞ λ x e − λ x d x = 1 λ D ( X ) = E ( X 2 ) − E ( X ) 2 = ∫ 0 + ∞ λ x 2 e − λ x d x − 1 λ 2 = 1 λ 2 \begin{align} &E(X) = \int_{-\infty}^{+\infty} xf(x)dx = \int_{0}^{+\infty} \lambda x e^{-\lambda x}dx = \frac{1}{\lambda} \\ &D(X) = E(X^2) - E(X)^2= \int_{0}^{+\infty} \lambda x^2 e^{-\lambda x}dx - \frac{1}{\lambda^2} = \frac{1}{\lambda^2} \end{align} E(X)=∫−∞+∞xf(x)dx=∫0+∞λxe−λxdx=λ1D(X)=E(X2)−E(X)2=∫0+∞λx2e−λxdx−λ21=λ21
2.3 正态分布 N ( μ , σ 2 ) N(\mu , \sigma^2) N(μ,σ2)
若连续型随机变量 X X X具有概率密度
f ( x ) = 1 2 π σ e − ( x − μ ) 2 2 σ 2 ( − ∞ < x < + ∞ ) f(x) = \frac{1}{\sqrt{2 \pi} \sigma}e^{- \frac{(x - \mu)^2}{2\sigma^2}} \; (-\infty \lt x \lt +\infty) f(x)=2π σ1e−2σ2(x−μ)2(−∞<x<+∞)
其中 μ , σ ( σ > 0 ) \mu, \sigma (\sigma \gt 0) μ,σ(σ>0)为常数,则称 X X X服从参数为 μ , σ \mu , \sigma μ,σ的正态分布 或高斯(Gauss)分布 ,记为 X ∼ N ( μ , σ 2 ) X \sim N(\mu,\sigma^2) X∼N(μ,σ2)
正态分布的概率密度有如下性质
f ( x ) f(x) f(x)关于 x = μ x = \mu x=μ对称,这表明对任意 h > 0 h > 0 h>0 有
f ( μ + x ) = f ( μ − x ) f(\mu + x) = f(\mu -x) f(μ+x)=f(μ−x)
P { μ − h < X ≤ μ } = P { μ < X ≤ μ + h } P\{\mu - h \lt X \le \mu \} = P\{\mu \lt X \le \mu + h \} P{μ−h<X≤μ}=P{μ<X≤μ+h}
当 x = μ x = \mu x=μ时取得最大值 f ( μ ) = 1 2 π f(\mu) = \frac{1}{\sqrt{2 \pi}} f(μ)=2π 1
f ( x ) f(x) f(x)的拐点为 x = μ ± σ x = \mu \pm \sigma x=μ±σ,且其渐进线为 x x x轴
另外,如果固定 σ \sigma σ,改变 μ \mu μ 的值,则图形沿着 O x Ox Ox 轴平移,而不改变其形状可见正态分布的概率密度曲线 y = f ( x ) y = f(x) y=f(x) 的位置完全由参数 μ \mu μ 所确定。
μ \mu μ 称为位置参数。 如果固定 μ \mu μ,改变 σ \sigma σ,由于最大值 f ( μ ) = 1 2 π σ f(\mu) = \frac{1}{\sqrt{2\pi}\sigma} f(μ)=2π σ1,可知当 σ \sigma σ 越小时图形变得越尖(如下图所示),因而 X X X 落在 μ \mu μ 附近的概率越大。
标准正态分布
当 μ = 0 , σ = 1 \mu=0, \sigma=1 μ=0,σ=1 时称随机变量 X X X 服从标准正态分布。
其概率密度和分布函数分别用 φ ( x ) , Φ ( x ) \varphi(x), \Phi(x) φ(x),Φ(x) 表示,即有
φ ( x ) = 1 2 π e − x 2 / 2 Φ ( x ) = 1 2 π ∫ − ∞ x e − t 2 / 2 d t \begin{align} &\varphi(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2} \\ &\Phi(x) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^x e^{-t^2/2} dt \end{align} φ(x)=2π 1e−x2/2Φ(x)=2π 1∫−∞xe−t2/2dt
易知 Φ ( − x ) = 1 − Φ ( x ) \Phi(-x) = 1 - \Phi(x) Φ(−x)=1−Φ(x)
若 X ∼ N ( μ , σ 2 ) X \sim N(\mu,\sigma ^2) X∼N(μ,σ2),只需要通过一个线性变换就能把它转换为标准正态分布
见正态分布的性质部分
设 X ∼ N ( μ , σ 2 ) X \sim N(\mu, \sigma^2) X∼N(μ,σ2),由 Φ ( x ) \Phi(x) Φ(x) 的函数表可得
设随机变量 X ∼ N ( μ , σ 2 ) X \sim N(\mu,\sigma^2) X∼N(μ,σ2),由标准正态分布的期望和方差可以推导其期望和方差
设标准正态分布 Z ∼ N ( 0 , 1 ) Z \sim N(0,1) Z∼N(0,1),则由期望和方差定义
E ( Z ) = ∫ − ∞ + ∞ t ϕ ( t ) d t = 1 2 π ∫ − ∞ + ∞ t e − t 2 2 d t = 0 D ( Z ) = E ( Z 2 ) − E ( Z ) 2 = ∫ − ∞ + ∞ t 2 ϕ ( t ) d t = 1 2 π ∫ − ∞ + ∞ t 2 e − t 2 2 d t = 1 \begin{align} &E(Z) = \int_{-\infty}^{+\infty} t\phi(t)dt = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{+\infty} t e^{-\frac{t^2}{2}}dt = 0 \\ &D(Z) = E(Z^2) - E(Z)^2 = \int_{-\infty}^{+\infty} t^2\phi(t)dt = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^{+\infty} t^2 e^{-\frac{t^2}{2}}dt = 1 \end{align} E(Z)=∫−∞+∞tϕ(t)dt=2π 1∫−∞+∞te−2t2dt=0D(Z)=E(Z2)−E(Z)2=∫−∞+∞t2ϕ(t)dt=2π 1∫−∞+∞t2e−2t2dt=1
又因为 X = σ Z + μ X = \sigma Z + \mu X=σZ+μ,所以
E ( X ) = E ( σ Z + μ ) = μ D ( X ) = D ( σ Z + μ ) = σ 2 ⋅ D ( Z ) = σ 2 \begin{align} &E(X) = E(\sigma Z + \mu) = \mu \\ &D(X) = D(\sigma Z + \mu) = \sigma^2 \cdot D(Z) = \sigma^2 \end{align} E(X)=E(σZ+μ)=μD(X)=D(σZ+μ)=σ2⋅D(Z)=σ2
故正态分布的期望和方差分别为 E ( X ) = μ , D ( X ) = σ 2 E(X) = \mu, D(X) = \sigma^2 E(X)=μ,D(X)=σ2
正态分布的性质
1.线性变换封闭性 :若随机变量 X ∼ N ( μ , σ 2 ) X \sim N(\mu, \sigma^2) X∼N(μ,σ2),则 X X X 的线性函数 Y = a X + b Y = aX + b Y=aX+b ( a ≠ 0 a \neq 0 a=0) 也服从正态分布
证 X X X 的概率密度为
f X ( x ) = 1 2 π σ 2 e − ( x − μ ) 2 2 σ 2 , − ∞ < x < ∞ . f_X(x) = \frac{1}{\sqrt{2\pi\sigma^2}} e^{-\frac{(x-\mu)^2}{2\sigma^2}}, \quad -\infty < x < \infty. fX(x)=2πσ2 1e−2σ2(x−μ)2,−∞<x<∞.
又 y = g ( x ) = a X + b y = g(x) = aX + b y=g(x)=aX+b,由这一式子解得 x = h ( y ) = y − b a x = h(y) = \frac{y - b}{a} x=h(y)=ay−b,且 h ′ ( y ) = 1 a h'(y) = \frac{1}{a} h′(y)=a1
因此 Y = a X + b Y = aX + b Y=aX+b 的概率密度为
f Y ( y ) = 1 ∣ a ∣ f X ( y − b a ) = 1 ∣ a ∣ 1 2 π σ 2 e − ( y − b a − μ ) 2 2 σ 2 = 1 2 π ∣ a ∣ σ e − ( y − ( a μ + b ) ) 2 2 ( a σ ) 2 \begin{align} f_Y(y) &= \frac{1}{|a|} f_X\left(\frac{y - b}{a}\right) \\ &=\frac{1}{|a|} \frac{1}{\sqrt{2\pi\sigma^2}} e^{-\frac{\left(\frac{y-b}{a}-\mu\right)^2}{2\sigma^2}} \\ &= \frac{1}{\sqrt{2\pi} |a| \sigma} e^{-\frac{(y - (a\mu+b))^2}{2(a\sigma)^2}} \end{align} fY(y)=∣a∣1fX(ay−b)=∣a∣12πσ2 1e−2σ2(ay−b−μ)2=2π ∣a∣σ1e−2(aσ)2(y−(aμ+b))2
即 Y = a X + b ∼ N ( a μ + b , ( a σ ) 2 ) Y = aX + b \sim N(a\mu + b, (a\sigma)^2) Y=aX+b∼N(aμ+b,(aσ)2)
特别地,若 a = 1 σ , b = − μ σ a = \frac{1}{\sigma}, b = -\frac{\mu}{\sigma} a=σ1,b=−σμ 得 Y = X − μ σ ∼ N ( 0 , 1 ) Y = \frac{X - \mu}{\sigma} \sim N(0, 1) Y=σX−μ∼N(0,1)
2.独立可加性 :若 X i ∼ N ( μ i , σ i 2 ) X_i \sim N(\mu_i, \sigma_i^2) Xi∼N(μi,σi2), i = 1 , 2 , ⋯ , n i = 1, 2, \cdots, n i=1,2,⋯,n,且它们相互独立,则它们的线性组合 C 1 X 1 + C 2 X 2 + ⋯ + C n X n C_1 X_1 + C_2 X_2 + \cdots + C_n X_n C1X1+C2X2+⋯+CnXn( C 1 , C 2 , ⋯ , C n C_1, C_2, \cdots, C_n C1,C2,⋯,Cn是不全为 0 的常数)仍然服从正态分布,于是由数学期望和方差的性质知道
C 1 X 1 + C 2 X 2 + ⋯ + C n X n ∼ N ( ∑ i = 1 n C i μ i , ∑ i = 1 n C i 2 σ i 2 ) C_1 X_1 + C_2 X_2 + \cdots + C_n X_n \sim N\left(\sum_{i=1}^n C_i \mu_i, \sum_{i=1}^n C_i^2 \sigma_i^2\right) C1X1+C2X2+⋯+CnXn∼N(i=1∑nCiμi,i=1∑nCi2σi2)
F ( x ) = P { X ≤ x } = Φ ( x − μ σ ) F(x) = P\{X \le x \} = \Phi(\frac{x - \mu}{\sigma}) F(x)=P{X≤x}=Φ(σx−μ)
4.若 X ∼ N ( μ , σ 2 ) X \sim N(\mu, \sigma^2) X∼N(μ,σ2),则 P { μ − k σ ≤ X ≤ μ + k σ } = 2 Φ ( k ) − 1 , k > 0 P\{\mu - k \sigma \le X \le \mu + k\sigma \} = 2\Phi(k) - 1\quad ,k \gt 0 P{μ−kσ≤X≤μ+kσ}=2Φ(k)−1,k>0
f X ( x ) = ∫ − ∞ + ∞ f ( x , y ) d y = 1 2 π σ 1 e ( x − μ 1 ) 2 2 σ 1 2 , − ∞ < x < + ∞ f_X(x) = \int_{-\infty}^{+\infty} f(x,y) dy = \frac{1}{\sqrt{2\pi}\sigma_1} e^{\frac{(x - \mu_1)^2}{2\sigma_1^2}} \quad ,-\infty \lt x \lt +\infty fX(x)=∫−∞+∞f(x,y)dy=2π σ11e2σ12(x−μ1)2,−∞<x<+∞
∫ − ∞ + ∞ f ( x , y ) d y = 1 2 π σ 1 σ 2 1 − ρ 2 e − ( x − μ 1 ) 2 2 σ 1 2 ⋅ ∫ − ∞ + ∞ e − 1 2 ( 1 − ρ 2 ) ( y − μ 2 σ 2 − ρ x − μ 1 σ 1 ) 2 d y \int_{-\infty}^{+\infty} f(x,y) dy = \frac{1}{2\pi\sigma_1\sigma_2\sqrt{1-\rho^2}}e ^{-\frac{(x - \mu_1)^2}{2\sigma_1^2}} \cdot \int_{-\infty}^{+\infty} e^{-\frac{1}{2(1-\rho^2)}(\frac{y- \mu_2}{\sigma_2} - \rho \frac{ x - \mu_1}{\sigma1})^2} dy ∫−∞+∞f(x,y)dy=2πσ1σ21−ρ2 1e−2σ12(x−μ1)2⋅∫−∞+∞e−2(1−ρ2)1(σ2y−μ2−ρσ1x−μ1)2dy
令 t = 1 1 − ρ 2 ( y − μ 2 σ 2 − ρ x − μ 1 σ 1 ) t = \frac{1}{\sqrt{1-\rho^2}}(\frac{y- \mu_2}{\sigma_2} - \rho \frac{ x - \mu_1}{\sigma1}) t=1−ρ2 1(σ2y−μ2−ρσ1x−μ1)
则有
∫ − ∞ + ∞ f ( x , y ) d y = 1 2 π σ 1 e − ( x − μ 1 σ 1 ) 2 ⋅ ∫ − ∞ + ∞ e − t 2 2 d t = 1 2 π σ 1 e ( x − μ 1 ) 2 2 σ 1 2 \int_{-\infty}^{+\infty} f(x,y) dy = \frac{1}{2\pi\sigma_1}e^{-(\frac{x-\mu_1}{\sigma_1})^2} \cdot \int_{-\infty}^{+\infty} e^{-\frac{t^2}{2}} dt = \frac{1}{\sqrt{2\pi}\sigma_1} e^{\frac{(x - \mu_1)^2}{2\sigma_1^2}} ∫−∞+∞f(x,y)dy=2πσ11e−(σ1x−μ1)2⋅∫−∞+∞e−2t2dt=2π σ11e2σ12(x−μ1)2
ρ \rho ρ 的含义
二维正态随机变量 ( X , Y ) (X,Y) (X,Y)的参数 ρ \rho ρ就是 X X X和 Y Y Y的相关系数,其联合分布可以由 X , Y X,Y X,Y各自的数学期望,方差和它们的相关系数所确定.
其中
C o v ( X , Y ) = ∫ − ∞ + ∞ ∫ − ∞ + ∞ ( x − μ 1 ) ( y − μ 2 ) f ( x , y ) d x d y ρ X Y = C o v ( X , Y ) D ( X ) D ( Y ) \begin{align} &Cov(X,Y) = \int_{-\infty}^{+\infty}\int_{-\infty}^{+\infty} (x - \mu_1)(y - \mu_2)f(x,y) dx dy \\ &\rho_{XY} = \frac{Cov(X,Y)}{\sqrt{D(X)}\sqrt{D(Y)}} \end{align} Cov(X,Y)=∫−∞+∞∫−∞+∞(x−μ1)(y−μ2)f(x,y)dxdyρXY=D(X) D(Y) Cov(X,Y)
假设 X 1 , X 2 , ⋯ , X n X_1, X_2, \cdots, X_n X1,X2,⋯,Xn 为连续发生事件的等候时间,且这 n n n 次等候时间为独立的,那么这 n n n 次等候时间之和 Y Y Y ( Y = X 1 + X 2 + ⋯ + X n ) (Y = X_1 + X_2 + \cdots + X_n) (Y=X1+X2+⋯+Xn)服从伽玛分布
若 X 1 , X 2 , ⋯ , X n X_1,X_2,\cdots,X_n X1,X2,⋯,Xn相互独立且 X i X_i Xi服从参数为 α i , λ ( i = 1 , 2 , ⋯ , n ) \alpha_i,\lambda \quad(i =1,2,\cdots,n) αi,λ(i=1,2,⋯,n)的 Γ \Gamma Γ分布, 则 ∑ i = 1 n X i \displaystyle \sum_{i = 1}^n X_i i=1∑nXi服从参数为 ∑ i = 1 n α i , λ \displaystyle \sum_{i = 1}^n \alpha_i , \lambda i=1∑nαi,λ的 Γ \Gamma Γ分布
证 设 X , Y X, Y X,Y分布服从参数为 α , λ ; β , λ \alpha,\lambda;\beta ,\lambda α,λ;β,λ的 Γ \Gamma Γ分布,则由卷积公式
f Z ( z ) = ∫ − ∞ + ∞ f X ( x ) f Y ( z − x ) d x f_Z(z) = \int_{-\infty}^{+\infty} f_X(x)f_Y(z - x)dx fZ(z)=∫−∞+∞fX(x)fY(z−x)dx
由 Γ \Gamma Γ分布的概率密度知,当且仅当
{ x > 0 , x − z > 0 \begin{cases} x \gt 0 ,\\ x - z \gt 0 \end{cases} {x>0,x−z>0
时,被积函数非0。即 z > x > 0 z \gt x \gt 0 z>x>0,因此
f Z ( z ) = ∫ 0 z f X ( x ) f Y ( z − x ) d x = e − λ z λ − ( α + β ) Γ ( α ) Γ ( β ) ∫ 0 z x α − 1 ( z − x ) β − 1 d x ( 令 x = z t ) = e − λ z ⋅ z α + β − 1 λ − ( α + β ) Γ ( α ) Γ ( β ) ∫ 0 1 t α − 1 ( 1 − t ) β − 1 d t \begin{align} f_Z(z) &= \int_{0}^{z} f_X(x)f_Y(z - x)dx \\ &= \frac{e^{-\lambda z}}{\lambda^{-(\alpha +\beta)}\Gamma(\alpha)\Gamma(\beta)}\int_{0}^{z} x^{\alpha -1}(z - x)^{\beta - 1} dx (\text{令 } x =zt) \\ &= \frac{e^{-\lambda z}\cdot z^{\alpha + \beta - 1}}{\lambda^{-(\alpha +\beta)}\Gamma(\alpha)\Gamma(\beta)}\int_{0}^{1} t^{\alpha - 1}(1 - t)^{\beta - 1}dt \end{align} fZ(z)=∫0zfX(x)fY(z−x)dx=λ−(α+β)Γ(α)Γ(β)e−λz∫0zxα−1(z−x)β−1dx(令 x=zt)=λ−(α+β)Γ(α)Γ(β)e−λz⋅zα+β−1∫01tα−1(1−t)β−1dt