第一部分:概率论(Probability Theory)
一、随机事件与概率
1.1 基本概念
| 术语 | 定义 | 示例 |
|---|---|---|
| 随机试验 | 在相同条件下可重复,结果不唯一但可预知的试验 | 掷骰子、抛硬币 |
| 样本空间 Ω | 随机试验所有可能结果的集合 | Ω={1,2,3,4,5,6} |
| 样本点 ω | 样本空间中的单个元素 | ω=3(掷出3点) |
| 随机事件 A | 样本空间的子集 | A={2,4,6}(掷出偶数) |
| 必然事件 | 每次试验必然发生(Ω本身) | 掷出点数≤6 |
| 不可能事件 | 每次试验都不发生(∅) | 掷出点数>6 |
1.2 事件的关系与运算
| 运算 | 符号 | 含义 |
|---|---|---|
| 包含 | A⊂B | A发生则B发生 |
| 相等 | A=B | A⊂B且B⊂A |
| 并(和) | A∪B | A、B至少一个发生 |
| 交(积) | A∩B(或AB) | A、B同时发生 |
| 差 | A−B(或A\B) | A发生但B不发生 |
| 互斥 | A∩B=∅ | 不能同时发生 |
| 对立 | Ā(或Aᶜ) | A不发生 |
| 完备事件组 | ∪Aᵢ=Ω,且两两互斥 | 划分样本空间 |
运算律:
-
交换律:A∪B=B∪A,A∩B=B∩A
-
结合律:(A∪B)∪C=A∪(B∪C)
-
分配律:A∩(B∪C)=(A∩B)∪(A∩C)
-
德·摩根律:A∪B‾=Aˉ∩BˉA∪B=Aˉ∩Bˉ,A∩B‾=Aˉ∪BˉA∩B=Aˉ∪Bˉ
1.3 概率的定义与性质
概率的公理化定义 (柯尔莫哥洛夫):
满足以下三条公理:
-
非负性:P(A) ≥ 0
-
规范性:P(Ω) = 1
-
可列可加性:若A₁,A₂,...两两互斥,则 P(∪Aᵢ) = ∑P(Aᵢ)
重要性质:
-
P(∅)=0
-
P(Ā)=1−P(A)
-
P(A∪B)=P(A)+P(B)−P(A∩B)(容斥原理)
-
若A⊂B,则P(A)≤P(B)
1.4 古典概型与几何概型
古典概型:有限等可能
- P(A) = A中样本点数 / Ω中样本点数 = k/n
几何概型:无限等可能
- P(A) = A的度量(长度/面积/体积)/ Ω的度量
1.5 条件概率
条件概率定义 :
P(B|A) = P(A∩B) / P(A),P(A)>0
乘法公式:
-
P(A∩B) = P(A)·P(B|A) = P(B)·P(A|B)
-
推广:P(A₁A₂...Aₙ) = P(A₁)·P(A₂|A₁)·P(A₃|A₁A₂)...P(Aₙ|A₁...Aₙ₋₁)
全概率公式 :
若{B₁,B₂,...,Bₙ}是完备事件组,则
P(A) = ∑P(Bᵢ)·P(A|Bᵢ)
贝叶斯公式 :
P(Bᵢ|A) = P(Bᵢ)·P(A|Bᵢ) / ∑P(Bⱼ)·P(A|Bⱼ)
1.6 事件的独立性
两事件独立:P(A∩B) = P(A)·P(B)
多个事件相互独立:任意子集的交的概率 = 各事件概率之积
注意:两两独立 ≠ 相互独立
二、随机变量及其分布
2.1 随机变量
定义:定义在样本空间Ω上的实值函数 X: Ω→R。
| 类型 | 特征 | 示例 |
|---|---|---|
| 离散型 | 取有限或可列无穷个值 | 掷骰子点数、二项分布 |
| 连续型 | 取某个区间内所有值 | 身高、正态分布 |
2.2 分布函数
分布函数 F(x) = P(X ≤ x),x∈R
性质:
-
单调不减(x₁<x₂ ⇒ F(x₁)≤F(x₂))
-
右连续:F(x+0)=F(x)
-
边界:F(−∞)=0,F(+∞)=1
-
P(a<X≤b)=F(b)−F(a)
2.3 离散型随机变量
概率分布律:P(X=xᵢ)=pᵢ,满足∑pᵢ=1
常见离散分布:
| 分布 | 符号 | 概率函数 | 参数 | 适用场景 |
|---|---|---|---|---|
| 0-1分布 | B(1,p) | P(X=k)=pᵏ(1−p)¹⁻ᵏ,k=0,1 | 0<p<1 | 单次伯努利试验 |
| 二项分布 | B(n,p) | P(X=k)=C(n,k)pᵏ(1−p)ⁿ⁻ᵏ | n≥1,0<p<1 | n次独立重复试验 |
| 泊松分布 | P(λ) | P(X=k)=λᵏe⁻ᵏ/k!,k=0,1,2,... | λ>0 | 稀有事件(电话呼叫数) |
| 几何分布 | G(p) | P(X=k)=(1−p)ᵏ⁻¹p,k=1,2,... | 0<p<1 | 首次成功所需次数 |
| 超几何分布 | H(N,M,n) | P(X=k)=C(M,k)C(N−M,n−k)/C(N,n) | N,M,n | 不放回抽样 |
二项分布与泊松分布的关系 :
当n很大,p很小,λ=np保持适中时,B(n,p)近似P(λ)。
2.4 连续型随机变量
概率密度函数 f(x):
-
f(x) ≥ 0
-
∫₋∞⁺∞ f(x)dx = 1
-
F(x) = ∫₋∞ˣ f(t)dt
-
P(a<X≤b) = ∫ₐᵇ f(x)dx
常见连续分布:
| 分布 | 符号 | 密度函数 | 参数 | 适用场景 |
|---|---|---|---|---|
| 均匀分布 | U(a,b) | f(x)=1/(b−a),a≤x≤b | a<b | 等可能区间 |
| 指数分布 | E(λ) | f(x)=λe⁻λˣ,x≥0 | λ>0 | 寿命、等待时间 |
| 正态分布 | N(μ,σ²) | f(x)=1/(σ√2π)·e^{-(x−μ)²/(2σ²)} | μ∈R,σ>0 | 自然界最常见 |
| 标准正态 | N(0,1) | φ(x)=1/√2π·e^{-x²/2} | --- | 正态分布标准化 |
| 伽马分布 | Γ(α,β) | f(x)=βᵃxᵃ⁻¹e^{-βx}/Γ(α),x≥0 | α>0,β>0 | 广义指数分布 |
| 卡方分布 | χ²(n) | Γ(n/2,1/2) | n为自由度 | 正态样本方差 |
| t分布 | t(n) | --- | n自由度 | 小样本均值推断 |
| F分布 | F(m,n) | --- | m,n自由度 | 方差比较 |
正态分布标准化:若X~N(μ,σ²),则Z=(X−μ)/σ~N(0,1)
3σ法则:
-
P(|X−μ|<σ)=68.26%
-
P(|X−μ|<2σ)=95.44%
-
P(|X−μ|<3σ)=99.74%
2.5 随机变量函数的分布
离散型:直接代入并合并相同值
连续型 (单调函数法):
若Y=g(X),g严格单调且可导,则
f_Y(y) = f_X(g⁻¹(y))·|d/dy g⁻¹(y)|
三、多维随机变量
3.1 联合分布
联合分布函数 :
F(x,y) = P(X≤x, Y≤y)
离散型联合分布律 :
pᵢⱼ = P(X=xᵢ, Y=yⱼ)
连续型联合密度 :
f(x,y) ≥ 0,∫∫f(x,y)dxdy = 1
3.2 边缘分布
离散型:
-
P(X=xᵢ)=∑ⱼ pᵢⱼ = pᵢ(行和)
-
P(Y=yⱼ)=∑ᵢ pᵢⱼ = pⱼ(列和)
连续型:
-
f_X(x)=∫₋∞⁺∞ f(x,y)dy
-
f_Y(y)=∫₋∞⁺∞ f(x,y)dx
3.3 条件分布
离散型 :
P(X=xᵢ|Y=yⱼ) = P(X=xᵢ,Y=yⱼ) / P(Y=yⱼ)
连续型 :
f_{X|Y}(x|y) = f(x,y) / f_Y(y),f_Y(y)>0
3.4 独立性
X与Y独立 ⇔ F(x,y)=F_X(x)·F_Y(y)
⇔ 离散:pᵢⱼ=pᵢ·pⱼ
⇔ 连续:f(x,y)=f_X(x)·f_Y(y)
3.5 多维随机变量函数的分布
卷积公式(Z=X+Y):
-
离散:P(Z=z)=∑ₓ P(X=x)P(Y=z−x)
-
连续:f_Z(z)=∫₋∞⁺∞ f_X(x)f_Y(z−x)dx
可加性:
-
X~B(n₁,p),Y~B(n₂,p),独立 ⇒ X+Y~B(n₁+n₂,p)
-
X~P(λ₁),Y~P(λ₂),独立 ⇒ X+Y~P(λ₁+λ₂)
-
X~N(μ₁,σ₁²),Y~N(μ₂,σ₂²),独立 ⇒ X+Y~N(μ₁+μ₂, σ₁²+σ₂²)
-
X~χ²(m),Y~χ²(n),独立 ⇒ X+Y~χ²(m+n)
四、随机变量的数字特征
4.1 数学期望(均值)
定义:
-
离散:E(X)=∑ xᵢ·pᵢ
-
连续:E(X)=∫₋∞⁺∞ x·f(x)dx
性质:
-
E(c)=c
-
E(aX+b)=aE(X)+b
-
E(X+Y)=E(X)+E(Y)
-
X与Y独立时,E(XY)=E(X)·E(Y)
常见分布的期望:
| 分布 | E(X) |
|---|---|
| 0-1 B(1,p) | p |
| 二项 B(n,p) | np |
| 泊松 P(λ) | λ |
| 几何 G(p) | 1/p |
| 均匀 U(a,b) | (a+b)/2 |
| 指数 E(λ) | 1/λ |
| 正态 N(μ,σ²) | μ |
4.2 方差与标准差
定义 :Var(X)=E(X−E(X))²=E(X²)−E(X)²
标准差:σ(X)=√Var(X)
性质:
-
Var(c)=0
-
Var(aX+b)=a²Var(X)
-
X与Y独立时,Var(X+Y)=Var(X)+Var(Y)
-
切比雪夫不等式:P(|X−μ|≥ε)≤σ²/ε²
常见分布的方差:
| 分布 | Var(X) |
|---|---|
| 0-1 B(1,p) | p(1−p) |
| 二项 B(n,p) | np(1−p) |
| 泊松 P(λ) | λ |
| 几何 G(p) | (1−p)/p² |
| 均匀 U(a,b) | (b−a)²/12 |
| 指数 E(λ) | 1/λ² |
| 正态 N(μ,σ²) | σ² |
4.3 协方差与相关系数
协方差 :
Cov(X,Y)=E(X−E(X))(Y−E(Y))=E(XY)−E(X)E(Y)
性质:
-
Cov(X,X)=Var(X)
-
Cov(X,Y)=Cov(Y,X)
-
Cov(aX+b, cY+d)=ac·Cov(X,Y)
-
Cov(X+Y,Z)=Cov(X,Z)+Cov(Y,Z)
相关系数 :
ρ_XY = Cov(X,Y) / (σ_X·σ_Y)
性质:
-
|ρ|≤1
-
|ρ|=1 ⇔ Y=aX+b(线性相关)
-
ρ=0 ⇔ X与Y不相关(注意:独立⇒不相关,反之不成立)
4.4 矩与协方差矩阵
k阶原点矩:μ_k = E(Xᵏ)
k阶中心矩:ν_k = E(X−E(X))ᵏ
协方差矩阵 :
对于n维随机向量X=(X₁,...,Xₙ)ᵀ,
Σ = (σᵢⱼ)ₙₓₙ,其中σᵢⱼ=Cov(Xᵢ,Xⱼ)
五、大数定律与中心极限定理
5.1 切比雪夫不等式
P(|X−μ| ≥ ε) ≤ σ²/ε²
5.2 大数定律
依概率收敛:Xₙ →ᵖ a,即∀ε>0,lim P(|Xₙ−a|<ε)=1
切比雪夫大数定律 :
独立随机变量序列,方差一致有界,则样本均值依概率收敛于期望均值。
伯努利大数定律 :
频率依概率收敛于概率(大数定律的最早形式)。
辛钦大数定律 :
独立同分布,期望存在,则样本均值依概率收敛于期望。
5.3 中心极限定理
林德伯格-莱维定理 (独立同分布):
X₁,...,Xₙ独立同分布,E(Xᵢ)=μ,Var(Xᵢ)=σ²,则
∑Xᵢ ≈ N(nμ, nσ²),即
Zn = (∑Xᵢ − nμ)/(σ√n) →ᵈ N(0,1)
棣莫弗-拉普拉斯定理 (二项分布):
X~B(n,p),则
Zn = (X−np)/√(np(1−p)) →ᵈ N(0,1)
第二部分:数理统计(Mathematical Statistics)
六、样本与抽样分布
6.1 基本概念
| 术语 | 定义 |
|---|---|
| 总体 | 研究对象的全体(通常服从某分布) |
| 个体 | 总体中的每个元素 |
| 样本 | 从总体中抽取的部分个体 |
| 样本容量 n | 样本中个体的数量 |
| 简单随机样本 | 独立同分布(i.i.d.)的样本 |
设总体X~F(x),样本X₁,...,Xₙ独立且都与X同分布。
6.2 统计量
统计量:不依赖于未知参数的样本函数。
常用统计量:
-
样本均值:Xˉ=1/n⋅∑XiXˉ=1/n⋅∑Xi
-
样本方差:S2=1/(n−1)⋅∑(Xi−Xˉ)2S2=1/(n−1)⋅∑(Xi−Xˉ)2
-
样本标准差:S=√S2S=√S2
-
样本k阶原点矩:Ak=1/n⋅∑XikAk=1/n⋅∑Xik
-
样本k阶中心矩:Bk=1/n⋅∑(Xi−Xˉ)kBk=1/n⋅∑(Xi−Xˉ)k
-
次序统计量:X₍₁₎≤X₍₂₎≤...≤X₍ₙ₎
6.3 常用抽样分布
χ²分布:
-
若Z₁,...,Zₙ~N(0,1)独立,则∑Zᵢ²~χ²(n)
-
E(χ²)=n,Var(χ²)=2n
-
可加性:χ²(m)+χ²(n)=χ²(m+n)
t分布:
-
若Z~N(0,1),Y~χ²(n),Z与Y独立,则 Z/√(Y/n) ~ t(n)
-
当n→∞,t(n)→N(0,1)
-
用于小样本均值检验
F分布:
-
若U~χ²(m),V~χ²(n),U与V独立,则 (U/m)/(V/n) ~ F(m,n)
-
用于方差比检验
6.4 正态总体抽样分布
单正态总体:
-
Xˉ∼N(μ,σ2/n)Xˉ∼N(μ,σ2/n)
-
Z=(Xˉ−μ)/(σ/√n)∼N(0,1)Z=(Xˉ−μ)/(σ/√n)∼N(0,1)
-
T=(Xˉ−μ)/(S/√n)∼t(n−1)T=(Xˉ−μ)/(S/√n)∼t(n−1)
-
(n−1)S2/σ2∼χ2(n−1)(n−1)S2/σ2∼χ2(n−1)
双正态总体:
- SX2/SY2∼F(nX−1,nY−1)SX2/SY2∼F(nX−1,nY−1)(方差比)
七、参数估计(Parameter Estimation)
7.1 点估计
定义:用样本统计量作为总体参数的估计值。
7.1.1 矩估计法(Method of Moments)
-
用样本矩估计总体矩
-
解方程:E(Xk)=AkE(Xk)=Ak
示例:对正态总体N(μ,σ²),μ^=Xˉμ^=Xˉ,σ^2=B2=1/n∑(Xi−Xˉ)2σ^2=B2=1/n∑(Xi−Xˉ)2
7.1.2 最大似然估计(MLE)
-
写出似然函数:L(θ)=∏f(xi;θ)L(θ)=∏f(xi;θ)
-
取对数:ℓ(θ)=lnL(θ)ℓ(θ)=lnL(θ)
-
解方程:dℓ/dθ=0dℓ/dθ=0
性质:相合性、无偏性、有效性、渐近正态性
7.1.3 估计量的评价标准
| 标准 | 定义 |
|---|---|
| 无偏性 | E(ĥ)=h(θ)(无系统偏差) |
| 有效性 | 方差越小越有效(相对效率) |
| 一致性(相合性) | 样本量增大时,ĥ→ᵖh(θ) |
无偏修正:
-
样本方差S2=1/(n−1)∑(Xi−Xˉ)2S2=1/(n−1)∑(Xi−Xˉ)2是σ²的无偏估计
-
1/n∑(Xi−Xˉ)21/n∑(Xi−Xˉ)2是σ²的有偏估计
7.2 区间估计
置信区间:以一定置信水平包含未知参数的区间。
步骤:
-
选取枢轴量G(θ,样本),分布已知且与θ无关
-
求a,b使P(a≤G≤b)=1−α
-
反解θ的不等式,得置信区间
常见置信区间(置信水平1−α):
| 场景 | 枢轴量 | 置信区间 |
|---|---|---|
| σ²已知,求μ | Z=(X̄−μ)/(σ/√n) | Xˉ±zα/2⋅σ/√nXˉ±zα/2⋅σ/√n |
| σ²未知,求μ | T=(X̄−μ)/(S/√n) | Xˉ±tα/2(n−1)⋅S/√nXˉ±tα/2(n−1)⋅S/√n |
| 求σ² | χ²=(n−1)S²/σ² | ((n−1)S2χα/22,(n−1)S2χ1−α/22)(χα/22(n−1)S2,χ1−α/22(n−1)S2) |
| 两正态均值差(σ相等未知) | T | Xˉ−Yˉ±tα/2⋅Sw√(1/n+1/m)Xˉ−Yˉ±tα/2⋅Sw√(1/n+1/m) |
八、假设检验(Hypothesis Testing)
8.1 基本概念
| 术语 | 说明 |
|---|---|
| 原假设 H₀ | 待检验的假设(通常为"没有差异") |
| 备择假设 H₁ | 原假设不成立时的情形 |
| 检验统计量 | 基于样本计算的统计量 |
| 拒绝域 W | 拒绝H₀的样本范围 |
| 显著性水平 α | 第一类错误概率 |
| p值 | 在原假设下观察到当前结果的概率 |
8.2 两类错误
| H₀为真 | H₀为假 | |
|---|---|---|
| 接受H₀ | 正确 | 第二类错误(β) |
| 拒绝H₀ | 第一类错误(α) | 正确(1−β,检验功效) |
8.3 常用假设检验
| 检验类型 | H₀ | 统计量 | 分布 |
|---|---|---|---|
| 单正态总体均值 | μ=μ₀ | Z=(X̄−μ₀)/(σ/√n) | N(0,1)(σ已知) |
| 同上 | μ=μ₀ | T=(X̄−μ₀)/(S/√n) | t(n−1)(σ未知) |
| 单正态总体方差 | σ²=σ₀² | χ²=(n−1)S²/σ₀² | χ²(n−1) |
| 双正态总体均值差 | μ₁=μ₂ | T = ... | t(n+m−2) |
| 双正态总体方差比 | σ₁²=σ₂² | F=S₁²/S₂² | F(n₁−1,n₂−1) |
8.4 拟合优度检验
χ²拟合优度检验:
-
检验实际频数与理论频数是否一致
-
统计量:χ²=∑(Oᵢ−Eᵢ)²/Eᵢ ~ χ²(k−1)
独立性检验(列联表):
-
检验两个分类变量是否独立
-
χ²=∑(Oᵢⱼ−Eᵢⱼ)²/Eᵢⱼ ~ χ²((r−1)(c−1))
8.5 正态性检验
-
QQ图:样本分位数 vs 正态分位数
-
Shapiro-Wilk检验
-
Kolmogorov-Smirnov检验
九、方差分析(ANOVA)
9.1 单因素方差分析
目的:比较多个总体的均值是否相等。
模型 :
Xij=μ+αi+εijXij=μ+αi+εij,εij∼N(0,σ2)εij∼N(0,σ2)
平方和分解:
-
SST = SSA + SSE(总离差 = 组间 + 组内)
-
SSA = ∑ nᵢ(Ȳᵢ−Ȳ)²
-
SSE = ∑∑(Yᵢⱼ−Ȳᵢ)²
F检验 :
F=(SSA/(k−1))/(SSE/(n−k))∼F(k−1,n−k)F=(SSA/(k−1))/(SSE/(n−k))∼F(k−1,n−k)
9.2 双因素方差分析
-
无交互效应:主效应检验
-
有交互效应:需要重复试验,检验主效应和交互效应
十、回归分析(Regression Analysis)
10.1 一元线性回归
模型:Y=β0+β1X+εY=β0+β1X+ε,ε∼N(0,σ2)ε∼N(0,σ2)
最小二乘估计:
-
β1^=∑(xi−xˉ)(yi−yˉ)/∑(xi−xˉ)2=Sxy/Sxxβ1^=∑(xi−xˉ)(yi−yˉ)/∑(xi−xˉ)2=Sxy/Sxx
-
β0^=yˉ−β1^xˉβ0^=yˉ−β1^xˉ
判定系数 R² :
R2=SSR/SST=1−SSE/SSTR2=SSR/SST=1−SSE/SST,衡量回归拟合程度
显著性检验:
-
H0:β1=0H0:β1=0
-
T=β1^/(S/√Sxx)∼t(n−2)T=β1^/(S/√Sxx)∼t(n−2)
10.2 多元线性回归
模型:Y=β0+β1X1+...+βpXp+εY=β0+β1X1+...+βpXp+ε
矩阵形式:Y=Xβ+εY=Xβ+ε
最小二乘估计:β^=(XTX)−1XTYβ^=(XTX)−1XTY
逐步回归:变量选择方法(向前、向后、逐步)