概率论与数理统计完整知识笔记

第一部分:概率论(Probability Theory)

一、随机事件与概率

1.1 基本概念

术语 定义 示例
随机试验 在相同条件下可重复,结果不唯一但可预知的试验 掷骰子、抛硬币
样本空间 Ω 随机试验所有可能结果的集合 Ω={1,2,3,4,5,6}
样本点 ω 样本空间中的单个元素 ω=3(掷出3点)
随机事件 A 样本空间的子集 A={2,4,6}(掷出偶数)
必然事件 每次试验必然发生(Ω本身) 掷出点数≤6
不可能事件 每次试验都不发生(∅) 掷出点数>6

1.2 事件的关系与运算

运算 符号 含义
包含 A⊂B A发生则B发生
相等 A=B A⊂B且B⊂A
并(和) A∪B A、B至少一个发生
交(积) A∩B(或AB) A、B同时发生
A−B(或A\B) A发生但B不发生
互斥 A∩B=∅ 不能同时发生
对立 Ā(或Aᶜ) A不发生
完备事件组 ∪Aᵢ=Ω,且两两互斥 划分样本空间

运算律

  • 交换律:A∪B=B∪A,A∩B=B∩A

  • 结合律:(A∪B)∪C=A∪(B∪C)

  • 分配律:A∩(B∪C)=(A∩B)∪(A∩C)

  • 德·摩根律:A∪B‾=Aˉ∩BˉA∪B=Aˉ∩Bˉ,A∩B‾=Aˉ∪BˉA∩B=Aˉ∪Bˉ

1.3 概率的定义与性质

概率的公理化定义 (柯尔莫哥洛夫):

满足以下三条公理:

  1. 非负性:P(A) ≥ 0

  2. 规范性:P(Ω) = 1

  3. 可列可加性:若A₁,A₂,...两两互斥,则 P(∪Aᵢ) = ∑P(Aᵢ)

重要性质

  • P(∅)=0

  • P(Ā)=1−P(A)

  • P(A∪B)=P(A)+P(B)−P(A∩B)(容斥原理)

  • 若A⊂B,则P(A)≤P(B)

1.4 古典概型与几何概型

古典概型:有限等可能

  • P(A) = A中样本点数 / Ω中样本点数 = k/n

几何概型:无限等可能

  • P(A) = A的度量(长度/面积/体积)/ Ω的度量

1.5 条件概率

条件概率定义

P(B|A) = P(A∩B) / P(A),P(A)>0

乘法公式

  • P(A∩B) = P(A)·P(B|A) = P(B)·P(A|B)

  • 推广:P(A₁A₂...Aₙ) = P(A₁)·P(A₂|A₁)·P(A₃|A₁A₂)...P(Aₙ|A₁...Aₙ₋₁)

全概率公式

若{B₁,B₂,...,Bₙ}是完备事件组,则

P(A) = ∑P(Bᵢ)·P(A|Bᵢ)

贝叶斯公式

P(Bᵢ|A) = P(Bᵢ)·P(A|Bᵢ) / ∑P(Bⱼ)·P(A|Bⱼ)

1.6 事件的独立性

两事件独立:P(A∩B) = P(A)·P(B)

多个事件相互独立:任意子集的交的概率 = 各事件概率之积

注意:两两独立 ≠ 相互独立

二、随机变量及其分布

2.1 随机变量

定义:定义在样本空间Ω上的实值函数 X: Ω→R。

类型 特征 示例
离散型 取有限或可列无穷个值 掷骰子点数、二项分布
连续型 取某个区间内所有值 身高、正态分布

2.2 分布函数

分布函数 F(x) = P(X ≤ x),x∈R

性质

  • 单调不减(x₁<x₂ ⇒ F(x₁)≤F(x₂))

  • 右连续:F(x+0)=F(x)

  • 边界:F(−∞)=0,F(+∞)=1

  • P(a<X≤b)=F(b)−F(a)

2.3 离散型随机变量

概率分布律:P(X=xᵢ)=pᵢ,满足∑pᵢ=1

常见离散分布

分布 符号 概率函数 参数 适用场景
0-1分布 B(1,p) P(X=k)=pᵏ(1−p)¹⁻ᵏ,k=0,1 0<p<1 单次伯努利试验
二项分布 B(n,p) P(X=k)=C(n,k)pᵏ(1−p)ⁿ⁻ᵏ n≥1,0<p<1 n次独立重复试验
泊松分布 P(λ) P(X=k)=λᵏe⁻ᵏ/k!,k=0,1,2,... λ>0 稀有事件(电话呼叫数)
几何分布 G(p) P(X=k)=(1−p)ᵏ⁻¹p,k=1,2,... 0<p<1 首次成功所需次数
超几何分布 H(N,M,n) P(X=k)=C(M,k)C(N−M,n−k)/C(N,n) N,M,n 不放回抽样

二项分布与泊松分布的关系

当n很大,p很小,λ=np保持适中时,B(n,p)近似P(λ)。

2.4 连续型随机变量

概率密度函数 f(x)

  • f(x) ≥ 0

  • ∫₋∞⁺∞ f(x)dx = 1

  • F(x) = ∫₋∞ˣ f(t)dt

  • P(a<X≤b) = ∫ₐᵇ f(x)dx

常见连续分布

分布 符号 密度函数 参数 适用场景
均匀分布 U(a,b) f(x)=1/(b−a),a≤x≤b a<b 等可能区间
指数分布 E(λ) f(x)=λe⁻λˣ,x≥0 λ>0 寿命、等待时间
正态分布 N(μ,σ²) f(x)=1/(σ√2π)·e^{-(x−μ)²/(2σ²)} μ∈R,σ>0 自然界最常见
标准正态 N(0,1) φ(x)=1/√2π·e^{-x²/2} --- 正态分布标准化
伽马分布 Γ(α,β) f(x)=βᵃxᵃ⁻¹e^{-βx}/Γ(α),x≥0 α>0,β>0 广义指数分布
卡方分布 χ²(n) Γ(n/2,1/2) n为自由度 正态样本方差
t分布 t(n) --- n自由度 小样本均值推断
F分布 F(m,n) --- m,n自由度 方差比较

正态分布标准化:若X~N(μ,σ²),则Z=(X−μ)/σ~N(0,1)

3σ法则

  • P(|X−μ|<σ)=68.26%

  • P(|X−μ|<2σ)=95.44%

  • P(|X−μ|<3σ)=99.74%

2.5 随机变量函数的分布

离散型:直接代入并合并相同值

连续型 (单调函数法):

若Y=g(X),g严格单调且可导,则

f_Y(y) = f_X(g⁻¹(y))·|d/dy g⁻¹(y)|

三、多维随机变量

3.1 联合分布

联合分布函数

F(x,y) = P(X≤x, Y≤y)

离散型联合分布律

pᵢⱼ = P(X=xᵢ, Y=yⱼ)

连续型联合密度

f(x,y) ≥ 0,∫∫f(x,y)dxdy = 1

3.2 边缘分布

离散型

  • P(X=xᵢ)=∑ⱼ pᵢⱼ = pᵢ(行和)

  • P(Y=yⱼ)=∑ᵢ pᵢⱼ = pⱼ(列和)

连续型

  • f_X(x)=∫₋∞⁺∞ f(x,y)dy

  • f_Y(y)=∫₋∞⁺∞ f(x,y)dx

3.3 条件分布

离散型

P(X=xᵢ|Y=yⱼ) = P(X=xᵢ,Y=yⱼ) / P(Y=yⱼ)

连续型

f_{X|Y}(x|y) = f(x,y) / f_Y(y),f_Y(y)>0

3.4 独立性

X与Y独立 ⇔ F(x,y)=F_X(x)·F_Y(y)

⇔ 离散:pᵢⱼ=pᵢ·pⱼ

⇔ 连续:f(x,y)=f_X(x)·f_Y(y)

3.5 多维随机变量函数的分布

卷积公式(Z=X+Y):

  • 离散:P(Z=z)=∑ₓ P(X=x)P(Y=z−x)

  • 连续:f_Z(z)=∫₋∞⁺∞ f_X(x)f_Y(z−x)dx

可加性

  • X~B(n₁,p),Y~B(n₂,p),独立 ⇒ X+Y~B(n₁+n₂,p)

  • X~P(λ₁),Y~P(λ₂),独立 ⇒ X+Y~P(λ₁+λ₂)

  • X~N(μ₁,σ₁²),Y~N(μ₂,σ₂²),独立 ⇒ X+Y~N(μ₁+μ₂, σ₁²+σ₂²)

  • X~χ²(m),Y~χ²(n),独立 ⇒ X+Y~χ²(m+n)

四、随机变量的数字特征

4.1 数学期望(均值)

定义

  • 离散:E(X)=∑ xᵢ·pᵢ

  • 连续:E(X)=∫₋∞⁺∞ x·f(x)dx

性质

  • E(c)=c

  • E(aX+b)=aE(X)+b

  • E(X+Y)=E(X)+E(Y)

  • X与Y独立时,E(XY)=E(X)·E(Y)

常见分布的期望

分布 E(X)
0-1 B(1,p) p
二项 B(n,p) np
泊松 P(λ) λ
几何 G(p) 1/p
均匀 U(a,b) (a+b)/2
指数 E(λ) 1/λ
正态 N(μ,σ²) μ

4.2 方差与标准差

定义 :Var(X)=E(X−E(X))²=E(X²)−E(X)²

标准差:σ(X)=√Var(X)

性质

  • Var(c)=0

  • Var(aX+b)=a²Var(X)

  • X与Y独立时,Var(X+Y)=Var(X)+Var(Y)

  • 切比雪夫不等式:P(|X−μ|≥ε)≤σ²/ε²

常见分布的方差

分布 Var(X)
0-1 B(1,p) p(1−p)
二项 B(n,p) np(1−p)
泊松 P(λ) λ
几何 G(p) (1−p)/p²
均匀 U(a,b) (b−a)²/12
指数 E(λ) 1/λ²
正态 N(μ,σ²) σ²

4.3 协方差与相关系数

协方差

Cov(X,Y)=E(X−E(X))(Y−E(Y))=E(XY)−E(X)E(Y)

性质

  • Cov(X,X)=Var(X)

  • Cov(X,Y)=Cov(Y,X)

  • Cov(aX+b, cY+d)=ac·Cov(X,Y)

  • Cov(X+Y,Z)=Cov(X,Z)+Cov(Y,Z)

相关系数

ρ_XY = Cov(X,Y) / (σ_X·σ_Y)

性质

  • |ρ|≤1

  • |ρ|=1 ⇔ Y=aX+b(线性相关)

  • ρ=0 ⇔ X与Y不相关(注意:独立⇒不相关,反之不成立)

4.4 矩与协方差矩阵

k阶原点矩:μ_k = E(Xᵏ)

k阶中心矩:ν_k = E(X−E(X))ᵏ

协方差矩阵

对于n维随机向量X=(X₁,...,Xₙ)ᵀ,

Σ = (σᵢⱼ)ₙₓₙ,其中σᵢⱼ=Cov(Xᵢ,Xⱼ)

五、大数定律与中心极限定理

5.1 切比雪夫不等式

P(|X−μ| ≥ ε) ≤ σ²/ε²

5.2 大数定律

依概率收敛:Xₙ →ᵖ a,即∀ε>0,lim P(|Xₙ−a|<ε)=1

切比雪夫大数定律

独立随机变量序列,方差一致有界,则样本均值依概率收敛于期望均值。

伯努利大数定律

频率依概率收敛于概率(大数定律的最早形式)。

辛钦大数定律

独立同分布,期望存在,则样本均值依概率收敛于期望。

5.3 中心极限定理

林德伯格-莱维定理 (独立同分布):

X₁,...,Xₙ独立同分布,E(Xᵢ)=μ,Var(Xᵢ)=σ²,则

∑Xᵢ ≈ N(nμ, nσ²),即

Zn = (∑Xᵢ − nμ)/(σ√n) →ᵈ N(0,1)

棣莫弗-拉普拉斯定理 (二项分布):

X~B(n,p),则

Zn = (X−np)/√(np(1−p)) →ᵈ N(0,1)


第二部分:数理统计(Mathematical Statistics)

六、样本与抽样分布

6.1 基本概念

术语 定义
总体 研究对象的全体(通常服从某分布)
个体 总体中的每个元素
样本 从总体中抽取的部分个体
样本容量 n 样本中个体的数量
简单随机样本 独立同分布(i.i.d.)的样本

设总体X~F(x),样本X₁,...,Xₙ独立且都与X同分布。

6.2 统计量

统计量:不依赖于未知参数的样本函数。

常用统计量

  • 样本均值:Xˉ=1/n⋅∑XiXˉ=1/n⋅∑Xi​

  • 样本方差:S2=1/(n−1)⋅∑(Xi−Xˉ)2S2=1/(n−1)⋅∑(Xi​−Xˉ)2

  • 样本标准差:S=√S2S=√S2

  • 样本k阶原点矩:Ak=1/n⋅∑XikAk​=1/n⋅∑Xik​

  • 样本k阶中心矩:Bk=1/n⋅∑(Xi−Xˉ)kBk​=1/n⋅∑(Xi​−Xˉ)k

  • 次序统计量:X₍₁₎≤X₍₂₎≤...≤X₍ₙ₎

6.3 常用抽样分布

χ²分布

  • 若Z₁,...,Zₙ~N(0,1)独立,则∑Zᵢ²~χ²(n)

  • E(χ²)=n,Var(χ²)=2n

  • 可加性:χ²(m)+χ²(n)=χ²(m+n)

t分布

  • 若Z~N(0,1),Y~χ²(n),Z与Y独立,则 Z/√(Y/n) ~ t(n)

  • 当n→∞,t(n)→N(0,1)

  • 用于小样本均值检验

F分布

  • 若U~χ²(m),V~χ²(n),U与V独立,则 (U/m)/(V/n) ~ F(m,n)

  • 用于方差比检验

6.4 正态总体抽样分布

单正态总体

  • Xˉ∼N(μ,σ2/n)Xˉ∼N(μ,σ2/n)

  • Z=(Xˉ−μ)/(σ/√n)∼N(0,1)Z=(Xˉ−μ)/(σ/√n)∼N(0,1)

  • T=(Xˉ−μ)/(S/√n)∼t(n−1)T=(Xˉ−μ)/(S/√n)∼t(n−1)

  • (n−1)S2/σ2∼χ2(n−1)(n−1)S2/σ2∼χ2(n−1)

双正态总体

  • SX2/SY2∼F(nX−1,nY−1)SX2​/SY2​∼F(nX​−1,nY​−1)(方差比)

七、参数估计(Parameter Estimation)

7.1 点估计

定义:用样本统计量作为总体参数的估计值。

7.1.1 矩估计法(Method of Moments)
  • 用样本矩估计总体矩

  • 解方程:E(Xk)=AkE(Xk)=Ak​

示例:对正态总体N(μ,σ²),μ^=Xˉμ^​=Xˉ,σ^2=B2=1/n∑(Xi−Xˉ)2σ^2=B2​=1/n∑(Xi​−Xˉ)2

7.1.2 最大似然估计(MLE)
  • 写出似然函数:L(θ)=∏f(xi;θ)L(θ)=∏f(xi​;θ)

  • 取对数:ℓ(θ)=lnL(θ)ℓ(θ)=lnL(θ)

  • 解方程:dℓ/dθ=0dℓ/dθ=0

性质:相合性、无偏性、有效性、渐近正态性

7.1.3 估计量的评价标准
标准 定义
无偏性 E(ĥ)=h(θ)(无系统偏差)
有效性 方差越小越有效(相对效率)
一致性(相合性) 样本量增大时,ĥ→ᵖh(θ)

无偏修正

  • 样本方差S2=1/(n−1)∑(Xi−Xˉ)2S2=1/(n−1)∑(Xi​−Xˉ)2是σ²的无偏估计

  • 1/n∑(Xi−Xˉ)21/n∑(Xi​−Xˉ)2是σ²的有偏估计

7.2 区间估计

置信区间:以一定置信水平包含未知参数的区间。

步骤

  1. 选取枢轴量G(θ,样本),分布已知且与θ无关

  2. 求a,b使P(a≤G≤b)=1−α

  3. 反解θ的不等式,得置信区间

常见置信区间(置信水平1−α):
场景 枢轴量 置信区间
σ²已知,求μ Z=(X̄−μ)/(σ/√n) Xˉ±zα/2⋅σ/√nXˉ±zα/2​⋅σ/√n
σ²未知,求μ T=(X̄−μ)/(S/√n) Xˉ±tα/2(n−1)⋅S/√nXˉ±tα/2​(n−1)⋅S/√n
求σ² χ²=(n−1)S²/σ² ((n−1)S2χα/22,(n−1)S2χ1−α/22)(χα/22​(n−1)S2​,χ1−α/22​(n−1)S2​)
两正态均值差(σ相等未知) T Xˉ−Yˉ±tα/2⋅Sw√(1/n+1/m)Xˉ−Yˉ±tα/2​⋅Sw​√(1/n+1/m)

八、假设检验(Hypothesis Testing)

8.1 基本概念

术语 说明
原假设 H₀ 待检验的假设(通常为"没有差异")
备择假设 H₁ 原假设不成立时的情形
检验统计量 基于样本计算的统计量
拒绝域 W 拒绝H₀的样本范围
显著性水平 α 第一类错误概率
p值 在原假设下观察到当前结果的概率

8.2 两类错误

H₀为真 H₀为假
接受H₀ 正确 第二类错误(β)
拒绝H₀ 第一类错误(α) 正确(1−β,检验功效)

8.3 常用假设检验

检验类型 H₀ 统计量 分布
单正态总体均值 μ=μ₀ Z=(X̄−μ₀)/(σ/√n) N(0,1)(σ已知)
同上 μ=μ₀ T=(X̄−μ₀)/(S/√n) t(n−1)(σ未知)
单正态总体方差 σ²=σ₀² χ²=(n−1)S²/σ₀² χ²(n−1)
双正态总体均值差 μ₁=μ₂ T = ... t(n+m−2)
双正态总体方差比 σ₁²=σ₂² F=S₁²/S₂² F(n₁−1,n₂−1)

8.4 拟合优度检验

χ²拟合优度检验

  • 检验实际频数与理论频数是否一致

  • 统计量:χ²=∑(Oᵢ−Eᵢ)²/Eᵢ ~ χ²(k−1)

独立性检验(列联表)

  • 检验两个分类变量是否独立

  • χ²=∑(Oᵢⱼ−Eᵢⱼ)²/Eᵢⱼ ~ χ²((r−1)(c−1))

8.5 正态性检验

  • QQ图:样本分位数 vs 正态分位数

  • Shapiro-Wilk检验

  • Kolmogorov-Smirnov检验

九、方差分析(ANOVA)

9.1 单因素方差分析

目的:比较多个总体的均值是否相等。

模型

Xij=μ+αi+εijXij​=μ+αi​+εij​,εij∼N(0,σ2)εij​∼N(0,σ2)

平方和分解

  • SST = SSA + SSE(总离差 = 组间 + 组内)

  • SSA = ∑ nᵢ(Ȳᵢ−Ȳ)²

  • SSE = ∑∑(Yᵢⱼ−Ȳᵢ)²

F检验

F=(SSA/(k−1))/(SSE/(n−k))∼F(k−1,n−k)F=(SSA/(k−1))/(SSE/(n−k))∼F(k−1,n−k)

9.2 双因素方差分析

  • 无交互效应:主效应检验

  • 有交互效应:需要重复试验,检验主效应和交互效应

十、回归分析(Regression Analysis)

10.1 一元线性回归

模型:Y=β0+β1X+εY=β0​+β1​X+ε,ε∼N(0,σ2)ε∼N(0,σ2)

最小二乘估计

  • β1^=∑(xi−xˉ)(yi−yˉ)/∑(xi−xˉ)2=Sxy/Sxxβ1​^​=∑(xi​−xˉ)(yi​−yˉ​)/∑(xi​−xˉ)2=Sxy​/Sxx​

  • β0^=yˉ−β1^xˉβ0​^​=yˉ​−β1​^​xˉ

判定系数 R²

R2=SSR/SST=1−SSE/SSTR2=SSR/SST=1−SSE/SST,衡量回归拟合程度

显著性检验

  • H0:β1=0H0​:β1​=0

  • T=β1^/(S/√Sxx)∼t(n−2)T=β1​^​/(S/√Sxx​)∼t(n−2)

10.2 多元线性回归

模型:Y=β0+β1X1+...+βpXp+εY=β0​+β1​X1​+...+βp​Xp​+ε

矩阵形式:Y=Xβ+εY=Xβ+ε

最小二乘估计:β^=(XTX)−1XTYβ^​=(XTX)−1XTY

逐步回归:变量选择方法(向前、向后、逐步)

相关推荐
过期的秋刀鱼!3 天前
倾斜数据集的错误指标-混淆矩阵
人工智能·python·深度学习·机器学习·概率论·模型评估
六边形战士DONK6 天前
16-估计量的评选标准[无偏性,有效性,相合性,均方误差准则]
人工智能·机器学习·概率论
六边形战士DONK7 天前
11-常见随机变量的分布[连续型]
概率论
六边形战士DONK7 天前
15-参数的点估计方法[矩估计,极大似然估计]
人工智能·机器学习·概率论
六边形战士DONK7 天前
08-随机变量的相互独立性
概率论
六边形战士DONK8 天前
09-随机变量的数字特征
人工智能·机器学习·概率论
知识分享小能手10 天前
高等数学学习教程,从入门到精通,定积分 — 知识点全面总结(10)
学习·机器学习·概率论
Chen--Xing11 天前
概率论导论 —— 泊松分布[X~Pois(λ)]
概率论
知识分享小能手11 天前
高等数学学习教程,从入门到精通,微分中值定理与导数的应用(5)
学习·机器学习·概率论