统计学学习教程,从入门到精通,分类数据分析 — 知识点详解(13)

分类数据分析 --- 知识点详解


一、分类数据与 χ² 统计量

1.1 分类数据的概念

分类数据(Categorical Data) 是指按照事物的某种属性进行分类后得到的数据,其结果表现为类别,而非数值。例如:

  • 性别(男/女)
  • 血型(A/B/AB/O)
  • 满意度(满意/一般/不满意)
  • 产品等级(一等品/二等品/不合格品)

分类数据又称为定性数据计数数据 ,因为分析的基本形式是各类别出现的频数(frequency)


1.2 χ² 统计量的定义

设某项试验的全部可能结果分为 kkk 个互不相容的类别(互斥且完备),记第 iii 类的观察频数 为 fof_ofo(observed frequency),期望频数 为 fef_efe(expected frequency),则 Pearson χ² 统计量定义为:

χ2=∑i=1k(fo−fe)2fe\boxed{\chi^2 = \sum_{i=1}^{k} \frac{(f_o - f_e)^2}{f_e}}χ2=i=1∑kfe(fo−fe)2

直观理解:

  • (fo−fe)(f_o - f_e)(fo−fe) 衡量观察值与期望值之间的偏差
  • 平方消除正负号;
  • 除以 fef_efe 是标准化,使得偏差相对于期望值的大小来衡量;
  • 对所有类别求和,得到一个总偏差度量

1.3 χ² 统计量的推导

(1)从正态近似出发

假设每个类别的概率为 pip_ipi,样本量为 nnn,则:

  • fo∼Binomial(n,pi)f_o \sim \text{Binomial}(n, p_i)fo∼Binomial(n,pi)
  • 当 nnn 较大时,由中心极限定理,fof_ofo 近似正态分布:

fo≈N(npi,  npi(1−pi))f_o \approx N(np_i,\; np_i(1-p_i))fo≈N(npi,npi(1−pi))

Zi=fo−npinpi(1−pi)≈N(0,1)Z_i = \frac{f_o - np_i}{\sqrt{np_i(1-p_i)}} \approx N(0,1)Zi=npi(1−pi) fo−npi≈N(0,1)

但如果将 kkk 个 Zi2Z_i^2Zi2 直接相加,并不相互独立(因为 ∑fo=n\sum f_o = n∑fo=n 约束)。实际上:

χ2=∑i=1k(fo−fe)2fe\chi^2 = \sum_{i=1}^{k} \frac{(f_o - f_e)^2}{f_e}χ2=i=1∑kfe(fo−fe)2

其中 fe=npif_e = np_ife=npi。

(2)严格推导思路

设 Xi=foX_i = f_oXi=fo,ei=npie_i = np_iei=npi,考虑向量 X=(X1,X2,...,Xk)\mathbf{X} = (X_1, X_2, \ldots, X_k)X=(X1,X2,...,Xk)。

由于 ∑i=1kXi=n\sum_{i=1}^k X_i = n∑i=1kXi=n,所以 X\mathbf{X}X 服从多项分布 Multinomial(n;p1,p2,...,pk)\text{Multinomial}(n; p_1, p_2, \ldots, p_k)Multinomial(n;p1,p2,...,pk)。

构造标准化变量:

Yi=Xi−npinpi,i=1,2,...,kY_i = \frac{X_i - np_i}{\sqrt{np_i}}, \quad i = 1, 2, \ldots, kYi=npi Xi−npi,i=1,2,...,k

则 ∑i=1kYi2\sum_{i=1}^k Y_i^2∑i=1kYi2 并不等于 χ2\chi^2χ2,因为 YiY_iYi 之间不独立。实际上:

∑i=1kYi2=∑i=1k(Xi−npi)2npi=χ2\sum_{i=1}^k Y_i^2 = \sum_{i=1}^k \frac{(X_i - np_i)^2}{np_i} = \chi^2i=1∑kYi2=i=1∑knpi(Xi−npi)2=χ2

由于约束 ∑Xi=n\sum X_i = n∑Xi=n 带来一个线性约束,这使得 ∑Yi2\sum Y_i^2∑Yi2 的分布不是 自由度为 kkk 的 χ2\chi^2χ2 分布,而是自由度为 k−1k-1k−1 的 χ2\chi^2χ2 分布。

结论:

χ2=∑i=1k(fo−fe)2fe∼χ2(k−1)\chi^2 = \sum_{i=1}^{k} \frac{(f_o - f_e)^2}{f_e} \sim \chi^2(k-1)χ2=i=1∑kfe(fo−fe)2∼χ2(k−1)

当期望频数 fe≥5f_e \geq 5fe≥5(通常要求)且样本量 nnn 足够大时,上述近似成立。


1.4 χ² 统计量的性质

性质 说明
非负性 χ2≥0\chi^2 \geq 0χ2≥0,当且仅当所有 fo=fef_o = f_efo=fe 时取等号
偏态分布 χ2\chi^2χ2 分布是右偏的,自由度越大越趋于正态
可加性 若 X∼χ2(m)X \sim \chi^2(m)X∼χ2(m),Y∼χ2(n)Y \sim \chi^2(n)Y∼χ2(n),且独立,则 X+Y∼χ2(m+n)X+Y \sim \chi^2(m+n)X+Y∼χ2(m+n)
期望与方差 若 X∼χ2(ν)X \sim \chi^2(\nu)X∼χ2(ν),则 E(X)=νE(X) = \nuE(X)=ν,D(X)=2νD(X) = 2\nuD(X)=2ν

二、拟合优度检验(Goodness-of-Fit Test)

2.1 问题描述

拟合优度检验用于判断一组观察数据是否服从某个特定的理论分布

设总体 XXX 的分布未知,我们提出假设:

H0:X 服从某特定分布(如均匀分布、正态分布、泊松分布等)H_0: X \text{ 服从某特定分布(如均匀分布、正态分布、泊松分布等)}H0:X 服从某特定分布(如均匀分布、正态分布、泊松分布等)

H1:X 不服从该特定分布H_1: X \text{ 不服从该特定分布}H1:X 不服从该特定分布


2.2 检验步骤

Step 1: 提出假设 H0H_0H0 和 H1H_1H1。

Step 2: 将数据的取值范围分成 kkk 个互不相容的区间(组)。

Step 3: 计算在 H0H_0H0 成立的条件下,每个区间的期望频数 fef_efe。

Step 4: 计算检验统计量:

χ2=∑i=1k(fo−fe)2fe\chi^2 = \sum_{i=1}^{k} \frac{(f_o - f_e)^2}{f_e}χ2=i=1∑kfe(fo−fe)2

Step 5: 确定自由度。

  • 如果 H0H_0H0 中的分布完全已知(如均匀分布 U(0,1)U(0,1)U(0,1)),自由度为 ν=k−1\nu = k - 1ν=k−1。
  • 如果 H0H_0H0 中的分布有 rrr 个参数需要从数据中估计,则自由度为 ν=k−1−r\nu = k - 1 - rν=k−1−r。

Step 6: 对于给定的显著性水平 α\alphaα,查表得临界值 χα2(ν)\chi^2_\alpha(\nu)χα2(ν)。

  • 若 χ2>χα2(ν)\chi^2 > \chi^2_\alpha(\nu)χ2>χα2(ν),则拒绝 H0H_0H0。
  • 若 χ2≤χα2(ν)\chi^2 \leq \chi^2_\alpha(\nu)χ2≤χα2(ν),则不拒绝 H0H_0H0。

2.3 拟合优度检验的详细推导

(1)期望频数的计算

在 H0H_0H0 成立时,总体落在第 iii 个区间的概率为 pip_ipi,则:

fei=n⋅pif_{e_i} = n \cdot p_ifei=n⋅pi

其中 nnn 为样本总数。

示例: 若 H0H_0H0 为均匀分布 U(a,b)U(a,b)U(a,b),将 a,ba,ba,b 等分为 kkk 个区间,则:

pi=1k,fei=nkp_i = \frac{1}{k}, \quad f_{e_i} = \frac{n}{k}pi=k1,fei=kn

示例: 若 H0H_0H0 为正态分布 N(μ,σ2)N(\mu, \sigma^2)N(μ,σ2),参数 μ\muμ 和 σ2\sigma^2σ2 由样本均值 Xˉ\bar{X}Xˉ 和样本方差 S2S^2S2 估计,则:

pi=P(ai−1<X≤ai)=Φ ⁣(ai−XˉS)−Φ ⁣(ai−1−XˉS)p_i = P(a_{i-1} < X \leq a_i) = \Phi\!\left(\frac{a_i - \bar{X}}{S}\right) - \Phi\!\left(\frac{a_{i-1} - \bar{X}}{S}\right)pi=P(ai−1<X≤ai)=Φ(Sai−Xˉ)−Φ(Sai−1−Xˉ)

此时 r=2r = 2r=2(估计了均值和方差两个参数),自由度为 k−1−2=k−3k - 1 - 2 = k - 3k−1−2=k−3。

(2)自由度的详细解释

为什么是 k−1−rk - 1 - rk−1−r?

  • kkk 个频数 fo,fo,...,fof_o, f_o, \ldots, f_ofo,fo,...,fo 受到一个约束:∑fo=n\sum f_o = n∑fo=n,因此只有 k−1k-1k−1 个"自由"的信息。
  • 每从数据中估计一个参数,就多消耗一个自由度,故再减去 rrr。
(3)期望频数的要求

一般要求每个类别的期望频数 fe≥5f_e \geq 5fe≥5。若某个 fe<5f_e < 5fe<5,应将相邻的类别合并,以满足此要求。


2.4 典型例题

【例题1】掷骰子的公平性检验

一枚骰子掷了 60 次,各面出现的次数如下:

点数 1 2 3 4 5 6
频数 fof_ofo 8 12 10 7 15 8

在 α=0.05\alpha = 0.05α=0.05 的显著性水平下,检验这枚骰子是否均匀。

解:

H0H_0H0: 骰子均匀,pi=16p_i = \frac{1}{6}pi=61,i=1,2,...,6i = 1,2,\ldots,6i=1,2,...,6

H1H_1H1: 骰子不均匀

在 H0H_0H0 下,每个面的期望频数为:

fe=60×16=10f_e = 60 \times \frac{1}{6} = 10fe=60×61=10

计算 χ2\chi^2χ2 统计量:

χ2=(8−10)210+(12−10)210+(10−10)210+(7−10)210+(15−10)210+(8−10)210\chi^2 = \frac{(8-10)^2}{10} + \frac{(12-10)^2}{10} + \frac{(10-10)^2}{10} + \frac{(7-10)^2}{10} + \frac{(15-10)^2}{10} + \frac{(8-10)^2}{10}χ2=10(8−10)2+10(12−10)2+10(10−10)2+10(7−10)2+10(15−10)2+10(8−10)2

=410+410+010+910+2510+410= \frac{4}{10} + \frac{4}{10} + \frac{0}{10} + \frac{9}{10} + \frac{25}{10} + \frac{4}{10}=104+104+100+109+1025+104

=0.4+0.4+0+0.9+2.5+0.4=4.6= 0.4 + 0.4 + 0 + 0.9 + 2.5 + 0.4 = 4.6=0.4+0.4+0+0.9+2.5+0.4=4.6

自由度 ν=k−1=6−1=5\nu = k - 1 = 6 - 1 = 5ν=k−1=6−1=5

查 χ2\chi^2χ2 分布表:χ0.052(5)=11.071\chi^2_{0.05}(5) = 11.071χ0.052(5)=11.071

因为 χ2=4.6<11.071=χ0.052(5)\chi^2 = 4.6 < 11.071 = \chi^2_{0.05}(5)χ2=4.6<11.071=χ0.052(5)

结论: 不拒绝 H0H_0H0,没有充分证据说明骰子不均匀。


【例题2】泊松分布的拟合优度检验

某电话交换台在 200 个等长时间间隔内记录到的呼叫次数如下:

呼叫次数 xxx 0 1 2 3 4 ≥5\geq 5≥5
间隔数 fof_ofo 32 60 56 34 12 6

检验呼叫次数是否服从泊松分布(α=0.05\alpha = 0.05α=0.05)。

解:

H0H_0H0: 呼叫次数服从泊松分布 P(λ)P(\lambda)P(λ)

H1H_1H1: 呼叫次数不服从泊松分布

Step 1: 估计参数 λ\lambdaλ(泊松分布的参数即为均值)

λ^=xˉ=∑xifon=0×32+1×60+2×56+3×34+4×12+5×6200\hat{\lambda} = \bar{x} = \frac{\sum x_i f_o}{n} = \frac{0 \times 32 + 1 \times 60 + 2 \times 56 + 3 \times 34 + 4 \times 12 + 5 \times 6}{200}λ^=xˉ=n∑xifo=2000×32+1×60+2×56+3×34+4×12+5×6

=0+60+112+102+48+30200=352200=1.76= \frac{0 + 60 + 112 + 102 + 48 + 30}{200} = \frac{352}{200} = 1.76=2000+60+112+102+48+30=200352=1.76

Step 2: 计算各 pip_ipi

泊松分布 P(1.76)P(1.76)P(1.76) 的概率为:

P(X=x)=e−1.76×1.76xx!P(X = x) = \frac{e^{-1.76} \times 1.76^x}{x!}P(X=x)=x!e−1.76×1.76x

其中 e−1.76=0.17204e^{-1.76} = 0.17204e−1.76=0.17204

xxx pip_ipi 计算过程 pip_ipi fe=200pif_e = 200 p_ife=200pi
0 e−1.76=0.17204e^{-1.76} = 0.17204e−1.76=0.17204 0.172040.172040.17204 34.4134.4134.41
1 0.17204×1.76=0.302790.17204 \times 1.76 = 0.302790.17204×1.76=0.30279 0.302790.302790.30279 60.5660.5660.56
2 0.30279×1.762=0.266460.30279 \times \frac{1.76}{2} = 0.266460.30279×21.76=0.26646 0.266460.266460.26646 53.2953.2953.29
3 0.26646×1.763=0.156390.26646 \times \frac{1.76}{3} = 0.156390.26646×31.76=0.15639 0.156390.156390.15639 31.2831.2831.28
4 0.15639×1.764=0.068810.15639 \times \frac{1.76}{4} = 0.068810.15639×41.76=0.06881 0.068810.068810.06881 13.7613.7613.76
≥5\geq 5≥5 1−(0.17204+0.30279+0.26646+0.15639+0.06881)=0.033511 - (0.17204+0.30279+0.26646+0.15639+0.06881) = 0.033511−(0.17204+0.30279+0.26646+0.15639+0.06881)=0.03351 0.033510.033510.03351 6.706.706.70

验证:34.41+60.56+53.29+31.28+13.76+6.70=200.0034.41 + 60.56 + 53.29 + 31.28 + 13.76 + 6.70 = 200.0034.41+60.56+53.29+31.28+13.76+6.70=200.00 ✓

Step 3: 计算 χ² 统计量

χ2=(32−34.41)234.41+(60−60.56)260.56+(56−53.29)253.29+(34−31.28)231.28+(12−13.76)213.76+(6−6.70)26.70\chi^2 = \frac{(32-34.41)^2}{34.41} + \frac{(60-60.56)^2}{60.56} + \frac{(56-53.29)^2}{53.29} + \frac{(34-31.28)^2}{31.28} + \frac{(12-13.76)^2}{13.76} + \frac{(6-6.70)^2}{6.70}χ2=34.41(32−34.41)2+60.56(60−60.56)2+53.29(56−53.29)2+31.28(34−31.28)2+13.76(12−13.76)2+6.70(6−6.70)2

=5.8134.41+0.3160.56+7.3453.29+7.4031.28+3.1013.76+0.496.70= \frac{5.81}{34.41} + \frac{0.31}{60.56} + \frac{7.34}{53.29} + \frac{7.40}{31.28} + \frac{3.10}{13.76} + \frac{0.49}{6.70}=34.415.81+60.560.31+53.297.34+31.287.40+13.763.10+6.700.49

=0.169+0.005+0.138+0.237+0.225+0.073=0.847= 0.169 + 0.005 + 0.138 + 0.237 + 0.225 + 0.073 = 0.847=0.169+0.005+0.138+0.237+0.225+0.073=0.847

Step 4: 确定自由度

  • 类别数 k=6k = 6k=6
  • 估计参数个数 r=1r = 1r=1(估计了 λ\lambdaλ)
  • 自由度 ν=6−1−1=4\nu = 6 - 1 - 1 = 4ν=6−1−1=4

Step 5: 判断

χ0.052(4)=9.488\chi^2_{0.05}(4) = 9.488χ0.052(4)=9.488

因为 χ2=0.847<9.488\chi^2 = 0.847 < 9.488χ2=0.847<9.488

结论: 不拒绝 H0H_0H0,可以认为呼叫次数服从泊松分布。


【例题3】正态分布的拟合优度检验

某工厂生产的零件重量(克)的 50 个数据如下(已分组):

重量区间 [90,94)[90,94)[90,94) [94,98)[94,98)[94,98) [98,102)[98,102)[98,102) [102,106)[102,106)[102,106) [106,110)[106,110)[106,110)
频数 fof_ofo 6 12 17 10 5

检验零件重量是否服从正态分布(α=0.05\alpha = 0.05α=0.05)。

解:

H0H_0H0: 零件重量服从正态分布 N(μ,σ2)N(\mu, \sigma^2)N(μ,σ2)

H1H_1H1: 零件重量不服从正态分布

Step 1: 估计参数

取各组的组中值:92,96,100,104,10892, 96, 100, 104, 10892,96,100,104,108

μ^=xˉ=92×6+96×12+100×17+104×10+108×550\hat{\mu} = \bar{x} = \frac{92 \times 6 + 96 \times 12 + 100 \times 17 + 104 \times 10 + 108 \times 5}{50}μ^=xˉ=5092×6+96×12+100×17+104×10+108×5

=552+1152+1700+1040+54050=498450=99.68= \frac{552 + 1152 + 1700 + 1040 + 540}{50} = \frac{4984}{50} = 99.68=50552+1152+1700+1040+540=504984=99.68

σ^2=S2=∑fixi2−nxˉ2n−1\hat{\sigma}^2 = S^2 = \frac{\sum f_i x_i^2 - n\bar{x}^2}{n-1}σ^2=S2=n−1∑fixi2−nxˉ2

∑fixi2=6×922+12×962+17×1002+10×1042+5×1082\sum f_i x_i^2 = 6 \times 92^2 + 12 \times 96^2 + 17 \times 100^2 + 10 \times 104^2 + 5 \times 108^2∑fixi2=6×922+12×962+17×1002+10×1042+5×1082

=6×8464+12×9216+17×10000+10×10816+5×11664= 6 \times 8464 + 12 \times 9216 + 17 \times 10000 + 10 \times 10816 + 5 \times 11664=6×8464+12×9216+17×10000+10×10816+5×11664

=50784+110592+170000+108160+58320=497856= 50784 + 110592 + 170000 + 108160 + 58320 = 497856=50784+110592+170000+108160+58320=497856

S2=497856−50×99.68249=497856−496808.9649=1047.0449=21.37S^2 = \frac{497856 - 50 \times 99.68^2}{49} = \frac{497856 - 496808.96}{49} = \frac{1047.04}{49} = 21.37S2=49497856−50×99.682=49497856−496808.96=491047.04=21.37

σ^=S=21.37≈4.62\hat{\sigma} = S = \sqrt{21.37} \approx 4.62σ^=S=21.37 ≈4.62

Step 2: 计算各区间概率

用标准正态分布 Φ\PhiΦ 函数:

Zi=xi−99.684.62Z_i = \frac{x_i - 99.68}{4.62}Zi=4.62xi−99.68

区间 ZZZ 值范围 pip_ipi fe=50pif_e = 50p_ife=50pi
(−∞,94)(-\infty, 94)(−∞,94) (−∞,−1.23)(-\infty, -1.23)(−∞,−1.23) Φ(−1.23)=0.1093\Phi(-1.23) = 0.1093Φ(−1.23)=0.1093 5.475.475.47
[94,98)[94, 98)[94,98) [−1.23,−0.36)[-1.23, -0.36)[−1.23,−0.36) Φ(−0.36)−Φ(−1.23)=0.3594−0.1093=0.2501\Phi(-0.36) - \Phi(-1.23) = 0.3594 - 0.1093 = 0.2501Φ(−0.36)−Φ(−1.23)=0.3594−0.1093=0.2501 12.5112.5112.51
[98,102)[98, 102)[98,102) [−0.36,0.50)[-0.36, 0.50)[−0.36,0.50) Φ(0.50)−Φ(−0.36)=0.6915−0.3594=0.3321\Phi(0.50) - \Phi(-0.36) = 0.6915 - 0.3594 = 0.3321Φ(0.50)−Φ(−0.36)=0.6915−0.3594=0.3321 16.6116.6116.61
[102,106)[102, 106)[102,106) [0.50,1.37)[0.50, 1.37)[0.50,1.37) Φ(1.37)−Φ(0.50)=0.9147−0.6915=0.2232\Phi(1.37) - \Phi(0.50) = 0.9147 - 0.6915 = 0.2232Φ(1.37)−Φ(0.50)=0.9147−0.6915=0.2232 11.1611.1611.16
[106,+∞)[106, +\infty)[106,+∞) [1.37,+∞)[1.37, +\infty)[1.37,+∞) 1−Φ(1.37)=1−0.9147=0.08531 - \Phi(1.37) = 1 - 0.9147 = 0.08531−Φ(1.37)=1−0.9147=0.0853 4.274.274.27

注意:最后一组 fe=4.27<5f_e = 4.27 < 5fe=4.27<5,需要合并。将 [102,106)[102,106)[102,106) 和 [106,+∞)[106,+\infty)[106,+∞) 合并:

合并后:

fof_ofo fef_efe
(−∞,94)(-\infty, 94)(−∞,94) 6 5.47
[94,98)[94, 98)[94,98) 12 12.51
[98,102)[98, 102)[98,102) 17 16.61
[102,+∞)[102, +\infty)[102,+∞) 15 15.43

Step 3: 计算 χ²

χ2=(6−5.47)25.47+(12−12.51)212.51+(17−16.61)216.61+(15−15.43)215.43\chi^2 = \frac{(6-5.47)^2}{5.47} + \frac{(12-12.51)^2}{12.51} + \frac{(17-16.61)^2}{16.61} + \frac{(15-15.43)^2}{15.43}χ2=5.47(6−5.47)2+12.51(12−12.51)2+16.61(17−16.61)2+15.43(15−15.43)2

=0.28095.47+0.260112.51+0.152116.61+0.184915.43= \frac{0.2809}{5.47} + \frac{0.2601}{12.51} + \frac{0.1521}{16.61} + \frac{0.1849}{15.43}=5.470.2809+12.510.2601+16.610.1521+15.430.1849

=0.0514+0.0208+0.0092+0.0120=0.0934= 0.0514 + 0.0208 + 0.0092 + 0.0120 = 0.0934=0.0514+0.0208+0.0092+0.0120=0.0934

Step 4: 自由度

合并后 k=4k = 4k=4,估计参数 r=2r = 2r=2(μ\muμ 和 σ2\sigma^2σ2)

ν=4−1−2=1\nu = 4 - 1 - 2 = 1ν=4−1−2=1

Step 5: 判断

χ0.052(1)=3.841\chi^2_{0.05}(1) = 3.841χ0.052(1)=3.841

χ2=0.0934<3.841\chi^2 = 0.0934 < 3.841χ2=0.0934<3.841

结论: 不拒绝 H0H_0H0,可以认为零件重量服从正态分布。


三、列联分析:独立性检验

3.1 列联表(Contingency Table)

列联表是将两个分类变量的频数交叉分类后形成的二维表格。

一般的 r×cr \times cr×c 列联表结构如下:

列变量 B1B_1B1 列变量 B2B_2B2 ⋯\cdots⋯ 列变量 BcB_cBc 行合计
行变量 A1A_1A1 f11f_{11}f11 f12f_{12}f12 ⋯\cdots⋯ f1cf_{1c}f1c R1R_1R1
行变量 A2A_2A2 f21f_{21}f21 f22f_{22}f22 ⋯\cdots⋯ f2cf_{2c}f2c R2R_2R2
⋮\vdots⋮ ⋮\vdots⋮ ⋮\vdots⋮ ⋱\ddots⋱ ⋮\vdots⋮ ⋮\vdots⋮
行变量 ArA_rAr fr1f_{r1}fr1 fr2f_{r2}fr2 ⋯\cdots⋯ frcf_{rc}frc RrR_rRr
列合计 C1C_1C1 C2C_2C2 ⋯\cdots⋯ CcC_cCc nnn

其中:

  • Ri=∑j=1cfijR_i = \sum_{j=1}^{c} f_{ij}Ri=∑j=1cfij 为第 iii 行的合计
  • Cj=∑i=1rfijC_j = \sum_{i=1}^{r} f_{ij}Cj=∑i=1rfij 为第 jjj 列的合计
  • n=∑i=1r∑j=1cfijn = \sum_{i=1}^{r} \sum_{j=1}^{c} f_{ij}n=∑i=1r∑j=1cfij 为总样本量

3.2 独立性检验的假设

H0:两个分类变量之间相互独立H_0: \text{两个分类变量之间相互独立}H0:两个分类变量之间相互独立

H1:两个分类变量之间不独立(存在关联)H_1: \text{两个分类变量之间不独立(存在关联)}H1:两个分类变量之间不独立(存在关联)


3.3 期望频数的推导

在 H0H_0H0(独立性)成立时:

P(Ai∩Bj)=P(Ai)⋅P(Bj)P(A_i \cap B_j) = P(A_i) \cdot P(B_j)P(Ai∩Bj)=P(Ai)⋅P(Bj)

用样本估计:

P^(Ai)=Rin,P^(Bj)=Cjn\hat{P}(A_i) = \frac{R_i}{n}, \quad \hat{P}(B_j) = \frac{C_j}{n}P^(Ai)=nRi,P^(Bj)=nCj

因此,单元格 (i,j)(i,j)(i,j) 的期望频数为:

feij=n⋅P^(Ai)⋅P^(Bj)=Ri⋅Cjn\boxed{f_{e_{ij}} = n \cdot \hat{P}(A_i) \cdot \hat{P}(B_j) = \frac{R_i \cdot C_j}{n}}feij=n⋅P^(Ai)⋅P^(Bj)=nRi⋅Cj


3.4 检验统计量

χ2=∑i=1r∑j=1c(foij−feij)2feij\boxed{\chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(f_{o_{ij}} - f_{e_{ij}})^2}{f_{e_{ij}}}}χ2=i=1∑rj=1∑cfeij(foij−feij)2


3.5 自由度的推导

推导过程:

考虑 r×cr \times cr×c 列联表中的所有频数 fijf_{ij}fij,i=1,...,ri = 1,\ldots,ri=1,...,r,j=1,...,cj = 1,\ldots,cj=1,...,c。

约束条件:

(1)行合计约束:∑j=1cfij=Ri\sum_{j=1}^c f_{ij} = R_i∑j=1cfij=Ri(i=1,...,ri = 1, \ldots, ri=1,...,r),共 rrr 个约束;

(2)列合计约束:∑i=1rfij=Cj\sum_{i=1}^r f_{ij} = C_j∑i=1rfij=Cj(j=1,...,cj = 1, \ldots, cj=1,...,c),共 ccc 个约束。

但这 r+cr + cr+c 个约束中有一个是冗余的(因为 ∑Ri=∑Cj=n\sum R_i = \sum C_j = n∑Ri=∑Cj=n),所以独立约束的个数 为 r+c−1r + c - 1r+c−1。

列联表总共有 r×cr \times cr×c 个单元格,因此自由度为:

ν=rc−(r+c−1)=(r−1)(c−1)\boxed{\nu = rc - (r + c - 1) = (r-1)(c-1)}ν=rc−(r+c−1)=(r−1)(c−1)


3.6 完整的例题推导

【例题4】吸烟与患肺癌的独立性检验

调查 300 人的吸烟习惯与是否患肺癌的情况如下:

患肺癌 未患肺癌 合计
吸烟 42 108 150
不吸烟 18 132 150
合计 60 240 300

在 α=0.05\alpha = 0.05α=0.05 下,检验吸烟与患肺癌是否独立。

解:

H0H_0H0: 吸烟与患肺癌独立

H1H_1H1: 吸烟与患肺癌不独立

Step 1: 计算期望频数

fe11=150×60300=30,fe12=150×240300=120f_{e_{11}} = \frac{150 \times 60}{300} = 30, \quad f_{e_{12}} = \frac{150 \times 240}{300} = 120fe11=300150×60=30,fe12=300150×240=120

fe21=150×60300=30,fe22=150×240300=120f_{e_{21}} = \frac{150 \times 60}{300} = 30, \quad f_{e_{22}} = \frac{150 \times 240}{300} = 120fe21=300150×60=30,fe22=300150×240=120

Step 2: 计算 χ²

χ2=(42−30)230+(108−120)2120+(18−30)230+(132−120)2120\chi^2 = \frac{(42-30)^2}{30} + \frac{(108-120)^2}{120} + \frac{(18-30)^2}{30} + \frac{(132-120)^2}{120}χ2=30(42−30)2+120(108−120)2+30(18−30)2+120(132−120)2

=14430+144120+14430+144120= \frac{144}{30} + \frac{144}{120} + \frac{144}{30} + \frac{144}{120}=30144+120144+30144+120144

=4.80+1.20+4.80+1.20=12.00= 4.80 + 1.20 + 4.80 + 1.20 = 12.00=4.80+1.20+4.80+1.20=12.00

Step 3: 自由度

ν=(2−1)(2−1)=1\nu = (2-1)(2-1) = 1ν=(2−1)(2−1)=1

Step 4: 判断

χ0.052(1)=3.841\chi^2_{0.05}(1) = 3.841χ0.052(1)=3.841

χ2=12.00>3.841\chi^2 = 12.00 > 3.841χ2=12.00>3.841

结论: 拒绝 H0H_0H0,在 0.05 的显著性水平下,有充分证据表明吸烟与患肺癌之间存在关联。


【例题5】3×43 \times 43×4 列联表

某公司调查不同年龄段的员工对三种工作模式(远程/混合/到岗)的偏好,数据如下:

远程 混合 到岗 合计
青年(<30岁) 30 45 25 100
中年(30-50岁) 20 55 45 120
老年(>50岁) 10 30 40 80
合计 60 130 110 300

检验年龄段与工作模式偏好是否独立(α=0.05\alpha = 0.05α=0.05)。

解:

H0H_0H0: 年龄段与工作模式偏好独立

H1H_1H1: 年龄段与工作模式偏好不独立

期望频数:

fe11=100×60300=20,fe12=100×130300=43.33,fe13=100×110300=36.67f_{e_{11}} = \frac{100 \times 60}{300} = 20, \quad f_{e_{12}} = \frac{100 \times 130}{300} = 43.33, \quad f_{e_{13}} = \frac{100 \times 110}{300} = 36.67fe11=300100×60=20,fe12=300100×130=43.33,fe13=300100×110=36.67

fe21=120×60300=24,fe22=120×130300=52,fe23=120×110300=44f_{e_{21}} = \frac{120 \times 60}{300} = 24, \quad f_{e_{22}} = \frac{120 \times 130}{300} = 52, \quad f_{e_{23}} = \frac{120 \times 110}{300} = 44fe21=300120×60=24,fe22=300120×130=52,fe23=300120×110=44

fe31=80×60300=16,fe32=80×130300=34.67,fe33=80×110300=29.33f_{e_{31}} = \frac{80 \times 60}{300} = 16, \quad f_{e_{32}} = \frac{80 \times 130}{300} = 34.67, \quad f_{e_{33}} = \frac{80 \times 110}{300} = 29.33fe31=30080×60=16,fe32=30080×130=34.67,fe33=30080×110=29.33

χ² 统计量:

χ2=(30−20)220+(45−43.33)243.33+(25−36.67)236.67\chi^2 = \frac{(30-20)^2}{20} + \frac{(45-43.33)^2}{43.33} + \frac{(25-36.67)^2}{36.67}χ2=20(30−20)2+43.33(45−43.33)2+36.67(25−36.67)2

+(20−24)224+(55−52)252+(45−44)244+ \frac{(20-24)^2}{24} + \frac{(55-52)^2}{52} + \frac{(45-44)^2}{44}+24(20−24)2+52(55−52)2+44(45−44)2

+(10−16)216+(30−34.67)234.67+(40−29.33)229.33+ \frac{(10-16)^2}{16} + \frac{(30-34.67)^2}{34.67} + \frac{(40-29.33)^2}{29.33}+16(10−16)2+34.67(30−34.67)2+29.33(40−29.33)2

=10020+2.7943.33+136.1936.67= \frac{100}{20} + \frac{2.79}{43.33} + \frac{136.19}{36.67}=20100+43.332.79+36.67136.19

+1624+952+144+ \frac{16}{24} + \frac{9}{52} + \frac{1}{44}+2416+529+441

+3616+21.8134.67+113.8529.33+ \frac{36}{16} + \frac{21.81}{34.67} + \frac{113.85}{29.33}+1636+34.6721.81+29.33113.85

=5.00+0.064+3.714+0.667+0.173+0.023+2.250+0.629+3.882= 5.00 + 0.064 + 3.714 + 0.667 + 0.173 + 0.023 + 2.250 + 0.629 + 3.882=5.00+0.064+3.714+0.667+0.173+0.023+2.250+0.629+3.882

=16.402= 16.402=16.402

自由度:

ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4

判断:

χ0.052(4)=9.488\chi^2_{0.05}(4) = 9.488χ0.052(4)=9.488

χ2=16.402>9.488\chi^2 = 16.402 > 9.488χ2=16.402>9.488

结论: 拒绝 H0H_0H0,年龄段与工作模式偏好之间存在显著关联。

相关推荐
dankokoko3 小时前
一.函数与极限2
学习
知识分享小能手3 小时前
统计学学习教程,从入门到精通,分类数据分析 — 知识点详解(14)
学习·分类·数据分析
菜鸟‍3 小时前
【论文学习】MICCAI 2025 || ARSeg:面向不完整文本提示的鲁棒医学图像指代表达分割
图像处理·学习
三克的油3 小时前
c++算法学习-4
学习
AC赳赳老秦5 小时前
司法公开数据采集应用:OpenClaw 抓取裁判文书公开信息,批量整理同类参考案例
java·大数据·python·数据挖掘·数据分析·php·openclaw
知识分享小能手6 小时前
统计学学习教程,从入门到精通,参数估计 — 知识点详解与公式推导(10)
学习·机器学习·概率论
有Li6 小时前
EvoMDT:用于多癌种结构化临床决策的自进化多智能体系统文献速递/医学智能体前沿
人工智能·学习·分类·文献·医学生
初学者,亦行者6 小时前
利用Pyecharts绘制堆叠柱状图
python·信息可视化·数据分析
sulikey9 小时前
个人Linux操作系统学习笔记11 - 环境变量
linux·笔记·学习