统计学学习教程,从入门到精通,分类数据分析 — 知识点详解(14)

四、列联表中的相关测量

χ² 检验只能告诉我们两个变量是否独立(是否有关联 ),但不能告诉我们关联的强度和方向。因此需要相关测量指标。

4.1 φ 系数(Phi Coefficient)--- 用于 2×22 \times 22×2 表

ϕ=χ2n\boxed{\phi = \sqrt{\frac{\chi^2}{n}}}ϕ=nχ2

推导:

对于 2×22 \times 22×2 列联表:

B1B_1B1 B2B_2B2 合计
A1A_1A1 aaa bbb a+ba+ba+b
A2A_2A2 ccc ddd c+dc+dc+d
合计 a+ca+ca+c b+db+db+d nnn

可以证明:

χ2=n(ad−bc)2(a+b)(c+d)(a+c)(b+d)\chi^2 = \frac{n(ad - bc)^2}{(a+b)(c+d)(a+c)(b+d)}χ2=(a+b)(c+d)(a+c)(b+d)n(ad−bc)2

因此:

ϕ=χ2n=∣ad−bc∣(a+b)(c+d)(a+c)(b+d)\phi = \sqrt{\frac{\chi^2}{n}} = \frac{|ad - bc|}{\sqrt{(a+b)(c+d)(a+c)(b+d)}}ϕ=nχ2 =(a+b)(c+d)(a+c)(b+d) ∣ad−bc∣

性质:

  • ϕ\phiϕ 的取值范围为 0,10, 10,1
  • ϕ=0\phi = 0ϕ=0 表示完全独立
  • ϕ=1\phi = 1ϕ=1 表示完全关联

4.2 C 系数(Contingency Coefficient)--- 适用于任意 r×cr \times cr×c 表

C=χ2χ2+n\boxed{C = \sqrt{\frac{\chi^2}{\chi^2 + n}}}C=χ2+nχ2

性质:

  • C≥0C \geq 0C≥0
  • C=0C = 0C=0 表示完全独立
  • CCC 的最大值取决于表格的维度,对于 r×cr \times cr×c 表:

Cmax⁡=min⁡(r,c)−1min⁡(r,c)C_{\max} = \sqrt{\frac{\min(r,c) - 1}{\min(r,c)}}Cmax=min(r,c)min(r,c)−1

例如,2×22 \times 22×2 表的 Cmax⁡=12=0.707C_{\max} = \sqrt{\frac{1}{2}} = 0.707Cmax=21 =0.707,3×33 \times 33×3 表的 Cmax⁡=23=0.816C_{\max} = \sqrt{\frac{2}{3}} = 0.816Cmax=32 =0.816。

因此,CCC 系数无法达到 1,不同维度的列联表之间的 CCC 值不可直接比较。


4.3 V 系数(Cramér's V)--- 适用于任意 r×cr \times cr×c 表(推荐)

KaTeX parse error: Unexpected end of input in a macro argument, expected '}' at end of input: ...min(r-1, c-1)}}

性质:

  • 0≤V≤10 \leq V \leq 10≤V≤1
  • V=0V = 0V=0 表示完全独立
  • V=1V = 1V=1 表示完全关联
  • 不同维度的列联表之间可以比较

推导思路:

Cramér's V 是对 φ 系数的修正推广。在 2×22 \times 22×2 表中,V=ϕV = \phiV=ϕ。对于更大的表,除以 min⁡(r−1,c−1)\min(r-1, c-1)min(r−1,c−1) 使得上界归一化为 1。


4.4 λ 系数(Lambda Coefficient)--- 不对称关联测量

λ 系数衡量的是:知道一个变量的信息后,预测另一个变量的错误率减少了多少

对称 λ:

λ=∑imax⁡jfij+∑jmax⁡ifij−max⁡iRi−max⁡jCj2n−max⁡iRi−max⁡jCj\lambda = \frac{\sum_{i} \max_j f_{ij} + \sum_{j} \max_i f_{ij} - \max_i R_i - \max_j C_j}{2n - \max_i R_i - \max_j C_j}λ=2n−maxiRi−maxjCj∑imaxjfij+∑jmaxifij−maxiRi−maxjCj

非对称 λ(以行变量预测列变量):

λB∣A=∑i=1rmax⁡jfij−max⁡jCjn−max⁡jCj\lambda_{B|A} = \frac{\sum_{i=1}^{r} \max_{j} f_{ij} - \max_j C_j}{n - \max_j C_j}λB∣A=n−maxjCj∑i=1rmaxjfij−maxjCj

解释:

  • λ=0\lambda = 0λ=0:知道行变量对预测列变量毫无帮助
  • λ=1\lambda = 1λ=1:知道行变量可以完全预测列变量

4.5 各相关测量指标的比较

指标 适用范围 取值范围 是否可达1 特点
ϕ\phiϕ 2×22 \times 22×2 表 0,10, 10,1 简单直观
CCC r×cr \times cr×c 表 0,Cmax⁡0, C_{\\max}0,Cmax 否(<1<1<1) 不可跨维度比较
VVV r×cr \times cr×c 表 0,10, 10,1 最通用,推荐使用
λ\lambdaλ r×cr \times cr×c 表 0,10, 10,1 基于预测改善,不对称

五、列联分析中应注意的问题

5.1 期望频数不宜过小

  • 一般要求每个单元格的期望频数 fe≥5f_e \geq 5fe≥5。
  • 若 fe<5f_e < 5fe<5,χ² 统计量的近似效果不好,可能导致检验结果不可靠。
  • 补救方法: 合并相邻的行或列。

5.2 样本量的要求

  • χ² 检验要求独立随机抽样
  • 样本量不宜太小,一般要求 n≥50n \geq 50n≥50,或至少所有 fe≥5f_e \geq 5fe≥5。
  • 样本量过大时,即使实际关联很小,χ² 检验也可能显著(因为 χ² 值与 nnn 成正比),此时应关注相关强度指标(如 V、C 等)而非仅看 χ² 的显著性。

5.3 自由度的正确计算

  • 拟合优度检验:ν=k−1−r\nu = k - 1 - rν=k−1−r(rrr 为估计的参数个数)
  • 独立性检验:ν=(r−1)(c−1)\nu = (r-1)(c-1)ν=(r−1)(c−1)
  • 二者不可混淆。

5.4 相关 ≠ 因果

  • 列联分析检测到的关联不一定意味着因果关系。
  • 可能存在混杂变量(confounding variable)同时影响两个分类变量。

5.5 Fisher 精确检验

  • 当样本量很小,或某些期望频数 fe<5f_e < 5fe<5 时,应使用 Fisher 精确检验代替 χ² 检验。
  • Fisher 精确检验基于超几何分布直接计算概率,不依赖渐近近似。

对于 2×22 \times 22×2 表:

P=(a+ba)(c+dc)(na+c)=(a+b)!(c+d)!(a+c)!(b+d)!n! a! b! c! d!P = \frac{\binom{a+b}{a}\binom{c+d}{c}}{\binom{n}{a+c}} = \frac{(a+b)!(c+d)!(a+c)!(b+d)!}{n! \, a! \, b! \, c! \, d!}P=(a+cn)(aa+b)(cc+d)=n!a!b!c!d!(a+b)!(c+d)!(a+c)!(b+d)!

5.6 连续性修正

对于 2×22 \times 22×2 列联表,当自由度为 1 时,使用 Yates 连续性修正(correction for continuity)

χ2=∑i=1r∑j=1c(∣fo−fe∣−0.5)2fe\chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(|f_o - f_e| - 0.5)^2}{f_e}χ2=i=1∑rj=1∑cfe(∣fo−fe∣−0.5)2


六、思考与练习

【习题1】拟合优度检验(均匀分布)

某随机数生成器声称能产生均匀分布的随机整数(1 到 6),一位程序员测试了 120 次,结果如下:

数字 1 2 3 4 5 6
频数 15 22 18 25 16 24

在 α=0.05\alpha = 0.05α=0.05 下检验该随机数生成器产生的数字是否均匀。

解答:

H0H_0H0: 均匀分布,pi=1/6p_i = 1/6pi=1/6;H1H_1H1: 不是均匀分布

期望频数:fe=120/6=20f_e = 120/6 = 20fe=120/6=20

χ2=(15−20)220+(22−20)220+(18−20)220+(25−20)220+(16−20)220+(24−20)220\chi^2 = \frac{(15-20)^2}{20} + \frac{(22-20)^2}{20} + \frac{(18-20)^2}{20} + \frac{(25-20)^2}{20} + \frac{(16-20)^2}{20} + \frac{(24-20)^2}{20}χ2=20(15−20)2+20(22−20)2+20(18−20)2+20(25−20)2+20(16−20)2+20(24−20)2

=25+4+4+25+16+1620=9020=4.50= \frac{25+4+4+25+16+16}{20} = \frac{90}{20} = 4.50=2025+4+4+25+16+16=2090=4.50

ν=5\nu = 5ν=5,χ0.052(5)=11.071\chi^2_{0.05}(5) = 11.071χ0.052(5)=11.071

χ2=4.50<11.071\chi^2 = 4.50 < 11.071χ2=4.50<11.071,不拒绝 H0H_0H0,随机数生成器产生的数字可以认为是均匀的。


【习题2】泊松分布拟合

在某十字路口,200 个小时内记录到的交通事故次数分布如下:

事故次数 0 1 2 3 ≥4\geq 4≥4
小时数 84 72 30 10 4

检验事故次数是否服从泊松分布(α=0.05\alpha = 0.05α=0.05)。

解答:

估计 λ\lambdaλ:

λ^=0×84+1×72+2×30+3×10+4×4200=0+72+60+30+16200=178200=0.89\hat{\lambda} = \frac{0 \times 84 + 1 \times 72 + 2 \times 30 + 3 \times 10 + 4 \times 4}{200} = \frac{0 + 72 + 60 + 30 + 16}{200} = \frac{178}{200} = 0.89λ^=2000×84+1×72+2×30+3×10+4×4=2000+72+60+30+16=200178=0.89

e−0.89=0.4107e^{-0.89} = 0.4107e−0.89=0.4107

xxx pip_ipi fe=200pif_e = 200p_ife=200pi fof_ofo
0 0.41070.41070.4107 82.1482.1482.14 84
1 0.4107×0.89=0.36550.4107 \times 0.89 = 0.36550.4107×0.89=0.3655 73.1073.1073.10 72
2 0.3655×0.89/2=0.16270.3655 \times 0.89/2 = 0.16270.3655×0.89/2=0.1627 32.5432.5432.54 30
3 0.1627×0.89/3=0.04830.1627 \times 0.89/3 = 0.04830.1627×0.89/3=0.0483 9.669.669.66 10
≥4\geq 4≥4 1−0.4107−0.3655−0.1627−0.0483=0.01281 - 0.4107 - 0.3655 - 0.1627 - 0.0483 = 0.01281−0.4107−0.3655−0.1627−0.0483=0.0128 2.562.562.56 4

第5组 fe=2.56<5f_e = 2.56 < 5fe=2.56<5,与第4组合并:

合并后 fof_ofo fef_efe
0 84 82.14
1 72 73.10
2 30 32.54
≥3\geq 3≥3 14 12.22

χ2=(84−82.14)282.14+(72−73.10)273.10+(30−32.54)232.54+(14−12.22)212.22\chi^2 = \frac{(84-82.14)^2}{82.14} + \frac{(72-73.10)^2}{73.10} + \frac{(30-32.54)^2}{32.54} + \frac{(14-12.22)^2}{12.22}χ2=82.14(84−82.14)2+73.10(72−73.10)2+32.54(30−32.54)2+12.22(14−12.22)2

=3.4682.14+1.2173.10+6.4532.54+3.1712.22= \frac{3.46}{82.14} + \frac{1.21}{73.10} + \frac{6.45}{32.54} + \frac{3.17}{12.22}=82.143.46+73.101.21+32.546.45+12.223.17

=0.042+0.017+0.198+0.259=0.516= 0.042 + 0.017 + 0.198 + 0.259 = 0.516=0.042+0.017+0.198+0.259=0.516

ν=4−1−1=2\nu = 4 - 1 - 1 = 2ν=4−1−1=2,χ0.052(2)=5.991\chi^2_{0.05}(2) = 5.991χ0.052(2)=5.991

χ2=0.516<5.991\chi^2 = 0.516 < 5.991χ2=0.516<5.991,不拒绝 H0H_0H0,可以认为事故次数服从泊松分布。


【习题3】独立性检验(2×22 \times 22×2 表)

某医院研究治疗方法(传统/新法)与疗效(有效/无效)的关系:

有效 无效 合计
传统方法 60 40 100
新方法 80 20 100
合计 140 60 200

检验治疗方法与疗效是否独立(α=0.05\alpha = 0.05α=0.05)。

解答:

H0H_0H0: 治疗方法与疗效独立

期望频数:

fe11=100×140200=70,fe12=100×60200=30f_{e_{11}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{12}} = \frac{100 \times 60}{200} = 30fe11=200100×140=70,fe12=200100×60=30

fe21=100×140200=70,fe22=100×60200=30f_{e_{21}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{22}} = \frac{100 \times 60}{200} = 30fe21=200100×140=70,fe22=200100×60=30

χ2=(60−70)270+(40−30)230+(80−70)270+(20−30)230\chi^2 = \frac{(60-70)^2}{70} + \frac{(40-30)^2}{30} + \frac{(80-70)^2}{70} + \frac{(20-30)^2}{30}χ2=70(60−70)2+30(40−30)2+70(80−70)2+30(20−30)2

=10070+10030+10070+10030=1.429+3.333+1.429+3.333=9.524= \frac{100}{70} + \frac{100}{30} + \frac{100}{70} + \frac{100}{30} = 1.429 + 3.333 + 1.429 + 3.333 = 9.524=70100+30100+70100+30100=1.429+3.333+1.429+3.333=9.524

ν=1\nu = 1ν=1,χ0.052(1)=3.841\chi^2_{0.05}(1) = 3.841χ0.052(1)=3.841

χ2=9.524>3.841\chi^2 = 9.524 > 3.841χ2=9.524>3.841,拒绝 H0H_0H0,治疗方法与疗效存在显著关联。

相关测量:

ϕ=9.524200=0.04762=0.218\phi = \sqrt{\frac{9.524}{200}} = \sqrt{0.04762} = 0.218ϕ=2009.524 =0.04762 =0.218

C=9.5249.524+200=0.04545=0.213C = \sqrt{\frac{9.524}{9.524 + 200}} = \sqrt{0.04545} = 0.213C=9.524+2009.524 =0.04545 =0.213

V=9.524200×1=0.218V = \sqrt{\frac{9.524}{200 \times 1}} = 0.218V=200×19.524 =0.218

ϕ=V=0.218\phi = V = 0.218ϕ=V=0.218,表明治疗方法与疗效之间存在中等偏弱的正相关。


【习题4】3×33 \times 33×3 列联表 + V 系数

某公司调查三种学历(高中、本科、研究生)的员工与三种晋升速度(快、中、慢)的关系:

合计
高中 10 30 40 80
本科 30 60 30 120
研究生 40 50 10 100
合计 80 140 80 300

检验学历与晋升速度是否独立,并计算 Cramér's V。

解答:

H0H_0H0: 学历与晋升速度独立

期望频数:

fe11=80×80300=21.33,fe12=80×140300=37.33,fe13=80×80300=21.33f_{e_{11}} = \frac{80 \times 80}{300} = 21.33, \quad f_{e_{12}} = \frac{80 \times 140}{300} = 37.33, \quad f_{e_{13}} = \frac{80 \times 80}{300} = 21.33fe11=30080×80=21.33,fe12=30080×140=37.33,fe13=30080×80=21.33

fe21=120×80300=32,fe22=120×140300=56,fe23=120×80300=32f_{e_{21}} = \frac{120 \times 80}{300} = 32, \quad f_{e_{22}} = \frac{120 \times 140}{300} = 56, \quad f_{e_{23}} = \frac{120 \times 80}{300} = 32fe21=300120×80=32,fe22=300120×140=56,fe23=300120×80=32

fe31=100×80300=26.67,fe32=100×140300=46.67,fe33=100×80300=26.67f_{e_{31}} = \frac{100 \times 80}{300} = 26.67, \quad f_{e_{32}} = \frac{100 \times 140}{300} = 46.67, \quad f_{e_{33}} = \frac{100 \times 80}{300} = 26.67fe31=300100×80=26.67,fe32=300100×140=46.67,fe33=300100×80=26.67

χ2=(10−21.33)221.33+(30−37.33)237.33+(40−21.33)221.33\chi^2 = \frac{(10-21.33)^2}{21.33} + \frac{(30-37.33)^2}{37.33} + \frac{(40-21.33)^2}{21.33}χ2=21.33(10−21.33)2+37.33(30−37.33)2+21.33(40−21.33)2

+(30−32)232+(60−56)256+(30−32)232+ \frac{(30-32)^2}{32} + \frac{(60-56)^2}{56} + \frac{(30-32)^2}{32}+32(30−32)2+56(60−56)2+32(30−32)2

+(40−26.67)226.67+(50−46.67)246.67+(10−26.67)226.67+ \frac{(40-26.67)^2}{26.67} + \frac{(50-46.67)^2}{46.67} + \frac{(10-26.67)^2}{26.67}+26.67(40−26.67)2+46.67(50−46.67)2+26.67(10−26.67)2

=128.3721.33+53.7337.33+348.5721.33+432+1656+432+177.6926.67+11.0946.67+278.0926.67= \frac{128.37}{21.33} + \frac{53.73}{37.33} + \frac{348.57}{21.33} + \frac{4}{32} + \frac{16}{56} + \frac{4}{32} + \frac{177.69}{26.67} + \frac{11.09}{46.67} + \frac{278.09}{26.67}=21.33128.37+37.3353.73+21.33348.57+324+5616+324+26.67177.69+46.6711.09+26.67278.09

=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427= 6.018 + 1.439 + 16.342 + 0.125 + 0.286 + 0.125 + 6.663 + 0.238 + 10.427=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427

=41.663= 41.663=41.663

ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.052(4)=9.488\chi^2_{0.05}(4) = 9.488χ0.052(4)=9.488

χ2=41.663>9.488\chi^2 = 41.663 > 9.488χ2=41.663>9.488,拒绝 H0H_0H0,学历与晋升速度存在显著关联。

V=41.663300×min⁡(2,2)=41.663600=0.06944=0.264V = \sqrt{\frac{41.663}{300 \times \min(2, 2)}} = \sqrt{\frac{41.663}{600}} = \sqrt{0.06944} = 0.264V=300×min(2,2)41.663 =60041.663 =0.06944 =0.264

V=0.264V = 0.264V=0.264,说明学历与晋升速度之间存在中等程度的关联。


【习题5】综合应用

某市场研究公司调查了 400 名消费者的品牌偏好(A/B/C)与收入水平(高/中/低):

品牌 A 品牌 B 品牌 C 合计
高收入 60 40 20 120
中收入 50 70 40 160
低收入 20 50 50 120
合计 130 160 110 400

(1)检验收入水平与品牌偏好是否独立(α=0.01\alpha = 0.01α=0.01)

(2)计算 Cramér's V 系数并解释

解答:

(1)独立性检验

H0H_0H0: 收入水平与品牌偏好独立

期望频数:

品牌 A 品牌 B 品牌 C
高收入 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33
中收入 160×130400=52\frac{160 \times 130}{400} = 52400160×130=52 160×160400=64\frac{160 \times 160}{400} = 64400160×160=64 160×110400=44\frac{160 \times 110}{400} = 44400160×110=44
低收入 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33

χ2=(60−39)239+(40−48)248+(20−33)233\chi^2 = \frac{(60-39)^2}{39} + \frac{(40-48)^2}{48} + \frac{(20-33)^2}{33}χ2=39(60−39)2+48(40−48)2+33(20−33)2

+(50−52)252+(70−64)264+(40−44)244+ \frac{(50-52)^2}{52} + \frac{(70-64)^2}{64} + \frac{(40-44)^2}{44}+52(50−52)2+64(70−64)2+44(40−44)2

+(20−39)239+(50−48)248+(50−33)233+ \frac{(20-39)^2}{39} + \frac{(50-48)^2}{48} + \frac{(50-33)^2}{33}+39(20−39)2+48(50−48)2+33(50−33)2

=44139+6448+16933+452+3664+1644+36139+448+28933= \frac{441}{39} + \frac{64}{48} + \frac{169}{33} + \frac{4}{52} + \frac{36}{64} + \frac{16}{44} + \frac{361}{39} + \frac{4}{48} + \frac{289}{33}=39441+4864+33169+524+6436+4416+39361+484+33289

=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758= 11.308 + 1.333 + 5.121 + 0.077 + 0.563 + 0.364 + 9.256 + 0.083 + 8.758=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758

=36.863= 36.863=36.863

ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.012(4)=13.277\chi^2_{0.01}(4) = 13.277χ0.012(4)=13.277

χ2=36.863>13.277\chi^2 = 36.863 > 13.277χ2=36.863>13.277

结论: 在 α=0.01\alpha = 0.01α=0.01 的水平下拒绝 H0H_0H0,收入水平与品牌偏好之间存在极显著的关联。

(2)Cramér's V 系数

V=χ2n⋅min⁡(r−1,c−1)=36.863400×2=0.04608=0.2147V = \sqrt{\frac{\chi^2}{n \cdot \min(r-1, c-1)}} = \sqrt{\frac{36.863}{400 \times 2}} = \sqrt{0.04608} = 0.2147V=n⋅min(r−1,c−1)χ2 =400×236.863 =0.04608 =0.2147

V=0.215V = 0.215V=0.215,表明收入水平与品牌偏好之间存在中等偏低 程度的关联。虽然统计上高度显著,但由于样本量较大(n=400n=400n=400),即使关联强度不大,也能检出显著性。实际业务决策中应结合实际意义综合判断。


七、本章知识框架总结

四、列联表中的相关测量

χ² 检验只能告诉我们两个变量是否独立(是否有关联 ),但不能告诉我们关联的强度和方向。因此需要相关测量指标。

4.1 φ 系数(Phi Coefficient)--- 用于 2×22 \times 22×2 表

ϕ=χ2n\boxed{\phi = \sqrt{\frac{\chi^2}{n}}}ϕ=nχ2

推导:

对于 2×22 \times 22×2 列联表:

B1B_1B1 B2B_2B2 合计
A1A_1A1 aaa bbb a+ba+ba+b
A2A_2A2 ccc ddd c+dc+dc+d
合计 a+ca+ca+c b+db+db+d nnn

可以证明:

χ2=n(ad−bc)2(a+b)(c+d)(a+c)(b+d)\chi^2 = \frac{n(ad - bc)^2}{(a+b)(c+d)(a+c)(b+d)}χ2=(a+b)(c+d)(a+c)(b+d)n(ad−bc)2

因此:

ϕ=χ2n=∣ad−bc∣(a+b)(c+d)(a+c)(b+d)\phi = \sqrt{\frac{\chi^2}{n}} = \frac{|ad - bc|}{\sqrt{(a+b)(c+d)(a+c)(b+d)}}ϕ=nχ2 =(a+b)(c+d)(a+c)(b+d) ∣ad−bc∣

性质:

  • ϕ\phiϕ 的取值范围为 0,10, 10,1
  • ϕ=0\phi = 0ϕ=0 表示完全独立
  • ϕ=1\phi = 1ϕ=1 表示完全关联

4.2 C 系数(Contingency Coefficient)--- 适用于任意 r×cr \times cr×c 表

C=χ2χ2+n\boxed{C = \sqrt{\frac{\chi^2}{\chi^2 + n}}}C=χ2+nχ2

性质:

  • C≥0C \geq 0C≥0
  • C=0C = 0C=0 表示完全独立
  • CCC 的最大值取决于表格的维度,对于 r×cr \times cr×c 表:

Cmax⁡=min⁡(r,c)−1min⁡(r,c)C_{\max} = \sqrt{\frac{\min(r,c) - 1}{\min(r,c)}}Cmax=min(r,c)min(r,c)−1

例如,2×22 \times 22×2 表的 Cmax⁡=12=0.707C_{\max} = \sqrt{\frac{1}{2}} = 0.707Cmax=21 =0.707,3×33 \times 33×3 表的 Cmax⁡=23=0.816C_{\max} = \sqrt{\frac{2}{3}} = 0.816Cmax=32 =0.816。

因此,CCC 系数无法达到 1,不同维度的列联表之间的 CCC 值不可直接比较。


4.3 V 系数(Cramér's V)--- 适用于任意 r×cr \times cr×c 表(推荐)

KaTeX parse error: Unexpected end of input in a macro argument, expected '}' at end of input: ...min(r-1, c-1)}}

性质:

  • 0≤V≤10 \leq V \leq 10≤V≤1
  • V=0V = 0V=0 表示完全独立
  • V=1V = 1V=1 表示完全关联
  • 不同维度的列联表之间可以比较

推导思路:

Cramér's V 是对 φ 系数的修正推广。在 2×22 \times 22×2 表中,V=ϕV = \phiV=ϕ。对于更大的表,除以 min⁡(r−1,c−1)\min(r-1, c-1)min(r−1,c−1) 使得上界归一化为 1。


4.4 λ 系数(Lambda Coefficient)--- 不对称关联测量

λ 系数衡量的是:知道一个变量的信息后,预测另一个变量的错误率减少了多少

对称 λ:

λ=∑imax⁡jfij+∑jmax⁡ifij−max⁡iRi−max⁡jCj2n−max⁡iRi−max⁡jCj\lambda = \frac{\sum_{i} \max_j f_{ij} + \sum_{j} \max_i f_{ij} - \max_i R_i - \max_j C_j}{2n - \max_i R_i - \max_j C_j}λ=2n−maxiRi−maxjCj∑imaxjfij+∑jmaxifij−maxiRi−maxjCj

非对称 λ(以行变量预测列变量):

λB∣A=∑i=1rmax⁡jfij−max⁡jCjn−max⁡jCj\lambda_{B|A} = \frac{\sum_{i=1}^{r} \max_{j} f_{ij} - \max_j C_j}{n - \max_j C_j}λB∣A=n−maxjCj∑i=1rmaxjfij−maxjCj

解释:

  • λ=0\lambda = 0λ=0:知道行变量对预测列变量毫无帮助
  • λ=1\lambda = 1λ=1:知道行变量可以完全预测列变量

4.5 各相关测量指标的比较

指标 适用范围 取值范围 是否可达1 特点
ϕ\phiϕ 2×22 \times 22×2 表 0,10, 10,1 简单直观
CCC r×cr \times cr×c 表 0,Cmax⁡0, C_{\\max}0,Cmax 否(<1<1<1) 不可跨维度比较
VVV r×cr \times cr×c 表 0,10, 10,1 最通用,推荐使用
λ\lambdaλ r×cr \times cr×c 表 0,10, 10,1 基于预测改善,不对称

五、列联分析中应注意的问题

5.1 期望频数不宜过小

  • 一般要求每个单元格的期望频数 fe≥5f_e \geq 5fe≥5。
  • 若 fe<5f_e < 5fe<5,χ² 统计量的近似效果不好,可能导致检验结果不可靠。
  • 补救方法: 合并相邻的行或列。

5.2 样本量的要求

  • χ² 检验要求独立随机抽样
  • 样本量不宜太小,一般要求 n≥50n \geq 50n≥50,或至少所有 fe≥5f_e \geq 5fe≥5。
  • 样本量过大时,即使实际关联很小,χ² 检验也可能显著(因为 χ² 值与 nnn 成正比),此时应关注相关强度指标(如 V、C 等)而非仅看 χ² 的显著性。

5.3 自由度的正确计算

  • 拟合优度检验:ν=k−1−r\nu = k - 1 - rν=k−1−r(rrr 为估计的参数个数)
  • 独立性检验:ν=(r−1)(c−1)\nu = (r-1)(c-1)ν=(r−1)(c−1)
  • 二者不可混淆。

5.4 相关 ≠ 因果

  • 列联分析检测到的关联不一定意味着因果关系。
  • 可能存在混杂变量(confounding variable)同时影响两个分类变量。

5.5 Fisher 精确检验

  • 当样本量很小,或某些期望频数 fe<5f_e < 5fe<5 时,应使用 Fisher 精确检验代替 χ² 检验。
  • Fisher 精确检验基于超几何分布直接计算概率,不依赖渐近近似。

对于 2×22 \times 22×2 表:

P=(a+ba)(c+dc)(na+c)=(a+b)!(c+d)!(a+c)!(b+d)!n! a! b! c! d!P = \frac{\binom{a+b}{a}\binom{c+d}{c}}{\binom{n}{a+c}} = \frac{(a+b)!(c+d)!(a+c)!(b+d)!}{n! \, a! \, b! \, c! \, d!}P=(a+cn)(aa+b)(cc+d)=n!a!b!c!d!(a+b)!(c+d)!(a+c)!(b+d)!

5.6 连续性修正

对于 2×22 \times 22×2 列联表,当自由度为 1 时,使用 Yates 连续性修正(correction for continuity)

χ2=∑i=1r∑j=1c(∣fo−fe∣−0.5)2fe\chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(|f_o - f_e| - 0.5)^2}{f_e}χ2=i=1∑rj=1∑cfe(∣fo−fe∣−0.5)2


六、思考与练习

【习题1】拟合优度检验(均匀分布)

某随机数生成器声称能产生均匀分布的随机整数(1 到 6),一位程序员测试了 120 次,结果如下:

数字 1 2 3 4 5 6
频数 15 22 18 25 16 24

在 α=0.05\alpha = 0.05α=0.05 下检验该随机数生成器产生的数字是否均匀。

解答:

H0H_0H0: 均匀分布,pi=1/6p_i = 1/6pi=1/6;H1H_1H1: 不是均匀分布

期望频数:fe=120/6=20f_e = 120/6 = 20fe=120/6=20

χ2=(15−20)220+(22−20)220+(18−20)220+(25−20)220+(16−20)220+(24−20)220\chi^2 = \frac{(15-20)^2}{20} + \frac{(22-20)^2}{20} + \frac{(18-20)^2}{20} + \frac{(25-20)^2}{20} + \frac{(16-20)^2}{20} + \frac{(24-20)^2}{20}χ2=20(15−20)2+20(22−20)2+20(18−20)2+20(25−20)2+20(16−20)2+20(24−20)2

=25+4+4+25+16+1620=9020=4.50= \frac{25+4+4+25+16+16}{20} = \frac{90}{20} = 4.50=2025+4+4+25+16+16=2090=4.50

ν=5\nu = 5ν=5,χ0.052(5)=11.071\chi^2_{0.05}(5) = 11.071χ0.052(5)=11.071

χ2=4.50<11.071\chi^2 = 4.50 < 11.071χ2=4.50<11.071,不拒绝 H0H_0H0,随机数生成器产生的数字可以认为是均匀的。


【习题2】泊松分布拟合

在某十字路口,200 个小时内记录到的交通事故次数分布如下:

事故次数 0 1 2 3 ≥4\geq 4≥4
小时数 84 72 30 10 4

检验事故次数是否服从泊松分布(α=0.05\alpha = 0.05α=0.05)。

解答:

估计 λ\lambdaλ:

λ^=0×84+1×72+2×30+3×10+4×4200=0+72+60+30+16200=178200=0.89\hat{\lambda} = \frac{0 \times 84 + 1 \times 72 + 2 \times 30 + 3 \times 10 + 4 \times 4}{200} = \frac{0 + 72 + 60 + 30 + 16}{200} = \frac{178}{200} = 0.89λ^=2000×84+1×72+2×30+3×10+4×4=2000+72+60+30+16=200178=0.89

e−0.89=0.4107e^{-0.89} = 0.4107e−0.89=0.4107

xxx pip_ipi fe=200pif_e = 200p_ife=200pi fof_ofo
0 0.41070.41070.4107 82.1482.1482.14 84
1 0.4107×0.89=0.36550.4107 \times 0.89 = 0.36550.4107×0.89=0.3655 73.1073.1073.10 72
2 0.3655×0.89/2=0.16270.3655 \times 0.89/2 = 0.16270.3655×0.89/2=0.1627 32.5432.5432.54 30
3 0.1627×0.89/3=0.04830.1627 \times 0.89/3 = 0.04830.1627×0.89/3=0.0483 9.669.669.66 10
≥4\geq 4≥4 1−0.4107−0.3655−0.1627−0.0483=0.01281 - 0.4107 - 0.3655 - 0.1627 - 0.0483 = 0.01281−0.4107−0.3655−0.1627−0.0483=0.0128 2.562.562.56 4

第5组 fe=2.56<5f_e = 2.56 < 5fe=2.56<5,与第4组合并:

合并后 fof_ofo fef_efe
0 84 82.14
1 72 73.10
2 30 32.54
≥3\geq 3≥3 14 12.22

χ2=(84−82.14)282.14+(72−73.10)273.10+(30−32.54)232.54+(14−12.22)212.22\chi^2 = \frac{(84-82.14)^2}{82.14} + \frac{(72-73.10)^2}{73.10} + \frac{(30-32.54)^2}{32.54} + \frac{(14-12.22)^2}{12.22}χ2=82.14(84−82.14)2+73.10(72−73.10)2+32.54(30−32.54)2+12.22(14−12.22)2

=3.4682.14+1.2173.10+6.4532.54+3.1712.22= \frac{3.46}{82.14} + \frac{1.21}{73.10} + \frac{6.45}{32.54} + \frac{3.17}{12.22}=82.143.46+73.101.21+32.546.45+12.223.17

=0.042+0.017+0.198+0.259=0.516= 0.042 + 0.017 + 0.198 + 0.259 = 0.516=0.042+0.017+0.198+0.259=0.516

ν=4−1−1=2\nu = 4 - 1 - 1 = 2ν=4−1−1=2,χ0.052(2)=5.991\chi^2_{0.05}(2) = 5.991χ0.052(2)=5.991

χ2=0.516<5.991\chi^2 = 0.516 < 5.991χ2=0.516<5.991,不拒绝 H0H_0H0,可以认为事故次数服从泊松分布。


【习题3】独立性检验(2×22 \times 22×2 表)

某医院研究治疗方法(传统/新法)与疗效(有效/无效)的关系:

有效 无效 合计
传统方法 60 40 100
新方法 80 20 100
合计 140 60 200

检验治疗方法与疗效是否独立(α=0.05\alpha = 0.05α=0.05)。

解答:

H0H_0H0: 治疗方法与疗效独立

期望频数:

fe11=100×140200=70,fe12=100×60200=30f_{e_{11}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{12}} = \frac{100 \times 60}{200} = 30fe11=200100×140=70,fe12=200100×60=30

fe21=100×140200=70,fe22=100×60200=30f_{e_{21}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{22}} = \frac{100 \times 60}{200} = 30fe21=200100×140=70,fe22=200100×60=30

χ2=(60−70)270+(40−30)230+(80−70)270+(20−30)230\chi^2 = \frac{(60-70)^2}{70} + \frac{(40-30)^2}{30} + \frac{(80-70)^2}{70} + \frac{(20-30)^2}{30}χ2=70(60−70)2+30(40−30)2+70(80−70)2+30(20−30)2

=10070+10030+10070+10030=1.429+3.333+1.429+3.333=9.524= \frac{100}{70} + \frac{100}{30} + \frac{100}{70} + \frac{100}{30} = 1.429 + 3.333 + 1.429 + 3.333 = 9.524=70100+30100+70100+30100=1.429+3.333+1.429+3.333=9.524

ν=1\nu = 1ν=1,χ0.052(1)=3.841\chi^2_{0.05}(1) = 3.841χ0.052(1)=3.841

χ2=9.524>3.841\chi^2 = 9.524 > 3.841χ2=9.524>3.841,拒绝 H0H_0H0,治疗方法与疗效存在显著关联。

相关测量:

ϕ=9.524200=0.04762=0.218\phi = \sqrt{\frac{9.524}{200}} = \sqrt{0.04762} = 0.218ϕ=2009.524 =0.04762 =0.218

C=9.5249.524+200=0.04545=0.213C = \sqrt{\frac{9.524}{9.524 + 200}} = \sqrt{0.04545} = 0.213C=9.524+2009.524 =0.04545 =0.213

V=9.524200×1=0.218V = \sqrt{\frac{9.524}{200 \times 1}} = 0.218V=200×19.524 =0.218

ϕ=V=0.218\phi = V = 0.218ϕ=V=0.218,表明治疗方法与疗效之间存在中等偏弱的正相关。


【习题4】3×33 \times 33×3 列联表 + V 系数

某公司调查三种学历(高中、本科、研究生)的员工与三种晋升速度(快、中、慢)的关系:

合计
高中 10 30 40 80
本科 30 60 30 120
研究生 40 50 10 100
合计 80 140 80 300

检验学历与晋升速度是否独立,并计算 Cramér's V。

解答:

H0H_0H0: 学历与晋升速度独立

期望频数:

fe11=80×80300=21.33,fe12=80×140300=37.33,fe13=80×80300=21.33f_{e_{11}} = \frac{80 \times 80}{300} = 21.33, \quad f_{e_{12}} = \frac{80 \times 140}{300} = 37.33, \quad f_{e_{13}} = \frac{80 \times 80}{300} = 21.33fe11=30080×80=21.33,fe12=30080×140=37.33,fe13=30080×80=21.33

fe21=120×80300=32,fe22=120×140300=56,fe23=120×80300=32f_{e_{21}} = \frac{120 \times 80}{300} = 32, \quad f_{e_{22}} = \frac{120 \times 140}{300} = 56, \quad f_{e_{23}} = \frac{120 \times 80}{300} = 32fe21=300120×80=32,fe22=300120×140=56,fe23=300120×80=32

fe31=100×80300=26.67,fe32=100×140300=46.67,fe33=100×80300=26.67f_{e_{31}} = \frac{100 \times 80}{300} = 26.67, \quad f_{e_{32}} = \frac{100 \times 140}{300} = 46.67, \quad f_{e_{33}} = \frac{100 \times 80}{300} = 26.67fe31=300100×80=26.67,fe32=300100×140=46.67,fe33=300100×80=26.67

χ2=(10−21.33)221.33+(30−37.33)237.33+(40−21.33)221.33\chi^2 = \frac{(10-21.33)^2}{21.33} + \frac{(30-37.33)^2}{37.33} + \frac{(40-21.33)^2}{21.33}χ2=21.33(10−21.33)2+37.33(30−37.33)2+21.33(40−21.33)2

+(30−32)232+(60−56)256+(30−32)232+ \frac{(30-32)^2}{32} + \frac{(60-56)^2}{56} + \frac{(30-32)^2}{32}+32(30−32)2+56(60−56)2+32(30−32)2

+(40−26.67)226.67+(50−46.67)246.67+(10−26.67)226.67+ \frac{(40-26.67)^2}{26.67} + \frac{(50-46.67)^2}{46.67} + \frac{(10-26.67)^2}{26.67}+26.67(40−26.67)2+46.67(50−46.67)2+26.67(10−26.67)2

=128.3721.33+53.7337.33+348.5721.33+432+1656+432+177.6926.67+11.0946.67+278.0926.67= \frac{128.37}{21.33} + \frac{53.73}{37.33} + \frac{348.57}{21.33} + \frac{4}{32} + \frac{16}{56} + \frac{4}{32} + \frac{177.69}{26.67} + \frac{11.09}{46.67} + \frac{278.09}{26.67}=21.33128.37+37.3353.73+21.33348.57+324+5616+324+26.67177.69+46.6711.09+26.67278.09

=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427= 6.018 + 1.439 + 16.342 + 0.125 + 0.286 + 0.125 + 6.663 + 0.238 + 10.427=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427

=41.663= 41.663=41.663

ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.052(4)=9.488\chi^2_{0.05}(4) = 9.488χ0.052(4)=9.488

χ2=41.663>9.488\chi^2 = 41.663 > 9.488χ2=41.663>9.488,拒绝 H0H_0H0,学历与晋升速度存在显著关联。

V=41.663300×min⁡(2,2)=41.663600=0.06944=0.264V = \sqrt{\frac{41.663}{300 \times \min(2, 2)}} = \sqrt{\frac{41.663}{600}} = \sqrt{0.06944} = 0.264V=300×min(2,2)41.663 =60041.663 =0.06944 =0.264

V=0.264V = 0.264V=0.264,说明学历与晋升速度之间存在中等程度的关联。


【习题5】综合应用

某市场研究公司调查了 400 名消费者的品牌偏好(A/B/C)与收入水平(高/中/低):

品牌 A 品牌 B 品牌 C 合计
高收入 60 40 20 120
中收入 50 70 40 160
低收入 20 50 50 120
合计 130 160 110 400

(1)检验收入水平与品牌偏好是否独立(α=0.01\alpha = 0.01α=0.01)

(2)计算 Cramér's V 系数并解释

解答:

(1)独立性检验

H0H_0H0: 收入水平与品牌偏好独立

期望频数:

品牌 A 品牌 B 品牌 C
高收入 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33
中收入 160×130400=52\frac{160 \times 130}{400} = 52400160×130=52 160×160400=64\frac{160 \times 160}{400} = 64400160×160=64 160×110400=44\frac{160 \times 110}{400} = 44400160×110=44
低收入 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33

χ2=(60−39)239+(40−48)248+(20−33)233\chi^2 = \frac{(60-39)^2}{39} + \frac{(40-48)^2}{48} + \frac{(20-33)^2}{33}χ2=39(60−39)2+48(40−48)2+33(20−33)2

+(50−52)252+(70−64)264+(40−44)244+ \frac{(50-52)^2}{52} + \frac{(70-64)^2}{64} + \frac{(40-44)^2}{44}+52(50−52)2+64(70−64)2+44(40−44)2

+(20−39)239+(50−48)248+(50−33)233+ \frac{(20-39)^2}{39} + \frac{(50-48)^2}{48} + \frac{(50-33)^2}{33}+39(20−39)2+48(50−48)2+33(50−33)2

=44139+6448+16933+452+3664+1644+36139+448+28933= \frac{441}{39} + \frac{64}{48} + \frac{169}{33} + \frac{4}{52} + \frac{36}{64} + \frac{16}{44} + \frac{361}{39} + \frac{4}{48} + \frac{289}{33}=39441+4864+33169+524+6436+4416+39361+484+33289

=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758= 11.308 + 1.333 + 5.121 + 0.077 + 0.563 + 0.364 + 9.256 + 0.083 + 8.758=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758

=36.863= 36.863=36.863

ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.012(4)=13.277\chi^2_{0.01}(4) = 13.277χ0.012(4)=13.277

χ2=36.863>13.277\chi^2 = 36.863 > 13.277χ2=36.863>13.277

结论: 在 α=0.01\alpha = 0.01α=0.01 的水平下拒绝 H0H_0H0,收入水平与品牌偏好之间存在极显著的关联。

(2)Cramér's V 系数

V=χ2n⋅min⁡(r−1,c−1)=36.863400×2=0.04608=0.2147V = \sqrt{\frac{\chi^2}{n \cdot \min(r-1, c-1)}} = \sqrt{\frac{36.863}{400 \times 2}} = \sqrt{0.04608} = 0.2147V=n⋅min(r−1,c−1)χ2 =400×236.863 =0.04608 =0.2147

V=0.215V = 0.215V=0.215,表明收入水平与品牌偏好之间存在中等偏低 程度的关联。虽然统计上高度显著,但由于样本量较大(n=400n=400n=400),即使关联强度不大,也能检出显著性。实际业务决策中应结合实际意义综合判断。


七、本章知识框架总结

分类数据分析

├── χ² 统计量

│ ├── 定义与性质

│ ├── 渐近分布:χ²(k-1)

│ └── 期望频数要求:f_e ≥ 5

├── 拟合优度检验

│ ├── 适用场景:检验总体是否服从某理论分布

│ ├── 自由度:ν = k - 1 - r(r 为估计参数个数)

│ └── 常见应用:均匀分布、泊松分布、正态分布检验

├── 列联分析:独立性检验

│ ├── 列联表结构(r × c 表)

│ ├── 期望频数:f_e = R_i × C_j / n

│ ├── 自由度:ν = (r-1)(c-1)

│ └── Fisher 精确检验(小样本替代方案)

├── 相关测量

│ ├── φ 系数(2×2 表)

│ ├── C 系数(C 系数,上界 < 1)

│ ├── V 系数(Cramér's V,上界 = 1,推荐)

│ └── λ 系数(基于预测改善的不对称测量)

└── 注意事项

├── 期望频数不宜过小

├── 样本量与检验功效

├── 相关 ≠ 因果

├── 连续性修正(Yates 校正)

└── 样本过大时关注效应量而非仅 p 值

相关推荐
你想知道什么?2 小时前
线性回归-学习笔记
笔记·学习·线性回归
鱼毓屿御2 小时前
从「只会聊」到「边想边做」的跃迁
前端·学习·react.js
临床数据科学和人工智能兴趣组3 小时前
RStudio的Console(控制台)是一个非常重要的组件
人工智能·机器学习·数据分析·r语言·r语言-4.2.1
AOwhisky3 小时前
Python 学习笔记(第十五期)——运维自动化(下·后篇):堡垒机实战——paramiko高阶篇
运维·python·学习·云原生·自动化·运维开发
minglie14 小时前
zynq中linux系统的自动登录和免密登录
学习
茯苓gao5 小时前
嵌入式开发笔记:Qt信号槽机制深度解析——从原理到实战的全方位指南
开发语言·笔记·嵌入式硬件·qt·学习
暖和_白开水5 小时前
数据分析agent (七):contextvars 模块上下文request_id
java·前端·数据分析
我想我不够好。6 小时前
监控学习 7.23 1.5hour
学习
泰勒朗斯8 小时前
Helicopter FBI-405尾电机版本设置
学习
动物园猫8 小时前
生活固废垃圾分类目标检测数据集:5类别 | 目标检测
目标检测·分类·生活