四、列联表中的相关测量
χ² 检验只能告诉我们两个变量是否独立(是否有关联 ),但不能告诉我们关联的强度和方向。因此需要相关测量指标。
4.1 φ 系数(Phi Coefficient)--- 用于 2×22 \times 22×2 表
ϕ=χ2n\boxed{\phi = \sqrt{\frac{\chi^2}{n}}}ϕ=nχ2
推导:
对于 2×22 \times 22×2 列联表:
| B1B_1B1 | B2B_2B2 | 合计 | |
|---|---|---|---|
| A1A_1A1 | aaa | bbb | a+ba+ba+b |
| A2A_2A2 | ccc | ddd | c+dc+dc+d |
| 合计 | a+ca+ca+c | b+db+db+d | nnn |
可以证明:
χ2=n(ad−bc)2(a+b)(c+d)(a+c)(b+d)\chi^2 = \frac{n(ad - bc)^2}{(a+b)(c+d)(a+c)(b+d)}χ2=(a+b)(c+d)(a+c)(b+d)n(ad−bc)2
因此:
ϕ=χ2n=∣ad−bc∣(a+b)(c+d)(a+c)(b+d)\phi = \sqrt{\frac{\chi^2}{n}} = \frac{|ad - bc|}{\sqrt{(a+b)(c+d)(a+c)(b+d)}}ϕ=nχ2 =(a+b)(c+d)(a+c)(b+d) ∣ad−bc∣
性质:
- ϕ\phiϕ 的取值范围为 0,10, 10,1
- ϕ=0\phi = 0ϕ=0 表示完全独立
- ϕ=1\phi = 1ϕ=1 表示完全关联
4.2 C 系数(Contingency Coefficient)--- 适用于任意 r×cr \times cr×c 表
C=χ2χ2+n\boxed{C = \sqrt{\frac{\chi^2}{\chi^2 + n}}}C=χ2+nχ2
性质:
- C≥0C \geq 0C≥0
- C=0C = 0C=0 表示完全独立
- CCC 的最大值取决于表格的维度,对于 r×cr \times cr×c 表:
Cmax=min(r,c)−1min(r,c)C_{\max} = \sqrt{\frac{\min(r,c) - 1}{\min(r,c)}}Cmax=min(r,c)min(r,c)−1
例如,2×22 \times 22×2 表的 Cmax=12=0.707C_{\max} = \sqrt{\frac{1}{2}} = 0.707Cmax=21 =0.707,3×33 \times 33×3 表的 Cmax=23=0.816C_{\max} = \sqrt{\frac{2}{3}} = 0.816Cmax=32 =0.816。
因此,CCC 系数无法达到 1,不同维度的列联表之间的 CCC 值不可直接比较。
4.3 V 系数(Cramér's V)--- 适用于任意 r×cr \times cr×c 表(推荐)
KaTeX parse error: Unexpected end of input in a macro argument, expected '}' at end of input: ...min(r-1, c-1)}}
性质:
- 0≤V≤10 \leq V \leq 10≤V≤1
- V=0V = 0V=0 表示完全独立
- V=1V = 1V=1 表示完全关联
- 不同维度的列联表之间可以比较
推导思路:
Cramér's V 是对 φ 系数的修正推广。在 2×22 \times 22×2 表中,V=ϕV = \phiV=ϕ。对于更大的表,除以 min(r−1,c−1)\min(r-1, c-1)min(r−1,c−1) 使得上界归一化为 1。
4.4 λ 系数(Lambda Coefficient)--- 不对称关联测量
λ 系数衡量的是:知道一个变量的信息后,预测另一个变量的错误率减少了多少。
对称 λ:
λ=∑imaxjfij+∑jmaxifij−maxiRi−maxjCj2n−maxiRi−maxjCj\lambda = \frac{\sum_{i} \max_j f_{ij} + \sum_{j} \max_i f_{ij} - \max_i R_i - \max_j C_j}{2n - \max_i R_i - \max_j C_j}λ=2n−maxiRi−maxjCj∑imaxjfij+∑jmaxifij−maxiRi−maxjCj
非对称 λ(以行变量预测列变量):
λB∣A=∑i=1rmaxjfij−maxjCjn−maxjCj\lambda_{B|A} = \frac{\sum_{i=1}^{r} \max_{j} f_{ij} - \max_j C_j}{n - \max_j C_j}λB∣A=n−maxjCj∑i=1rmaxjfij−maxjCj
解释:
- λ=0\lambda = 0λ=0:知道行变量对预测列变量毫无帮助
- λ=1\lambda = 1λ=1:知道行变量可以完全预测列变量
4.5 各相关测量指标的比较
| 指标 | 适用范围 | 取值范围 | 是否可达1 | 特点 |
|---|---|---|---|---|
| ϕ\phiϕ | 2×22 \times 22×2 表 | 0,10, 10,1 | 是 | 简单直观 |
| CCC | r×cr \times cr×c 表 | 0,Cmax0, C_{\\max}0,Cmax | 否(<1<1<1) | 不可跨维度比较 |
| VVV | r×cr \times cr×c 表 | 0,10, 10,1 | 是 | 最通用,推荐使用 |
| λ\lambdaλ | r×cr \times cr×c 表 | 0,10, 10,1 | 是 | 基于预测改善,不对称 |
五、列联分析中应注意的问题
5.1 期望频数不宜过小
- 一般要求每个单元格的期望频数 fe≥5f_e \geq 5fe≥5。
- 若 fe<5f_e < 5fe<5,χ² 统计量的近似效果不好,可能导致检验结果不可靠。
- 补救方法: 合并相邻的行或列。
5.2 样本量的要求
- χ² 检验要求独立随机抽样。
- 样本量不宜太小,一般要求 n≥50n \geq 50n≥50,或至少所有 fe≥5f_e \geq 5fe≥5。
- 样本量过大时,即使实际关联很小,χ² 检验也可能显著(因为 χ² 值与 nnn 成正比),此时应关注相关强度指标(如 V、C 等)而非仅看 χ² 的显著性。
5.3 自由度的正确计算
- 拟合优度检验:ν=k−1−r\nu = k - 1 - rν=k−1−r(rrr 为估计的参数个数)
- 独立性检验:ν=(r−1)(c−1)\nu = (r-1)(c-1)ν=(r−1)(c−1)
- 二者不可混淆。
5.4 相关 ≠ 因果
- 列联分析检测到的关联不一定意味着因果关系。
- 可能存在混杂变量(confounding variable)同时影响两个分类变量。
5.5 Fisher 精确检验
- 当样本量很小,或某些期望频数 fe<5f_e < 5fe<5 时,应使用 Fisher 精确检验代替 χ² 检验。
- Fisher 精确检验基于超几何分布直接计算概率,不依赖渐近近似。
对于 2×22 \times 22×2 表:
P=(a+ba)(c+dc)(na+c)=(a+b)!(c+d)!(a+c)!(b+d)!n! a! b! c! d!P = \frac{\binom{a+b}{a}\binom{c+d}{c}}{\binom{n}{a+c}} = \frac{(a+b)!(c+d)!(a+c)!(b+d)!}{n! \, a! \, b! \, c! \, d!}P=(a+cn)(aa+b)(cc+d)=n!a!b!c!d!(a+b)!(c+d)!(a+c)!(b+d)!
5.6 连续性修正
对于 2×22 \times 22×2 列联表,当自由度为 1 时,使用 Yates 连续性修正(correction for continuity):
χ2=∑i=1r∑j=1c(∣fo−fe∣−0.5)2fe\chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(|f_o - f_e| - 0.5)^2}{f_e}χ2=i=1∑rj=1∑cfe(∣fo−fe∣−0.5)2
六、思考与练习
【习题1】拟合优度检验(均匀分布)
某随机数生成器声称能产生均匀分布的随机整数(1 到 6),一位程序员测试了 120 次,结果如下:
| 数字 | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 频数 | 15 | 22 | 18 | 25 | 16 | 24 |
在 α=0.05\alpha = 0.05α=0.05 下检验该随机数生成器产生的数字是否均匀。
解答:
H0H_0H0: 均匀分布,pi=1/6p_i = 1/6pi=1/6;H1H_1H1: 不是均匀分布
期望频数:fe=120/6=20f_e = 120/6 = 20fe=120/6=20
χ2=(15−20)220+(22−20)220+(18−20)220+(25−20)220+(16−20)220+(24−20)220\chi^2 = \frac{(15-20)^2}{20} + \frac{(22-20)^2}{20} + \frac{(18-20)^2}{20} + \frac{(25-20)^2}{20} + \frac{(16-20)^2}{20} + \frac{(24-20)^2}{20}χ2=20(15−20)2+20(22−20)2+20(18−20)2+20(25−20)2+20(16−20)2+20(24−20)2
=25+4+4+25+16+1620=9020=4.50= \frac{25+4+4+25+16+16}{20} = \frac{90}{20} = 4.50=2025+4+4+25+16+16=2090=4.50
ν=5\nu = 5ν=5,χ0.052(5)=11.071\chi^2_{0.05}(5) = 11.071χ0.052(5)=11.071
χ2=4.50<11.071\chi^2 = 4.50 < 11.071χ2=4.50<11.071,不拒绝 H0H_0H0,随机数生成器产生的数字可以认为是均匀的。
【习题2】泊松分布拟合
在某十字路口,200 个小时内记录到的交通事故次数分布如下:
| 事故次数 | 0 | 1 | 2 | 3 | ≥4\geq 4≥4 |
|---|---|---|---|---|---|
| 小时数 | 84 | 72 | 30 | 10 | 4 |
检验事故次数是否服从泊松分布(α=0.05\alpha = 0.05α=0.05)。
解答:
估计 λ\lambdaλ:
λ^=0×84+1×72+2×30+3×10+4×4200=0+72+60+30+16200=178200=0.89\hat{\lambda} = \frac{0 \times 84 + 1 \times 72 + 2 \times 30 + 3 \times 10 + 4 \times 4}{200} = \frac{0 + 72 + 60 + 30 + 16}{200} = \frac{178}{200} = 0.89λ^=2000×84+1×72+2×30+3×10+4×4=2000+72+60+30+16=200178=0.89
e−0.89=0.4107e^{-0.89} = 0.4107e−0.89=0.4107
| xxx | pip_ipi | fe=200pif_e = 200p_ife=200pi | fof_ofo |
|---|---|---|---|
| 0 | 0.41070.41070.4107 | 82.1482.1482.14 | 84 |
| 1 | 0.4107×0.89=0.36550.4107 \times 0.89 = 0.36550.4107×0.89=0.3655 | 73.1073.1073.10 | 72 |
| 2 | 0.3655×0.89/2=0.16270.3655 \times 0.89/2 = 0.16270.3655×0.89/2=0.1627 | 32.5432.5432.54 | 30 |
| 3 | 0.1627×0.89/3=0.04830.1627 \times 0.89/3 = 0.04830.1627×0.89/3=0.0483 | 9.669.669.66 | 10 |
| ≥4\geq 4≥4 | 1−0.4107−0.3655−0.1627−0.0483=0.01281 - 0.4107 - 0.3655 - 0.1627 - 0.0483 = 0.01281−0.4107−0.3655−0.1627−0.0483=0.0128 | 2.562.562.56 | 4 |
第5组 fe=2.56<5f_e = 2.56 < 5fe=2.56<5,与第4组合并:
| 合并后 | fof_ofo | fef_efe |
|---|---|---|
| 0 | 84 | 82.14 |
| 1 | 72 | 73.10 |
| 2 | 30 | 32.54 |
| ≥3\geq 3≥3 | 14 | 12.22 |
χ2=(84−82.14)282.14+(72−73.10)273.10+(30−32.54)232.54+(14−12.22)212.22\chi^2 = \frac{(84-82.14)^2}{82.14} + \frac{(72-73.10)^2}{73.10} + \frac{(30-32.54)^2}{32.54} + \frac{(14-12.22)^2}{12.22}χ2=82.14(84−82.14)2+73.10(72−73.10)2+32.54(30−32.54)2+12.22(14−12.22)2
=3.4682.14+1.2173.10+6.4532.54+3.1712.22= \frac{3.46}{82.14} + \frac{1.21}{73.10} + \frac{6.45}{32.54} + \frac{3.17}{12.22}=82.143.46+73.101.21+32.546.45+12.223.17
=0.042+0.017+0.198+0.259=0.516= 0.042 + 0.017 + 0.198 + 0.259 = 0.516=0.042+0.017+0.198+0.259=0.516
ν=4−1−1=2\nu = 4 - 1 - 1 = 2ν=4−1−1=2,χ0.052(2)=5.991\chi^2_{0.05}(2) = 5.991χ0.052(2)=5.991
χ2=0.516<5.991\chi^2 = 0.516 < 5.991χ2=0.516<5.991,不拒绝 H0H_0H0,可以认为事故次数服从泊松分布。
【习题3】独立性检验(2×22 \times 22×2 表)
某医院研究治疗方法(传统/新法)与疗效(有效/无效)的关系:
| 有效 | 无效 | 合计 | |
|---|---|---|---|
| 传统方法 | 60 | 40 | 100 |
| 新方法 | 80 | 20 | 100 |
| 合计 | 140 | 60 | 200 |
检验治疗方法与疗效是否独立(α=0.05\alpha = 0.05α=0.05)。
解答:
H0H_0H0: 治疗方法与疗效独立
期望频数:
fe11=100×140200=70,fe12=100×60200=30f_{e_{11}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{12}} = \frac{100 \times 60}{200} = 30fe11=200100×140=70,fe12=200100×60=30
fe21=100×140200=70,fe22=100×60200=30f_{e_{21}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{22}} = \frac{100 \times 60}{200} = 30fe21=200100×140=70,fe22=200100×60=30
χ2=(60−70)270+(40−30)230+(80−70)270+(20−30)230\chi^2 = \frac{(60-70)^2}{70} + \frac{(40-30)^2}{30} + \frac{(80-70)^2}{70} + \frac{(20-30)^2}{30}χ2=70(60−70)2+30(40−30)2+70(80−70)2+30(20−30)2
=10070+10030+10070+10030=1.429+3.333+1.429+3.333=9.524= \frac{100}{70} + \frac{100}{30} + \frac{100}{70} + \frac{100}{30} = 1.429 + 3.333 + 1.429 + 3.333 = 9.524=70100+30100+70100+30100=1.429+3.333+1.429+3.333=9.524
ν=1\nu = 1ν=1,χ0.052(1)=3.841\chi^2_{0.05}(1) = 3.841χ0.052(1)=3.841
χ2=9.524>3.841\chi^2 = 9.524 > 3.841χ2=9.524>3.841,拒绝 H0H_0H0,治疗方法与疗效存在显著关联。
相关测量:
ϕ=9.524200=0.04762=0.218\phi = \sqrt{\frac{9.524}{200}} = \sqrt{0.04762} = 0.218ϕ=2009.524 =0.04762 =0.218
C=9.5249.524+200=0.04545=0.213C = \sqrt{\frac{9.524}{9.524 + 200}} = \sqrt{0.04545} = 0.213C=9.524+2009.524 =0.04545 =0.213
V=9.524200×1=0.218V = \sqrt{\frac{9.524}{200 \times 1}} = 0.218V=200×19.524 =0.218
ϕ=V=0.218\phi = V = 0.218ϕ=V=0.218,表明治疗方法与疗效之间存在中等偏弱的正相关。
【习题4】3×33 \times 33×3 列联表 + V 系数
某公司调查三种学历(高中、本科、研究生)的员工与三种晋升速度(快、中、慢)的关系:
| 快 | 中 | 慢 | 合计 | |
|---|---|---|---|---|
| 高中 | 10 | 30 | 40 | 80 |
| 本科 | 30 | 60 | 30 | 120 |
| 研究生 | 40 | 50 | 10 | 100 |
| 合计 | 80 | 140 | 80 | 300 |
检验学历与晋升速度是否独立,并计算 Cramér's V。
解答:
H0H_0H0: 学历与晋升速度独立
期望频数:
fe11=80×80300=21.33,fe12=80×140300=37.33,fe13=80×80300=21.33f_{e_{11}} = \frac{80 \times 80}{300} = 21.33, \quad f_{e_{12}} = \frac{80 \times 140}{300} = 37.33, \quad f_{e_{13}} = \frac{80 \times 80}{300} = 21.33fe11=30080×80=21.33,fe12=30080×140=37.33,fe13=30080×80=21.33
fe21=120×80300=32,fe22=120×140300=56,fe23=120×80300=32f_{e_{21}} = \frac{120 \times 80}{300} = 32, \quad f_{e_{22}} = \frac{120 \times 140}{300} = 56, \quad f_{e_{23}} = \frac{120 \times 80}{300} = 32fe21=300120×80=32,fe22=300120×140=56,fe23=300120×80=32
fe31=100×80300=26.67,fe32=100×140300=46.67,fe33=100×80300=26.67f_{e_{31}} = \frac{100 \times 80}{300} = 26.67, \quad f_{e_{32}} = \frac{100 \times 140}{300} = 46.67, \quad f_{e_{33}} = \frac{100 \times 80}{300} = 26.67fe31=300100×80=26.67,fe32=300100×140=46.67,fe33=300100×80=26.67
χ2=(10−21.33)221.33+(30−37.33)237.33+(40−21.33)221.33\chi^2 = \frac{(10-21.33)^2}{21.33} + \frac{(30-37.33)^2}{37.33} + \frac{(40-21.33)^2}{21.33}χ2=21.33(10−21.33)2+37.33(30−37.33)2+21.33(40−21.33)2
+(30−32)232+(60−56)256+(30−32)232+ \frac{(30-32)^2}{32} + \frac{(60-56)^2}{56} + \frac{(30-32)^2}{32}+32(30−32)2+56(60−56)2+32(30−32)2
+(40−26.67)226.67+(50−46.67)246.67+(10−26.67)226.67+ \frac{(40-26.67)^2}{26.67} + \frac{(50-46.67)^2}{46.67} + \frac{(10-26.67)^2}{26.67}+26.67(40−26.67)2+46.67(50−46.67)2+26.67(10−26.67)2
=128.3721.33+53.7337.33+348.5721.33+432+1656+432+177.6926.67+11.0946.67+278.0926.67= \frac{128.37}{21.33} + \frac{53.73}{37.33} + \frac{348.57}{21.33} + \frac{4}{32} + \frac{16}{56} + \frac{4}{32} + \frac{177.69}{26.67} + \frac{11.09}{46.67} + \frac{278.09}{26.67}=21.33128.37+37.3353.73+21.33348.57+324+5616+324+26.67177.69+46.6711.09+26.67278.09
=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427= 6.018 + 1.439 + 16.342 + 0.125 + 0.286 + 0.125 + 6.663 + 0.238 + 10.427=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427
=41.663= 41.663=41.663
ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.052(4)=9.488\chi^2_{0.05}(4) = 9.488χ0.052(4)=9.488
χ2=41.663>9.488\chi^2 = 41.663 > 9.488χ2=41.663>9.488,拒绝 H0H_0H0,学历与晋升速度存在显著关联。
V=41.663300×min(2,2)=41.663600=0.06944=0.264V = \sqrt{\frac{41.663}{300 \times \min(2, 2)}} = \sqrt{\frac{41.663}{600}} = \sqrt{0.06944} = 0.264V=300×min(2,2)41.663 =60041.663 =0.06944 =0.264
V=0.264V = 0.264V=0.264,说明学历与晋升速度之间存在中等程度的关联。
【习题5】综合应用
某市场研究公司调查了 400 名消费者的品牌偏好(A/B/C)与收入水平(高/中/低):
| 品牌 A | 品牌 B | 品牌 C | 合计 | |
|---|---|---|---|---|
| 高收入 | 60 | 40 | 20 | 120 |
| 中收入 | 50 | 70 | 40 | 160 |
| 低收入 | 20 | 50 | 50 | 120 |
| 合计 | 130 | 160 | 110 | 400 |
(1)检验收入水平与品牌偏好是否独立(α=0.01\alpha = 0.01α=0.01)
(2)计算 Cramér's V 系数并解释
解答:
(1)独立性检验
H0H_0H0: 收入水平与品牌偏好独立
期望频数:
| 品牌 A | 品牌 B | 品牌 C | |
|---|---|---|---|
| 高收入 | 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 | 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 | 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33 |
| 中收入 | 160×130400=52\frac{160 \times 130}{400} = 52400160×130=52 | 160×160400=64\frac{160 \times 160}{400} = 64400160×160=64 | 160×110400=44\frac{160 \times 110}{400} = 44400160×110=44 |
| 低收入 | 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 | 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 | 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33 |
χ2=(60−39)239+(40−48)248+(20−33)233\chi^2 = \frac{(60-39)^2}{39} + \frac{(40-48)^2}{48} + \frac{(20-33)^2}{33}χ2=39(60−39)2+48(40−48)2+33(20−33)2
+(50−52)252+(70−64)264+(40−44)244+ \frac{(50-52)^2}{52} + \frac{(70-64)^2}{64} + \frac{(40-44)^2}{44}+52(50−52)2+64(70−64)2+44(40−44)2
+(20−39)239+(50−48)248+(50−33)233+ \frac{(20-39)^2}{39} + \frac{(50-48)^2}{48} + \frac{(50-33)^2}{33}+39(20−39)2+48(50−48)2+33(50−33)2
=44139+6448+16933+452+3664+1644+36139+448+28933= \frac{441}{39} + \frac{64}{48} + \frac{169}{33} + \frac{4}{52} + \frac{36}{64} + \frac{16}{44} + \frac{361}{39} + \frac{4}{48} + \frac{289}{33}=39441+4864+33169+524+6436+4416+39361+484+33289
=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758= 11.308 + 1.333 + 5.121 + 0.077 + 0.563 + 0.364 + 9.256 + 0.083 + 8.758=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758
=36.863= 36.863=36.863
ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.012(4)=13.277\chi^2_{0.01}(4) = 13.277χ0.012(4)=13.277
χ2=36.863>13.277\chi^2 = 36.863 > 13.277χ2=36.863>13.277
结论: 在 α=0.01\alpha = 0.01α=0.01 的水平下拒绝 H0H_0H0,收入水平与品牌偏好之间存在极显著的关联。
(2)Cramér's V 系数
V=χ2n⋅min(r−1,c−1)=36.863400×2=0.04608=0.2147V = \sqrt{\frac{\chi^2}{n \cdot \min(r-1, c-1)}} = \sqrt{\frac{36.863}{400 \times 2}} = \sqrt{0.04608} = 0.2147V=n⋅min(r−1,c−1)χ2 =400×236.863 =0.04608 =0.2147
V=0.215V = 0.215V=0.215,表明收入水平与品牌偏好之间存在中等偏低 程度的关联。虽然统计上高度显著,但由于样本量较大(n=400n=400n=400),即使关联强度不大,也能检出显著性。实际业务决策中应结合实际意义综合判断。
七、本章知识框架总结
四、列联表中的相关测量
χ² 检验只能告诉我们两个变量是否独立(是否有关联 ),但不能告诉我们关联的强度和方向。因此需要相关测量指标。
4.1 φ 系数(Phi Coefficient)--- 用于 2×22 \times 22×2 表
ϕ=χ2n\boxed{\phi = \sqrt{\frac{\chi^2}{n}}}ϕ=nχ2
推导:
对于 2×22 \times 22×2 列联表:
| B1B_1B1 | B2B_2B2 | 合计 | |
|---|---|---|---|
| A1A_1A1 | aaa | bbb | a+ba+ba+b |
| A2A_2A2 | ccc | ddd | c+dc+dc+d |
| 合计 | a+ca+ca+c | b+db+db+d | nnn |
可以证明:
χ2=n(ad−bc)2(a+b)(c+d)(a+c)(b+d)\chi^2 = \frac{n(ad - bc)^2}{(a+b)(c+d)(a+c)(b+d)}χ2=(a+b)(c+d)(a+c)(b+d)n(ad−bc)2
因此:
ϕ=χ2n=∣ad−bc∣(a+b)(c+d)(a+c)(b+d)\phi = \sqrt{\frac{\chi^2}{n}} = \frac{|ad - bc|}{\sqrt{(a+b)(c+d)(a+c)(b+d)}}ϕ=nχ2 =(a+b)(c+d)(a+c)(b+d) ∣ad−bc∣
性质:
- ϕ\phiϕ 的取值范围为 0,10, 10,1
- ϕ=0\phi = 0ϕ=0 表示完全独立
- ϕ=1\phi = 1ϕ=1 表示完全关联
4.2 C 系数(Contingency Coefficient)--- 适用于任意 r×cr \times cr×c 表
C=χ2χ2+n\boxed{C = \sqrt{\frac{\chi^2}{\chi^2 + n}}}C=χ2+nχ2
性质:
- C≥0C \geq 0C≥0
- C=0C = 0C=0 表示完全独立
- CCC 的最大值取决于表格的维度,对于 r×cr \times cr×c 表:
Cmax=min(r,c)−1min(r,c)C_{\max} = \sqrt{\frac{\min(r,c) - 1}{\min(r,c)}}Cmax=min(r,c)min(r,c)−1
例如,2×22 \times 22×2 表的 Cmax=12=0.707C_{\max} = \sqrt{\frac{1}{2}} = 0.707Cmax=21 =0.707,3×33 \times 33×3 表的 Cmax=23=0.816C_{\max} = \sqrt{\frac{2}{3}} = 0.816Cmax=32 =0.816。
因此,CCC 系数无法达到 1,不同维度的列联表之间的 CCC 值不可直接比较。
4.3 V 系数(Cramér's V)--- 适用于任意 r×cr \times cr×c 表(推荐)
KaTeX parse error: Unexpected end of input in a macro argument, expected '}' at end of input: ...min(r-1, c-1)}}
性质:
- 0≤V≤10 \leq V \leq 10≤V≤1
- V=0V = 0V=0 表示完全独立
- V=1V = 1V=1 表示完全关联
- 不同维度的列联表之间可以比较
推导思路:
Cramér's V 是对 φ 系数的修正推广。在 2×22 \times 22×2 表中,V=ϕV = \phiV=ϕ。对于更大的表,除以 min(r−1,c−1)\min(r-1, c-1)min(r−1,c−1) 使得上界归一化为 1。
4.4 λ 系数(Lambda Coefficient)--- 不对称关联测量
λ 系数衡量的是:知道一个变量的信息后,预测另一个变量的错误率减少了多少。
对称 λ:
λ=∑imaxjfij+∑jmaxifij−maxiRi−maxjCj2n−maxiRi−maxjCj\lambda = \frac{\sum_{i} \max_j f_{ij} + \sum_{j} \max_i f_{ij} - \max_i R_i - \max_j C_j}{2n - \max_i R_i - \max_j C_j}λ=2n−maxiRi−maxjCj∑imaxjfij+∑jmaxifij−maxiRi−maxjCj
非对称 λ(以行变量预测列变量):
λB∣A=∑i=1rmaxjfij−maxjCjn−maxjCj\lambda_{B|A} = \frac{\sum_{i=1}^{r} \max_{j} f_{ij} - \max_j C_j}{n - \max_j C_j}λB∣A=n−maxjCj∑i=1rmaxjfij−maxjCj
解释:
- λ=0\lambda = 0λ=0:知道行变量对预测列变量毫无帮助
- λ=1\lambda = 1λ=1:知道行变量可以完全预测列变量
4.5 各相关测量指标的比较
| 指标 | 适用范围 | 取值范围 | 是否可达1 | 特点 |
|---|---|---|---|---|
| ϕ\phiϕ | 2×22 \times 22×2 表 | 0,10, 10,1 | 是 | 简单直观 |
| CCC | r×cr \times cr×c 表 | 0,Cmax0, C_{\\max}0,Cmax | 否(<1<1<1) | 不可跨维度比较 |
| VVV | r×cr \times cr×c 表 | 0,10, 10,1 | 是 | 最通用,推荐使用 |
| λ\lambdaλ | r×cr \times cr×c 表 | 0,10, 10,1 | 是 | 基于预测改善,不对称 |
五、列联分析中应注意的问题
5.1 期望频数不宜过小
- 一般要求每个单元格的期望频数 fe≥5f_e \geq 5fe≥5。
- 若 fe<5f_e < 5fe<5,χ² 统计量的近似效果不好,可能导致检验结果不可靠。
- 补救方法: 合并相邻的行或列。
5.2 样本量的要求
- χ² 检验要求独立随机抽样。
- 样本量不宜太小,一般要求 n≥50n \geq 50n≥50,或至少所有 fe≥5f_e \geq 5fe≥5。
- 样本量过大时,即使实际关联很小,χ² 检验也可能显著(因为 χ² 值与 nnn 成正比),此时应关注相关强度指标(如 V、C 等)而非仅看 χ² 的显著性。
5.3 自由度的正确计算
- 拟合优度检验:ν=k−1−r\nu = k - 1 - rν=k−1−r(rrr 为估计的参数个数)
- 独立性检验:ν=(r−1)(c−1)\nu = (r-1)(c-1)ν=(r−1)(c−1)
- 二者不可混淆。
5.4 相关 ≠ 因果
- 列联分析检测到的关联不一定意味着因果关系。
- 可能存在混杂变量(confounding variable)同时影响两个分类变量。
5.5 Fisher 精确检验
- 当样本量很小,或某些期望频数 fe<5f_e < 5fe<5 时,应使用 Fisher 精确检验代替 χ² 检验。
- Fisher 精确检验基于超几何分布直接计算概率,不依赖渐近近似。
对于 2×22 \times 22×2 表:
P=(a+ba)(c+dc)(na+c)=(a+b)!(c+d)!(a+c)!(b+d)!n! a! b! c! d!P = \frac{\binom{a+b}{a}\binom{c+d}{c}}{\binom{n}{a+c}} = \frac{(a+b)!(c+d)!(a+c)!(b+d)!}{n! \, a! \, b! \, c! \, d!}P=(a+cn)(aa+b)(cc+d)=n!a!b!c!d!(a+b)!(c+d)!(a+c)!(b+d)!
5.6 连续性修正
对于 2×22 \times 22×2 列联表,当自由度为 1 时,使用 Yates 连续性修正(correction for continuity):
χ2=∑i=1r∑j=1c(∣fo−fe∣−0.5)2fe\chi^2 = \sum_{i=1}^{r} \sum_{j=1}^{c} \frac{(|f_o - f_e| - 0.5)^2}{f_e}χ2=i=1∑rj=1∑cfe(∣fo−fe∣−0.5)2
六、思考与练习
【习题1】拟合优度检验(均匀分布)
某随机数生成器声称能产生均匀分布的随机整数(1 到 6),一位程序员测试了 120 次,结果如下:
| 数字 | 1 | 2 | 3 | 4 | 5 | 6 |
|---|---|---|---|---|---|---|
| 频数 | 15 | 22 | 18 | 25 | 16 | 24 |
在 α=0.05\alpha = 0.05α=0.05 下检验该随机数生成器产生的数字是否均匀。
解答:
H0H_0H0: 均匀分布,pi=1/6p_i = 1/6pi=1/6;H1H_1H1: 不是均匀分布
期望频数:fe=120/6=20f_e = 120/6 = 20fe=120/6=20
χ2=(15−20)220+(22−20)220+(18−20)220+(25−20)220+(16−20)220+(24−20)220\chi^2 = \frac{(15-20)^2}{20} + \frac{(22-20)^2}{20} + \frac{(18-20)^2}{20} + \frac{(25-20)^2}{20} + \frac{(16-20)^2}{20} + \frac{(24-20)^2}{20}χ2=20(15−20)2+20(22−20)2+20(18−20)2+20(25−20)2+20(16−20)2+20(24−20)2
=25+4+4+25+16+1620=9020=4.50= \frac{25+4+4+25+16+16}{20} = \frac{90}{20} = 4.50=2025+4+4+25+16+16=2090=4.50
ν=5\nu = 5ν=5,χ0.052(5)=11.071\chi^2_{0.05}(5) = 11.071χ0.052(5)=11.071
χ2=4.50<11.071\chi^2 = 4.50 < 11.071χ2=4.50<11.071,不拒绝 H0H_0H0,随机数生成器产生的数字可以认为是均匀的。
【习题2】泊松分布拟合
在某十字路口,200 个小时内记录到的交通事故次数分布如下:
| 事故次数 | 0 | 1 | 2 | 3 | ≥4\geq 4≥4 |
|---|---|---|---|---|---|
| 小时数 | 84 | 72 | 30 | 10 | 4 |
检验事故次数是否服从泊松分布(α=0.05\alpha = 0.05α=0.05)。
解答:
估计 λ\lambdaλ:
λ^=0×84+1×72+2×30+3×10+4×4200=0+72+60+30+16200=178200=0.89\hat{\lambda} = \frac{0 \times 84 + 1 \times 72 + 2 \times 30 + 3 \times 10 + 4 \times 4}{200} = \frac{0 + 72 + 60 + 30 + 16}{200} = \frac{178}{200} = 0.89λ^=2000×84+1×72+2×30+3×10+4×4=2000+72+60+30+16=200178=0.89
e−0.89=0.4107e^{-0.89} = 0.4107e−0.89=0.4107
| xxx | pip_ipi | fe=200pif_e = 200p_ife=200pi | fof_ofo |
|---|---|---|---|
| 0 | 0.41070.41070.4107 | 82.1482.1482.14 | 84 |
| 1 | 0.4107×0.89=0.36550.4107 \times 0.89 = 0.36550.4107×0.89=0.3655 | 73.1073.1073.10 | 72 |
| 2 | 0.3655×0.89/2=0.16270.3655 \times 0.89/2 = 0.16270.3655×0.89/2=0.1627 | 32.5432.5432.54 | 30 |
| 3 | 0.1627×0.89/3=0.04830.1627 \times 0.89/3 = 0.04830.1627×0.89/3=0.0483 | 9.669.669.66 | 10 |
| ≥4\geq 4≥4 | 1−0.4107−0.3655−0.1627−0.0483=0.01281 - 0.4107 - 0.3655 - 0.1627 - 0.0483 = 0.01281−0.4107−0.3655−0.1627−0.0483=0.0128 | 2.562.562.56 | 4 |
第5组 fe=2.56<5f_e = 2.56 < 5fe=2.56<5,与第4组合并:
| 合并后 | fof_ofo | fef_efe |
|---|---|---|
| 0 | 84 | 82.14 |
| 1 | 72 | 73.10 |
| 2 | 30 | 32.54 |
| ≥3\geq 3≥3 | 14 | 12.22 |
χ2=(84−82.14)282.14+(72−73.10)273.10+(30−32.54)232.54+(14−12.22)212.22\chi^2 = \frac{(84-82.14)^2}{82.14} + \frac{(72-73.10)^2}{73.10} + \frac{(30-32.54)^2}{32.54} + \frac{(14-12.22)^2}{12.22}χ2=82.14(84−82.14)2+73.10(72−73.10)2+32.54(30−32.54)2+12.22(14−12.22)2
=3.4682.14+1.2173.10+6.4532.54+3.1712.22= \frac{3.46}{82.14} + \frac{1.21}{73.10} + \frac{6.45}{32.54} + \frac{3.17}{12.22}=82.143.46+73.101.21+32.546.45+12.223.17
=0.042+0.017+0.198+0.259=0.516= 0.042 + 0.017 + 0.198 + 0.259 = 0.516=0.042+0.017+0.198+0.259=0.516
ν=4−1−1=2\nu = 4 - 1 - 1 = 2ν=4−1−1=2,χ0.052(2)=5.991\chi^2_{0.05}(2) = 5.991χ0.052(2)=5.991
χ2=0.516<5.991\chi^2 = 0.516 < 5.991χ2=0.516<5.991,不拒绝 H0H_0H0,可以认为事故次数服从泊松分布。
【习题3】独立性检验(2×22 \times 22×2 表)
某医院研究治疗方法(传统/新法)与疗效(有效/无效)的关系:
| 有效 | 无效 | 合计 | |
|---|---|---|---|
| 传统方法 | 60 | 40 | 100 |
| 新方法 | 80 | 20 | 100 |
| 合计 | 140 | 60 | 200 |
检验治疗方法与疗效是否独立(α=0.05\alpha = 0.05α=0.05)。
解答:
H0H_0H0: 治疗方法与疗效独立
期望频数:
fe11=100×140200=70,fe12=100×60200=30f_{e_{11}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{12}} = \frac{100 \times 60}{200} = 30fe11=200100×140=70,fe12=200100×60=30
fe21=100×140200=70,fe22=100×60200=30f_{e_{21}} = \frac{100 \times 140}{200} = 70, \quad f_{e_{22}} = \frac{100 \times 60}{200} = 30fe21=200100×140=70,fe22=200100×60=30
χ2=(60−70)270+(40−30)230+(80−70)270+(20−30)230\chi^2 = \frac{(60-70)^2}{70} + \frac{(40-30)^2}{30} + \frac{(80-70)^2}{70} + \frac{(20-30)^2}{30}χ2=70(60−70)2+30(40−30)2+70(80−70)2+30(20−30)2
=10070+10030+10070+10030=1.429+3.333+1.429+3.333=9.524= \frac{100}{70} + \frac{100}{30} + \frac{100}{70} + \frac{100}{30} = 1.429 + 3.333 + 1.429 + 3.333 = 9.524=70100+30100+70100+30100=1.429+3.333+1.429+3.333=9.524
ν=1\nu = 1ν=1,χ0.052(1)=3.841\chi^2_{0.05}(1) = 3.841χ0.052(1)=3.841
χ2=9.524>3.841\chi^2 = 9.524 > 3.841χ2=9.524>3.841,拒绝 H0H_0H0,治疗方法与疗效存在显著关联。
相关测量:
ϕ=9.524200=0.04762=0.218\phi = \sqrt{\frac{9.524}{200}} = \sqrt{0.04762} = 0.218ϕ=2009.524 =0.04762 =0.218
C=9.5249.524+200=0.04545=0.213C = \sqrt{\frac{9.524}{9.524 + 200}} = \sqrt{0.04545} = 0.213C=9.524+2009.524 =0.04545 =0.213
V=9.524200×1=0.218V = \sqrt{\frac{9.524}{200 \times 1}} = 0.218V=200×19.524 =0.218
ϕ=V=0.218\phi = V = 0.218ϕ=V=0.218,表明治疗方法与疗效之间存在中等偏弱的正相关。
【习题4】3×33 \times 33×3 列联表 + V 系数
某公司调查三种学历(高中、本科、研究生)的员工与三种晋升速度(快、中、慢)的关系:
| 快 | 中 | 慢 | 合计 | |
|---|---|---|---|---|
| 高中 | 10 | 30 | 40 | 80 |
| 本科 | 30 | 60 | 30 | 120 |
| 研究生 | 40 | 50 | 10 | 100 |
| 合计 | 80 | 140 | 80 | 300 |
检验学历与晋升速度是否独立,并计算 Cramér's V。
解答:
H0H_0H0: 学历与晋升速度独立
期望频数:
fe11=80×80300=21.33,fe12=80×140300=37.33,fe13=80×80300=21.33f_{e_{11}} = \frac{80 \times 80}{300} = 21.33, \quad f_{e_{12}} = \frac{80 \times 140}{300} = 37.33, \quad f_{e_{13}} = \frac{80 \times 80}{300} = 21.33fe11=30080×80=21.33,fe12=30080×140=37.33,fe13=30080×80=21.33
fe21=120×80300=32,fe22=120×140300=56,fe23=120×80300=32f_{e_{21}} = \frac{120 \times 80}{300} = 32, \quad f_{e_{22}} = \frac{120 \times 140}{300} = 56, \quad f_{e_{23}} = \frac{120 \times 80}{300} = 32fe21=300120×80=32,fe22=300120×140=56,fe23=300120×80=32
fe31=100×80300=26.67,fe32=100×140300=46.67,fe33=100×80300=26.67f_{e_{31}} = \frac{100 \times 80}{300} = 26.67, \quad f_{e_{32}} = \frac{100 \times 140}{300} = 46.67, \quad f_{e_{33}} = \frac{100 \times 80}{300} = 26.67fe31=300100×80=26.67,fe32=300100×140=46.67,fe33=300100×80=26.67
χ2=(10−21.33)221.33+(30−37.33)237.33+(40−21.33)221.33\chi^2 = \frac{(10-21.33)^2}{21.33} + \frac{(30-37.33)^2}{37.33} + \frac{(40-21.33)^2}{21.33}χ2=21.33(10−21.33)2+37.33(30−37.33)2+21.33(40−21.33)2
+(30−32)232+(60−56)256+(30−32)232+ \frac{(30-32)^2}{32} + \frac{(60-56)^2}{56} + \frac{(30-32)^2}{32}+32(30−32)2+56(60−56)2+32(30−32)2
+(40−26.67)226.67+(50−46.67)246.67+(10−26.67)226.67+ \frac{(40-26.67)^2}{26.67} + \frac{(50-46.67)^2}{46.67} + \frac{(10-26.67)^2}{26.67}+26.67(40−26.67)2+46.67(50−46.67)2+26.67(10−26.67)2
=128.3721.33+53.7337.33+348.5721.33+432+1656+432+177.6926.67+11.0946.67+278.0926.67= \frac{128.37}{21.33} + \frac{53.73}{37.33} + \frac{348.57}{21.33} + \frac{4}{32} + \frac{16}{56} + \frac{4}{32} + \frac{177.69}{26.67} + \frac{11.09}{46.67} + \frac{278.09}{26.67}=21.33128.37+37.3353.73+21.33348.57+324+5616+324+26.67177.69+46.6711.09+26.67278.09
=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427= 6.018 + 1.439 + 16.342 + 0.125 + 0.286 + 0.125 + 6.663 + 0.238 + 10.427=6.018+1.439+16.342+0.125+0.286+0.125+6.663+0.238+10.427
=41.663= 41.663=41.663
ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.052(4)=9.488\chi^2_{0.05}(4) = 9.488χ0.052(4)=9.488
χ2=41.663>9.488\chi^2 = 41.663 > 9.488χ2=41.663>9.488,拒绝 H0H_0H0,学历与晋升速度存在显著关联。
V=41.663300×min(2,2)=41.663600=0.06944=0.264V = \sqrt{\frac{41.663}{300 \times \min(2, 2)}} = \sqrt{\frac{41.663}{600}} = \sqrt{0.06944} = 0.264V=300×min(2,2)41.663 =60041.663 =0.06944 =0.264
V=0.264V = 0.264V=0.264,说明学历与晋升速度之间存在中等程度的关联。
【习题5】综合应用
某市场研究公司调查了 400 名消费者的品牌偏好(A/B/C)与收入水平(高/中/低):
| 品牌 A | 品牌 B | 品牌 C | 合计 | |
|---|---|---|---|---|
| 高收入 | 60 | 40 | 20 | 120 |
| 中收入 | 50 | 70 | 40 | 160 |
| 低收入 | 20 | 50 | 50 | 120 |
| 合计 | 130 | 160 | 110 | 400 |
(1)检验收入水平与品牌偏好是否独立(α=0.01\alpha = 0.01α=0.01)
(2)计算 Cramér's V 系数并解释
解答:
(1)独立性检验
H0H_0H0: 收入水平与品牌偏好独立
期望频数:
| 品牌 A | 品牌 B | 品牌 C | |
|---|---|---|---|
| 高收入 | 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 | 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 | 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33 |
| 中收入 | 160×130400=52\frac{160 \times 130}{400} = 52400160×130=52 | 160×160400=64\frac{160 \times 160}{400} = 64400160×160=64 | 160×110400=44\frac{160 \times 110}{400} = 44400160×110=44 |
| 低收入 | 120×130400=39\frac{120 \times 130}{400} = 39400120×130=39 | 120×160400=48\frac{120 \times 160}{400} = 48400120×160=48 | 120×110400=33\frac{120 \times 110}{400} = 33400120×110=33 |
χ2=(60−39)239+(40−48)248+(20−33)233\chi^2 = \frac{(60-39)^2}{39} + \frac{(40-48)^2}{48} + \frac{(20-33)^2}{33}χ2=39(60−39)2+48(40−48)2+33(20−33)2
+(50−52)252+(70−64)264+(40−44)244+ \frac{(50-52)^2}{52} + \frac{(70-64)^2}{64} + \frac{(40-44)^2}{44}+52(50−52)2+64(70−64)2+44(40−44)2
+(20−39)239+(50−48)248+(50−33)233+ \frac{(20-39)^2}{39} + \frac{(50-48)^2}{48} + \frac{(50-33)^2}{33}+39(20−39)2+48(50−48)2+33(50−33)2
=44139+6448+16933+452+3664+1644+36139+448+28933= \frac{441}{39} + \frac{64}{48} + \frac{169}{33} + \frac{4}{52} + \frac{36}{64} + \frac{16}{44} + \frac{361}{39} + \frac{4}{48} + \frac{289}{33}=39441+4864+33169+524+6436+4416+39361+484+33289
=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758= 11.308 + 1.333 + 5.121 + 0.077 + 0.563 + 0.364 + 9.256 + 0.083 + 8.758=11.308+1.333+5.121+0.077+0.563+0.364+9.256+0.083+8.758
=36.863= 36.863=36.863
ν=(3−1)(3−1)=4\nu = (3-1)(3-1) = 4ν=(3−1)(3−1)=4,χ0.012(4)=13.277\chi^2_{0.01}(4) = 13.277χ0.012(4)=13.277
χ2=36.863>13.277\chi^2 = 36.863 > 13.277χ2=36.863>13.277
结论: 在 α=0.01\alpha = 0.01α=0.01 的水平下拒绝 H0H_0H0,收入水平与品牌偏好之间存在极显著的关联。
(2)Cramér's V 系数
V=χ2n⋅min(r−1,c−1)=36.863400×2=0.04608=0.2147V = \sqrt{\frac{\chi^2}{n \cdot \min(r-1, c-1)}} = \sqrt{\frac{36.863}{400 \times 2}} = \sqrt{0.04608} = 0.2147V=n⋅min(r−1,c−1)χ2 =400×236.863 =0.04608 =0.2147
V=0.215V = 0.215V=0.215,表明收入水平与品牌偏好之间存在中等偏低 程度的关联。虽然统计上高度显著,但由于样本量较大(n=400n=400n=400),即使关联强度不大,也能检出显著性。实际业务决策中应结合实际意义综合判断。
七、本章知识框架总结
分类数据分析
├── χ² 统计量
│ ├── 定义与性质
│ ├── 渐近分布:χ²(k-1)
│ └── 期望频数要求:f_e ≥ 5
│
├── 拟合优度检验
│ ├── 适用场景:检验总体是否服从某理论分布
│ ├── 自由度:ν = k - 1 - r(r 为估计参数个数)
│ └── 常见应用:均匀分布、泊松分布、正态分布检验
│
├── 列联分析:独立性检验
│ ├── 列联表结构(r × c 表)
│ ├── 期望频数:f_e = R_i × C_j / n
│ ├── 自由度:ν = (r-1)(c-1)
│ └── Fisher 精确检验(小样本替代方案)
│
├── 相关测量
│ ├── φ 系数(2×2 表)
│ ├── C 系数(C 系数,上界 < 1)
│ ├── V 系数(Cramér's V,上界 = 1,推荐)
│ └── λ 系数(基于预测改善的不对称测量)
│
└── 注意事项
├── 期望频数不宜过小
├── 样本量与检验功效
├── 相关 ≠ 因果
├── 连续性修正(Yates 校正)
└── 样本过大时关注效应量而非仅 p 值