P-value 到底是什么?从"原假设"到"统计显著性"的完整理解
在学习统计学、线性回归和机器学习模型评价时,我们经常会看到一个指标:
p-value p\text{-value} p-value
中文通常称为 P 值。
很多初学者会把 P 值理解为:
原假设成立的概率。
或者理解为:
两个变量没有关系的概率。
还有一种常见理解是:
如果 P 值等于 0.03,那么两个变量有关系的概率就是 3%。
这些理解都不准确。
P 值真正讨论的不是"原假设本身有多大概率正确",而是:
先暂时假设原假设成立,然后判断当前观察到的样本结果,在这个假设下究竟有多么反常。
本文将从直观逻辑、数学定义、线性回归案例、硬币案例和常见误区几个方面,完整解释 P 值的含义。
一、为什么需要 P-value?
假设我们研究一个问题:
温度变量 xxx 是否会影响终点碳含量 yyy?
我们采集了一批生产数据,并建立线性回归模型:
y=β0+β1x+ε y=\beta_0+\beta_1x+\varepsilon y=β0+β1x+ε
其中:
- xxx 表示温度;
- yyy 表示终点碳含量;
- β0\beta_0β0 表示截距;
- β1\beta_1β1 表示温度对终点碳含量的线性影响系数;
- ε\varepsilonε 表示随机误差和模型未解释的影响。
如果:
β1=0 \beta_1=0 β1=0
那么模型变为:
y=β0+ε y=\beta_0+\varepsilon y=β0+ε
此时温度 xxx 不会改变 yyy 的平均水平,也就是温度与终点碳含量之间不存在该模型所描述的线性关系。
但现实中,我们无法直接知道总体参数 β1\beta_1β1 的真实值,只能根据有限的样本估计它。
假设根据样本计算得到:
β^1=−0.25 \hat{\beta}_1=-0.25 β^1=−0.25
这说明样本中表现出了负向线性关系。
但是,仅仅看到:
β^1≠0 \hat{\beta}_1\neq 0 β^1=0
还不能立即得出结论:
温度与终点碳含量在总体中一定存在关系。
因为即使总体中的真实系数确实为零,有限样本也可能因为随机波动而得到一个不等于零的估计值。
因此,我们需要判断:
当前样本中观察到的关系,究竟只是随机波动,还是已经强到难以用随机波动解释?
P 值就是为了解决这个问题。
二、首先提出原假设
统计检验通常从原假设开始。
原假设记为:
H0 H_0 H0
在温度与终点碳含量的案例中,可以设定:
H0:β1=0 H_0:\beta_1=0 H0:β1=0
它表示:
在总体中,温度对终点碳含量没有线性影响。
与原假设对应的是备择假设:
H1:β1≠0 H_1:\beta_1\neq 0 H1:β1=0
它表示:
在总体中,温度对终点碳含量存在线性影响。
需要注意,统计检验在计算 P 值时,并不是一开始就假设两个变量有关系,而是首先站在原假设的角度:
我们暂时假定温度和终点碳含量在总体中没有线性关系。
然后再判断当前样本结果是否与这个假设相容。
三、P-value 的数学定义
p=P(观察到当前结果或更极端的结果∣H0成立) \begin{aligned} p &= P\big(\text{观察到当前结果或更极端的结果} \mid H_0\text{成立}\big) \end{aligned} p=P(观察到当前结果或更极端的结果∣H0成立)
这里的条件概率符号:
P(A∣B) P(A\mid B) P(A∣B)
表示:
在条件 BBB 成立的前提下,事件 AAA 发生的概率。
因此:
p=P(当前或更极端的数据∣H0成立) \begin{aligned} p &= P\big(\text{当前或更极端的数据} \mid H_0\text{成立}\big) \end{aligned} p=P(当前或更极端的数据∣H0成立)
表示:
假设原假设确实成立,仅仅由于随机抽样,得到当前这么极端或更加极端结果的概率。
这里有三个关键词必须理解:
- 假设原假设成立;
- 当前或更极端;
- 随机抽样产生这种结果的概率。
四、如何直观理解 P-value?
可以把 P 值理解为:
假如原假设是正确的,当前样本结果到底有多反常?
如果 P 值很大,说明当前结果在原假设成立时并不罕见。
如果 P 值很小,说明当前结果在原假设成立时非常罕见。
因此:
p越小⟹当前数据与原假设越不相容 p\text{越小} \Longrightarrow \text{当前数据与原假设越不相容} p越小⟹当前数据与原假设越不相容
进而:
p越小⟹反对原假设的统计证据越强 p\text{越小} \Longrightarrow \text{反对原假设的统计证据越强} p越小⟹反对原假设的统计证据越强
五、对一个常见理解的优化
一种比较直观的理解是:
原假设认为两个变量没有关系。现在拿到了一批样本数据,而样本表现出了关系。接下来计算:在没有关系的情况下,出现这种关系的概率是多少?如果概率只有 3%,但实际偏偏出现了这样的结果,那么就有理由怀疑原假设。
这个理解的总体方向是正确的,但有两个地方需要进一步优化。
1. 不能说样本数据"一定有关系"
根据样本计算得到:
β^1≠0 \hat{\beta}_1\neq 0 β^1=0
只能说明:
当前样本表现出了一定程度的关系。
不能直接说:
这批数据已经证明两个变量一定有关系。
因为即使总体完全没有关系,有限样本仍然可能因为随机误差而表现出相关性。
例如,假设总体相关系数为:
ρ=0 \rho=0 ρ=0
从总体中随机抽取 20 个样本,得到的样本相关系数 rrr 可能是:
r=0.12 r=0.12 r=0.12
也可能是:
r=−0.25 r=-0.25 r=−0.25
甚至偶尔可能得到:
r=0.48 r=0.48 r=0.48
因此,统计检验并不是判断样本中是否存在任何不为零的关系,而是判断:
样本表现出的关系是否已经强到难以用随机波动解释。
2. 不能简单说"没有关系时出现关系的概率"
更准确的说法不是:
在没有关系时,出现关系的概率为 3%。
而是:
在总体没有关系的前提下,出现当前这么强或更强的样本关系,其概率为 3%。
为什么必须强调"当前这么强或更强"?
因为只要样本数量有限,样本相关系数几乎不可能恰好等于零。
如果把"有关系"简单定义为:
r≠0 r\neq 0 r=0
那么即使总体没有关系,样本中出现非零相关系数也是非常常见的。
统计学真正关心的不是:
有没有任何偏离零的现象?
而是:
这种偏离零的程度是否足够大?
因此,更准确的完整理解是:
首先假设总体中温度与终点碳含量没有线性关系。现在样本数据显示出了较明显的线性关系。于是计算:如果总体确实没有关系,仅依靠随机抽样,得到当前这么强或更强关系的概率是多少?结果为 3%。由于这种结果在原假设成立时比较少见,因此样本数据与原假设不太相容,从而有理由拒绝原假设。
六、当 P-value 等于 0.03 时代表什么?
假设回归分析得到:
p=0.03 p=0.03 p=0.03
因为:
0.03=3% 0.03=3\% 0.03=3%
所以它表示:
如果温度在总体中实际上对终点碳含量没有线性影响,那么通过随机抽样,仍有 3% 的概率得到当前这么强或更强的样本关系。
它不表示:
原假设成立的概率是 3%。
也不表示:
温度与终点碳含量有关系的概率是 3%。
更不表示:
温度与终点碳含量有关系的概率是 97%。
P 值计算的是:
P(数据∣H0) P(\text{数据}\mid H_0) P(数据∣H0)
而不是:
P(H0∣数据) P(H_0\mid\text{数据}) P(H0∣数据)
这两个条件概率的方向不同。
七、为什么 P-value 越小,越应该拒绝原假设?
假设:
H0:β1=0 H_0:\beta_1=0 H0:β1=0
现在得到:
p=0.03 p=0.03 p=0.03
其逻辑是:
- 先假设 β1=0\beta_1=0β1=0;
- 在这个假设下,当前这么极端的数据只有 3% 的概率出现;
- 当前结果在原假设成立时比较罕见;
- 但当前结果实际上已经出现;
- 因此我们开始怀疑"β1=0\beta_1=0β1=0"这个前提;
- 当 P 值小于预先设定的显著性水平时,拒绝原假设。
整个逻辑可以表示为:
H0成立⟹当前结果很少出现 H_0\text{成立} \Longrightarrow \text{当前结果很少出现} H0成立⟹当前结果很少出现
但实际中当前结果出现了,于是我们认为:
当前数据与 H0 不太相容 \text{当前数据与 }H_0\text{ 不太相容} 当前数据与 H0 不太相容
因此倾向于拒绝:
H0 H_0 H0
需要注意,这是一种反证式的统计推理,而不是直接计算原假设为假的概率。
八、为什么 P-value 越大,反而越不能拒绝原假设?
假设得到:
p=0.60 p=0.60 p=0.60
它表示:
即使温度实际上与终点碳含量没有线性关系,仍然有 60% 的概率得到当前这么极端或更极端的样本结果。
这说明当前样本结果在原假设成立时非常常见。
既然这个结果在"没有关系"的情况下很容易出现,那么它就不能构成反对原假设的有力证据。
因此:
p很大⟹当前数据与原假设并不冲突 p\text{很大} \Longrightarrow \text{当前数据与原假设并不冲突} p很大⟹当前数据与原假设并不冲突
于是我们只能得出:
没有足够证据拒绝原假设。
注意,这不等于:
原假设已经被证明正确。
P 值大可能存在多种原因:
- 两个变量确实没有关系;
- 样本数量太少;
- 数据噪声太大;
- 测量误差较大;
- 变量之间存在复杂的非线性关系;
- 模型形式设置不正确;
- 其他变量掩盖了当前变量的独立作用。
所以,P 值较大时,规范表达是:
当前数据没有提供足够证据拒绝原假设。
而不是:
已经证明原假设成立。
九、显著性水平 α\alphaα 是什么?
在进行统计检验之前,通常需要设置显著性水平:
α \alpha α
最常见的设置是:
α=0.05 \alpha=0.05 α=0.05
它相当于规定了一条判断界限。
当:
p<α p<\alpha p<α
则拒绝原假设。
当:
p≥α p\geq\alpha p≥α
则不拒绝原假设。
例如:
p=0.03,α=0.05 p=0.03,\quad \alpha=0.05 p=0.03,α=0.05
因为:
0.03<0.05 0.03<0.05 0.03<0.05
所以在 5% 显著性水平下拒绝原假设。
规范的结论是:
当前数据提供了足够的统计证据,表明温度与终点碳含量之间存在显著的线性关系。
不能写成:
原假设百分之百错误。
因为即使原假设成立,极端样本仍然可能以较小概率出现。
十、拒绝原假设仍然可能犯错
假设原假设实际上是正确的:
H0为真 H_0\text{为真} H0为真
但由于随机抽样,恰好获得了一个极端样本,最终得到:
p<0.05 p<0.05 p<0.05
于是错误地拒绝了原假设。
这种错误称为第一类错误。
第一类错误=原假设为真,但错误地拒绝原假设 \text{第一类错误} = \text{原假设为真,但错误地拒绝原假设} 第一类错误=原假设为真,但错误地拒绝原假设
显著性水平:
α=0.05 \alpha=0.05 α=0.05
表示在长期重复执行同类检验并满足相关统计假设时,研究者接受一定的错误拒绝风险。
因此,统计学通常不说:
原假设已经被彻底证明错误。
而是说:
在给定显著性水平下,拒绝原假设。
十一、用硬币案例理解 P-value
假设有人拿出一枚硬币,并声称它是一枚公平硬币。
原假设为:
H0:P(正面)=0.5 H_0:P(\text{正面})=0.5 H0:P(正面)=0.5
现在连续抛 10 次,结果 10 次全部为正面。
如果硬币真的是公平硬币,那么连续 10 次出现正面的概率为:
P(连续10次正面∣H0)=(12)10=0.0009765625 \begin{aligned} P(\text{连续10次正面}\mid H_0) &= \left(\frac{1}{2}\right)^{10} \\ &= 0.0009765625 \end{aligned} P(连续10次正面∣H0)=(21)10=0.0009765625
约为:
0.098% 0.098\% 0.098%
这个概率非常小。
因此我们会产生怀疑:
如果硬币真的公平,为什么会出现这么极端的结果?
于是,当前数据构成了反对"硬币公平"这一原假设的证据。
但这个结果仍然不表示:
硬币公平的概率只有 0.098%。
它只表示:
假设硬币公平,当前结果非常罕见。
十二、回归分析中 P-value 是怎么得到的?
在线性回归模型中:
y=β0+β1x+ε y=\beta_0+\beta_1x+\varepsilon y=β0+β1x+ε
我们希望检验:
H0:β1=0 H_0:\beta_1=0 H0:β1=0
根据样本得到回归系数估计:
β^1 \hat{\beta}_1 β^1
同时计算该估计值的标准误差:
SE(β^1) \operatorname{SE}(\hat{\beta}_1) SE(β^1)
然后构造 ttt 统计量:
t=β^1−0SE(β^1) t = \frac{\hat{\beta}_1-0}{\operatorname{SE}(\hat{\beta}_1)} t=SE(β^1)β^1−0
这里的 0 来自原假设:
H0:β1=0 H_0:\beta_1=0 H0:β1=0
ttt 统计量衡量的是:
当前估计系数距离原假设中的零值有多少个标准误差。
例如:
β^1=−0.24,SE(β^1)=0.10 \hat{\beta}_1=-0.24,\quad \operatorname{SE}(\hat{\beta}_1)=0.10 β^1=−0.24,SE(β^1)=0.10
那么:
t=−0.240.10=−2.4 t = \frac{-0.24}{0.10} = -2.4 t=0.10−0.24=−2.4
这表示当前估计值距离零大约有 2.4 个标准误差。
在双侧检验中,P 值计算的是:
p=P(∣T∣≥2.4∣H0) p = P\big(|T|\geq 2.4 \mid H_0\big) p=P(∣T∣≥2.4∣H0)
假设最终得到:
p=0.03 p=0.03 p=0.03
说明在真实系数为零的条件下,得到绝对值至少为 2.4 的 ttt 统计量的概率为 3%。
十三、"当前或更极端"是什么意思?
假设当前得到:
t=−2.4 t=-2.4 t=−2.4
对于双侧检验:
H1:β1≠0 H_1:\beta_1\neq 0 H1:β1=0
不仅负方向的大幅偏离属于极端结果,正方向的大幅偏离也属于极端结果。
因此:
∣T∣≥2.4 |T|\geq2.4 ∣T∣≥2.4
包括:
T≤−2.4,T≥2.4 T\leq-2.4,\quad T\geq2.4 T≤−2.4,T≥2.4
所以双侧 P 值通常包括分布两端的尾部概率。
如果当前估计系数为正,则"更极端"仍然要考虑正负两个方向,因为备择假设允许:
β1>0,β1<0 \beta_1>0,\quad \beta_1<0 β1>0,β1<0
十四、一个完整的温度与终点碳案例
假设建立模型:
Cend=β0+β1T+ε C_{\mathrm{end}} = \beta_0 + \beta_1T + \varepsilon Cend=β0+β1T+ε
其中:
- CendC_{\mathrm{end}}Cend 为终点碳含量;
- TTT 为某个温度变量;
- β1\beta_1β1 为温度的线性影响系数。
提出假设:
H0:β1=0,H1:β1≠0 H_0:\beta_1=0,\quad H_1:\beta_1\neq0 H0:β1=0,H1:β1=0
根据样本得到:
β^1=−0.25,SE(β^1)=0.104 \hat{\beta}_1=-0.25,\quad \operatorname{SE}(\hat{\beta}_1)=0.104 β^1=−0.25,SE(β^1)=0.104
因此:
t=−0.250.104≈−2.40 t = \frac{-0.25}{0.104} \approx-2.40 t=0.104−0.25≈−2.40
进一步计算得到:
p=0.03 p=0.03 p=0.03
设显著性水平为:
α=0.05 \alpha=0.05 α=0.05
由于:
p<α p<\alpha p<α
所以拒绝:
H0:β1=0 H_0:\beta_1=0 H0:β1=0
结论可以写成:
在 5% 显著性水平下,温度变量的回归系数显著不为零,当前样本提供了温度与终点碳含量之间存在线性关系的统计证据。
如果回归系数为负,则还可以进一步说明:
在其他模型条件保持不变时,温度变量增加与终点碳含量降低相关。
但不能仅根据显著性直接写成:
温度升高必然导致终点碳含量降低。
因为统计相关关系并不自动等于因果关系。
十五、P-value 不等于原假设为真的概率
这是最重要的误区。
P 值计算的是:
P(数据∣H0) P(\text{数据}\mid H_0) P(数据∣H0)
而很多人错误地把它理解为:
P(H0∣数据) P(H_0\mid\text{数据}) P(H0∣数据)
假设:
p=0.03 p=0.03 p=0.03
它表示:
在原假设成立时,当前或更极端数据出现的概率为 3%。
它不表示:
根据当前数据,原假设成立的概率为 3%。
从:
P(数据∣H0) P(\text{数据}\mid H_0) P(数据∣H0)
不能直接得到:
P(H0∣数据) P(H_0\mid\text{数据}) P(H0∣数据)
如果希望计算后者,通常需要贝叶斯统计框架,并结合原假设的先验概率等信息。
十六、P-value 不等于"关系存在的概率"
假设:
p=0.03 p=0.03 p=0.03
不能得出:
P(β1≠0∣数据)=0.97 P(\beta_1\neq0\mid\text{数据})=0.97 P(β1=0∣数据)=0.97
也不能说:
温度与终点碳含量有 97% 的概率存在关系。
传统频率学派的 P 值并不直接给出参数或假设的概率。
它只衡量:
当前样本结果在原假设成立时有多罕见。
十七、P-value 越小,不等于影响越大
假设某个变量的回归系数为:
β^1=0.001 \hat{\beta}_1=0.001 β^1=0.001
虽然影响很小,但如果样本数量非常大、测量误差很小,那么可能得到:
p<0.001 p<0.001 p<0.001
这说明:
有较强的统计证据认为该系数不等于零。
但不代表:
该变量的实际影响非常大。
反过来,如果某个变量的估计系数较大,但样本量很少、数据波动很大,也可能得到:
p>0.05 p>0.05 p>0.05
因此:
统计显著性≠实际重要性 \text{统计显著性} \neq \text{实际重要性} 统计显著性=实际重要性
评价实际影响大小,还需要关注:
- 回归系数;
- 效应量;
- 置信区间;
- 变量单位;
- 实际工程意义;
- 预测误差;
- 业务或工艺容许范围。
十八、样本数量为什么会影响 P-value?
在线性回归中:
t=β^1SE(β^1) t = \frac{\hat{\beta}_1}{\operatorname{SE}(\hat{\beta}_1)} t=SE(β^1)β^1
随着样本数量增加,回归系数的标准误差通常会减小。
如果:
SE(β^1) \operatorname{SE}(\hat{\beta}_1) SE(β^1)
变小,那么即使回归系数没有明显增大,ttt 统计量的绝对值也可能变大:
∣t∣↑ |t|\uparrow ∣t∣↑
进而导致:
p↓ p\downarrow p↓
所以,大样本中非常微弱的关系也可能达到统计显著。
小样本中,即使存在实际影响,也可能因为不确定性过大而无法达到显著。
这也是为什么不能只看 P 值。
十九、P-value 大于 0.05 是否说明没有关系?
不能。
假设:
p=0.20 p=0.20 p=0.20
只能说明:
当前样本没有提供足够证据拒绝原假设。
它可能意味着:
- 两个变量确实没有线性关系;
- 存在关系,但样本数量不足;
- 数据噪声过大;
- 存在异常值;
- 关系是非线性的;
- 变量之间存在多重共线性;
- 模型遗漏了重要变量;
- 测量误差降低了检验能力。
因此,规范表述是:
未发现统计显著关系。
而不是:
已经证明不存在关系。
"没有发现证据"和"证明不存在"是两个完全不同的结论。
二十、P-value 小于 0.05 是否说明一定存在因果关系?
不能。
即使得到:
p<0.001 p<0.001 p<0.001
也只能说明:
当前数据提供了反对原假设的强统计证据。
它不自动证明因果关系。
例如,温度与终点碳含量之间可能存在显著关系,但这种关系可能由其他变量共同造成,例如:
- 吹氧量;
- 吹炼时间;
- 铁水初始碳含量;
- 废钢加入量;
- 炉料结构;
- 氧枪操作制度。
如果这些变量没有得到合理控制,就不能仅凭一个较小的 P 值断言温度是终点碳变化的直接原因。
二十一、P-value 与置信区间的关系
对于双侧检验:
H0:β1=0 H_0:\beta_1=0 H0:β1=0
如果回归系数的 95% 置信区间不包含零,通常对应:
p<0.05 p<0.05 p<0.05
例如:
β^1=−0.25 \hat{\beta}_1=-0.25 β^1=−0.25
其 95% 置信区间为:
−0.45,−0.05\] \[-0.45,-0.05\] \[−0.45,−0.05
因为区间不包含零,所以在 5% 显著性水平下,可以拒绝:
H0:β1=0 H_0:\beta_1=0 H0:β1=0
如果置信区间为:
−0.40,0.08\] \[-0.40,0.08\] \[−0.40,0.08
由于其中包含零,因此不能排除真实系数为零的可能性,通常对应:
p>0.05 p>0.05 p>0.05
与单独的 P 值相比,置信区间还能反映:
- 参数可能取值的范围;
- 估计结果的不确定性;
- 效应方向;
- 效应大小是否具有实际意义。
因此,在正式论文中,通常建议同时报告:
β^1,95%置信区间,p-value \hat{\beta}_1,\quad 95\%\text{置信区间},\quad p\text{-value} β^1,95%置信区间,p-value
二十二、P-value 与 R-squared 的区别
P 值和决定系数:
R2 R^2 R2
回答的是不同问题。
P 值主要回答:
某个变量的回归系数是否有足够证据认为不等于零?
R2R^2R2 主要回答:
整个模型解释了因变量多大比例的波动?
例如:
R2=0.80 R^2=0.80 R2=0.80
表示模型解释了约 80% 的因变量波动。
同时,某个变量可能得到:
p=0.40 p=0.40 p=0.40
这并不矛盾。
它可能表示:
- 整个模型具有较强解释能力;
- 但该变量在控制其他变量后,没有表现出显著的独立贡献。
反过来,也可能出现:
R2=0.05,p<0.001 R^2=0.05,\quad p<0.001 R2=0.05,p<0.001
这说明:
- 关系在统计上较为可信;
- 但该模型只能解释约 5% 的总体波动;
- 关系可能真实存在,但解释能力和应用价值有限。
因此:
p-value≠R2 p\text{-value} \neq R^2 p-value=R2
P 值关注统计证据,R2R^2R2 关注解释比例。
二十三、多次检验会带来什么问题?
假设显著性水平为:
α=0.05 \alpha=0.05 α=0.05
如果只进行一次检验,错误拒绝原假设的风险受到一定控制。
但如果同时对大量变量进行检验,例如一次性检验 100 个完全无关的变量,那么即使所有原假设都成立,也可能由于随机波动出现若干个:
p<0.05 p<0.05 p<0.05
的结果。
直观上,若每次检验都有约 5% 的机会产生假阳性,那么进行大量检验后,至少出现一次假阳性的概率会明显上升。
因此,多重比较中通常需要使用校正方法,例如:
- Bonferroni 校正;
- Holm 校正;
- Benjamini--Hochberg 方法;
- 假发现率控制。
这说明不能在大量变量中只挑出 P 值最小的几个,就直接宣称发现了可靠规律。
二十四、统计显著性不等于研究价值
一个完整的统计结论不能只包含:
p<0.05 p<0.05 p<0.05
还应当考虑:
- 效应量有多大;
- 回归系数方向是否符合机理;
- 置信区间是否过宽;
- 样本数量是否足够;
- 模型假设是否成立;
- 是否存在异常值;
- 是否存在多重共线性;
- 是否进行了多重检验;
- 结果是否具有工程意义;
- 是否能在独立数据中复现。
例如,在转炉终点温度预测中,某变量的回归系数虽然显著,但它只使终点温度平均变化:
0.01 ∘C 0.01\,^\circ\mathrm{C} 0.01∘C
那么即使:
p<0.001 p<0.001 p<0.001
这种影响在工程上也可能几乎没有实际价值。
二十五、如何正确阅读一条 P-value 结果?
假设论文中写道:
温度变量的回归系数为 −0.25-0.25−0.25,P 值为 0.03。
可以按照以下顺序理解。
首先,回归系数:
β^1=−0.25 \hat{\beta}_1=-0.25 β^1=−0.25
说明在当前模型设定下,温度增加与终点碳含量降低相关。
其次:
p=0.03 p=0.03 p=0.03
说明如果总体中温度没有线性影响,那么观察到当前这么强或更强结果的概率为 3%。
再次,如果:
α=0.05 \alpha=0.05 α=0.05
由于:
p<α p<\alpha p<α
所以拒绝原假设。
最后,结论是:
当前数据提供了温度与终点碳含量之间存在统计显著线性关系的证据。
但仍然不能直接得出:
温度变化一定导致终点碳含量变化。
二十六、P-value 的完整思维流程
可以把整个过程总结为以下步骤。
第一步:定义研究问题
例如:
温度是否与终点碳含量存在线性关系?
第二步:建立统计模型
y=β0+β1x+ε y=\beta_0+\beta_1x+\varepsilon y=β0+β1x+ε
第三步:提出原假设
H0:β1=0 H_0:\beta_1=0 H0:β1=0
第四步:根据样本计算统计量
t=β^1SE(β^1) t = \frac{\hat{\beta}_1}{\operatorname{SE}(\hat{\beta}_1)} t=SE(β^1)β^1
第五步:计算 P-value
p=P(∣T∣≥∣tobs∣∣H0) p = P\big(|T|\geq|t_{\mathrm{obs}}| \mid H_0\big) p=P(∣T∣≥∣tobs∣∣H0)
第六步:与显著性水平比较
若:
p<α p<\alpha p<α
则拒绝原假设。
若:
p≥α p\geq\alpha p≥α
则不拒绝原假设。
第七步:结合效应量和实际背景解释
不能只报告 P 值,还应结合:
- 回归系数;
- 置信区间;
- 样本量;
- 模型拟合程度;
- 实际工程意义。
二十七、最适合记忆的一句话
P 值可以记成:
假设原假设是正确的,当前观察结果到底有多反常?
如果:
p很小 p\text{很小} p很小
说明:
当前结果在原假设成立时很罕见,数据与原假设不太相容。
于是倾向于:
拒绝 H0 \text{拒绝 }H_0 拒绝 H0
如果:
p很大 p\text{很大} p很大
说明:
当前结果在原假设成立时很常见,没有足够理由拒绝原假设。
二十八、对 P-value 的最终准确理解
将直观理解和统计学规范结合起来,可以形成下面这段完整表述:
首先假设总体中两个变量没有关系。然后从总体中获得一批样本,样本表现出了一定程度的关系。由于有限样本本身可能产生随机相关,因此不能直接根据样本关系断言总体中一定存在关系。接下来计算:在总体确实没有关系的条件下,仅依靠随机抽样,得到当前这么强或更强关系的概率是多少。这个概率就是 P 值。如果 P 值很小,例如为 0.03,说明这种样本结果在原假设成立时只有 3% 的概率出现,因此当前数据与原假设不太相容。在显著性水平为 0.05 时,可以拒绝原假设,认为当前数据提供了两个变量之间存在统计显著关系的证据。但这不能被解释为原假设只有 3% 的概率正确,也不能被解释为两个变量有 97% 的概率存在关系,更不能说明二者一定存在因果关系。
二十九、常见错误表达与正确表达
错误表达一
P 值为 0.03,所以原假设成立的概率是 3%。
正确表达:
在原假设成立的条件下,得到当前或更极端结果的概率为 3%。
错误表达二
P 值为 0.03,所以两个变量有关系的概率是 97%。
正确表达:
当前数据在原假设成立时较为罕见,因此构成了反对原假设的统计证据。
错误表达三
P 值大于 0.05,所以两个变量没有关系。
正确表达:
当前样本没有提供足够证据拒绝无关系的原假设。
错误表达四
P 值越小,变量影响越大。
正确表达:
P 值越小,通常表示反对原假设的统计证据越强,但影响大小需要通过回归系数、效应量和置信区间判断。
错误表达五
P 值显著,所以存在因果关系。
正确表达:
P 值显著说明数据支持统计关联,但因果关系还需要研究设计、变量控制和机理证据支持。
三十、总结
P 值的核心不是:
原假设有多大概率成立?
而是:
假设原假设成立,当前数据有多难出现?
其定义为:
p=P(当前或更极端的结果∣H0成立) \begin{aligned} p &= P\big(\text{当前或更极端的结果} \mid H_0\text{成立}\big) \end{aligned} p=P(当前或更极端的结果∣H0成立)
判断逻辑为:
p较小⟹当前数据在 H0 下较罕见⟹数据与 H0 不太相容⟹倾向于拒绝 H0 \begin{aligned} p\text{较小} &\Longrightarrow \text{当前数据在 }H_0\text{ 下较罕见} \\ &\Longrightarrow \text{数据与 }H_0\text{ 不太相容} \\ &\Longrightarrow \text{倾向于拒绝 }H_0 \end{aligned} p较小⟹当前数据在 H0 下较罕见⟹数据与 H0 不太相容⟹倾向于拒绝 H0
但需要始终记住:
P(数据∣H0)≠P(H0∣数据) P(\text{数据}\mid H_0) \neq P(H_0\mid\text{数据}) P(数据∣H0)=P(H0∣数据)
同时:
统计显著≠影响很大≠具有实际价值≠存在因果关系 \text{统计显著} \neq \text{影响很大} \neq \text{具有实际价值} \neq \text{存在因果关系} 统计显著=影响很大=具有实际价值=存在因果关系
因此,在统计分析、回归分析或科研论文中,应当将 P 值与回归系数、置信区间、样本数量、模型拟合效果和实际工程意义结合起来进行解释,而不能把 P 值作为唯一结论依据。