第十章:假设检验原理

从错误概率、p 值与功效出发,理解 Neyman–Pearson、似然比、可选停止和多重检验。

第十章:假设检验原理

案例: 新疗法的平均改善为 0.2 个标准差。研究“不显著”可能表示无效,也可能只是样本太小。

假设检验是在预先声明的错误控制规则下,用数据评价原假设。它不是自动判断“理论真假”的机器。

学习目标

你应能:

  1. 写出原假设、备择假设与检验统计量;
  2. 区分一类错误、二类错误、显著性水平与功效;
  3. 准确解释 p 值;
  4. 使用 Neyman–Pearson 与似然比思想;
  5. 识别可选停止、多重检验与选择性报告。

1. 检验的四个组成

以均值为例:

H0:μ=μ0,H1:μμ0.H_0:\mu=\mu_0,\qquad H_1:\mu\ne\mu_0.

必须同时说明:

  1. 数据模型与抽样单位;
  2. 检验统计量 T(X)T(X)
  3. 原假设下 TT 的分布;
  4. 拒绝域或 p 值规则。

双侧与单侧备择应由研究问题预先确定,不能看完效应方向再选择。

2. 两类错误与功效

真实状态不拒绝 H0H_0拒绝 H0H_0
H0H_0正确,概率 1α1-\alpha一类错误,概率 α\alpha
H1H_1二类错误,概率 β(θ)\beta(\theta)功效 1β(θ)1-\beta(\theta)

显著性水平控制最坏原假设下的误拒概率:

supθΘ0Pθ(reject)α.\sup_{\theta\in\Theta_0}P_\theta(\text{reject})\le\alpha.

功效是效应大小的函数。样本量规划必须指定最小重要效应,而不是只说“希望功效 80%”。

3. p 值的准确解释

p 值是:

p=PH0{T(Xrep) 至少与观察值同样极端}.p=P_{H_0}\{T(X^{rep})\text{ 至少与观察值同样极端}\}.

它不是:

  • P(H0data)P(H_0\mid data)
  • “结果由随机造成的概率”;
  • 效应为零的概率;
  • 未来重复研究成功的概率;
  • 效应大小或实际重要性。

p 值小表示数据与指定 H0H_0 及其模型较不相容。若模型、停止规则或分析选择错误,数值也会失去校准。

4. Neyman–Pearson 与似然比

对于简单原假设和简单备择,Neyman–Pearson 引理说明:在固定 α\alpha 下,拒绝较大似然比

L(θ1;x)L(θ0;x)\frac{L(\theta_1;x)}{L(\theta_0;x)}

的检验最有力。

复合假设常使用广义似然比:

Λ(x)=supθΘ0L(θ;x)supθΘL(θ;x).\Lambda(x) = \frac{\sup_{\theta\in\Theta_0}L(\theta;x)} {\sup_{\theta\in\Theta}L(\theta;x)}.

正则条件下,2logΛ-2\log\Lambda 常渐近服从卡方;边界参数、混合模型和弱识别可产生非标准极限。

5. 可运行案例:样本量、效应与功效

已知标准差为 1,双侧 z 检验使用 Z>1.96|Z|>1.96。代码模拟不同真实效应和样本量。

Py

Python:一类错误与功效曲线

Idle

效应为 0 时拒绝率接近 0.05;效应固定时样本量增加提高功效。大样本也会让极小效应显著,因此必须同时报告估计值、区间和实际阈值。

6. 区间与检验的对偶

对双侧水平 α\alpha 检验,若 1α1-\alpha 置信区间不包含 θ0\theta_0,通常等价于拒绝 H0:θ=θ0H_0:\theta=\theta_0。但前提是区间和检验使用同一模型、尾部与近似。

区间提供与数据相容的参数范围,比一个二元“显著/不显著”包含更多信息。

7. 可选停止

固定样本 p 值假设样本量与停止规则预先确定。若每天查看一次并在首次 p<0.05p<0.05 时停止,一类错误通常膨胀。

可选方案:

  • 预先固定样本量;
  • 群序贯设计与 alpha spending;
  • 随时有效 p 值、e-process 或置信序列;
  • 将所有中期查看纳入正式方案。

前沿章会用 Ville 不等式解释随时有效推断。

8. 多重检验

进行 mm 个独立的 5% 检验时,至少一次误拒概率为:

1(10.05)m.1-(1-0.05)^m.

常见目标不同:

  • FWER:至少一个假阳性的概率;
  • FDR:拒绝结果中假阳性的期望比例;
  • simultaneous coverage:一组区间同时覆盖。

Bonferroni 控制 FWER;Benjamini–Hochberg 在相应依赖条件下控制 FDR。选择方法要先写清错误目标。

9. 诊断清单

  • 原假设和备择是否在看数据前写清?
  • 单侧方向是否有制度依据?
  • 检验统计量在 H0H_0 下如何校准?
  • 样本量是否按最小重要效应规划?
  • 是否查看、筛选或停止过多次?
  • 是否进行了多个终点、亚组或模型检验?
  • 是否同时报告效应、区间、功效和假设?

常见误区

  • “不显著”写成“证明没有效应”;
  • p=0.03p=0.03 写成“原假设只有 3% 概率为真”;
  • 两组一个显著、一个不显著,就称组间差异显著;
  • 看完结果后改单双侧;
  • 把统计显著等同于临床或经济重要。

课堂任务

为“新教学方法提高平均成绩”写一份检验方案:

  1. 定义最小重要差异;
  2. H0,H1H_0,H_1 与单双侧理由;
  3. 指定 α\alpha、目标功效与样本量输入;
  4. 说明期中查看如何处理;
  5. 列出主要终点与多重检验规则。

核心阅读

上一章:点估计方法|下一章:常用检验方法

Copyright © 2026