第十章:假设检验原理
从错误概率、p 值与功效出发,理解 Neyman–Pearson、似然比、可选停止和多重检验。
第十章:假设检验原理
案例: 新疗法的平均改善为 0.2 个标准差。研究“不显著”可能表示无效,也可能只是样本太小。
假设检验是在预先声明的错误控制规则下,用数据评价原假设。它不是自动判断“理论真假”的机器。
学习目标
你应能:
- 写出原假设、备择假设与检验统计量;
- 区分一类错误、二类错误、显著性水平与功效;
- 准确解释 p 值;
- 使用 Neyman–Pearson 与似然比思想;
- 识别可选停止、多重检验与选择性报告。
1. 检验的四个组成
以均值为例:
必须同时说明:
- 数据模型与抽样单位;
- 检验统计量 ;
- 原假设下 的分布;
- 拒绝域或 p 值规则。
双侧与单侧备择应由研究问题预先确定,不能看完效应方向再选择。
2. 两类错误与功效
| 真实状态 | 不拒绝 | 拒绝 |
|---|---|---|
| 真 | 正确,概率 | 一类错误,概率 |
| 真 | 二类错误,概率 | 功效 |
显著性水平控制最坏原假设下的误拒概率:
功效是效应大小的函数。样本量规划必须指定最小重要效应,而不是只说“希望功效 80%”。
3. p 值的准确解释
p 值是:
它不是:
- ;
- “结果由随机造成的概率”;
- 效应为零的概率;
- 未来重复研究成功的概率;
- 效应大小或实际重要性。
p 值小表示数据与指定 及其模型较不相容。若模型、停止规则或分析选择错误,数值也会失去校准。
4. Neyman–Pearson 与似然比
对于简单原假设和简单备择,Neyman–Pearson 引理说明:在固定 下,拒绝较大似然比
的检验最有力。
复合假设常使用广义似然比:
正则条件下, 常渐近服从卡方;边界参数、混合模型和弱识别可产生非标准极限。
5. 可运行案例:样本量、效应与功效
已知标准差为 1,双侧 z 检验使用 。代码模拟不同真实效应和样本量。
Py
Python:一类错误与功效曲线
效应为 0 时拒绝率接近 0.05;效应固定时样本量增加提高功效。大样本也会让极小效应显著,因此必须同时报告估计值、区间和实际阈值。
6. 区间与检验的对偶
对双侧水平 检验,若 置信区间不包含 ,通常等价于拒绝 。但前提是区间和检验使用同一模型、尾部与近似。
区间提供与数据相容的参数范围,比一个二元“显著/不显著”包含更多信息。
7. 可选停止
固定样本 p 值假设样本量与停止规则预先确定。若每天查看一次并在首次 时停止,一类错误通常膨胀。
可选方案:
- 预先固定样本量;
- 群序贯设计与 alpha spending;
- 随时有效 p 值、e-process 或置信序列;
- 将所有中期查看纳入正式方案。
前沿章会用 Ville 不等式解释随时有效推断。
8. 多重检验
进行 个独立的 5% 检验时,至少一次误拒概率为:
常见目标不同:
- FWER:至少一个假阳性的概率;
- FDR:拒绝结果中假阳性的期望比例;
- simultaneous coverage:一组区间同时覆盖。
Bonferroni 控制 FWER;Benjamini–Hochberg 在相应依赖条件下控制 FDR。选择方法要先写清错误目标。
9. 诊断清单
- 原假设和备择是否在看数据前写清?
- 单侧方向是否有制度依据?
- 检验统计量在 下如何校准?
- 样本量是否按最小重要效应规划?
- 是否查看、筛选或停止过多次?
- 是否进行了多个终点、亚组或模型检验?
- 是否同时报告效应、区间、功效和假设?
常见误区
- “不显著”写成“证明没有效应”;
- 写成“原假设只有 3% 概率为真”;
- 两组一个显著、一个不显著,就称组间差异显著;
- 看完结果后改单双侧;
- 把统计显著等同于临床或经济重要。
课堂任务
为“新教学方法提高平均成绩”写一份检验方案:
- 定义最小重要差异;
- 写 与单双侧理由;
- 指定 、目标功效与样本量输入;
- 说明期中查看如何处理;
- 列出主要终点与多重检验规则。
核心阅读
- Lehmann & Romano, Testing Statistical Hypotheses。
- Wasserstein & Lazar (2016), “The ASA Statement on p-Values”。
- Wasserstein, Schirm & Lazar (2019), “Moving to a World Beyond p < 0.05”。