第十一章:常用检验方法与选择
第十一章:常用检验方法与选择
案例: 两组结果重尾且样本各 35。应该用 Welch t、Mann–Whitney,还是随机分配对应的置换检验?
检验方法由研究设计、目标参数和交换性决定,不由“先做正态性检验,再按 p 值选菜单”决定。
学习目标
你应能:
- 区分单样本、独立样本、配对与多组设计;
- 正确选择 t、比例、卡方、ANOVA 和非参数检验;
- 解释 Welch 检验为何通常优于默认等方差检验;
- 构造置换检验并说明交换性;
- 报告效应量、区间、多重比较与诊断。
1. 先按设计分流
| 问题 | 典型目标 | 起始方法 | 关键条件 |
|---|---|---|---|
| 一个均值 vs 常数 | 单样本 t | 独立;小样本需近似正态 | |
| 两个独立均值 | Welch t | 组间独立 | |
| 同一对象前后 | 配对 t | 对差值建模 | |
| 一个/两个比例 | 、 | 二项/Wilson/score | 独立 Bernoulli 或设计修正 |
| 两个分类变量 | 关联 | 卡方或 Fisher | 计数、期望频数 |
| 多个均值 | 组间差异 | ANOVA/Welch ANOVA | 独立、方差结构 |
| 分布/秩差异 | 随机优势 | 秩和/置换 | 目标与交换性匹配 |
“非参数”不表示无假设。秩和检验的零假设通常关于分布或随机优势;只有额外位置平移条件下才可解释为中位数差。
2. 独立样本与配对样本
配对设计应先形成:
再对 做单样本推断。把前后测量当独立样本会丢掉个体内相关,通常降低精度。
独立两样本均值比较优先使用 Welch 标准误:
它不强迫两组方差相等;在方差相等时效率损失通常很小。
3. 分类数据
Pearson 卡方统计量:
期望频数很小时,渐近卡方近似可能差。2×2 表可使用 Fisher 精确检验,但“精确”仍条件于固定边际等抽样假设。
报告比例差、风险比或优势比及区间,不应只给“有/无关联”。
4. ANOVA 与事后比较
单因素 ANOVA 的原假设:
整体拒绝只说明至少一组均值不同,不说明哪几组。事后比较需要 Tukey、Holm 等控制;若对比由理论预先规定,可直接估计计划对比并给同时区间。
方差不齐可用 Welch ANOVA;重复测量、层级或聚类数据需相应模型,不能靠普通 ANOVA 忽略相关。
5. 置换检验的逻辑
若原假设下处理标签可交换:
- 计算观察统计量;
- 在设计允许的标签重排中重新分配;
- 每次计算统计量;
- p 值是至少同样极端排列的比例。
随机实验中的置换应遵守原随机化方式,如分层、配对或整群分配。
6. 可运行案例:随机实验的置换检验
70 个单位被随机分成两组,结果重尾。处理使结果增加 0.8。代码用原设计的固定组大小进行 Monte Carlo 置换。
Python:重尾结果下的随机化置换检验
此固定种子下,尽管模拟设置的个体处理效应为 0.8,观察均值差更小且 p 值并不显著;这是有限样本与重尾噪声造成的低功效,不是“证明效应为零”。此 p 值依赖随机分配带来的标签交换性;把相同代码用于自愿参加的观察组,也不会自动解决混淆。
7. 何时使用秩方法
| 方法 | 常见目标 | 注意 |
|---|---|---|
| Sign test | 中位数/配对差符号 | 功效较低但稳健 |
| Wilcoxon signed-rank | 对称差分的位置 | 需要对称等条件 |
| Mann–Whitney | 随机优势/分布差异 | 不自动等于中位数差 |
| Kruskal–Wallis | 多组秩分布差异 | 拒绝后仍需多重比较 |
如果研究目标本来是均值差,重尾并不自动要求改成秩参数;可考虑稳健均值、截尾均值、置换或 Bootstrap,并明确 estimand。
8. 方法选择审计
- 单位、组别与配对结构是什么?
- 目标是均值、比例、中位数、分布还是随机优势?
- 标签可交换来自随机化还是模型假设?
- 方差相等、正态或大样本近似是否必要?
- 有无聚类、重复测量或分层随机化?
- 多组/多终点怎样控制错误率?
- 效应量和区间是否与检验目标一致?
常见误区
- 先做 Shapiro–Wilk,再以其显著性机械选择 t 或秩检验;
- 两独立组误用配对检验,或反之;
- ANOVA 拒绝后逐对做未校正 t 检验;
- 把 Mann–Whitney 一律解释成中位数检验;
- 观察研究使用置换后声称获得随机化因果结论。
课堂任务
为以下四个设计各写方法、estimand 与关键假设:
- 同一患者服药前后血压;
- 两家独立学校平均成绩;
- 三种广告版本点击率;
- 20 个班级整群随机教学方案。
核心阅读
- Lehmann & Romano, Testing Statistical Hypotheses。
- Good, Permutation, Parametric, and Bootstrap Tests of Hypotheses。
- Delacre, Lakens & Leys (2017), “Why Psychologists Should by Default Use Welch’s t-test”。