第十一章:常用检验方法与选择

按研究设计选择 t、比例、卡方、ANOVA、秩和与置换检验,并报告效应与假设。

第十一章:常用检验方法与选择

案例: 两组结果重尾且样本各 35。应该用 Welch t、Mann–Whitney,还是随机分配对应的置换检验?

检验方法由研究设计、目标参数和交换性决定,不由“先做正态性检验,再按 p 值选菜单”决定。

学习目标

你应能:

  1. 区分单样本、独立样本、配对与多组设计;
  2. 正确选择 t、比例、卡方、ANOVA 和非参数检验;
  3. 解释 Welch 检验为何通常优于默认等方差检验;
  4. 构造置换检验并说明交换性;
  5. 报告效应量、区间、多重比较与诊断。

1. 先按设计分流

问题典型目标起始方法关键条件
一个均值 vs 常数μμ0\mu-\mu_0单样本 t独立;小样本需近似正态
两个独立均值μ1μ0\mu_1-\mu_0Welch t组间独立
同一对象前后E[D]E[D]配对 t对差值建模
一个/两个比例ppp1p0p_1-p_0二项/Wilson/score独立 Bernoulli 或设计修正
两个分类变量关联卡方或 Fisher计数、期望频数
多个均值组间差异ANOVA/Welch ANOVA独立、方差结构
分布/秩差异随机优势秩和/置换目标与交换性匹配

“非参数”不表示无假设。秩和检验的零假设通常关于分布或随机优势;只有额外位置平移条件下才可解释为中位数差。

2. 独立样本与配对样本

配对设计应先形成:

Di=Yi,afterYi,before,D_i=Y_{i,after}-Y_{i,before},

再对 DiD_i 做单样本推断。把前后测量当独立样本会丢掉个体内相关,通常降低精度。

独立两样本均值比较优先使用 Welch 标准误:

SE(XˉYˉ)=SX2nX+SY2nY.SE(\bar X-\bar Y) =\sqrt{\frac{S_X^2}{n_X}+\frac{S_Y^2}{n_Y}}.

它不强迫两组方差相等;在方差相等时效率损失通常很小。

3. 分类数据

Pearson 卡方统计量:

X2=r,c(OrcErc)2Erc.X^2=\sum_{r,c}\frac{(O_{rc}-E_{rc})^2}{E_{rc}}.

期望频数很小时,渐近卡方近似可能差。2×2 表可使用 Fisher 精确检验,但“精确”仍条件于固定边际等抽样假设。

报告比例差、风险比或优势比及区间,不应只给“有/无关联”。

4. ANOVA 与事后比较

单因素 ANOVA 的原假设:

H0:μ1==μk.H_0:\mu_1=\cdots=\mu_k.

整体拒绝只说明至少一组均值不同,不说明哪几组。事后比较需要 Tukey、Holm 等控制;若对比由理论预先规定,可直接估计计划对比并给同时区间。

方差不齐可用 Welch ANOVA;重复测量、层级或聚类数据需相应模型,不能靠普通 ANOVA 忽略相关。

5. 置换检验的逻辑

若原假设下处理标签可交换:

  1. 计算观察统计量;
  2. 在设计允许的标签重排中重新分配;
  3. 每次计算统计量;
  4. p 值是至少同样极端排列的比例。

随机实验中的置换应遵守原随机化方式,如分层、配对或整群分配。

6. 可运行案例:随机实验的置换检验

70 个单位被随机分成两组,结果重尾。处理使结果增加 0.8。代码用原设计的固定组大小进行 Monte Carlo 置换。

Py

Python:重尾结果下的随机化置换检验

Idle

此固定种子下,尽管模拟设置的个体处理效应为 0.8,观察均值差更小且 p 值并不显著;这是有限样本与重尾噪声造成的低功效,不是“证明效应为零”。此 p 值依赖随机分配带来的标签交换性;把相同代码用于自愿参加的观察组,也不会自动解决混淆。

7. 何时使用秩方法

方法常见目标注意
Sign test中位数/配对差符号功效较低但稳健
Wilcoxon signed-rank对称差分的位置需要对称等条件
Mann–Whitney随机优势/分布差异不自动等于中位数差
Kruskal–Wallis多组秩分布差异拒绝后仍需多重比较

如果研究目标本来是均值差,重尾并不自动要求改成秩参数;可考虑稳健均值、截尾均值、置换或 Bootstrap,并明确 estimand。

8. 方法选择审计

  1. 单位、组别与配对结构是什么?
  2. 目标是均值、比例、中位数、分布还是随机优势?
  3. 标签可交换来自随机化还是模型假设?
  4. 方差相等、正态或大样本近似是否必要?
  5. 有无聚类、重复测量或分层随机化?
  6. 多组/多终点怎样控制错误率?
  7. 效应量和区间是否与检验目标一致?

常见误区

  • 先做 Shapiro–Wilk,再以其显著性机械选择 t 或秩检验;
  • 两独立组误用配对检验,或反之;
  • ANOVA 拒绝后逐对做未校正 t 检验;
  • 把 Mann–Whitney 一律解释成中位数检验;
  • 观察研究使用置换后声称获得随机化因果结论。

课堂任务

为以下四个设计各写方法、estimand 与关键假设:

  1. 同一患者服药前后血压;
  2. 两家独立学校平均成绩;
  3. 三种广告版本点击率;
  4. 20 个班级整群随机教学方案。

核心阅读

上一章:假设检验原理|下一章:Bootstrap

Copyright © 2026