第七章:匹配、倾向得分与加权
围绕无混杂与重叠条件,掌握匹配、倾向得分加权、平衡诊断和双重稳健估计。
第七章:匹配、倾向得分与加权
案例: 主动报名就业培训的人更有动机,也可能更缺乏工作机会。怎样只用处理前信息构造可比人群?
匹配和加权不能把观察研究变成随机实验。它们只在“所有重要混淆都已被测量”时,重新组织已有样本中的比较。
学习目标
你应能:
- 写出条件无混杂与重叠假设;
- 区分 ATE、ATT 对应的匹配与权重;
- 把倾向得分当作设计工具而非结果预测器;
- 用标准化差异、权重分布和有效样本量诊断设计;
- 解释修剪、截尾和双重稳健估计的目标变化。
1. 两个不可缺少的条件
条件无混杂
给定处理前协变量 后,处理分配与潜在结果独立。这个条件无法由观察数据证明;变量选择必须来自制度知识和因果图。
重叠
每类 人群都要有接受与未接受处理的可能。若某些高风险者必然接受培训,就没有同类未培训者可构造反事实。
2. 倾向得分的角色
若无混杂基于 成立,则在适当条件下基于 调整也能平衡 。但:
- 预测处理越准,不一定因果设计越好;
- AUC 很高可能意味着两组几乎不重叠;
- 结果变量不应参与设计阶段的倾向得分调参;
- 处理后变量不能因“预测力强”就放入模型。
3. estimand 决定权重
| 目标 | 处理组权重 | 对照组权重 | 解释 |
|---|---|---|---|
| ATE | 重建总体 | ||
| ATT | 1 | 让对照组像已处理者 | |
| overlap effect | 强调最有共同支持的人群 |
极端倾向得分会产生大权重。修剪或截尾能降低方差,却也改变目标人群;必须报告规则和新 estimand。
4. 可运行案例:自愿培训与 IPW
模拟中报名同时受技能与就业障碍影响。两者都被观察,且真实倾向得分已知,因此 IPW 可以恢复 ATE;代码同时展示加权前后的协变量平衡与有效样本量。
Py
Python:IPW、平衡与有效样本量
这里使用“真实”倾向得分是为了隔离加权机制;代码按处理状态分别归一化权重(Hájek 形式),以降低有限样本中极端权重造成的波动。实际研究必须估计 ,并把模型选择、缺失值处理和权重诊断纳入不确定性审计。
5. 匹配不是按显著性筛变量
常见设计:
- 最近邻匹配:直观,但结果依赖距离、替换与匹配顺序;
- 卡尺匹配:拒绝距离过远的配对,会改变目标样本;
- 精确/粗化精确匹配:保证关键变量分层内可比;
- Mahalanobis 距离:适合少量连续协变量;
- 倾向得分匹配:降维方便,但同一得分下单个协变量仍可能失衡。
匹配后必须重新检查每个关键协变量的标准化差异和分布,而不是只报告倾向得分均值。
6. 双重稳健的准确含义
增广 IPW 同时使用倾向得分模型 与结果模型 。在常见条件下,只要其中一个 nuisance model 正确设定,估计仍可一致;它不意味着:
- 两个错误模型会互相修复;
- 未观测混淆不再重要;
- 重叠不足可以被算法解决。
交叉拟合可降低灵活机器学习造成的过拟合偏误,详见第十一章。
7. 诊断与报告
- 协变量是否全部在处理前测量?
- 变量选择是否由 DAG 与制度机制决定?
- 倾向得分分布是否有共同支持?
- 每个关键变量的加权后 SMD 是否接近零?
- 最大权重、权重分位数与有效样本量是多少?
- 修剪了谁,目标人群怎样改变?
- 是否进行未观测混淆敏感性分析?
“SMD < 0.1”是常用经验门槛,不是有效性的证明;还要检查分布尾部、非线性和交互项。
常见误区
- 用结果显著性选择倾向得分模型;
- 匹配后仍按原始独立样本公式计算标准误;
- 删除无法匹配的处理者后仍声称估计原总体 ATE;
- 把未观测混淆写成一句泛泛“研究局限”;
- 把极端权重只当软件问题,而不重审目标人群。
课堂任务
为“参加创业辅导是否提高企业存续率”设计 ATT 匹配:
- 列出五个处理前混淆变量;
- 指出一个不应控制的处理后变量;
- 说明共同支持不足时删掉哪些企业;
- 选择一个平衡图和一个敏感性分析;
- 用一句话重新定义修剪后的 ATT。
核心阅读
- Rosenbaum & Rubin (1983), “The Central Role of the Propensity Score”。
- Imbens (2004), “Nonparametric Estimation of Average Treatment Effects”。
- Stuart (2010), “Matching Methods for Causal Inference”。