第十章:合成控制法
为单个处理单位构造加权反事实,掌握供体池、处理前拟合、安慰剂推断与现代扩展。
第十章:合成控制法
案例: 只有一个城市实施拥堵收费,没有任何单一城市足够相似。能否把多个未实施城市加权成一个可信的“合成城市”?
合成控制法(SCM)把研究重点从“选择一条回归线”转向“展示反事实由哪些供体单位组成,以及政策前是否真的拟合”。
学习目标
你应能:
- 写出合成控制权重与路径效应;
- 解释非负、和为 1 的权重为何限制外推;
- 依据制度与预处理信息选择供体池;
- 用时间、单位和结果安慰剂进行推断;
- 区分经典 SCM、增强 SCM、合成 DID 与矩阵补全。
1. 基本构造
设单位 1 在 期开始接受处理,单位 从未处理。选择权重
使处理前特征与结果路径接近:
处理后路径效应:
权重非负且和为 1,意味着反事实位于供体凸包内。若处理单位在处理前已经超出所有供体范围,经典 SCM 无法靠加权解决外推。
2. 供体池决定研究问题
供体单位必须:
- 在研究期内未接受同类处理;
- 不受处理单位的溢出;
- 结果测量和制度环境可比;
- 有足够长且无结构断裂的预处理期;
- 不因“加入后结果更显著”才被选择。
例如评估伦敦拥堵收费时,把同时规划类似政策、交通网络完全不同或受伦敦通勤溢出的城市放入供体池,会改变反事实含义。
3. 为什么处理前路径比协变量清单重要
在潜在因子模型中:
长预处理路径包含对未观测因子载荷 的信息。好的处理前拟合因此是必要证据,但不是充分证明:短期过拟合、共同冲击变化和政策预期仍可能使处理后反事实失效。
4. 可运行案例:一个城市的减排政策
模拟中处理城市的未处理路径是三个供体的凸组合。代码只用处理前数据估计权重,再计算政策后差距与单位安慰剂的 RMSPE 比率。
Py
Python:合成控制权重与安慰剂比率
安慰剂 值只有 9 个可能排名,分辨率很粗。这不是经典大样本 值;它回答的是“若每个供体依次被假装处理,真实城市的异常程度排第几”。
5. 推断是一组设计比较
单位安慰剂
逐个把未处理单位当作处理单位,比较处理后异常程度。应排除处理前拟合极差的安慰剂,且预先说明阈值。
时间安慰剂
把处理时点提前到政策前。若提前期也出现“大效应”,可能有预趋势、结构断裂或过拟合。
结果安慰剂
选择理论上不应受政策影响、但测量机制类似的结果。
留一法
依次删除高权重供体。若结论完全依赖一个单位,必须解释该比较为何可信。
6. 常见扩展
| 方法 | 主要变化 | 适用问题 |
|---|---|---|
| augmented SCM | 用结果模型修正剩余预处理偏差 | 经典 SCM 拟合不完美 |
| synthetic DID | 结合单位权重和时间权重 | 多单位面板、共同趋势更灵活 |
| generalized SCM | 潜在因子/矩阵补全 | 多处理单位、较长面板 |
| penalized SCM | 对权重或外推加惩罚 | 供体多、过拟合风险 |
扩展可以改善拟合或精度,但不会自动修复受污染供体、政策预期、共同冲击或错误处理时点。
7. 诊断与报告
- 处理单位与时点为何特殊?
- 供体池如何在看结果前确定?
- 处理前路径有多长,RMSPE 多大?
- 权重是否集中,处理单位是否在凸包外?
- 有无其他政策或溢出污染供体?
- 单位、时间、结果与留一安慰剂是否一致?
- 效应是逐期路径、平均 ATT 还是累积效应?
- 推断分辨率是否受供体数量限制?
常见误区
- 只展示处理后大差距,不展示处理前拟合;
- 依据政策后结果删供体;
- 把回归合成的窄区间当作设计已被证明;
- 有一个高权重供体就称其为“因果匹配对象”;
- 将单个城市的效应直接推广为全国政策效应。
课堂任务
设计一个“城市禁塑令对垃圾量”的 SCM:
- 给出供体纳入与排除规则;
- 选择五个预处理预测量;
- 定义主 RMSPE 与安慰剂排序;
- 指出一个跨城市溢出;
- 解释如果所有权重集中在一个城市,应如何报告。
核心阅读
- Abadie, Diamond & Hainmueller (2010), “Synthetic Control Methods for Comparative Case Studies”。
- Abadie (2021), “Using Synthetic Controls: Feasibility, Data Requirements, and Methodological Aspects”。
- Arkhangelsky et al. (2021), “Synthetic Difference-in-Differences”。
- Ben-Michael, Feller & Rothstein (2021), “The Augmented Synthetic Control Method”。
上一章:计数数据与受限因变量|下一章:机器学习与因果推断。