第六章:断点回归设计

用阈值附近的局部比较理解连续性、带宽、操纵检验、局部多项式与模糊断点。

第六章:断点回归设计

案例: 考试成绩达到 80 分即可获得奖学金。阈值两侧学生的后续入学率跳跃,能否解释为奖学金效应?

断点回归(RDD)依赖一个简单直觉:若其他决定因素在阈值处平滑变化,紧邻阈值两侧的结果跳跃可归因于处理资格的跳跃。

学习目标

你应能:

  1. 区分运行变量、阈值、资格与实际处理;
  2. 写出 sharp RDD 的局部目标参数;
  3. 用局部线性回归解释带宽的偏差—方差权衡;
  4. 诊断排序、操纵、协变量不连续与结果测量变化;
  5. 区分 sharp、fuzzy、kink 与 donut RDD。

1. 识别对象是阈值处的局部效应

令运行变量为 XiX_i,阈值为 cc,sharp 设计中

Di=1{Xic}.D_i=\mathbf 1\{X_i\ge c\}.

若两个潜在结果的条件均值在 cc 处连续,则

τRDD=limxcE[YX=x]limxcE[YX=x].\tau_{RDD} = \lim_{x\downarrow c}E[Y\mid X=x] - \lim_{x\uparrow c}E[Y\mid X=x].

这估计阈值附近单位的效应。它不能自动推广到成绩 50 分或 100 分的学生。

2. 局部线性模型

在带宽 hh 内常估计:

Yi=α+τDi+β1(Xic)+β2Di(Xic)+εi,Xich.Y_i=\alpha+\tau D_i+\beta_1(X_i-c) +\beta_2D_i(X_i-c)+\varepsilon_i, \qquad |X_i-c|\le h.

两侧允许不同斜率;τ\tau 是阈值处截距跳跃。实践中常使用三角核,使距离阈值更近的观测权重更高。

带宽优点风险
更接近局部随机比较样本少、方差大
精度更高函数形式偏误、混入远端单位

应报告数据驱动带宽,同时展示合理替代带宽,而不是挑选最显著者。

3. 可运行案例:奖学金阈值

模拟中未处理结果随成绩平滑变化,奖学金在 80 分处产生真实 5 分提升。代码用三角核局部线性回归比较不同带宽。

Py

Python:局部线性 RDD 与带宽敏感性

Idle

带宽变化时估计会波动;这不是要求所有结果完全相同,而是检查结论是否由一个任意窗口驱动。

4. 设计有效性的证据链

运行变量能否被精确操纵

若学生知道评分规则并能把 79.9 调整到 80.0,阈值两侧可能不再可比。应结合:

  • 运行变量密度与堆积;
  • 制度上谁能看到、修改或复核分数;
  • 阈值附近个体特征是否跳跃;
  • 报名、缺失或样本进入是否在阈值处改变。

密度检验不显著不能证明无操纵;行政流程证据同样重要。

其他政策是否共享阈值

若 80 分同时决定奖学金、宿舍和导师资格,结果跳跃是政策束的效应,不能单独归因于现金奖学金。

结果是否按同一规则测量

阈值以上学生若被更频繁追踪,结果缺失本身也可能跳跃。

5. Sharp、fuzzy 与其他设计

设计阈值改变什么目标
sharp RDD处理从 0 跳到 1阈值处局部处理效应
fuzzy RDD处理概率跳跃阈值附近顺从者 LATE
regression kink处理强度斜率改变阈值处边际效应
donut RDD删除最靠近阈值观测对 heaping/操纵的敏感性分析

fuzzy RDD 的 Wald 比率是“结果跳跃 / 处理概率跳跃”,因此继承 IV 的排除限制、单调性与弱第一阶段问题。

6. 推断与报告

最低报告:

  • 阈值规则、运行变量精度与是否可操纵;
  • 原始散点或分箱图,但估计不依赖视觉拟合;
  • 主带宽、核函数、局部多项式阶数和偏差校正区间;
  • 两侧样本量与有效观测;
  • 密度、处理前协变量和伪阈值检查;
  • 局部 estimand 与外推边界。

不要使用高阶全局多项式跨越整个运行变量范围;它容易在边界产生不稳定形状和虚假跳跃。

课堂任务

评估“年龄满 65 岁获得医疗福利”:

  1. 明确运行变量的时间单位;
  2. 列出同时在 65 岁发生的其他制度变化;
  3. 设计一个处理前协变量连续性检查;
  4. 说明为何 64 岁 11 个月与 65 岁 1 个月仍可能受季节影响;
  5. 判断估计能否推广到 40 岁人群。

核心阅读

上一章:双重差分法|下一章:匹配与倾向得分

Copyright © 2026