第一章:微观计量与因果推断导论

从潜在结果、目标参数与选择偏误出发,建立微观计量研究的完整识别语言。

第一章:微观计量与因果推断导论

贯穿问题: 接受大学教育的人收入更高,究竟是教育产生了回报,还是本来更有优势的人更容易进入大学?

微观计量经济学不从“该跑哪个模型”开始,而从四个对象开始:

Rendering diagram…

学习目标

完成本章后,你应能:

  1. 用潜在结果写出一个因果问题;
  2. 区分 ATE、ATT、ITT 与局部效应;
  3. 把观察差异拆成处理效应与选择偏误;
  4. 说明随机化解决了什么、没有解决什么;
  5. 在看回归结果前完成一页识别审计。

1. 同一个人有两个潜在结果

Di{0,1}D_i\in\{0,1\} 表示是否接受处理:

  • Yi(1)Y_i(1):个体 ii 接受处理时的结果;
  • Yi(0)Y_i(0):同一个体不接受处理时的结果;
  • 个体处理效应:τi=Yi(1)Yi(0)\tau_i=Y_i(1)-Y_i(0)

实际只能观察

Yi=DiYi(1)+(1Di)Yi(0).Y_i=D_iY_i(1)+(1-D_i)Y_i(0).

因果推断的困难不是缺少一列数据,而是同一个人在同一时点不可能同时处于两种状态。研究设计的任务,是用其他单位、其他时间或制度边界构造可信的缺失反事实。

2. 先决定要估计谁的效应

参数定义适合回答
ATEE[Y(1)Y(0)]E[Y(1)-Y(0)]对目标总体普遍实施会怎样?
ATTE[Y(1)Y(0)D=1]E[Y(1)-Y(0)\mid D=1]已接受处理者因处理改变了多少?
ITT按随机分配 ZZ 比较结果提供政策或鼓励本身有何影响?
LATE被工具变量改变处理状态者的平均效应外生鼓励影响到的边际人群怎样?
CATEE[Y(1)Y(0)X=x]E[Y(1)-Y(0)\mid X=x]哪类人受益更多?

“教育回报是多少”不是完整问题。至少要补上人群、教育版本、比较状态、结果和时间窗口。

3. 为什么均值差通常不是因果效应

观察到的组间差异可以写成:

E[YD=1]E[YD=0]观察差异=E[Y(1)Y(0)D=1]ATT+E[Y(0)D=1]E[Y(0)D=0]选择偏误.\underbrace{E[Y\mid D=1]-E[Y\mid D=0]}_{\text{观察差异}} = \underbrace{E[Y(1)-Y(0)\mid D=1]}_{\text{ATT}} + \underbrace{E[Y(0)\mid D=1]-E[Y(0)\mid D=0]}_{\text{选择偏误}}.

最后一项问的是:即使所有人都没有接受处理,两组是否本来就会不同。能力、家庭资源、健康动机和企业管理质量都可能造成这种差异。

Rendering diagram…

只比较大学生和非大学生时,路径 DAYD\leftarrow A\rightarrow Y 仍然开放。样本再大,也只会更精确地估计这个混合差异。

4. 最小案例:自选择与随机分配

下面保持每个人的潜在收入不变,只改变教育如何分配。第一种情形让能力较高者更容易上大学;第二种情形随机分配。代码直接展示“同一处理效应、不同识别设计”会得到怎样的答案。

Py

Python:选择偏误如何改变教育回报

Idle

读数时只问三件事:

  1. 随机差异是否接近 ATE,而不是精确等于 ATE?有限样本仍有随机误差。
  2. 观察差异为何高于 ATT?处理组即使不上大学,潜在收入也更高。
  3. 随机化是否自动解决流失、干扰和处理版本?没有;它主要解决基线可交换性。

5. 识别假设分三层

层次问题例子
设计处理为何近似外生?随机抽签、阈值、分期实施
测量DDYY 是否对应研究概念?“获得奖学金”不等于“完成学位”
推广样本效应适用于谁?候补名单附近学生不代表全部申请者

常见条件包括一致性、无干扰(SUTVA 的一部分)、可交换性和正值性。它们不是一份机械清单:每个条件都要翻译成具体制度风险。

6. 一页研究设计审计

在运行模型前填完:

  1. 人群: 谁可能进入研究,谁实际进入样本?
  2. 处理: 起始时间、强度和版本是什么?
  3. 比较状态: “未处理”到底意味着什么?
  4. 结果: 测量窗口是否在处理之后且对两组一致?
  5. 参数: ATE、ATT、ITT、LATE 还是 CATE?
  6. 分配机制: 谁在何时决定处理?
  7. 反事实: 哪些单位或时期承担比较角色?
  8. 最大威胁: 哪一条路径会让比较失真?
  9. 证伪证据: 哪个安慰剂或平衡检查最有信息?

7. 常见误区

  • “控制变量很多,所以是因果。” 控制质量取决于因果位置,不取决于数量。
  • “随机实验没有偏误。” 不遵从、流失、干扰和选择性报告仍会破坏解释。
  • “显著就是重要。” 还需报告效应尺度、区间、基准风险和决策成本。
  • “平均有效,所以人人有效。” ATE 可以掩盖零效应、负效应和资源约束。

课堂任务

选择“就业培训是否提高一年后收入”:

  1. 分别把处理定义为“获得培训名额”“实际参加”“完成课程”;
  2. 为每个定义写出合适的 estimand;
  3. 画出动机、报名、参加、就业和收入的 DAG;
  4. 指出一个可诊断风险和一个只能依赖制度知识的风险。

核心阅读

下一章:线性回归与 OLS

Copyright © 2026