微观计量经济学

第十二章:前沿文献与现代微观案例(2024—2026)

用高校准入、因果机器学习与选择后推断案例训练现代微观计量的识别、异质性和政策决策能力。

第十二章:前沿文献与现代微观案例(2024—2026)

微观计量经济学的最终目标不是生成一个显著系数,而是回答一个边界清楚的反事实问题:对哪些人、在什么制度下、把哪种处理改成哪种替代状态,会怎样改变结果?当研究进一步用于分配大学名额、选择医疗方案或挑选“最有效”的项目时,还要处理异质性、选择后偏误与决策损失。

本章基于截至 2026 年 8 月 1 日 的一手文献定向更新。所选论文覆盖正式期刊研究与方法综述;课堂模拟只展示统计机制,不含真实个人数据,也不复现原论文。

学习目标

完成本章后,你应能够:

  1. 区分大学录取、实际就读和毕业等不同处理;
  2. 比较候补名单 IV 与录取分数 fuzzy RDD 所识别的不同边际人群;
  3. 区分风险预测 E[YX]E[Y\mid X] 与个体化处理效应 E[Y(1)Y(0)X]E[Y(1)-Y(0)\mid X]
  4. 写出从 ATE、CATE 到政策规则的完整决策链;
  5. 解释从多个项目中选出最大估计值为何产生赢家诅咒;
  6. 在论文阅读中同时审查识别、估计、推断、外部有效性与伦理边界。

案例一:进入高度选择性大学的因果效应

1. 先把处理定义清楚

Chetty、Deming 与 Friedman 的研究(2025 年在线发表,2026 年刊载于 Quarterly Journal of Economics)结合多所高校的匿名录取资料、税务记录和标准化考试成绩,研究高度选择性私立大学的准入与就读后果。

至少有三个不同问题:

  1. 被 Ivy-Plus 大学录取会怎样改变选择集合?
  2. 就读 Ivy-Plus 而不是州旗舰公立大学会怎样改变结果?
  3. 整体扩大名额或改变校友、非学术资历和体育特长偏好会怎样改变社会分配?

这三个问题的处理、遵从和一般均衡效应都不同。论文的因果设计利用候补名单申请者录取决策中的特殊变动,目标不是简单比较两类毕业生的平均收入。

2. 选择偏误为何严重

朴素回归可写成:

Yi=α+τAttendi+Xiβ+ui.Y_i=\alpha+\tau Attend_i+X_i'\beta+u_i.

即使控制考试成绩,AttendiAttend_i 仍可能与申请组合、家庭资源、推荐质量、职业偏好和未测能力相关。τ\tau 因而混合学校作用与入学前差异。

更可信的设计要寻找一个改变就读概率、但在适当条件下不直接改变结果的变动。用工具变量语言表示:

Attendi=π0+π1Zi+Xiπ2+vi,Attend_i=\pi_0+\pi_1 Z_i+X_i'\pi_2+v_i,

其中 ZiZ_i 来自候补录取决策中的准实验变动。若相关性、排除限制、独立性和单调性成立,IV 识别的是被该变动改变就读选择者的局部平均处理效应,而不是所有学生的 ATE。

3. 论文报告了什么

论文首先记录:在考试成绩相近的申请者中,最高收入 1% 家庭的子女进入 Ivy-Plus 的概率仍超过中产家庭子女的两倍;作者把差距分解为申请、录取和入学三个环节,并将录取优势与校友子女偏好、非学术资历权重和体育招募联系起来。

在论文的局部因果设计与特定比较下,就读 Ivy-Plus 而不是平均州旗舰公立大学,使进入收入分布最高 1% 的概率相对提高约 50%,进入顶尖研究生院的概率接近翻倍,在高声望企业工作的概率接近三倍。这些是相对变化,不是增加 50、100 或 200 个百分点。

4. 证据边界

  • 估计与候补名单附近、会因录取变动而改变就读选择的人群最直接相关。
  • “Ivy-Plus 相对州旗舰”不是“大学相对不读大学”。
  • 顶尖收入、研究生院和企业声望是特定结果,不等同于终身福利、幸福或社会贡献。
  • 扩大名额可能改变同伴、师资、课程与劳动力市场信号,因此局部效应不能机械乘以新增学生人数。
  • 行政数据提高测量质量,但仍不能替代对排除限制和制度细节的论证。

5. 分层讨论

本科生应能画出 ZAttendYZ\rightarrow Attend\rightarrow Y 的因果图,并列出 ZZ 可能直接影响 YY 的路径。研究生还应讨论多校申请、处理版本、非遵从、溢出效应、边际申请者构成和政策外推权重。

6. 同题异设计:公立大学录取断点

Mountjoy(2026)使用得州 35 所公立大学数百个 SAT/ACT 录取断点,将刚好越过与刚好未越过各校门槛的申请者进行比较。门槛使录取概率平均跳升 27 个百分点,并使就读目标大学的概率提高 15 个百分点,因此这是 fuzzy RDD:阈值资格是工具,实际就读是内生处理。

论文估计,典型边际录取者在四年制大学多接受约一年教育,取得学士学位的概率提高 12 个百分点,长期收入提高约 8%。成本—收益计算进一步报告学生、社会和政府预算视角下的内部收益率分别约为 26%、16% 和 7%。这些数字都对应论文的特定边际申请者、追踪期与成本假设。

这个对照有三层教学价值:

比较Ivy-Plus 候补名单设计公立大学录取断点
外生变动候补录取决策中的特殊变动考试分数刚好越过校级门槛
主要处理就读 Ivy-Plus 而非州旗舰因录取门槛而进入目标公立大学
局部人群会被候补录取改变去向者门槛附近的录取顺从者
政策含义选择性私立大学的录取与分配公立大学边际扩招的收益与成本

两项估计不回答同一个 ATE。即使都研究“大学回报”,工具、替代状态与顺从者不同,就不能直接比较数字大小。Mountjoy 还区分“是否进入任一四年制大学”的广延边际与“转向更具选择性学校”的集约边际;这一分解说明处理版本本身就是 estimand 的一部分。

案例二:从“谁风险高”到“谁会因治疗而受益”

1. 预测与因果不是同一个任务

Feuerriegel 等(2024)在 Nature Medicine 的综述讨论因果机器学习如何预测处理后的疗效与毒性,并给出从问题定义、数据、识别、估计到临床转化的工作流。

普通风险模型估计:

μ(x)=E[YX=x].\mu(x)=E[Y\mid X=x].

个体化治疗需要比较两个不能同时观察的潜在结果:

τ(x)=E[Y(1)Y(0)X=x].\tau(x)=E[Y(1)-Y(0)\mid X=x].

一个患者在不治疗时风险很高,不代表治疗效果最大。风险预测依赖结果相关特征;处理效应异质性则依赖这些特征是否改变处理与结果之间的差异。

2. CATE 如何进入政策规则

若处理成本或伤害以结果单位表示为 c(x)c(x),一个简单规则是:

d(x)=1{τ^(x)>c(x)}.d(x)=\mathbf 1\{\widehat\tau(x)>c(x)\}.

规则价值为:

V(d)=E[Y(d(X))c(X)d(X)].V(d)=E[Y(d(X))-c(X)d(X)].

这表明模型评估不能只看 CATE 的均方误差。研究者还要评估重叠、校准、策略价值、资源约束、公平性和样本外可迁移性。

3. RCT 与现实世界数据的不同风险

在随机试验中,处理分配有已知机制,但样本可能选择性强、处理遵从不完全,且稀有亚组样本少。真实世界数据规模更大,却需要更强的无混杂、测量一致和正值性假设。机器学习能灵活拟合结果与倾向得分,不能从未记录的信息中创造可交换性。

在医学以外,这套逻辑同样适用于培训、信贷、补贴和教育:

场景处理CATE 问题关键风险
就业培训是否提供课程哪类求职者收入改善最大自主报名与地区劳动力市场
信贷是否批准贷款对经营存续或福利的边际影响历史审批造成选择性标签
医疗药物 A 或 B谁从 A 相对 B 获益重叠、毒性、试验外推
教育是否提供辅导哪类学生成绩提高最大同伴干扰、教师差异

4. 证据边界

Feuerriegel 等的文章是方法性 Perspective,不是单个治疗的效果试验。它总结了可用工具和实践风险,不能被引用为“因果机器学习已经证明个体化治疗有效”。真实部署还需要前瞻性评价、临床或制度约束、误差成本与持续监测。

案例三:挑出“最佳项目”以后,估计值为什么偏高

1. 赢家诅咒的来源

假设有 KK 个项目,真实效应为 θk\theta_k,无偏估计为:

θ^k=θk+εk,E[εk]=0.\widehat\theta_k=\theta_k+\varepsilon_k, \qquad E[\varepsilon_k]=0.

决策者选择:

k=argmaxkθ^k.k^*=\arg\max_k\widehat\theta_k.

即使每个 θ^k\widehat\theta_k 单独无偏,入选项目更可能同时拥有较高真实效应和较幸运的正噪声,因此:

E[θ^kθk]>0.E[\widehat\theta_{k^*}-\theta_{k^*}]>0.

这不是回归到均值的口号,而是用同一组噪声完成选择与估计造成的选择后偏误。

2. Andrews、Kitagawa 与 McCloskey 的贡献

Andrews、Kitagawa 与 McCloskey(2024)研究对已选“赢家”的有效推断,构造控制中位数偏误的估计量和具有覆盖保证的置信区间,并区分:

  • 条件推断:给定选中了某个项目以后仍保证覆盖;
  • 无条件推断:对重复执行“估计—选择”流程的平均表现保证覆盖;
  • 混合方法:在保证与精度之间折中。

论文用多地点就业培训项目和高机会社区选择说明校正可能在经济意义上改变结论,同时仍可保留有信息的推断。

3. 为什么“留一半样本复核”也有代价

样本分割可用一半数据选项目、另一半估计其效果,从而切断选择噪声与推断噪声。但它减少选优与估计所用信息,可能选到较差项目,并扩大区间。选择后推断、层级/经验贝叶斯收缩、预注册独立验证各有假设与损失函数;不存在无成本修复。

浏览器实验:从 20 个项目中选择第一名

代码重复 3,000 次多地点试验。每次先生成 20 个真实项目效应,再加入估计噪声并选择观测效果最大的项目。我们比较“赢家”的观测估计与真实效应,并用独立复核样本展示回归到较合理水平。

Py

Python:选择最佳项目与赢家诅咒

Idle
R

R:选择最佳项目与赢家诅咒

Idle

实验审计

  • 把项目数从 20 改为 2、50 和 200,说明候选越多为何最大噪声通常越大。
  • 将标准误从 0.35 降到 0.10,区分更多项目与更精确估计的作用。
  • 让所有真实效应都等于 0.2,验证赢家诅咒不需要真实异质性。
  • 当前“独立复核”仍有噪声;重复很多次后其平均值才围绕真实效应。不要把单次复核失败自动归因于原研究错误。

从论文到政策的审计模板

环节必须写清的问题
目标预测风险、估计 ATE/CATE,还是选择政策?
数据谁进入样本,处理和结果怎样测量?
识别反事实来自随机化、阈值、工具还是无混杂?
异质性亚组是否事先定义,重叠是否足够?
选择模型、亚组或项目是否按同一数据挑选?
推断区间是否考虑聚类、多重比较和选择过程?
外推估计对应哪类边际个体与处理版本?
决策成本、资源、公平性和伤害怎样进入规则?

分层作业

本科生任务

为大学准入案例画一张 DAG,至少包括家庭收入、考试成绩、申请、录取、就读和职业结果。分别说明控制申请、控制录取后变量、只比较实际就读者可能产生什么问题。

研究生任务

设计一个“为 10 个地区选择最佳培训项目”的评价方案。必须给出:目标人群、福利函数、试验分层、CATE 估计、项目选择规则、选择后置信区间、独立复核和公平性审计。解释为何最大平均处理效应不一定是预算约束下价值最高的方案。

一手文献与延伸阅读

  1. Chetty, R., Deming, D. J., & Friedman, J. N. (2026). Diversifying Society’s Leaders? The Determinants and Causal Effects of Admission to Highly Selective Private Colleges. Quarterly Journal of Economics, 141(1), 51–145. DOI: 10.1093/qje/qjaf050.
  2. Mountjoy, J. (2026). Marginal Returns to Public Universities. Quarterly Journal of Economics, 141(1), 429–497. DOI: 10.1093/qje/qjaf055.
  3. Feuerriegel, S. et al. (2024). Causal Machine Learning for Predicting Treatment Outcomes. Nature Medicine, 30, 958–968. DOI: 10.1038/s41591-024-02902-1.
  4. Andrews, I., Kitagawa, T., & McCloskey, A. (2024). Inference on Winners. Quarterly Journal of Economics, 139(1), 305–358. DOI: 10.1093/qje/qjad043.

建议先复习工具变量双重差分机器学习与因果推断,再完成本章研究设计审计。

Copyright © 2026