第十一章:机器学习与因果推断
用正交化与交叉拟合连接高维预测、平均效应、异质性效应和政策学习。
第十一章:机器学习与因果推断
案例: 一个模型能准确预测谁会失业,是否也能告诉我们培训应优先给谁?
预测模型学习 ;因果决策需要比较 与 。机器学习可灵活估计高维 nuisance functions,但不能创造随机化、无混杂或重叠。
学习目标
你应能:
- 区分风险预测、ATE、CATE 与政策价值;
- 解释正交化为何降低 nuisance model 误差的一阶影响;
- 实施样本分割与交叉拟合;
- 识别因果森林、DML 和政策学习的不同目标;
- 审查重叠、目标泄漏、选择后推断与公平性。
1. 预测问题不等于因果问题
| 任务 | 目标 | 例子 |
|---|---|---|
| 风险预测 | 谁最可能失业? | |
| 平均效应 | 培训平均提高多少收入? | |
| 条件效应 | 哪类人因培训受益更多? | |
| 政策学习 | 最大化 | 名额有限时培训给谁? |
高风险者不一定最受益。例如长期失业者的基准风险高,但课程可能只对具备某些数字技能者有效。
2. Double / Debiased Machine Learning
部分线性模型:
先估计
再构造残差:
并回归 对 。正交矩条件使小幅 nuisance 误差对 的一阶影响为零,但仍要求:
- 识别假设成立;
- nuisance 估计足够好;
- 有重叠;
- 使用交叉拟合避免同一观测既训练又残差化。
3. 可运行案例:非线性选择下的交叉拟合 DML
培训参加概率和基准收入都以非线性方式依赖特征。朴素均值差有混淆;两折交叉拟合在未参与训练的观测上预测 nuisance functions,再用残差识别处理效应。
Py
Python:两折交叉拟合 DML
此例知道正确的特征基函数,目的只是展示正交化流程。现实研究应把 learner、调参、折数、随机种子和预处理全部纳入可复现管线,并使用 DML 的有效方差公式。
4. CATE 与因果森林
因果森林通过诚实样本分割、局部加权和正交化估计异质性。应避免:
- 看完同一数据后挑“最显著亚组”;
- 只展示变量重要性,未报告 CATE 校准;
- 在重叠很差区域解释个体效应;
- 把噪声很大的个体点估计用于高风险决策。
更稳健的报告通常按预先定义或样本外分组展示平均效应,并给出组间差异的有效推断。
5. 从 CATE 到政策规则
若处理成本为 ,简单规则:
但有限名额、公平约束和不可逆伤害会改变优化问题。策略应在独立测试样本上评价:
“CATE 预测误差低”不保证政策价值高;错误可能恰好集中在决策阈值附近。
6. 数据泄漏与选择后推断
典型泄漏包括:
- 用处理后的变量预测倾向得分;
- 在全样本标准化、筛特征后才切分;
- 用同一结果挑选亚组并报告普通区间;
- 尝试许多 learner,只展示效应最大的模型;
- 把未来信息编码进历史特征。
模型选择、超参数调优和亚组发现都属于分析过程。应使用嵌套交叉验证、独立确认样本、预注册或选择后推断。
7. 伦理与部署审计
| 问题 | 必须回答 |
|---|---|
| 可识别性 | 数据为何支持处理反事实? |
| 重叠 | 哪些人没有可比处理选择? |
| 伤害 | 错误分配的成本是否对称? |
| 公平 | 约束针对机会、结果还是误差? |
| 可迁移性 | 新地区的处理与人群是否相同? |
| 监测 | 部署后行为反应和数据漂移怎样发现? |
2024 年 Nature Medicine 的 Feuerriegel 等 强调,因果机器学习从问题定义到临床转化需要连续审查;方法综述本身不是任何治疗有效性的证据。
8. 最低报告标准
- 目标参数与识别假设;
- 所有特征的测量时点;
- 训练、调参、交叉拟合和测试划分;
- nuisance learner 与性能;
- 倾向得分和重叠诊断;
- ATE/CATE 的区间、校准和稳定性;
- 策略价值的样本外评估;
- 软件版本、随机种子与完整分析日志。
课堂任务
设计“把有限辅导名额分给学生”的政策学习方案:
- 区分辍学风险与辅导 CATE;
- 写出一个资源约束下的价值函数;
- 指出两个不能作为处理前特征的变量;
- 设计独立评估或随机上线实验;
- 说明公平约束会怎样改变最优规则。
核心阅读
- Chernozhukov et al. (2018), “Double/Debiased Machine Learning for Treatment and Structural Parameters”。
- Wager & Athey (2018), “Estimation and Inference of Heterogeneous Treatment Effects Using Random Forests”。
- Athey & Wager (2021), “Policy Learning with Observational Data”。
- Feuerriegel et al. (2024), “Causal Machine Learning for Predicting Treatment Outcomes”。