第十一章:机器学习与因果推断

用正交化与交叉拟合连接高维预测、平均效应、异质性效应和政策学习。

第十一章:机器学习与因果推断

案例: 一个模型能准确预测谁会失业,是否也能告诉我们培训应优先给谁?

预测模型学习 E[YX]E[Y\mid X];因果决策需要比较 Y(1)Y(1)Y(0)Y(0)。机器学习可灵活估计高维 nuisance functions,但不能创造随机化、无混杂或重叠。

学习目标

你应能:

  1. 区分风险预测、ATE、CATE 与政策价值;
  2. 解释正交化为何降低 nuisance model 误差的一阶影响;
  3. 实施样本分割与交叉拟合;
  4. 识别因果森林、DML 和政策学习的不同目标;
  5. 审查重叠、目标泄漏、选择后推断与公平性。

1. 预测问题不等于因果问题

任务目标例子
风险预测E[YX]E[Y\mid X]谁最可能失业?
平均效应E[Y(1)Y(0)]E[Y(1)-Y(0)]培训平均提高多少收入?
条件效应E[Y(1)Y(0)X=x]E[Y(1)-Y(0)\mid X=x]哪类人因培训受益更多?
政策学习最大化 E[Y(d(X))c(X)d(X)]E[Y(d(X))-c(X)d(X)]名额有限时培训给谁?

高风险者不一定最受益。例如长期失业者的基准风险高,但课程可能只对具备某些数字技能者有效。

2. Double / Debiased Machine Learning

部分线性模型:

Y=θD+g(X)+ε,D=m(X)+v.\begin{aligned} Y &= \theta D+g(X)+\varepsilon,\\ D &= m(X)+v. \end{aligned}

先估计

(X)=E[YX],m(X)=E[DX],\ell(X)=E[Y\mid X],\qquad m(X)=E[D\mid X],

再构造残差:

Y~=Y^(X),D~=Dm^(X),\widetilde Y=Y-\widehat\ell(X),\qquad \widetilde D=D-\widehat m(X),

并回归 Y~\widetilde YD~\widetilde D。正交矩条件使小幅 nuisance 误差对 θ^\widehat\theta 的一阶影响为零,但仍要求:

  • 识别假设成立;
  • nuisance 估计足够好;
  • 有重叠;
  • 使用交叉拟合避免同一观测既训练又残差化。

3. 可运行案例:非线性选择下的交叉拟合 DML

培训参加概率和基准收入都以非线性方式依赖特征。朴素均值差有混淆;两折交叉拟合在未参与训练的观测上预测 nuisance functions,再用残差识别处理效应。

Py

Python:两折交叉拟合 DML

Idle

此例知道正确的特征基函数,目的只是展示正交化流程。现实研究应把 learner、调参、折数、随机种子和预处理全部纳入可复现管线,并使用 DML 的有效方差公式。

4. CATE 与因果森林

τ(x)=E[Y(1)Y(0)X=x].\tau(x)=E[Y(1)-Y(0)\mid X=x].

因果森林通过诚实样本分割、局部加权和正交化估计异质性。应避免:

  • 看完同一数据后挑“最显著亚组”;
  • 只展示变量重要性,未报告 CATE 校准;
  • 在重叠很差区域解释个体效应;
  • 把噪声很大的个体点估计用于高风险决策。

更稳健的报告通常按预先定义或样本外分组展示平均效应,并给出组间差异的有效推断。

5. 从 CATE 到政策规则

若处理成本为 c(x)c(x),简单规则:

d(x)=1{τ^(x)>c(x)}.d(x)=\mathbf 1\{\widehat\tau(x)>c(x)\}.

但有限名额、公平约束和不可逆伤害会改变优化问题。策略应在独立测试样本上评价:

V(d)=E[Y(d(X))c(X)d(X)].V(d)=E[Y(d(X))-c(X)d(X)].

“CATE 预测误差低”不保证政策价值高;错误可能恰好集中在决策阈值附近。

6. 数据泄漏与选择后推断

典型泄漏包括:

  • 用处理后的变量预测倾向得分;
  • 在全样本标准化、筛特征后才切分;
  • 用同一结果挑选亚组并报告普通区间;
  • 尝试许多 learner,只展示效应最大的模型;
  • 把未来信息编码进历史特征。

模型选择、超参数调优和亚组发现都属于分析过程。应使用嵌套交叉验证、独立确认样本、预注册或选择后推断。

7. 伦理与部署审计

问题必须回答
可识别性数据为何支持处理反事实?
重叠哪些人没有可比处理选择?
伤害错误分配的成本是否对称?
公平约束针对机会、结果还是误差?
可迁移性新地区的处理与人群是否相同?
监测部署后行为反应和数据漂移怎样发现?

2024 年 Nature MedicineFeuerriegel 等 强调,因果机器学习从问题定义到临床转化需要连续审查;方法综述本身不是任何治疗有效性的证据。

8. 最低报告标准

  • 目标参数与识别假设;
  • 所有特征的测量时点;
  • 训练、调参、交叉拟合和测试划分;
  • nuisance learner 与性能;
  • 倾向得分和重叠诊断;
  • ATE/CATE 的区间、校准和稳定性;
  • 策略价值的样本外评估;
  • 软件版本、随机种子与完整分析日志。

课堂任务

设计“把有限辅导名额分给学生”的政策学习方案:

  1. 区分辍学风险与辅导 CATE;
  2. 写出一个资源约束下的价值函数;
  3. 指出两个不能作为处理前特征的变量;
  4. 设计独立评估或随机上线实验;
  5. 说明公平约束会怎样改变最优规则。

核心阅读

上一章:合成控制法|下一章:前沿文献与现代案例

Copyright © 2026