第二章:线性回归与 OLS
把 OLS 当作线性投影与比较工具,掌握控制变量、遗漏变量、FWL 与稳健推断。
第二章:线性回归与 OLS
案例: 工资对受教育年限的回归系数,是教育回报,还是教育与能力共同选择的结果?
OLS 最擅长回答“在指定线性比较下, 与 如何共同变化”。只有当研究设计支持时,这个线性投影才有因果含义。
学习目标
你应能:
- 区分线性投影、条件均值与因果效应;
- 用遗漏变量偏误公式判断偏误方向;
- 用 FWL 定理解释“控制变量”做了什么;
- 识别混淆变量、精度变量、坏控制和碰撞点;
- 报告稳健标准误、置信区间与经济量级。
1. OLS 究竟估计什么
总体线性投影写为
是在所有线性函数中使均方误差最小的系数。它自动具有描述意义;要解释为处理效应,还需类似
的条件可交换性,以及一致性、重叠和正确的比较范围。
2. 遗漏变量偏误:先判断方向
真实模型若为
却遗漏 ,简单回归系数满足
若能力 同时提高受教育年限和工资,则两项都为正,教育系数向上偏。这个公式不能证明真实世界偏误大小,但能迫使研究者写出方向逻辑。
3. FWL:控制就是先剥离可预测部分
Frisch–Waugh–Lovell 定理给出三步:
- 用控制变量 回归 ,取得残差 ;
- 用 回归 ,取得残差 ;
- 回归 对 。
所得斜率与完整多元回归中的 系数相同。因此 来自“控制变量相同的人之间仍剩下的 差异”。如果剩余差异很少,重叠差、标准误大,模型也会依赖外推。
4. 哪些变量该控制
| 变量角色 | 是否通常控制 | 原因 |
|---|---|---|
| 同时影响 和 的处理前混淆变量 | 是 | 关闭后门路径 |
| 只预测 的处理前变量 | 可选 | 常提高精度 |
| 处理后的中介变量 | 否,若目标是总效应 | 会截断部分效应 |
| 由 与未观测因素共同造成的碰撞点 | 否 | 条件化会打开伪路径 |
| 与研究人群几乎无重叠的变量组合 | 不能靠回归解决 | 系数来自函数形式外推 |
例如评估培训对工资的总效应时,培训后取得的证书可能是机制,不应作为普通“控制变量”放入主回归。
5. 可运行案例:能力遗漏与 FWL
代码生成一个真实教育效应为 1.5 的世界。能力同时影响教育与工资;研究者先看朴素回归,再加入能力,并用 FWL 复核。
Py
Python:遗漏变量偏误、稳健标准误与 FWL
这里“加入能力后接近真值”是因为模拟中能力被完整测量且模型设定正确。真实数据里的测量误差、未观测动机和学校选择仍可能存在。
6. 推断与报告
最少报告:
- 系数、稳健或聚类标准误、95% 置信区间;
- 、 的单位和变换;
- 样本量、缺失值处理与控制变量选择依据;
- 处理分配层级与误差相关层级;
- 经济量级,例如增加一年教育对应工资百分比变化,而不只给 值。
异方差稳健标准误修正的是方差估计,不会修复遗漏变量、反向因果或测量误差。
7. 快速诊断
- 支持集: 处理组和比较组在 上是否重叠?
- 函数形式: 连续变量是否需要非线性或分段关系?
- 影响点: 结论是否由少数极端观测驱动?
- 标准误: 处理是否按学校、企业或地区分配?
- 控制顺序: 控制是否在处理前测量?
- 敏感性: 未观测混淆需要多强才能解释结果?
常见误区
- 把高 当作因果可信度;
- 逐步回归后只保留显著控制变量;
- 控制处理后结果,仍把系数称为总效应;
- 对数因变量的系数直接说成精确百分比,忽略近似条件;
- 只换标准误,不重新审查识别设计。
课堂任务
为“远程办公对生产率的影响”列出:
- 两个处理前混淆变量;
- 一个可能的坏控制;
- 一个需要聚类的层级;
- 一个能暴露函数形式问题的图;
- 一句话说明 OLS 系数在什么假设下才是因果效应。
核心阅读
- Wooldridge, Econometric Analysis of Cross Section and Panel Data。
- Angrist & Pischke, Mostly Harmless Econometrics。
- Cinelli, Ferwerda & Hazlett (2020), “Sensemakr: Sensitivity Analysis Tools for OLS”。