第四章:面板数据方法
用同一单位的时间变化理解固定效应、双向固定效应、聚类推断与动态偏误。
第四章:面板数据方法
案例: 采用数字管理系统的企业生产率更高,是系统有效,还是管理能力强的企业更早采用?
面板数据重复观察同一单位。它的优势不是“样本量更大”,而是能比较同一个体、企业或地区在不同时点的变化。
学习目标
你应能:
- 区分 pooled OLS、固定效应(FE)、随机效应(RE)与一阶差分;
- 用组内变换解释 FE 消除了什么;
- 判断哪些变量因没有组内变化而无法识别;
- 识别时间变化混淆、动态面板偏误与序列相关;
- 选择与单位和处理分配匹配的聚类层级。
1. 基本模型与反事实
- :单位不随时间变化的特征,如长期管理文化;
- :所有单位共同经历的时间冲击,如宏观衰退;
- :在控制这些成分后, 的单位内变化与 的变化关系。
双向固定效应依赖的关键条件可写成严格外生性:
它比“当期无相关”更强:当期冲击不能反过来影响未来处理。企业因本期生产率骤降而下期购买软件时,这一条件值得怀疑。
2. 组内变换做了什么
只考虑单位固定效应时,从每个变量中减去单位均值:
被消除。因此:
- 从未改变处理状态的单位不直接识别 ;
- 性别、出生地等时间不变变量的主效应与单位 FE 共线;
- 测量误差在去均值后可能更严重;
- 时间变化的需求、政策预期和共同趋势仍需处理。
3. FE、RE 与一阶差分如何选
| 方法 | 使用的变化 | 核心风险 | 适合场景 |
|---|---|---|---|
| pooled OLS | 单位间 + 单位内 | 与处理相关 | 纯描述或可交换性可信 |
| 单位 FE | 单位内 | 时间变化混淆 | 多期、单位特征稳定 |
| 双向 FE | 单位内且净化共同时间冲击 | 异质趋势、交错处理 | 非吸收式处理或效应同质性合理 |
| 一阶差分 | 相邻期变化 | 差分放大噪声、序列结构 | 较短面板或冲击以变化表达 |
| RE | 单位间 + 单位内 | 要求随机效应与解释变量不相关 | 模型假设有强制度依据 |
Hausman 检验不能替代研究设计:不拒绝 RE 只表示样本没有提供足够反证,不会证明零相关假设。
4. 可运行案例:企业采用数字系统
高质量企业更早采用系统,因此 pooled OLS 把企业质量混入系统效应。双向去均值同时移除企业质量与共同年份冲击。
Py
Python:pooled OLS 与双向固定效应
FE 接近真值,是因为模拟没有遗漏的时间变化混淆。若高质量企业同时在采用当年更换管理团队,FE 仍会把两者混在一起。
5. 推断:为什么常按单位聚类
同一企业的误差通常跨期相关。把每个“企业—年份”当独立观测会夸大有效样本量。一般原则是:
- 先问处理在哪个层级分配;
- 再问误差在哪个层级相关;
- 聚类数很少时使用小样本修正、随机化推断或 wild cluster bootstrap;
- 双向相关时考虑多维聚类。
聚类标准误只修正推断,不会修复共同冲击、反向因果或处理前趋势。
6. 动态面板与滞后结果
若模型含 :
去均值后的滞后结果与去均值误差机械相关,短面板中产生 Nickell 偏误。增加单位数不能消除固定 下的偏误;需根据数据结构考虑差分 GMM、系统 GMM 或更透明的动态设计,并审查工具膨胀。
7. 诊断清单
- 每个单位有多少期?是否为不平衡面板?
- 处理有多少单位内变化?变化是否集中在少数单位?
- 处理前结果是否预测未来处理?
- 是否存在单位特定趋势或同步政策?
- 流失是否与过去结果、处理相关?
- 标准误是否按真实分配层级聚类?
- 吸收式且交错采用的处理是否应转入现代 DID 估计?
课堂任务
研究“远程办公制度对员工离职率”的企业面板:
- 写出一个时间不变混淆和一个时间变化混淆;
- 解释员工 FE 与企业 FE 分别比较什么;
- 判断员工跳槽造成的样本构成变化;
- 设计一个处理前预测检验;
- 说明聚类应放在哪个层级。
核心阅读
- Wooldridge, Econometric Analysis of Cross Section and Panel Data。
- Arellano (1987), “Computing Robust Standard Errors for Within-Groups Estimators”。
- Petersen (2009), “Estimating Standard Errors in Finance Panel Data Sets”。