计量经济学
第一章:数据、概率与回归对象
从样本、总体、条件期望和线性投影开始建立计量经济学语言。
第一章:数据、概率与回归对象
1. 计量问题从“对象”开始
在回归软件中输入变量之前,先说明:研究对象是谁、观察单位是什么、结果变量如何定义、解释变量如何测量,以及你想描述还是想识别因果效应。
例如,“教育影响工资”至少有三种不同问题:
- 受教育年限与工资的条件相关是什么?
- 对一个随机选择的个体,额外教育一年的潜在工资变化是什么?
- 某项教育政策使受影响者的工资改变多少?
三者可能使用相似数据和回归形式,但目标参数与识别条件不同。
学习目标
- 区分总体、样本、参数、统计量和估计量;
- 用条件期望函数描述预测与因果问题;
- 解释抽样误差、测量误差和选择进入数据的差异;
- 理解线性投影不要求真实条件期望函数完全线性;
- 为 OLS 推导准备矩阵和概率语言。
2. 随机变量与数据生成过程
把一个观测写成 。样本 来自某种数据生成过程。i.i.d. 是常见基准,但面板、时间序列、空间数据和聚类抽样会破坏简单独立性。
数据生成过程不是“软件看不到的误差项”,而是描述数据如何被产生、观测和选择进入样本的理论对象。若样本只包含就业者,工资回归的误差可能同时包含劳动参与选择;若问卷非随机缺失,缺失机制会影响目标参数。
3. 条件期望函数
条件期望函数为:
它是给定 时 的最佳平方损失预测器,因为对任意函数 :
线性回归进一步限制预测函数为 。当真实 CEF 非线性时,OLS 仍然估计总体线性投影系数,而不一定估计某个结构参数。
4. 相关、条件相关与因果
条件相关描述在控制 后 和 的关系。因果效应要求比较同一单位在不同处理状态下的潜在结果:
个体处理效应为 ,平均处理效应为 。问题在于同一单位不能同时观察两种状态。回归控制、随机化、工具变量和准实验设计都是构造或逼近反事实的方法,但依赖不同假设。
5. 目标参数表
| 对象 | 例子 | 是否自动具有因果含义 |
|---|---|---|
| 描述性统计量 | 样本平均工资 | 否 |
| 条件均值 | 否 | |
| 线性投影系数 | OLS 中 的系数 | 否,除非有识别假设 |
| ATE | 是,定义本身是因果参数 | |
| ATT | 是,但需要设计识别 | |
| 预测风险 | 否,评价预测任务 |
写实证报告时,把“估计的是什么”放在结果表之前,读者才知道系数应如何解释。
6. 测量与选择
测量误差包括教育年限报告误差、收入顶格报告、价格指数口径变化和行政数据匹配误差。解释变量测量误差在经典条件下可能造成衰减偏误,但现实测量误差未必满足经典条件。
选择问题包括:
- 只有就业者才有观察到的工资;
- 只有申请者才进入政策样本;
- 只有留下来接受追踪的个体有后续结果;
- 变量缺失与结果或处理状态相关。
样本量大不能自动修复选择偏误。大样本会让估计更精确地估计错误的对象。
自测题
- 为什么条件期望是最佳平方预测器?
- OLS 估计线性投影系数时,真实 CEF 非线性会产生什么含义?
- 描述性相关何时可能接近因果效应?需要什么假设?
- 解释变量测量误差为什么可能使系数向零偏?
- 选择进入样本与样本量大小有什么不同?
下一章
下一章把线性投影写成矩阵形式,推导 OLS,并使用 FWL 定理解释“控制变量”究竟改变了什么比较。