计量经济学

第一章:数据、概率与回归对象

从样本、总体、条件期望和线性投影开始建立计量经济学语言。

第一章:数据、概率与回归对象

1. 计量问题从“对象”开始

在回归软件中输入变量之前,先说明:研究对象是谁、观察单位是什么、结果变量如何定义、解释变量如何测量,以及你想描述还是想识别因果效应。

例如,“教育影响工资”至少有三种不同问题:

  1. 受教育年限与工资的条件相关是什么?
  2. 对一个随机选择的个体,额外教育一年的潜在工资变化是什么?
  3. 某项教育政策使受影响者的工资改变多少?

三者可能使用相似数据和回归形式,但目标参数与识别条件不同。

学习目标

  • 区分总体、样本、参数、统计量和估计量;
  • 用条件期望函数描述预测与因果问题;
  • 解释抽样误差、测量误差和选择进入数据的差异;
  • 理解线性投影不要求真实条件期望函数完全线性;
  • 为 OLS 推导准备矩阵和概率语言。

2. 随机变量与数据生成过程

把一个观测写成 Wi=(Yi,Xi)W_i=(Y_i,X_i)。样本 (W1,,Wn)(W_1,\ldots,W_n) 来自某种数据生成过程。i.i.d. 是常见基准,但面板、时间序列、空间数据和聚类抽样会破坏简单独立性。

数据生成过程不是“软件看不到的误差项”,而是描述数据如何被产生、观测和选择进入样本的理论对象。若样本只包含就业者,工资回归的误差可能同时包含劳动参与选择;若问卷非随机缺失,缺失机制会影响目标参数。

3. 条件期望函数

条件期望函数为:

m(x)=E[YX=x].m(x)=\mathbb{E}[Y\mid X=x].

它是给定 XXYY 的最佳平方损失预测器,因为对任意函数 g(X)g(X)

E[(Yg(X))2]=E[(Ym(X))2]+E[(m(X)g(X))2].\mathbb{E}[(Y-g(X))^2] =\mathbb{E}[(Y-m(X))^2]+\mathbb{E}[(m(X)-g(X))^2].

线性回归进一步限制预测函数为 XβX'\beta。当真实 CEF 非线性时,OLS 仍然估计总体线性投影系数,而不一定估计某个结构参数。

4. 相关、条件相关与因果

条件相关描述在控制 XXDDYY 的关系。因果效应要求比较同一单位在不同处理状态下的潜在结果:

Yi(1),Yi(0).Y_i(1),\qquad Y_i(0).

个体处理效应为 Yi(1)Yi(0)Y_i(1)-Y_i(0),平均处理效应为 E[Yi(1)Yi(0)]\mathbb{E}[Y_i(1)-Y_i(0)]。问题在于同一单位不能同时观察两种状态。回归控制、随机化、工具变量和准实验设计都是构造或逼近反事实的方法,但依赖不同假设。

5. 目标参数表

对象例子是否自动具有因果含义
描述性统计量样本平均工资
条件均值E[YD=1]E[Y\mid D=1]
线性投影系数OLS 中 DD 的系数否,除非有识别假设
ATEE[Y(1)Y(0)]E[Y(1)-Y(0)]是,定义本身是因果参数
ATTE[Y(1)Y(0)D=1]E[Y(1)-Y(0)\mid D=1]是,但需要设计识别
预测风险E[(YY^)2]E[(Y-\hat Y)^2]否,评价预测任务

写实证报告时,把“估计的是什么”放在结果表之前,读者才知道系数应如何解释。

6. 测量与选择

测量误差包括教育年限报告误差、收入顶格报告、价格指数口径变化和行政数据匹配误差。解释变量测量误差在经典条件下可能造成衰减偏误,但现实测量误差未必满足经典条件。

选择问题包括:

  • 只有就业者才有观察到的工资;
  • 只有申请者才进入政策样本;
  • 只有留下来接受追踪的个体有后续结果;
  • 变量缺失与结果或处理状态相关。

样本量大不能自动修复选择偏误。大样本会让估计更精确地估计错误的对象。

自测题

  1. 为什么条件期望是最佳平方预测器?
  2. OLS 估计线性投影系数时,真实 CEF 非线性会产生什么含义?
  3. 描述性相关何时可能接近因果效应?需要什么假设?
  4. 解释变量测量误差为什么可能使系数向零偏?
  5. 选择进入样本与样本量大小有什么不同?

下一章

下一章把线性投影写成矩阵形式,推导 OLS,并使用 FWL 定理解释“控制变量”究竟改变了什么比较。

Copyright © 2026