计量经济学

第三章:统计推断与稳健标准误

从抽样分布、t/F 检验到异方差、聚类和 bootstrap 推断。

第三章:统计推断与稳健标准误

1. 点估计不是完整结果

回归系数只是一个样本结果。由于换一批样本可能得到不同的系数,研究者还要报告标准误、置信区间、检验假设和估计对象。统计推断描述的是抽样不确定性,不自动包含测量误差、模型不确定性、外部有效性或识别假设失败的风险。

学习目标

  • 理解标准误来自抽样分布而不是“软件附带的误差”;
  • 正确解释置信区间、p 值和联合检验;
  • 区分异方差稳健、聚类稳健和时间序列稳健标准误;
  • 说明 bootstrap 何时有帮助、何时不能修复识别问题;
  • 解释统计显著、经济显著和实际重要性之间的差异。

2. 估计量的抽样分布

若重复从总体抽样并每次计算 β^\hat\beta,这些估计值的分布就是抽样分布。标准误是其标准差的估计。样本量增大通常让估计更集中,但前提是样本和估计过程仍然针对同一目标。

大样本近似常写为:

n(β^β)dN(0,V).\sqrt{n}(\hat\beta-\beta)\xrightarrow{d}N(0,V).

推断需要估计 VV。如果误差具有异方差或组内相关,使用错误的方差公式会让置信区间过窄,t 统计量过大。

3. t 检验与置信区间

检验 H0:βj=βj,0H_0:\beta_j=\beta_{j,0} 的统计量为:

t=β^jβj,0SE(β^j).t=\frac{\hat\beta_j-\beta_{j,0}}{SE(\hat\beta_j)}.

95% 置信区间近似为:

β^j±1.96SE(β^j).\hat\beta_j\pm1.96\,SE(\hat\beta_j).

置信区间不是“参数有 95% 概率在这个固定区间内”的贝叶斯陈述,而是重复抽样程序长期覆盖真参数约 95% 的频率学派解释。

4. 异方差

如果:

Var(uiXi)\operatorname{Var}(u_i\mid X_i)

XiX_i 改变,就存在异方差。OLS 点估计在外生性成立时仍可能一致,但同方差标准误不再可靠。Huber–White 三明治方差估计为:

V^HC=(XX)1(iu^i2XiXi)(XX)1.\widehat V_{HC} =(X'X)^{-1}\left(\sum_i\hat u_i^2X_iX_i'\right)(X'X)^{-1}.

稳健标准误修正推断,不会修正遗漏变量偏误、反向因果、错误函数形式或样本选择。

5. 聚类相关

同一学校、企业、地区、州或个体的观测可能共享冲击。若组内误差相关,样本的有效独立信息量小于观测行数。聚类标准误允许同组内任意相关,而通常要求组间独立或在更高层次上满足适当条件。

聚类层级应由误差相关和处理分配层级决定,而不是由“哪一种软件选项方便”决定。政策在州层面变化时,只在个人层面使用稳健标准误通常会低估不确定性。

6. 多重检验与经济显著

同时检验许多假设,即使所有原假设都正确,也可能偶然出现显著结果。研究者应预先说明主要结果、控制多重检验或报告探索性结果。

解释结果时同时写:

  1. 系数单位和数量级;
  2. 置信区间;
  3. 相对于基线均值或政策成本的经济意义;
  4. 识别假设与数据覆盖范围。

大样本可以让极小且无实际意义的效果显著;小样本可能让重要效果不显著。显著性星号不能替代机制和量级解释。

7. Bootstrap

Bootstrap 通过重复从样本重抽样近似估计量的抽样分布。它可用于复杂统计量、分位数或有限样本诊断,但需要尊重数据依赖结构:面板要按个体/组重抽,时间序列要使用区块或其他序列方法。

Bootstrap 不能解决内生性、错误的目标参数或不代表性的样本。它提高的是不确定性近似,不是因果可信度。

研究生扩展

  • sandwich 方差与影响函数;
  • 少量聚类、随机化推断和 wild bootstrap;
  • 高维同时推断;
  • 弱识别下的置信区间;
  • 预先注册、规格曲线和选择后推断。

自测题

  1. 异方差会影响 OLS 点估计还是标准误,取决于什么假设?
  2. 为什么州层面政策需要考虑州内相关?
  3. 95% 置信区间应该如何解释?
  4. bootstrap 为什么不能修复遗漏变量偏误?
  5. 如何判断一个统计显著结果是否具有经济意义?

下一章

下一章讨论一个更根本的问题:当解释变量与误差相关时,稳健标准误并不能使 OLS 重新具有因果含义,需要工具变量和更明确的识别设计。

Copyright © 2026