第三章:统计推断与稳健标准误
第三章:统计推断与稳健标准误
1. 点估计不是完整结果
回归系数只是一个样本结果。由于换一批样本可能得到不同的系数,研究者还要报告标准误、置信区间、检验假设和估计对象。统计推断描述的是抽样不确定性,不自动包含测量误差、模型不确定性、外部有效性或识别假设失败的风险。
学习目标
- 理解标准误来自抽样分布而不是“软件附带的误差”;
- 正确解释置信区间、p 值和联合检验;
- 区分异方差稳健、聚类稳健和时间序列稳健标准误;
- 说明 bootstrap 何时有帮助、何时不能修复识别问题;
- 解释统计显著、经济显著和实际重要性之间的差异。
2. 估计量的抽样分布
若重复从总体抽样并每次计算 ,这些估计值的分布就是抽样分布。标准误是其标准差的估计。样本量增大通常让估计更集中,但前提是样本和估计过程仍然针对同一目标。
大样本近似常写为:
推断需要估计 。如果误差具有异方差或组内相关,使用错误的方差公式会让置信区间过窄,t 统计量过大。
3. t 检验与置信区间
检验 的统计量为:
95% 置信区间近似为:
置信区间不是“参数有 95% 概率在这个固定区间内”的贝叶斯陈述,而是重复抽样程序长期覆盖真参数约 95% 的频率学派解释。
4. 异方差
如果:
随 改变,就存在异方差。OLS 点估计在外生性成立时仍可能一致,但同方差标准误不再可靠。Huber–White 三明治方差估计为:
稳健标准误修正推断,不会修正遗漏变量偏误、反向因果、错误函数形式或样本选择。
5. 聚类相关
同一学校、企业、地区、州或个体的观测可能共享冲击。若组内误差相关,样本的有效独立信息量小于观测行数。聚类标准误允许同组内任意相关,而通常要求组间独立或在更高层次上满足适当条件。
聚类层级应由误差相关和处理分配层级决定,而不是由“哪一种软件选项方便”决定。政策在州层面变化时,只在个人层面使用稳健标准误通常会低估不确定性。
6. 多重检验与经济显著
同时检验许多假设,即使所有原假设都正确,也可能偶然出现显著结果。研究者应预先说明主要结果、控制多重检验或报告探索性结果。
解释结果时同时写:
- 系数单位和数量级;
- 置信区间;
- 相对于基线均值或政策成本的经济意义;
- 识别假设与数据覆盖范围。
大样本可以让极小且无实际意义的效果显著;小样本可能让重要效果不显著。显著性星号不能替代机制和量级解释。
7. Bootstrap
Bootstrap 通过重复从样本重抽样近似估计量的抽样分布。它可用于复杂统计量、分位数或有限样本诊断,但需要尊重数据依赖结构:面板要按个体/组重抽,时间序列要使用区块或其他序列方法。
Bootstrap 不能解决内生性、错误的目标参数或不代表性的样本。它提高的是不确定性近似,不是因果可信度。
研究生扩展
- sandwich 方差与影响函数;
- 少量聚类、随机化推断和 wild bootstrap;
- 高维同时推断;
- 弱识别下的置信区间;
- 预先注册、规格曲线和选择后推断。
自测题
- 异方差会影响 OLS 点估计还是标准误,取决于什么假设?
- 为什么州层面政策需要考虑州内相关?
- 95% 置信区间应该如何解释?
- bootstrap 为什么不能修复遗漏变量偏误?
- 如何判断一个统计显著结果是否具有经济意义?
下一章
下一章讨论一个更根本的问题:当解释变量与误差相关时,稳健标准误并不能使 OLS 重新具有因果含义,需要工具变量和更明确的识别设计。