计量经济学

第七章:可重复计量实证项目

用数据字典、代码、推断和研究日志完成可审计的计量项目。

第七章:可重复计量实证项目

项目目标

计量学习的终点不是一张回归表,而是一个别人可以检查、运行、质疑和扩展的研究对象。本章给出本科生和研究生都适用的项目结构。

1. 项目目录建议

project/
  README.md
  data_raw/          # 原始数据,只读
  data_processed/    # 清洗后的中间数据
  code/               # 清理、估计、图表、表格脚本
  output/             # 自动生成的表格和图片
  notes/              # 研究日志、分析计划、变量字典
  report/             # Markdown、Quarto 或 LaTeX 报告

原始数据与生成结果分开,代码按步骤组织,避免在交互式环境中只运行部分单元而无法重现。

2. 数据字典

字段示例
变量名educ_years
含义最高完成教育年限
单位
观察层级个体—年份
来源调查问卷第 X 题
缺失编码−99 转换为缺失
处理顶格值、异常值和年龄范围
理论角色处理变量/控制变量/结果变量

没有数据字典,回归表中的变量名很容易脱离测量含义。研究生项目还要记录版本、下载日期、修订、匹配键和隐私处理。

3. 分析日志

每次改变样本、变量、函数形式、标准误或模型,都记录:日期、改变、理由、预期影响、结果和是否纳入主文。这样可以把“探索”与“确认性结果”区分开。

4. 结果表的最低标准

  • 显示观测数和目标样本;
  • 说明因变量单位和转换;
  • 报告标准误类型和聚类层级;
  • 标明固定效应、控制变量和样本限制;
  • 给出置信区间或至少明确显著性水平;
  • 同时报告经济量级而非只有星号;
  • 说明缺失值、权重和异常值处理。

5. 本科生项目

建议选择一个公开数据集,完成:

  1. 研究问题和变量字典;
  2. 描述性统计和可视化;
  3. 两到三个嵌套回归;
  4. 合适的稳健标准误;
  5. 一个函数形式或样本敏感性分析;
  6. 对系数、置信区间和限制的解释。

本科生不必声称发现了严格因果关系,但必须诚实区分描述性和因果语言。

6. 研究生项目

研究生应增加:

  • 预先定义的目标参数和识别策略;
  • 主要结果与探索性结果分开;
  • 处理缺失、测量误差、聚类和弱识别;
  • 安慰剂、预趋势、替代样本和规格敏感性;
  • 外部有效性、统计功效和政策解释边界;
  • 可复现环境或依赖版本说明。

7. 最终审计

在提交前,从一个新的环境运行:

  1. 安装依赖;
  2. 从原始数据运行清理脚本;
  3. 生成所有图表和表格;
  4. 检查报告中的数字与输出文件一致;
  5. 删除缓存和不可解释的手工修改;
  6. 阅读 README,确认另一位研究者知道如何复现。

自测题

  1. 为什么原始数据应尽量只读?
  2. 结果表中为什么必须说明聚类层级?
  3. 探索性结果如何与确认性结果区分?
  4. 一个可复现项目是否自动具有因果可信度?为什么?
  5. 如果重新运行代码得到不同结果,应该检查哪些来源?

与微观计量的衔接

完成本课程后,进入微观计量经济学时,应把同一套项目审计流程带入 IV、DID、RDD、匹配、离散选择和机器学习因果推断。高级方法不会降低对变量定义、识别假设和可重复性的要求,反而会提高要求。

Copyright © 2026