第九章:计数数据与受限因变量

按数据生成机制区分 Poisson、负二项、零膨胀、两部模型、删失、截断与选择模型。

第九章:计数数据与受限因变量

案例: 一年就诊次数有大量 0;工作时长也有大量 0。两个“很多零”的结果,为什么不应自动使用同一个模型?

模型选择应由零值和边界的生成机制决定,而不是由直方图长得像什么决定。

学习目标

你应能:

  1. 区分计数、删失、截断、样本选择与角点解;
  2. 解释 Poisson 条件均值和入射率比;
  3. 诊断过度离散与结构零;
  4. 判断何时使用负二项、hurdle、零膨胀、Tobit 或两部模型;
  5. 把系数转换为条件均值和政策相关概率。

1. 先辨认数据机制

观察现象可能机制典型模型
0,1,2,0,1,2,\ldots 次事件给定暴露期内发生次数Poisson、负二项
一部分人必然为 0,其他人再计数两种潜在人群zero-inflated
先决定是否发生,再决定正值大小两个决策过程hurdle / two-part
潜变量低于 0 都记为 0审查或测量边界Tobit
低于阈值的个体根本不进入样本截断truncated likelihood
结果只对就业者可见样本选择选择模型、界限或设计方法

零工作时长可能是最优劳动供给的角点,不一定存在一个“负的潜在工作时长”被机械审查。此时 two-part 往往比 Tobit 的单一潜变量假设更透明。

2. Poisson 的核心是条件均值

E[YiXi]=μi=exp(Xiβ).E[Y_i\mid X_i]=\mu_i=\exp(X_i'\beta).

对连续变量 xkx_kβk\beta_k 是对数条件均值的半弹性;exp(βk)\exp(\beta_k) 是入射率比(IRR)。例如 β=0.2\beta=0.2 对应条件均值乘以 e0.21.22e^{0.2}\approx1.22

完整 Poisson 分布要求

Var(YX)=E[YX],\operatorname{Var}(Y\mid X)=E[Y\mid X],

但 Poisson QMLE 在条件均值正确时,即使方差不等于均值也可一致;此时必须使用稳健方差。负二项模型进一步参数化过度离散。

3. 可运行案例:过度离散下的 Poisson QMLE

模拟中未观测但与协变量独立的 frailty 使方差远大于均值,条件均值仍正确。Poisson 系数接近真值,但模型式标准误会失真,实际分析应使用 sandwich/cluster-robust 推断。

Py

Python:Poisson IRLS、过度离散与 IRR

Idle

“方差大于均值”提示 Poisson 分布不合适,却不自动否定其条件均值估计。应分别审查均值设定与推断。

4. 大量零:三种不同解释

普通计数过程

低事件率本来就会产生许多零;Poisson 可能已足够。

Hurdle / two-part

先建模 P(Y>0X)P(Y>0\mid X),再建模 E[YY>0,X]E[Y\mid Y>0,X]。适合“是否使用服务”与“使用多少”由不同决策控制的场景。

Zero-inflated

假设存在结构零类与普通计数类。它是强潜类别假设,需要实质机制支持;仅因为零很多而采用会过度解释。

非嵌套模型选择指标只能比较拟合,不能证明潜在机制。

5. Tobit、截断与选择

Tobit I 型模型:

Yi=Xiβ+εi,Yi=max(0,Yi).Y_i^*=X_i'\beta+\varepsilon_i,\qquad Y_i=\max(0,Y_i^*).

它把参与概率与正值大小绑定在同一 β\beta 和误差分布上。若是否工作由托育可得性决定,而工作后的时长由工资决定,这一限制通常过强。

还要区分:

  • 删失: 个体在样本中,但结果只知道落在某边界;
  • 截断: 边界外个体完全不在样本中;
  • 样本选择: 结果可见性由另一个相关过程决定。

三者的似然和目标人群都不同。

6. 暴露量与固定效应

计数常受观察时间影响。医院住院 10 天与 100 天的感染次数不能直接比较,应使用 offset:

logE[YiXi]=Xiβ+log(exposurei).\log E[Y_i\mid X_i] =X_i'\beta+\log(\text{exposure}_i).

面板 Poisson 固定效应可处理单位不变异质性,但仍需严格外生性;不要因模型名有“固定效应”就忽略反向因果。

7. 诊断与报告

  • 结果是次数、率、金额还是潜变量?
  • 观察窗口和暴露量是否一致?
  • 零来自低发生率、结构状态还是参与决策?
  • 均值—方差关系如何,尾部是否由极端值驱动?
  • 报告 IRR 之外,是否给出典型人群预测均值?
  • 是否使用稳健或聚类标准误?
  • 模型比较是否包含机制解释、校准和样本外表现?
  • 删失、截断或选择规则是否被准确记录?

常见误区

  • 看到过度离散就认定 Poisson 系数一定不一致;
  • 看到很多零就自动使用 zero-inflated 模型;
  • 把 Tobit 系数直接解释为观测结果的边际效应;
  • 忽略暴露时间;
  • 对只有就业者可见的工资简单删除非就业者。

课堂任务

比较“医生就诊次数”和“年度慈善捐款”:

  1. 为每个结果解释零值机制;
  2. 判断是否需要 offset;
  3. 选择 Poisson、two-part 或其他模型并说明理由;
  4. 指出一个未观测异质性来源;
  5. 把一个系数转成 IRR 或预测均值差。

核心阅读

上一章:离散选择模型|下一章:合成控制法

Copyright © 2026