第九章:点估计方法
比较矩估计、极大似然、贝叶斯估计和 EM 算法的构造逻辑、计算与边界。
第九章:点估计方法
案例: 只观察 5 天故障数时,样本均值波动很大。应完全相信数据,还是让历史信息产生适度收缩?
估计方法规定如何从似然、矩条件或先验信息构造估计量。不同方法可能在大样本下接近,却在小样本、边界或模型错误时明显不同。
学习目标
你应能:
- 使用矩估计和极大似然估计参数;
- 写出 score、observed information 与 Fisher 信息;
- 区分 MLE、MAP 与后验均值;
- 解释贝叶斯估计对损失函数的依赖;
- 用 EM 的 E/M 两步处理潜变量。
1. 矩估计
若理论矩满足
用样本矩替代理论矩并解方程:
优点是直观、常有闭式;缺点是矩选择影响效率,重尾下高阶矩不稳定,方程也可能多解或无解。
2. 极大似然
MLE:
典型步骤:
- 明确支持集和参数空间;
- 写对数似然;
- 解 score ;
- 检查边界、二阶条件和全局最大值;
- 用信息矩阵或 profile likelihood 量化不确定性。
MLE 具有变换不变性,但有限样本可有偏;混合模型、分离 Logit 和方差边界会出现非正则问题。
3. 贝叶斯估计
点估计取决于损失:
| 损失 | Bayes 估计 |
|---|---|
| 平方损失 | 后验均值 |
| 绝对损失 | 后验中位数 |
| 0–1 类损失 | 后验众数 / MAP |
MAP 不是“贝叶斯版 MLE”的全部;完整贝叶斯推断以整个后验分布表达不确定性。
4. 可运行案例:泊松率的 MLE 与 Gamma–Poisson 收缩
若 ,矩估计与 MLE 都是 。设先验 ( 为 rate),后验均值为:
代码比较 与 的重复抽样 MSE。先验均值 ,真实值为 2.5。
Py
Python:MLE、矩估计与贝叶斯收缩
收缩不是免费改进。先验若远离真实参数,会引入更大偏差;应做先验预测检查和敏感性分析。
5. EM:缺失或潜变量下的似然优化
设完整数据包含未观察 。第 次迭代:
E 步
M 步
EM 保证观测数据似然不下降,但:
- 可能收敛到局部极值或鞍点;
- 收敛可很慢;
- 混合成分标签不可识别;
- 标准误不能从最后一次 M 步的普通 Hessian 直接猜测。
应使用多个起点、监控观测对数似然并检查退化解。
6. 方法怎样选择
| 场景 | 起点 | 关键审查 |
|---|---|---|
| 有简单理论矩 | 矩估计 | 矩是否存在、效率 |
| 完整概率模型可信 | MLE | 支持集、边界、模型错误 |
| 有可辩护先验信息 | Bayes | 先验敏感性、计算诊断 |
| 潜类别/缺失数据 | EM 或 MCMC | 可识别性、局部极值 |
| 只信部分矩条件 | GMM | 工具/矩有效性、权重矩阵 |
7. 诊断清单
- 参数空间和数据支持是否匹配?
- 似然是否有界、极值是否唯一?
- 优化是否对起点和尺度敏感?
- MLE 的正则条件是否成立?
- 先验在数据尺度上意味着什么?
- 后验计算是否收敛,有效样本量如何?
- EM 的观测似然是否单调,是否尝试多个起点?
课堂任务
对 (rate 参数化):
- 用一阶矩构造矩估计;
- 推导 MLE;
- 选择 Gamma 先验并写出后验;
- 比较后验均值、MAP 与 MLE;
- 说明若软件使用 scale 参数会怎样造成错误。
核心阅读
- Casella & Berger, Statistical Inference,估计方法章节。
- Gelman et al., Bayesian Data Analysis。
- Dempster, Laird & Rubin (1977), “Maximum Likelihood from Incomplete Data via the EM Algorithm”。