第九章:点估计方法

比较矩估计、极大似然、贝叶斯估计和 EM 算法的构造逻辑、计算与边界。

第九章:点估计方法

案例: 只观察 5 天故障数时,样本均值波动很大。应完全相信数据,还是让历史信息产生适度收缩?

估计方法规定如何从似然、矩条件或先验信息构造估计量。不同方法可能在大样本下接近,却在小样本、边界或模型错误时明显不同。

学习目标

你应能:

  1. 使用矩估计和极大似然估计参数;
  2. 写出 score、observed information 与 Fisher 信息;
  3. 区分 MLE、MAP 与后验均值;
  4. 解释贝叶斯估计对损失函数的依赖;
  5. 用 EM 的 E/M 两步处理潜变量。

1. 矩估计

若理论矩满足

Eθ[gj(X)]=mj(θ),j=1,,k,E_\theta[g_j(X)]=m_j(\theta),\qquad j=1,\ldots,k,

用样本矩替代理论矩并解方程:

1ni=1ngj(Xi)=mj(θ).\frac1n\sum_{i=1}^ng_j(X_i)=m_j(\theta).

优点是直观、常有闭式;缺点是矩选择影响效率,重尾下高阶矩不稳定,方程也可能多解或无解。

2. 极大似然

L(θ;x)=i=1nfθ(xi),(θ)=i=1nlogfθ(xi).L(\theta;x)=\prod_{i=1}^nf_\theta(x_i), \qquad \ell(\theta)=\sum_{i=1}^n\log f_\theta(x_i).

MLE:

θ^MLE=argmaxθΘ(θ).\widehat\theta_{MLE}=\arg\max_{\theta\in\Theta}\ell(\theta).

典型步骤:

  1. 明确支持集和参数空间;
  2. 写对数似然;
  3. 解 score U(θ)=/θ=0U(\theta)=\partial\ell/\partial\theta=0
  4. 检查边界、二阶条件和全局最大值;
  5. 用信息矩阵或 profile likelihood 量化不确定性。

MLE 具有变换不变性,但有限样本可有偏;混合模型、分离 Logit 和方差边界会出现非正则问题。

3. 贝叶斯估计

π(θx)L(θ;x)π(θ).\pi(\theta\mid x) \propto L(\theta;x)\pi(\theta).

点估计取决于损失:

损失Bayes 估计
平方损失后验均值
绝对损失后验中位数
0–1 类损失后验众数 / MAP

MAP 不是“贝叶斯版 MLE”的全部;完整贝叶斯推断以整个后验分布表达不确定性。

4. 可运行案例:泊松率的 MLE 与 Gamma–Poisson 收缩

XiPoisson(λ)X_i\sim Poisson(\lambda),矩估计与 MLE 都是 Xˉ\bar X。设先验 λGamma(a,b)\lambda\sim Gamma(a,b)bb 为 rate),后验均值为:

E[λX]=a+iXib+n.E[\lambda\mid X] =\frac{a+\sum_iX_i}{b+n}.

代码比较 n=5n=5n=50n=50 的重复抽样 MSE。先验均值 a/b=2a/b=2,真实值为 2.5。

Py

Python:MLE、矩估计与贝叶斯收缩

Idle

收缩不是免费改进。先验若远离真实参数,会引入更大偏差;应做先验预测检查和敏感性分析。

5. EM:缺失或潜变量下的似然优化

设完整数据包含未观察 ZZ。第 tt 次迭代:

E 步

Q(θθ(t))=EZX,θ(t)[logLc(θ;X,Z)].Q(\theta\mid\theta^{(t)}) =E_{Z\mid X,\theta^{(t)}}[\log L_c(\theta;X,Z)].

M 步

θ(t+1)=argmaxθQ(θθ(t)).\theta^{(t+1)} =\arg\max_\theta Q(\theta\mid\theta^{(t)}).

EM 保证观测数据似然不下降,但:

  • 可能收敛到局部极值或鞍点;
  • 收敛可很慢;
  • 混合成分标签不可识别;
  • 标准误不能从最后一次 M 步的普通 Hessian 直接猜测。

应使用多个起点、监控观测对数似然并检查退化解。

6. 方法怎样选择

场景起点关键审查
有简单理论矩矩估计矩是否存在、效率
完整概率模型可信MLE支持集、边界、模型错误
有可辩护先验信息Bayes先验敏感性、计算诊断
潜类别/缺失数据EM 或 MCMC可识别性、局部极值
只信部分矩条件GMM工具/矩有效性、权重矩阵

7. 诊断清单

  • 参数空间和数据支持是否匹配?
  • 似然是否有界、极值是否唯一?
  • 优化是否对起点和尺度敏感?
  • MLE 的正则条件是否成立?
  • 先验在数据尺度上意味着什么?
  • 后验计算是否收敛,有效样本量如何?
  • EM 的观测似然是否单调,是否尝试多个起点?

课堂任务

XiExponential(λ)X_i\sim Exponential(\lambda)(rate 参数化):

  1. 用一阶矩构造矩估计;
  2. 推导 MLE;
  3. 选择 Gamma 先验并写出后验;
  4. 比较后验均值、MAP 与 MLE;
  5. 说明若软件使用 scale 参数会怎样造成错误。

核心阅读

上一章:点估计理论|下一章:假设检验原理

Copyright © 2026