第八章:点估计理论

用偏差、方差、MSE、一致性、充分性、效率与稳健性评价估计量。

第八章:点估计理论

案例: 正态数据中样本均值最有效,但 5% 极端污染就可能使截尾均值更可靠。“最佳估计量”必须先说明模型和损失。

点估计理论不是给估计量排一个永久名次,而是在指定数据生成模型、参数空间和损失函数后比较风险。

学习目标

你应能:

  1. 区分估计量与估计值;
  2. 计算偏差、方差和均方误差;
  3. 解释一致性、渐近正态与效率;
  4. 使用充分性与 Rao–Blackwell 思想改进估计;
  5. 在模型污染下评价稳健性。

1. 估计量的有限样本性质

估计量 θ^=T(X1,,Xn)\widehat\theta=T(X_1,\ldots,X_n) 是随机变量。

偏差:

Biasθ(θ^)=Eθ[θ^]θ.\operatorname{Bias}_\theta(\widehat\theta) =E_\theta[\widehat\theta]-\theta.

均方误差:

MSEθ(θ^)=Eθ[(θ^θ)2]=Varθ(θ^)+Biasθ(θ^)2.\operatorname{MSE}_\theta(\widehat\theta) =E_\theta[(\widehat\theta-\theta)^2] =\operatorname{Var}_\theta(\widehat\theta) +\operatorname{Bias}_\theta(\widehat\theta)^2.

无偏不保证 MSE 最小。轻微有偏但方差大幅降低的估计量可能更适合预测或决策。

2. 一致性与渐近正态

一致性:

θ^npθ.\widehat\theta_n\xrightarrow{p}\theta.

它只描述 nn\to\infty,不说明当前样本误差小。常见的渐近正态形式:

n(θ^nθ)dN(0,Vθ).\sqrt n(\widehat\theta_n-\theta) \xrightarrow{d}N(0,V_\theta).

这给出标准误与区间近似,但仍需检查有限样本偏差、边界、弱识别和维度增长。

3. 充分性:压缩而不丢参数信息

统计量 T(X)T(X)θ\theta 充分,如果给定 TT 后样本的条件分布不再依赖 θ\theta

因子分解定理:

fθ(x)=gθ(T(x))h(x).f_\theta(x)=g_\theta(T(x))h(x).

TT 充分,Rao–Blackwell 定理说明对任意平方可积估计量 UU

E[UT]E[U\mid T]

在保持期望的同时,方差不大于 UU。这把“利用全部信息”变成可证明的改进。

4. Cramér–Rao 下界

在正则条件下,无偏估计量满足:

Varθ(θ^)1In(θ),\operatorname{Var}_\theta(\widehat\theta) \ge\frac{1}{I_n(\theta)},

其中 Fisher 信息

In(θ)=Eθ[(θlogL(θ;X))2].I_n(\theta) =E_\theta\left[ \left(\frac{\partial}{\partial\theta}\log L(\theta;X)\right)^2 \right].

达到下界称为有效。边界参数、支持集依赖参数或非正则模型可能不满足经典条件;不能只看公式形式。

5. 稳健性:模型近似错误时会怎样

常用概念:

  • 影响函数:单个微小污染对估计的局部影响;
  • breakdown point:多大比例污染可使估计任意失真;
  • 截尾/Huber 损失:限制极端观测影响;
  • sandwich 方差:允许部分方差模型错误。

稳健通常以效率为代价;应在理想模型性能与合理污染风险之间权衡。

6. 可运行案例:均值与 10% 截尾均值

代码比较两种世界:纯正态与 5% 对称极端污染。目标中心均为 0。

Py

Python:效率与稳健性的权衡

Idle

在纯正态模型中,样本均值方差最小;污染下,少数极端值大幅抬高其 MSE。没有脱离模型与损失的“永远最佳”估计量。

7. 决策论视角

给定损失 L(θ,a)L(\theta,a),估计规则 δ(X)\delta(X) 的风险:

R(θ,δ)=Eθ[L(θ,δ(X))].R(\theta,\delta) =E_\theta[L(\theta,\delta(X))].
  • 平方损失对应均值与 MSE;
  • 绝对损失对应中位数;
  • 非对称损失适合漏报和误报成本不同的决策。

Bayes、minimax 与可容许性都建立在风险比较上,不能仅凭无偏性决定。

8. 诊断清单

  • 目标参数与损失函数是什么?
  • 比较的是有限样本还是渐近性质?
  • 偏差、方差与 MSE 是否同时报告?
  • 正则条件与参数边界是否满足?
  • 充分统计量是否存在?
  • 离群点是数据错误、混合人群还是真实重尾?
  • 稳健方法改变了哪个 estimand?

课堂任务

XiBernoulli(p)X_i\sim Bernoulli(p)

  1. 证明 Xˉ\bar X 无偏并计算 MSE;
  2. 说明 iXi\sum_iX_ipp 充分;
  3. 推导 Fisher 信息与 CRLB;
  4. 比较 Xˉ\bar X(Xi+1)/(n+2)(\sum X_i+1)/(n+2) 的偏差—方差。

核心阅读

  • Lehmann & Casella, Theory of Point Estimation
  • Casella & Berger, Statistical Inference,点估计理论章节。
  • Huber & Ronchetti, Robust Statistics

上一章:区间估计|下一章:点估计方法

Copyright © 2026