第七章:区间估计

从枢轴量、t 区间和 Wilson 区间进入渐近、似然与 Bootstrap 置信区间,并检查重复抽样覆盖率。

第七章:区间估计

点估计给出一个数,区间估计进一步说明这个数有多不确定。一个合格的置信区间必须回答:

  1. 区间针对哪个参数?
  2. 覆盖概率来自什么重复抽样机制?
  3. 公式是有限样本精确结果,还是大样本近似?
  4. 方法依赖正态、独立同分布、方差齐性或其他条件吗?
  5. 样本量很小、参数接近边界或分布偏斜时会怎样?

学习成果

完成本章后,你应能够:

  • 正确解释置信水平与覆盖率,而不把参数误说成随机变量;
  • 从枢轴量推导正态均值、方差和均值差的精确区间;
  • 区分 z 区间、t 区间、Wald 区间和 Wilson 区间;
  • 使用渐近正态性和 Delta 方法构造一般参数区间;
  • 解释似然比区间、Bootstrap 区间和贝叶斯可信区间的差异;
  • 用 Python 与 R 做 Monte Carlo 覆盖率实验;
  • 根据参数边界、偏斜、样本量和数据依赖结构选择方法。

1. 置信区间究竟保证什么

设数据 X=(X1,,Xn)X=(X_1,\ldots,X_n) 来自参数为 θ\theta 的模型。区间

C(X)=[L(X),U(X)]C(X)=[L(X),U(X)]

是样本的函数,因此重复抽样时会变化。若

Pθ{θC(X)}=1α,P_\theta\{\theta\in C(X)\}=1-\alpha,

则称它是覆盖率为 1α1-\alpha 的置信区间。

频率学派的正确解释是:

若按同一抽样设计无限次重复收集数据并构造区间,长期约有 100(1α)%100(1-\alpha)\% 的区间覆盖固定真参数。

观测到具体区间后,它要么覆盖真参数,要么没有覆盖。不能在不引入贝叶斯后验的情况下说“这个固定参数有 95% 概率落在已经算出的区间内”。

95% 置信区间描述构造程序的长期覆盖性质。它不表示模型有 95% 概率正确,也不表示重复研究有 95% 概率显著。

2. 枢轴量:精确区间的核心

枢轴量是同时依赖样本和未知参数,但其分布不依赖未知参数的统计量。若

P{aQ(X,θ)b}=1α,P\{a\le Q(X,\theta)\le b\}=1-\alpha,

并能把不等式反解为 θ\theta 的范围,就得到置信区间。

2.1 正态均值、方差已知

XiiidN(μ,σ2)X_i\overset{iid}{\sim}N(\mu,\sigma^2)σ\sigma 已知,则

Z=Xˉμσ/nN(0,1).Z=\frac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1).

因此

μ[Xˉz1α/2σn,Xˉ+z1α/2σn].\mu\in \left[ \bar X-z_{1-\alpha/2}\frac{\sigma}{\sqrt n}, \bar X+z_{1-\alpha/2}\frac{\sigma}{\sqrt n} \right].

区间半宽由临界值、总体波动和样本量共同决定。样本量增加四倍,标准误和区间半宽约减半。

2.2 正态均值、方差未知

用样本标准差 SS 替代未知 σ\sigma 后,

T=XˉμS/ntn1.T=\frac{\bar X-\mu}{S/\sqrt n}\sim t_{n-1}.

精确区间为:

μ[Xˉt1α/2,n1Sn,Xˉ+t1α/2,n1Sn].\mu\in \left[ \bar X-t_{1-\alpha/2,n-1}\frac{S}{\sqrt n}, \bar X+t_{1-\alpha/2,n-1}\frac{S}{\sqrt n} \right].

t 临界值比 1.96 大,是因为估计 σ\sigma 引入额外不确定性。

交互例子:一次小样本均值区间

Py

Python:手工构造 t 区间

Idle
R

R:手工构造 t 区间

Idle

把置信水平改为 0.90 或 0.99,观察区间宽度。提高置信水平意味着要求构造程序更常覆盖真值,因此必须接受更宽区间。

3. 正态总体方差的精确区间

XiiidN(μ,σ2)X_i\overset{iid}{\sim}N(\mu,\sigma^2),则

(n1)S2σ2χn12.\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}.

把卡方分位数反解后:

[(n1)S2χ1α/2,n12,(n1)S2χα/2,n12]\left[ \frac{(n-1)S^2}{\chi^2_{1-\alpha/2,n-1}}, \frac{(n-1)S^2}{\chi^2_{\alpha/2,n-1}} \right]

σ2\sigma^2 的置信区间。由于卡方分布不对称,方差区间一般也不以 S2S^2 为中心对称。

若总体不是正态,以上有限样本精确分布通常不成立。样本方差对厚尾和极端值尤其敏感。

4. 两总体参数的区间

4.1 独立样本均值差

两个总体方差不必相等时,Welch 区间为:

(XˉYˉ)±t1α/2,νSX2nX+SY2nY,(\bar X-\bar Y) \pm t_{1-\alpha/2,\nu} \sqrt{\frac{S_X^2}{n_X}+\frac{S_Y^2}{n_Y}},

其中自由度 ν\nu 用 Welch–Satterthwaite 近似。除非有充分证据支持方差相等,实践中通常优先使用 Welch 方法。

4.2 配对样本

对同一对象前后测量时,应先构造差值 Di=XiYiD_i=X_i-Y_i,再对 E[D]E[D] 构造单样本 t 区间。配对设计利用个体内相关性,不能把两列数据当独立样本。

4.3 两个比例之差

大样本 Wald 区间为:

(p^1p^2)±z1α/2p^1(1p^1)n1+p^2(1p^2)n2.(\hat p_1-\hat p_2) \pm z_{1-\alpha/2} \sqrt{\frac{\hat p_1(1-\hat p_1)}{n_1} +\frac{\hat p_2(1-\hat p_2)}{n_2}}.

比例接近 0 或 1、样本量较小时,Wald 近似可能很差,应考虑 score、Wilson、精确或似然方法。

5. 比例参数:为什么 Wald 区间常失灵

单一比例的 Wald 区间为:

p^±z1α/2p^(1p^)n.\hat p\pm z_{1-\alpha/2} \sqrt{\frac{\hat p(1-\hat p)}{n}}.

它可能越过 [0,1][0,1],且在小样本和稀有事件下覆盖率明显低于标称水平。

Wilson 区间来自 score 检验反演。令 z=z1α/2z=z_{1-\alpha/2},其中心和半宽为:

center=p^+z2/(2n)1+z2/n,\text{center} =\frac{\hat p+z^2/(2n)}{1+z^2/n},half-width=z1+z2/np^(1p^)n+z24n2.\text{half-width} =\frac{z}{1+z^2/n} \sqrt{\frac{\hat p(1-\hat p)}{n}+\frac{z^2}{4n^2}}.

Wilson 区间自动保持在合理范围附近,有限样本覆盖通常更好。

覆盖率实验

下面设 n=30n=30、真比例 p=0.05p=0.05。这是 Wald 区间容易失败的场景。

Py

Python:Wald 与 Wilson 覆盖率

Idle
R

R:Wald 与 Wilson 覆盖率

Idle

pp 改为 0.5,或把 nn 改为 300,观察大样本近似何时改善。

6. 渐近正态与 Delta 方法

n(θ^θ)dN(0,V),\sqrt n(\hat\theta-\theta) \xrightarrow{d}N(0,V),

且有一致标准误估计 SE^(θ^)\widehat{SE}(\hat\theta),Wald 区间为:

θ^±z1α/2SE^(θ^).\hat\theta \pm z_{1-\alpha/2}\widehat{SE}(\hat\theta).

对变换参数 g(θ)g(\theta),Delta 方法给出:

n{g(θ^)g(θ)}dN(0,[g(θ)]2V).\sqrt n\{g(\hat\theta)-g(\theta)\} \xrightarrow{d} N\left(0,[g'(\theta)]^2V\right).

例如估计正参数 θ>0\theta>0 时,可先对 logθ\log\theta 构造对称区间,再指数变换回原尺度,保证端点为正。与直接在原尺度使用 Wald 区间相比,这常更符合参数边界和分布偏斜。

7. 似然区间

(θ)\ell(\theta) 是对数似然,似然比区间可写为:

2{(θ^)(θ)}χ1,1α2.2\{\ell(\hat\theta)-\ell(\theta)\} \le \chi^2_{1,1-\alpha}.

它保留似然曲面的不对称性,在参数接近边界或似然明显偏斜时可能优于对称 Wald 区间。代价是需要对候选参数重复计算或优化似然。

Score、Wald 和 likelihood-ratio 三类区间在正则大样本下渐近等价,但有限样本表现可能不同。

8. Bootstrap 区间

Bootstrap 通过重抽样近似估计量的抽样分布。常见区间包括:

方法构造主要特点
正态近似θ^±zSE^boot\hat\theta\pm z\,\widehat{SE}_{boot}简单,但忽略偏斜
百分位Bootstrap 分布的分位数直观、变换不变
Basic2θ^q1α/2,2θ^qα/22\hat\theta-q_{1-\alpha/2},\,2\hat\theta-q_{\alpha/2}反射 Bootstrap 偏差
BCa校正偏差与加速度精度更高,计算更复杂
Studentized对标准化统计量重抽样理论性质好,常需嵌套计算

偏斜分布中位数的 Bootstrap 区间

中位数的有限样本标准误公式不如均值直接。下面对指数分布样本使用百分位 Bootstrap。

Py

Python:中位数的 Bootstrap 区间

Idle
R

R:中位数的 Bootstrap 区间

Idle

Bootstrap 仍要求重抽样方案模拟真实抽样机制。时间序列应保留时间依赖,分层抽样应按设计重抽样,聚类数据通常按群组重抽样。

9. 覆盖率、长度与样本量的权衡

区间评价至少包含三个维度:

  • 覆盖率:实际覆盖是否接近标称水平?
  • 平均长度:在覆盖可靠时是否足够精确?
  • 稳定性:端点是否受极端值、边界或数值优化强烈影响?

提高置信水平会增加覆盖率但加宽区间;增加样本量通常缩短区间。若希望均值区间半宽不超过 EE,方差已知的粗略样本量为:

n(z1α/2σE)2.n\ge \left(\frac{z_{1-\alpha/2}\sigma}{E}\right)^2.

比例估计在最保守的 p=0.5p=0.5 下:

nz1α/224E2.n\ge \frac{z_{1-\alpha/2}^2}{4E^2}.

真实研究还要考虑失访、设计效应、聚类、有限总体修正和多重结果。

10. 与贝叶斯可信区间的区别

贝叶斯可信区间基于后验分布:

P(θCX)=1α.P(\theta\in C\mid X)=1-\alpha.

这里参数在后验中是随机量,因此可以给出条件于数据和先验的概率陈述。频率置信区间评价重复抽样覆盖;贝叶斯可信区间评价后验概率。两者在大样本和弱先验下可能接近,但概念与保证不同。

常见错误

  1. 把 95% 置信区间解释成“真参数有 95% 概率在里面”;
  2. 只报告区间是否包含 0,不解释单位和经济或科学意义;
  3. 对小样本比例机械使用 Wald 区间;
  4. 忽略配对、聚类、时间相关或复杂抽样设计;
  5. 把非显著结果解释为“证明没有效应”;
  6. 只追求窄区间,却不检查覆盖率和模型设定;
  7. Bootstrap 时按观测重抽样,却破坏了原数据的依赖结构。

自测题

  1. 为什么观测到一个 95% 置信区间后,频率学派不说参数有 95% 概率在其中?
  2. 正态均值在方差未知时为什么使用 t 而不是 z?
  3. 稀有事件比例为什么常优先使用 Wilson 而不是 Wald?
  4. 区间不包含 0 是否足以说明结果重要?
  5. 时间序列均值做 Bootstrap 时,为什么不能随意逐点重抽样?

答案指引

  1. 参数被视为固定,随机的是由样本决定的区间;95% 是构造程序的长期覆盖率。
  2. SS 估计 σ\sigma 带来额外随机性,标准化统计量服从 tn1t_{n-1}
  3. Wald 正态近似在参数边界和小样本下失真,Wilson 由 score 反演而来,覆盖通常更稳定。
  4. 不足。还要解释效应大小、单位、区间宽度、研究设计、成本和实际意义。
  5. 逐点重抽样破坏自相关结构,使 Bootstrap 分布不能模拟真实抽样机制;应考虑 block bootstrap 等方法。

进一步阅读

  • Casella and Berger, Statistical Inference:枢轴量与区间估计理论;
  • Wasserman, All of Statistics:渐近区间与现代统计概览;
  • Brown, Cai and DasGupta (2001):二项比例区间的系统比较;
  • Efron and Tibshirani, An Introduction to the Bootstrap
  • Davison and Hinkley, Bootstrap Methods and Their Application

上一章:抽样分布 · 下一章:点估计理论

Copyright © 2026