第七章:区间估计
第七章:区间估计
点估计给出一个数,区间估计进一步说明这个数有多不确定。一个合格的置信区间必须回答:
- 区间针对哪个参数?
- 覆盖概率来自什么重复抽样机制?
- 公式是有限样本精确结果,还是大样本近似?
- 方法依赖正态、独立同分布、方差齐性或其他条件吗?
- 样本量很小、参数接近边界或分布偏斜时会怎样?
学习成果
完成本章后,你应能够:
- 正确解释置信水平与覆盖率,而不把参数误说成随机变量;
- 从枢轴量推导正态均值、方差和均值差的精确区间;
- 区分 z 区间、t 区间、Wald 区间和 Wilson 区间;
- 使用渐近正态性和 Delta 方法构造一般参数区间;
- 解释似然比区间、Bootstrap 区间和贝叶斯可信区间的差异;
- 用 Python 与 R 做 Monte Carlo 覆盖率实验;
- 根据参数边界、偏斜、样本量和数据依赖结构选择方法。
1. 置信区间究竟保证什么
设数据 来自参数为 的模型。区间
是样本的函数,因此重复抽样时会变化。若
则称它是覆盖率为 的置信区间。
频率学派的正确解释是:
若按同一抽样设计无限次重复收集数据并构造区间,长期约有 的区间覆盖固定真参数。
观测到具体区间后,它要么覆盖真参数,要么没有覆盖。不能在不引入贝叶斯后验的情况下说“这个固定参数有 95% 概率落在已经算出的区间内”。
2. 枢轴量:精确区间的核心
枢轴量是同时依赖样本和未知参数,但其分布不依赖未知参数的统计量。若
并能把不等式反解为 的范围,就得到置信区间。
2.1 正态均值、方差已知
若 且 已知,则
因此
区间半宽由临界值、总体波动和样本量共同决定。样本量增加四倍,标准误和区间半宽约减半。
2.2 正态均值、方差未知
用样本标准差 替代未知 后,
精确区间为:
t 临界值比 1.96 大,是因为估计 引入额外不确定性。
交互例子:一次小样本均值区间
Python:手工构造 t 区间
R:手工构造 t 区间
把置信水平改为 0.90 或 0.99,观察区间宽度。提高置信水平意味着要求构造程序更常覆盖真值,因此必须接受更宽区间。
3. 正态总体方差的精确区间
若 ,则
把卡方分位数反解后:
是 的置信区间。由于卡方分布不对称,方差区间一般也不以 为中心对称。
若总体不是正态,以上有限样本精确分布通常不成立。样本方差对厚尾和极端值尤其敏感。
4. 两总体参数的区间
4.1 独立样本均值差
两个总体方差不必相等时,Welch 区间为:
其中自由度 用 Welch–Satterthwaite 近似。除非有充分证据支持方差相等,实践中通常优先使用 Welch 方法。
4.2 配对样本
对同一对象前后测量时,应先构造差值 ,再对 构造单样本 t 区间。配对设计利用个体内相关性,不能把两列数据当独立样本。
4.3 两个比例之差
大样本 Wald 区间为:
比例接近 0 或 1、样本量较小时,Wald 近似可能很差,应考虑 score、Wilson、精确或似然方法。
5. 比例参数:为什么 Wald 区间常失灵
单一比例的 Wald 区间为:
它可能越过 ,且在小样本和稀有事件下覆盖率明显低于标称水平。
Wilson 区间来自 score 检验反演。令 ,其中心和半宽为:
Wilson 区间自动保持在合理范围附近,有限样本覆盖通常更好。
覆盖率实验
下面设 、真比例 。这是 Wald 区间容易失败的场景。
Python:Wald 与 Wilson 覆盖率
R:Wald 与 Wilson 覆盖率
把 改为 0.5,或把 改为 300,观察大样本近似何时改善。
6. 渐近正态与 Delta 方法
若
且有一致标准误估计 ,Wald 区间为:
对变换参数 ,Delta 方法给出:
例如估计正参数 时,可先对 构造对称区间,再指数变换回原尺度,保证端点为正。与直接在原尺度使用 Wald 区间相比,这常更符合参数边界和分布偏斜。
7. 似然区间
若 是对数似然,似然比区间可写为:
它保留似然曲面的不对称性,在参数接近边界或似然明显偏斜时可能优于对称 Wald 区间。代价是需要对候选参数重复计算或优化似然。
Score、Wald 和 likelihood-ratio 三类区间在正则大样本下渐近等价,但有限样本表现可能不同。
8. Bootstrap 区间
Bootstrap 通过重抽样近似估计量的抽样分布。常见区间包括:
| 方法 | 构造 | 主要特点 |
|---|---|---|
| 正态近似 | 简单,但忽略偏斜 | |
| 百分位 | Bootstrap 分布的分位数 | 直观、变换不变 |
| Basic | 反射 Bootstrap 偏差 | |
| BCa | 校正偏差与加速度 | 精度更高,计算更复杂 |
| Studentized | 对标准化统计量重抽样 | 理论性质好,常需嵌套计算 |
偏斜分布中位数的 Bootstrap 区间
中位数的有限样本标准误公式不如均值直接。下面对指数分布样本使用百分位 Bootstrap。
Python:中位数的 Bootstrap 区间
R:中位数的 Bootstrap 区间
Bootstrap 仍要求重抽样方案模拟真实抽样机制。时间序列应保留时间依赖,分层抽样应按设计重抽样,聚类数据通常按群组重抽样。
9. 覆盖率、长度与样本量的权衡
区间评价至少包含三个维度:
- 覆盖率:实际覆盖是否接近标称水平?
- 平均长度:在覆盖可靠时是否足够精确?
- 稳定性:端点是否受极端值、边界或数值优化强烈影响?
提高置信水平会增加覆盖率但加宽区间;增加样本量通常缩短区间。若希望均值区间半宽不超过 ,方差已知的粗略样本量为:
比例估计在最保守的 下:
真实研究还要考虑失访、设计效应、聚类、有限总体修正和多重结果。
10. 与贝叶斯可信区间的区别
贝叶斯可信区间基于后验分布:
这里参数在后验中是随机量,因此可以给出条件于数据和先验的概率陈述。频率置信区间评价重复抽样覆盖;贝叶斯可信区间评价后验概率。两者在大样本和弱先验下可能接近,但概念与保证不同。
常见错误
- 把 95% 置信区间解释成“真参数有 95% 概率在里面”;
- 只报告区间是否包含 0,不解释单位和经济或科学意义;
- 对小样本比例机械使用 Wald 区间;
- 忽略配对、聚类、时间相关或复杂抽样设计;
- 把非显著结果解释为“证明没有效应”;
- 只追求窄区间,却不检查覆盖率和模型设定;
- Bootstrap 时按观测重抽样,却破坏了原数据的依赖结构。
自测题
- 为什么观测到一个 95% 置信区间后,频率学派不说参数有 95% 概率在其中?
- 正态均值在方差未知时为什么使用 t 而不是 z?
- 稀有事件比例为什么常优先使用 Wilson 而不是 Wald?
- 区间不包含 0 是否足以说明结果重要?
- 时间序列均值做 Bootstrap 时,为什么不能随意逐点重抽样?
答案指引
- 参数被视为固定,随机的是由样本决定的区间;95% 是构造程序的长期覆盖率。
- 用 估计 带来额外随机性,标准化统计量服从 。
- Wald 正态近似在参数边界和小样本下失真,Wilson 由 score 反演而来,覆盖通常更稳定。
- 不足。还要解释效应大小、单位、区间宽度、研究设计、成本和实际意义。
- 逐点重抽样破坏自相关结构,使 Bootstrap 分布不能模拟真实抽样机制;应考虑 block bootstrap 等方法。
进一步阅读
- Casella and Berger, Statistical Inference:枢轴量与区间估计理论;
- Wasserman, All of Statistics:渐近区间与现代统计概览;
- Brown, Cai and DasGupta (2001):二项比例区间的系统比较;
- Efron and Tibshirani, An Introduction to the Bootstrap;
- Davison and Hinkley, Bootstrap Methods and Their Application。