第六章:抽样分布
把统计量视为随机变量,连接样本均值、样本方差、卡方、t、F 与次序统计量。
第六章:抽样分布
案例: 从正态总体抽 12 个观测。未知总体方差时,为什么均值区间要用 t 分布而不是标准正态?
统计量在看到数据后是一个数字,在重复抽样前是随机变量。它的分布决定标准误、置信区间与检验临界值。
学习目标
你应能:
- 区分总体分布、样本分布与抽样分布;
- 推导样本均值的期望和方差;
- 陈述正态样本下的卡方、t 与 F 结果;
- 解释自由度与样本方差的 ;
- 使用次序统计量描述极值与分位数。
1. 三种“分布”
| 名称 | 随机对象 | 例子 |
|---|---|---|
| 总体分布 | 单个 | 个体身高 |
| 经验/样本分布 | 已观察数据上的质量 | 100 个身高的直方图 |
| 抽样分布 | 统计量 | 重复抽样中的 |
一次样本不能直接展示抽样分布;Bootstrap 用经验分布近似重复抽样机制,详见第十二章。
2. 样本均值
若 iid,、,则:
标准误为 。若观测相关:
不能仍机械使用 。
3. 正态样本的精确结果
若 ,定义
则:
且 与 独立。因此
这里的独立性是正态分布的特殊性质,不对任意总体精确成立。
4. 自由度为什么是
残差满足:
知道前 个残差后,最后一个由约束决定,只有 个自由方向。除以 使 对 无偏:
无偏不代表 MSE 最小;分母选择取决于估计目标。
5. t 与 F 分布
- t 分布是标准正态除以独立卡方平方根;
- F 分布是两个独立、按自由度标准化的卡方比:
它们连接均值、方差比、ANOVA 与回归检验。自由度越大,t 越接近标准正态;小样本时厚尾反映估计 的额外不确定性。
6. 可运行案例:小样本中 z 临界值覆盖不足
对 的正态样本,使用估计标准差后的枢轴量服从 。代码比较错误使用 1.96 与正确使用约 2.201 的覆盖率。
Py
Python:t 抽样分布与区间覆盖
t 区间的精确覆盖依赖 iid 正态样本。偏态、小样本、聚类或选择性缺失下,应重新审查抽样机制,而不只是换一个临界值。
7. 次序统计量
排序后:
对连续 CDF ,最大值满足:
第 个次序统计量连接样本分位数、容忍区间与保形预测中的校准秩。极值的分布随样本量显著移动,不能把样本最大值当总体上界。
8. 诊断清单
- 独立抽样单位到底是个人、家庭、学校还是时间块?
- 是否同分布,还是分层/加权抽样?
- 统计量的精确分布还是渐近分布?
- 方差是已知、估计还是由设计给定?
- 正态假设用于数据本身,还是只用于均值近似?
- 自由度是否与估计约束一致?
课堂任务
对 :
- 推导 和 ;
- 解释 为何除以 ;
- 写出均值与方差的两个枢轴量;
- 将 iid 改为同班学生,说明方差公式需要怎样变化。
核心阅读
- Casella & Berger, Statistical Inference,抽样分布章节。
- Lehmann & Romano, Testing Statistical Hypotheses,分布理论部分。
- Wasserman, All of Statistics,第 6–7 章。