第六章:抽样分布

把统计量视为随机变量,连接样本均值、样本方差、卡方、t、F 与次序统计量。

第六章:抽样分布

案例: 从正态总体抽 12 个观测。未知总体方差时,为什么均值区间要用 t 分布而不是标准正态?

统计量在看到数据后是一个数字,在重复抽样前是随机变量。它的分布决定标准误、置信区间与检验临界值。

学习目标

你应能:

  1. 区分总体分布、样本分布与抽样分布;
  2. 推导样本均值的期望和方差;
  3. 陈述正态样本下的卡方、t 与 F 结果;
  4. 解释自由度与样本方差的 n1n-1
  5. 使用次序统计量描述极值与分位数。

1. 三种“分布”

名称随机对象例子
总体分布单个 XX个体身高 XFX\sim F
经验/样本分布已观察数据上的质量100 个身高的直方图
抽样分布统计量 T(X1,,Xn)T(X_1,\ldots,X_n)重复抽样中的 Xˉ\bar X

一次样本不能直接展示抽样分布;Bootstrap 用经验分布近似重复抽样机制,详见第十二章。

2. 样本均值

X1,,XnX_1,\ldots,X_n iid,E[Xi]=μE[X_i]=\muVar(Xi)=σ2\operatorname{Var}(X_i)=\sigma^2,则:

E[Xˉ]=μ,Var(Xˉ)=σ2n.E[\bar X]=\mu,\qquad \operatorname{Var}(\bar X)=\frac{\sigma^2}{n}.

标准误为 σ/n\sigma/\sqrt n。若观测相关:

Var(Xˉ)=1n2(iVar(Xi)+2i<jCov(Xi,Xj)),\operatorname{Var}(\bar X) =\frac1{n^2}\left( \sum_i\operatorname{Var}(X_i) +2\sum_{i<j}\operatorname{Cov}(X_i,X_j) \right),

不能仍机械使用 σ2/n\sigma^2/n

3. 正态样本的精确结果

XiiidN(μ,σ2)X_i\overset{iid}{\sim}N(\mu,\sigma^2),定义

S2=1n1i=1n(XiXˉ)2.S^2=\frac1{n-1}\sum_{i=1}^n(X_i-\bar X)^2.

则:

XˉN(μ,σ2n),\bar X\sim N\left(\mu,\frac{\sigma^2}{n}\right),(n1)S2σ2χn12,\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1},

Xˉ\bar XS2S^2 独立。因此

T=XˉμS/ntn1.T=\frac{\bar X-\mu}{S/\sqrt n}\sim t_{n-1}.

这里的独立性是正态分布的特殊性质,不对任意总体精确成立。

4. 自由度为什么是 n1n-1

残差满足:

i=1n(XiXˉ)=0.\sum_{i=1}^n(X_i-\bar X)=0.

知道前 n1n-1 个残差后,最后一个由约束决定,只有 n1n-1 个自由方向。除以 n1n-1 使 S2S^2σ2\sigma^2 无偏:

E[S2]=σ2.E[S^2]=\sigma^2.

无偏不代表 MSE 最小;分母选择取决于估计目标。

5. t 与 F 分布

  • t 分布是标准正态除以独立卡方平方根;
  • F 分布是两个独立、按自由度标准化的卡方比:F=U1/ν1U2/ν2.F=\frac{U_1/\nu_1}{U_2/\nu_2}.

它们连接均值、方差比、ANOVA 与回归检验。自由度越大,t 越接近标准正态;小样本时厚尾反映估计 σ\sigma 的额外不确定性。

6. 可运行案例:小样本中 z 临界值覆盖不足

n=12n=12 的正态样本,使用估计标准差后的枢轴量服从 t11t_{11}。代码比较错误使用 1.96 与正确使用约 2.201 的覆盖率。

Py

Python:t 抽样分布与区间覆盖

Idle

t 区间的精确覆盖依赖 iid 正态样本。偏态、小样本、聚类或选择性缺失下,应重新审查抽样机制,而不只是换一个临界值。

7. 次序统计量

排序后:

X(1)X(n).X_{(1)}\le\cdots\le X_{(n)}.

对连续 CDF FF,最大值满足:

P(X(n)x)=F(x)n.P(X_{(n)}\le x)=F(x)^n.

kk 个次序统计量连接样本分位数、容忍区间与保形预测中的校准秩。极值的分布随样本量显著移动,不能把样本最大值当总体上界。

8. 诊断清单

  • 独立抽样单位到底是个人、家庭、学校还是时间块?
  • 是否同分布,还是分层/加权抽样?
  • 统计量的精确分布还是渐近分布?
  • 方差是已知、估计还是由设计给定?
  • 正态假设用于数据本身,还是只用于均值近似?
  • 自由度是否与估计约束一致?

课堂任务

XiN(μ,σ2)X_i\sim N(\mu,\sigma^2)

  1. 推导 E[Xˉ]E[\bar X]Var(Xˉ)\operatorname{Var}(\bar X)
  2. 解释 S2S^2 为何除以 n1n-1
  3. 写出均值与方差的两个枢轴量;
  4. 将 iid 改为同班学生,说明方差公式需要怎样变化。

核心阅读

  • Casella & Berger, Statistical Inference,抽样分布章节。
  • Lehmann & Romano, Testing Statistical Hypotheses,分布理论部分。
  • Wasserman, All of Statistics,第 6–7 章。

上一章:渐近理论|下一章:区间估计

Copyright © 2026