第零章:概率统计的对象与学习方法
用一次质量抽检串起总体、样本、随机变量、统计量、参数和不确定性。
第零章:概率统计的对象与学习方法
贯穿问题: 抽检 100 件产品发现 7 件不合格。总体不合格率是 7%,还是 7% 只是一次随机结果?
概率论从模型出发问“样本可能怎样变化”;统计学从样本出发问“未知总体参数可能是多少”。两者不是两门互不相干的课,而是一条正向与反向推理链。
Rendering diagram…
学习目标
你应能:
- 区分总体、样本、参数、随机变量、统计量和估计值;
- 说明概率模型与统计推断的方向差异;
- 把一个现实问题写成“对象—机制—未知量—数据—结论”;
- 用模拟观察重复抽样变异;
- 判断公式需要哪些数学与数据条件。
1. 六个对象不要混
| 对象 | 质量抽检中的含义 | 是否随机 |
|---|---|---|
| 总体 | 当前生产流程可能产生的全部产品 | 研究框架 |
| 参数 | 总体不合格概率 | 固定但未知 |
| 样本 | 被抽到的 100 件产品状态 | 是 |
| 随机变量 | 第 件是否不合格 | 是 |
| 统计量 | 样本不合格比例 | 抽样前是随机变量 |
| 估计值 | 本次观察到的 0.07 | 数据出现后是数值 |
“ 是随机的”指重复抽样会得到不同值,不是说参数 每次都变。
2. 正向问题与反向问题
若假设每件产品独立且不合格概率为 ,则
概率论可以在 已知时计算 。统计学面对相反情况:已观察 ,要估计未知 ,并量化结论因抽样而产生的不确定性。
3. 可运行案例:同一流程会给出不同样本比例
假设真实不合格率为 8%。重复进行 5,000 次“抽 100 件”的实验,观察样本比例的分布。
Py
Python:重复抽样与标准误
三点必须分开:
- 样本比例的标准差描述重复抽样变异;
- 它不包含抽样框遗漏、测量错误或产品之间相关;
- 模拟接近理论结果是数值审计,不是二项模型正确性的证据。
4. 一套通用解题顺序
- 对象: 事件、随机变量、参数还是决策?
- 机制: 数据如何产生,独立同分布是否合理?
- 已知与未知: 哪些量给定,哪些量要推断?
- 目标: 概率、期望、估计、区间、检验还是预测?
- 方法: 哪个定理或统计量与目标匹配?
- 条件: 正态、独立、大样本、连续性或可交换性是否成立?
- 解释: 数值在原问题中意味着什么,又不能说明什么?
5. 预备知识如何补
| 知识 | 本课程中的用途 | 最低要求 |
|---|---|---|
| 集合与逻辑 | 事件运算、补集、条件 | 能读交并补与量词 |
| 微积分 | 密度、期望、变量变换、似然 | 能求导、积分与极限 |
| 线性代数 | 协方差、多元正态、二次型 | 向量矩阵运算 |
| 编程 | Monte Carlo、优化、重抽样 | 数组、函数、随机数 |
遇到推导困难时,先用离散小例子确认对象,再回到连续形式;不要用软件输出替代定义。
6. 符号速查
| 符号 | 含义 |
|---|---|
| 样本空间、事件族、概率测度 | |
| 随机变量 服从分布 | |
| 期望与方差 | |
| 参数与估计量 | |
| 原假设、备择假设、显著性水平 | |
| 依概率收敛 |
7. 学习方法
每章完成四种产出:
- 一段不使用公式的概念解释;
- 一个可以手算的最小例题;
- 一个改变参数后的独立模拟;
- 一张“适用条件—失败方式—诊断证据”表。
证明训练应标明每一步使用了定义、代数、独立性还是极限定理。计算训练应保存随机种子,并先写理论预期再运行。
课堂任务
把“某药物试验中 60 人有 18 人改善”写成:
- 样本空间和随机变量;
- 一个可能参数;
- 一个统计量;
- 一个概率论问题;
- 一个统计推断问题;
- 两个可能破坏二项模型的现实机制。
核心阅读
- Ross, A First Course in Probability。
- Casella & Berger, Statistical Inference,第 1 章。
- Wasserman, All of Statistics,第 1–2 章。
下一章:概率论基础。