第四章:常见分布族与建模机制

按重复次数、事件率、等待时间和比例机制选择常见离散与连续分布。

第四章:常见分布族与建模机制

案例: 每天收到 2 次系统故障,应该使用二项分布、泊松分布,还是指数分布?

分布名称不是数据形状标签。应先解释随机机制,再检查该机制推出的支持集、均值—方差关系和尾部是否合理。

学习目标

你应能:

  1. 依据数据生成机制选择常见分布;
  2. 解释参数如何控制均值、方差与形状;
  3. 连接伯努利、二项、几何、泊松与指数分布;
  4. 使用正态、伽马与贝塔分布建模;
  5. 判断近似何时有效、何时失败。

1. 离散分布:计数什么

分布随机对象关键参数典型条件
Bernoulli(p)(p)一次成败pp两种结果
Binomial(n,p)(n,p)固定 nn 次中的成功数n,pn,p独立、同一 pp
Geometric(p)(p)首次成功前的等待次数pp独立重复、无记忆
Negative binomial达到若干成功前的次数r,pr,p重复 Bernoulli 或过度离散计数
Poisson(λ)(\lambda)固定暴露期内事件数λ\lambda小区间事件稀少且近似独立

参数化必须说明。例如几何分布可以从 0 或 1 开始;负二项也有多种定义。

2. 连续分布:范围和机制

分布支持集机制直觉
Uniform(a,b)(a,b)[a,b][a,b]区间内位置等密度
Exponential(λ)(\lambda)[0,)[0,\infty)泊松过程中的等待时间
Gamma(k,θ)(k,\theta)[0,)[0,\infty)多段等待时间之和
Normal(μ,σ2)(\mu,\sigma^2)R\mathbb R多个小效应相加的近似
Beta(a,b)(a,b)[0,1][0,1]比例、概率或先验分布

正态分布允许负值,因此不适合直接描述严格非负且强右偏的小额损失。对数变换、伽马或对数正态可能更符合机制。

3. 泊松过程连接计数与等待

若事件按速率 λ\lambda 的齐次泊松过程发生:

  • 长度 tt 区间的事件数 N(t)Poisson(λt)N(t)\sim Poisson(\lambda t)
  • 相邻事件等待时间 TExponential(λ)T\sim Exponential(\lambda)
  • 指数分布具有无记忆性:P(T>s+tT>s)=P(T>t).P(T>s+t\mid T>s)=P(T>t).

真实系统若有高峰时段、自激效应或维修后抑制,齐次独立增量假设会失败。

4. 二项到泊松的稀有事件近似

nn 大、pp 小且 λ=np\lambda=np 适中时:

Binomial(n,p)Poisson(λ).Binomial(n,p)\approx Poisson(\lambda).

近似保留均值 λ\lambda,方差从 np(1p)np(1-p) 近似为 λ\lambda。当 pp 不小或成功次数接近上界 nn 时,泊松的无上界支持会造成明显误差。

5. 可运行案例:200 次独立机会中的稀有故障

n=200,p=0.01n=200,p=0.01,因此 λ=2\lambda=2。代码比较二项与泊松 PMF。

Py

Python:二项分布的泊松近似

Idle

pp 改为 0.2 并保持 n=10n=10λ=2\lambda=2:均值仍相同,但近似会变差,因为事件不再稀有。

6. 正态分布为什么常见

XN(μ,σ2)X\sim N(\mu,\sigma^2)

由位置 μ\mu 和尺度 σ\sigma 决定。标准化:

Z=XμσN(0,1).Z=\frac{X-\mu}{\sigma}\sim N(0,1).

正态性可能来自:

  • 模型直接假设;
  • 多个近似独立小冲击相加;
  • 样本均值的 CLT 近似。

这三种理由不同。数据直方图近似钟形不能证明误差独立,也不能保证尾部风险估计正确。

7. 共轭关系是计算便利,不是真理

  • 二项似然 + Beta 先验 → Beta 后验;
  • 泊松似然 + Gamma 先验 → Gamma 后验;
  • 正态均值 + 正态先验 → 正态后验。

共轭先验带来闭式计算,但先验选择仍需实质依据和敏感性分析。

8. 选择分布的审计表

  1. 支持集与数据范围匹配吗?
  2. 随机对象是次数、等待时间、比例还是连续测量?
  3. 次数或暴露期固定吗?
  4. 独立、同质概率或恒定速率合理吗?
  5. 均值—方差关系与尾部是否匹配?
  6. 零值、截断、删失或混合人群是否另有机制?
  7. 参数化与软件文档一致吗?

课堂任务

为下列对象各选一个起始模型,并写出失败方式:

  1. 100 封邮件中的垃圾邮件数;
  2. 下一次客户来电的等待时间;
  3. 一次理赔金额;
  4. 某候选人的支持率;
  5. 一天内社交平台转发数。

核心阅读

  • Ross, A First Course in Probability,常见分布章节。
  • Johnson, Kemp & Kotz, Univariate Discrete Distributions
  • Gelman et al., Bayesian Data Analysis,概率分布与共轭模型章节。

上一章:期望、方差与条件矩|下一章:渐近理论

Copyright © 2026