概率论与数理统计

第十三章:前沿文献与现代统计案例(2023—2026)

从保形预测、分布漂移与随时有效推断理解现代不确定性量化的保证、假设和边界。

第十三章:前沿文献与现代统计案例(2023—2026)

现代机器学习可以生成很准确的点预测,但“预测值是多少”与“我们对预测有多确定”是两个问题。与此同时,在线实验、临床试验和平台监测经常一边收集数据一边查看结果,传统固定样本推断可能因反复窥视而失去错误率保证。

本章选择保形预测、分布漂移、选择后覆盖与随时有效推断四条近期文献线索,把概率论中的交换性、次序统计量、鞅和最大不等式连接到当前统计实践。材料来自截至 2026 年 8 月 1 日 的一手来源定向检索,不是系统综述;代码只做机制模拟。

学习目标

完成本章后,你应能够:

  1. 用校准残差构造 split conformal 预测区间;
  2. 准确解释“边际覆盖”而不是误写为“每个个体都有 90% 概率”;
  3. 说明交换性、模型对称性和分布漂移如何影响覆盖保证;
  4. 解释加权保形方法为何能缓解某些漂移、又为何不能应对任意变化;
  5. 说明挑选重点对象后,边际覆盖为何不再等于选择条件覆盖;
  6. 区分固定样本 p 值、随时有效 p 值、e-value 与置信序列;
  7. 用 Ville 不等式说明为什么检验鞅允许可选停止。

案例一:给任意预测器加上有限样本预测区间

1. 问题设定

我们有训练数据、校准数据和一个新样本:

(X1,Y1),,(Xn,Yn),(Xn+1,Yn+1).(X_1,Y_1),\ldots,(X_n,Y_n),(X_{n+1},Y_{n+1}).

目标不是估计总体均值,而是为新的、尚未观察到的 Yn+1Y_{n+1} 构造预测集合 C(Xn+1)C(X_{n+1}),使:

P{Yn+1C(Xn+1)}1α.P\{Y_{n+1}\in C(X_{n+1})\}\ge 1-\alpha.

Angelopoulos 与 Bates(2023)系统介绍了保形预测及分布无关不确定性量化。它的吸引力在于可以包裹线性回归、随机森林或神经网络,而不要求预测误差服从正态分布。

2. Split conformal 算法

把数据分为训练集 ItrainI_{train} 与校准集 IcalI_{cal}

  1. 在训练集拟合任意预测器 μ^(x)\widehat\mu(x)
  2. 对校准样本计算不合格分数Si=Yiμ^(Xi);S_i=|Y_i-\widehat\mu(X_i)|;
  3. ncal=Icaln_{cal}=|I_{cal}|,取排序后第k=(ncal+1)(1α)k=\left\lceil(n_{cal}+1)(1-\alpha)\right\rceil
    个分数为 q^\widehat q
  4. 对新样本输出C(x)=[μ^(x)q^,μ^(x)+q^].C(x)=[\widehat\mu(x)-\widehat q,\widehat\mu(x)+\widehat q].

有限样本修正中的 ncal+1n_{cal}+1 很重要。若只调用软件默认的线性插值分位数,可能得到略低于目标的覆盖。

3. 为什么它有效

在训练模型固定以后,若校准分数与新样本分数可交换,新分数在 ncal+1n_{cal}+1 个分数中的秩近似均匀。选取足够高的次序统计量,就能控制新分数超过阈值的概率。

证明依赖的是秩与交换性,而不是 μ^\widehat\mu 正确。因此模型拟合很差时仍可能覆盖,但区间会很宽。有效覆盖不等于高效率。

4. “90% 覆盖”的准确解释

保证通常是对训练、校准和新样本的重复抽样取平均:

P(YnewC(Xnew))0.9.P(Y_{new}\in C(X_{new}))\ge 0.9.

它一般不保证每一个协变量值都满足:

P(YnewC(Xnew)Xnew=x)0.9.P(Y_{new}\in C(X_{new})\mid X_{new}=x)\ge 0.9.

某些稀少亚组可能覆盖不足,另一些亚组覆盖过多。把边际保证写成“这个患者有 90% 概率落入区间”会隐藏模型、数据生成和重复抽样含义。

案例二:部署后数据漂移,交换性不再成立

1. 现实中的破坏方式

Barber、Candès、Ramdas 与 Tibshirani(2023)研究超越交换性的保形预测。部署场景常见:

  • 时间趋势使近期数据比早期数据更相关;
  • 传感器、医院或地区改变了协变量分布;
  • 训练算法对最近观测加权,因而不再对数据顺序对称;
  • 相邻时间点相关,不能任意置换。

此时,传统“新分数在所有分数中的秩均匀”论证不再直接成立。

2. 加权分位数的直觉

若研究者能用权重 wiw_i 表示校准观测与目标新样本的相关程度,可以使用加权经验分布:

F^w(s)=i=1nwi1(Sis)i=1nwi.\widehat F_w(s) =\frac{\sum_{i=1}^{n}w_i\mathbf 1(S_i\le s)} {\sum_{i=1}^{n}w_i}.

近期或更接近目标分布的观测获得较高权重,再从 F^w\widehat F_w 取分位数。论文同时设计随机化技术,处理拟合算法不对称的问题,并给出对分布漂移的稳健性界。

3. 不能过度承诺什么

权重必须与漂移结构有关。若未来出现校准样本从未覆盖的新机制、结果定义改变或标签测量失真,没有一个机械加权分位数可以凭空恢复保证。越偏离交换性,结论越依赖对漂移的建模与界定。

学生应把“不确定性量化”分为两层:

  1. 给定假设下的数学保证
  2. 假设在部署环境中是否可信的监测证据

4. 2026 年延伸:目标数据少时能否借用其他来源

Zhang 等(2026)在 Journal of Machine Learning Research 研究 transfer conformal:目标人群校准数据很少时,能否借用相关来源数据缩短区间。关键不是把所有来源直接合并,而是识别哪些来源对目标条件分布有信息,并允许来源与目标不交换。论文用条件 Kullback–Leibler 散度选择相关来源,并分析覆盖与区间宽度的非渐近性质。

这类方法把“更多数据”拆成两个问题:

  1. 来源数据能否提高精度?
  2. 来源与目标差异是否仍在方法保证覆盖的范围内?

若医院改变了结果定义、传感器出现系统偏差,或目标人群包含来源中不存在的亚组,迁移算法不能凭数据量恢复可比性。

案例三:选择了重点对象以后,边际覆盖还够吗

标准 conformal 保证针对一个随机测试点的边际覆盖。实践中却常先看风险分数,再挑出最高风险患者、最有希望药物或最异常账户。被选中的对象不是随机测试点;它们集中在模型最不稳定或噪声最大的区域时,原边际覆盖可能明显不足。

Jin 与 Ren(2025)在 Journal of the Royal Statistical Society: Series B 提出选择条件覆盖框架:给定对象被某个程序选中后,预测集合仍具有有限样本精确覆盖。框架允许多种对校准单位置换不变的选择规则,包括 top-KK、优化型选择和按初步 conformal 集合选择。

教学上要区分:

保证重复抽样对象适合问题
边际覆盖随机抽取一个新单位普通总体预测
条件于 X=xX=x 的覆盖固定协变量位置每类人都要校准
选择条件覆盖给定单位被规则选中只处理高风险/top-KK 对象
false coverage rate多个被选集合中的平均错误比例批量筛选

选择条件方法不是免费升级:区间可能变宽,且保证依赖选择规则被完整纳入推断。临时改选对象或只报告窄区间,会再次引入选择偏误。

案例四:可以反复看数据而不破坏错误率吗

1. 固定样本检验的窥视问题

传统检验先固定样本量 nn,再在末尾计算 p 值。如果研究者每天查看一次结果,并在第一次 p<0.05p<0.05 时停止,那么实际一类错误率可能超过 5%。原因是停止规则本身选择了看起来最极端的时点。

Ramdas、Grünwald、Vovk 与 Shafer(2023)综述了 safe anytime-valid inference(SAVI)。核心对象包括 e-process 与置信序列,它们在任意停止时刻仍保持有效。

2. 从赌博财富理解 e-value

Et0E_t\ge0 是在原假设成立时满足

EH0[Et]1E_{H_0}[E_t]\le1

的 e-value。较大的 EtE_t 是反对 H0H_0 的证据。若 (Mt)(M_t) 是从 M0=1M_0=1 开始的非负检验鞅,那么 Ville 不等式给出:

PH0(supt0Mt1α)α.P_{H_0}\left(\sup_{t\ge0}M_t\ge\frac{1}{\alpha}\right)\le\alpha.

MtM_t 想成下注者财富:若原假设正确,任何公平或超公平策略的财富都不应经常膨胀到 1/α1/\alpha。因此研究者可以持续监测,并在财富首次超过阈值时停止。

3. 置信序列

固定样本置信区间只保证某个预定 nn 的覆盖。置信序列 (Ct)(C_t) 则满足:

P{θCt 对所有 t1}1α.P\{\theta\in C_t\ \text{对所有 }t\ge1\}\ge1-\alpha.

它允许在任意时刻报告区间,但通常比只针对一个固定时点优化的区间更宽。这是灵活停止的价格。

4. 使用边界

  • “随时有效”不是“任何分析选择都有效”;临时更换终点、亚组或下注策略仍需被框架覆盖。
  • e-value 不是效果大小;它衡量证据,不说明处理是否具有实质意义。
  • 多个 e-value 可以按特定规则组合,但不能把普通 p 值随意相乘后称为 e-process。
  • 置信序列仍依赖数据界、条件矩或模型假设。

浏览器实验:交换性与分布漂移下的保形覆盖率

训练与校准数据来自 XU[2,2]X\sim U[-2,2],结果为 sin(X)\sin(X) 加噪声。我们故意用二次多项式拟合。第一组测试数据与校准数据同分布;第二组来自 XU[2,4]X\sim U[2,4],进入训练数据很少覆盖的区域。传统 split conformal 的区间宽度不随位置改变,因此漂移后可能覆盖不足。

Py

Python:Split conformal 的覆盖率与分布漂移

Idle
R

R:Split conformal 的覆盖率与分布漂移

Idle

实验审计

  • 把模型从二次多项式改为一次和五次,比较覆盖率与区间宽度;覆盖有效不代表宽度相同。
  • 把校准样本从 250 降到 30,观察分位数更离散。
  • 让噪声标准差随 X|X| 增加,检查固定宽度区间在哪些区域覆盖不足。
  • 漂移测试不满足经典保证,因此低覆盖不是 conformal 定理“出错”,而是其假设被破坏。

浏览器实验二:总体覆盖达标,高风险组仍可能失准

结果均值恒为 0,但噪声随风险分数 XX 增大。全局 split conformal 用一条固定半宽区间达到约 90% 的边际覆盖;随后只选择风险最高的 10% 对象,检查其覆盖。

Py

Python:边际覆盖与选择条件覆盖

Idle

低覆盖不是 split conformal 定理失效:总体测试点与校准点仍同分布,边际目标确实接近 90%。问题在于选择规则把注意力集中到高噪声区域,改变了要保证的条件事件。

分层作业

本科生任务

用 100 次完整重复实验估计 split conformal 的平均覆盖率。每次都必须重新生成训练、校准和测试数据。分别报告总体与 top-10% 风险组覆盖,并解释为什么两者可以不同。

研究生任务

为连续监测的 A/B 测试写一份推断协议:声明原假设、最大或无限时域、下注/e-process 构造、停止阈值、效果大小区间和实际最小重要差异。再比较固定样本设计、alpha spending 与置信序列在样本效率和运营灵活性上的权衡。

一手文献与延伸阅读

  1. Angelopoulos, A. N., & Bates, S. (2023). Conformal Prediction: A Gentle Introduction. Foundations and Trends in Machine Learning, 16(4), 494–591.
  2. Barber, R. F., Candès, E. J., Ramdas, A., & Tibshirani, R. J. (2023). Conformal Prediction Beyond Exchangeability. Annals of Statistics, 51(2), 816–845. DOI: 10.1214/23-AOS2276.
  3. Jin, Y., & Ren, Z. (2025). Confidence on the Focal: Conformal Prediction with Selection-Conditional Coverage. Journal of the Royal Statistical Society: Series B, 87(4), 1239–1259. DOI: 10.1093/jrsssb/qkaf016.
  4. Zhang, C., Li, T., Xie, J., Kong, L., & Jiang, B. (2026). Transfer Conformal Predictive Inference for Regression. Journal of Machine Learning Research, 27(90), 1–68.
  5. Ramdas, A., Grünwald, P., Vovk, V., & Shafer, G. (2023). Game-Theoretic Statistics and Safe Anytime-Valid Inference. Statistical Science, 38(4), 576–601.

建议与渐近理论区间估计Bootstrap对照学习:它们都在量化不确定性,但依赖的重复抽样结构和有效性目标并不相同。

Copyright © 2026