第十三章:前沿文献与现代统计案例(2023—2026)
第十三章:前沿文献与现代统计案例(2023—2026)
现代机器学习可以生成很准确的点预测,但“预测值是多少”与“我们对预测有多确定”是两个问题。与此同时,在线实验、临床试验和平台监测经常一边收集数据一边查看结果,传统固定样本推断可能因反复窥视而失去错误率保证。
本章选择保形预测、分布漂移、选择后覆盖与随时有效推断四条近期文献线索,把概率论中的交换性、次序统计量、鞅和最大不等式连接到当前统计实践。材料来自截至 2026 年 8 月 1 日 的一手来源定向检索,不是系统综述;代码只做机制模拟。
学习目标
完成本章后,你应能够:
- 用校准残差构造 split conformal 预测区间;
- 准确解释“边际覆盖”而不是误写为“每个个体都有 90% 概率”;
- 说明交换性、模型对称性和分布漂移如何影响覆盖保证;
- 解释加权保形方法为何能缓解某些漂移、又为何不能应对任意变化;
- 说明挑选重点对象后,边际覆盖为何不再等于选择条件覆盖;
- 区分固定样本 p 值、随时有效 p 值、e-value 与置信序列;
- 用 Ville 不等式说明为什么检验鞅允许可选停止。
案例一:给任意预测器加上有限样本预测区间
1. 问题设定
我们有训练数据、校准数据和一个新样本:
目标不是估计总体均值,而是为新的、尚未观察到的 构造预测集合 ,使:
Angelopoulos 与 Bates(2023)系统介绍了保形预测及分布无关不确定性量化。它的吸引力在于可以包裹线性回归、随机森林或神经网络,而不要求预测误差服从正态分布。
2. Split conformal 算法
把数据分为训练集 与校准集 :
- 在训练集拟合任意预测器 ;
- 对校准样本计算不合格分数
- 令 ,取排序后第
个分数为 ; - 对新样本输出
有限样本修正中的 很重要。若只调用软件默认的线性插值分位数,可能得到略低于目标的覆盖。
3. 为什么它有效
在训练模型固定以后,若校准分数与新样本分数可交换,新分数在 个分数中的秩近似均匀。选取足够高的次序统计量,就能控制新分数超过阈值的概率。
证明依赖的是秩与交换性,而不是 正确。因此模型拟合很差时仍可能覆盖,但区间会很宽。有效覆盖不等于高效率。
4. “90% 覆盖”的准确解释
保证通常是对训练、校准和新样本的重复抽样取平均:
它一般不保证每一个协变量值都满足:
某些稀少亚组可能覆盖不足,另一些亚组覆盖过多。把边际保证写成“这个患者有 90% 概率落入区间”会隐藏模型、数据生成和重复抽样含义。
案例二:部署后数据漂移,交换性不再成立
1. 现实中的破坏方式
Barber、Candès、Ramdas 与 Tibshirani(2023)研究超越交换性的保形预测。部署场景常见:
- 时间趋势使近期数据比早期数据更相关;
- 传感器、医院或地区改变了协变量分布;
- 训练算法对最近观测加权,因而不再对数据顺序对称;
- 相邻时间点相关,不能任意置换。
此时,传统“新分数在所有分数中的秩均匀”论证不再直接成立。
2. 加权分位数的直觉
若研究者能用权重 表示校准观测与目标新样本的相关程度,可以使用加权经验分布:
近期或更接近目标分布的观测获得较高权重,再从 取分位数。论文同时设计随机化技术,处理拟合算法不对称的问题,并给出对分布漂移的稳健性界。
3. 不能过度承诺什么
权重必须与漂移结构有关。若未来出现校准样本从未覆盖的新机制、结果定义改变或标签测量失真,没有一个机械加权分位数可以凭空恢复保证。越偏离交换性,结论越依赖对漂移的建模与界定。
学生应把“不确定性量化”分为两层:
- 给定假设下的数学保证;
- 假设在部署环境中是否可信的监测证据。
4. 2026 年延伸:目标数据少时能否借用其他来源
Zhang 等(2026)在 Journal of Machine Learning Research 研究 transfer conformal:目标人群校准数据很少时,能否借用相关来源数据缩短区间。关键不是把所有来源直接合并,而是识别哪些来源对目标条件分布有信息,并允许来源与目标不交换。论文用条件 Kullback–Leibler 散度选择相关来源,并分析覆盖与区间宽度的非渐近性质。
这类方法把“更多数据”拆成两个问题:
- 来源数据能否提高精度?
- 来源与目标差异是否仍在方法保证覆盖的范围内?
若医院改变了结果定义、传感器出现系统偏差,或目标人群包含来源中不存在的亚组,迁移算法不能凭数据量恢复可比性。
案例三:选择了重点对象以后,边际覆盖还够吗
标准 conformal 保证针对一个随机测试点的边际覆盖。实践中却常先看风险分数,再挑出最高风险患者、最有希望药物或最异常账户。被选中的对象不是随机测试点;它们集中在模型最不稳定或噪声最大的区域时,原边际覆盖可能明显不足。
Jin 与 Ren(2025)在 Journal of the Royal Statistical Society: Series B 提出选择条件覆盖框架:给定对象被某个程序选中后,预测集合仍具有有限样本精确覆盖。框架允许多种对校准单位置换不变的选择规则,包括 top-、优化型选择和按初步 conformal 集合选择。
教学上要区分:
| 保证 | 重复抽样对象 | 适合问题 |
|---|---|---|
| 边际覆盖 | 随机抽取一个新单位 | 普通总体预测 |
| 条件于 的覆盖 | 固定协变量位置 | 每类人都要校准 |
| 选择条件覆盖 | 给定单位被规则选中 | 只处理高风险/top- 对象 |
| false coverage rate | 多个被选集合中的平均错误比例 | 批量筛选 |
选择条件方法不是免费升级:区间可能变宽,且保证依赖选择规则被完整纳入推断。临时改选对象或只报告窄区间,会再次引入选择偏误。
案例四:可以反复看数据而不破坏错误率吗
1. 固定样本检验的窥视问题
传统检验先固定样本量 ,再在末尾计算 p 值。如果研究者每天查看一次结果,并在第一次 时停止,那么实际一类错误率可能超过 5%。原因是停止规则本身选择了看起来最极端的时点。
Ramdas、Grünwald、Vovk 与 Shafer(2023)综述了 safe anytime-valid inference(SAVI)。核心对象包括 e-process 与置信序列,它们在任意停止时刻仍保持有效。
2. 从赌博财富理解 e-value
设 是在原假设成立时满足
的 e-value。较大的 是反对 的证据。若 是从 开始的非负检验鞅,那么 Ville 不等式给出:
把 想成下注者财富:若原假设正确,任何公平或超公平策略的财富都不应经常膨胀到 。因此研究者可以持续监测,并在财富首次超过阈值时停止。
3. 置信序列
固定样本置信区间只保证某个预定 的覆盖。置信序列 则满足:
它允许在任意时刻报告区间,但通常比只针对一个固定时点优化的区间更宽。这是灵活停止的价格。
4. 使用边界
- “随时有效”不是“任何分析选择都有效”;临时更换终点、亚组或下注策略仍需被框架覆盖。
- e-value 不是效果大小;它衡量证据,不说明处理是否具有实质意义。
- 多个 e-value 可以按特定规则组合,但不能把普通 p 值随意相乘后称为 e-process。
- 置信序列仍依赖数据界、条件矩或模型假设。
浏览器实验:交换性与分布漂移下的保形覆盖率
训练与校准数据来自 ,结果为 加噪声。我们故意用二次多项式拟合。第一组测试数据与校准数据同分布;第二组来自 ,进入训练数据很少覆盖的区域。传统 split conformal 的区间宽度不随位置改变,因此漂移后可能覆盖不足。
Python:Split conformal 的覆盖率与分布漂移
R:Split conformal 的覆盖率与分布漂移
实验审计
- 把模型从二次多项式改为一次和五次,比较覆盖率与区间宽度;覆盖有效不代表宽度相同。
- 把校准样本从 250 降到 30,观察分位数更离散。
- 让噪声标准差随 增加,检查固定宽度区间在哪些区域覆盖不足。
- 漂移测试不满足经典保证,因此低覆盖不是 conformal 定理“出错”,而是其假设被破坏。
浏览器实验二:总体覆盖达标,高风险组仍可能失准
结果均值恒为 0,但噪声随风险分数 增大。全局 split conformal 用一条固定半宽区间达到约 90% 的边际覆盖;随后只选择风险最高的 10% 对象,检查其覆盖。
Python:边际覆盖与选择条件覆盖
低覆盖不是 split conformal 定理失效:总体测试点与校准点仍同分布,边际目标确实接近 90%。问题在于选择规则把注意力集中到高噪声区域,改变了要保证的条件事件。
分层作业
本科生任务
用 100 次完整重复实验估计 split conformal 的平均覆盖率。每次都必须重新生成训练、校准和测试数据。分别报告总体与 top-10% 风险组覆盖,并解释为什么两者可以不同。
研究生任务
为连续监测的 A/B 测试写一份推断协议:声明原假设、最大或无限时域、下注/e-process 构造、停止阈值、效果大小区间和实际最小重要差异。再比较固定样本设计、alpha spending 与置信序列在样本效率和运营灵活性上的权衡。
一手文献与延伸阅读
- Angelopoulos, A. N., & Bates, S. (2023). Conformal Prediction: A Gentle Introduction. Foundations and Trends in Machine Learning, 16(4), 494–591.
- Barber, R. F., Candès, E. J., Ramdas, A., & Tibshirani, R. J. (2023). Conformal Prediction Beyond Exchangeability. Annals of Statistics, 51(2), 816–845. DOI: 10.1214/23-AOS2276.
- Jin, Y., & Ren, Z. (2025). Confidence on the Focal: Conformal Prediction with Selection-Conditional Coverage. Journal of the Royal Statistical Society: Series B, 87(4), 1239–1259. DOI: 10.1093/jrsssb/qkaf016.
- Zhang, C., Li, T., Xie, J., Kong, L., & Jiang, B. (2026). Transfer Conformal Predictive Inference for Regression. Journal of Machine Learning Research, 27(90), 1–68.
- Ramdas, A., Grünwald, P., Vovk, V., & Shafer, G. (2023). Game-Theoretic Statistics and Safe Anytime-Valid Inference. Statistical Science, 38(4), 576–601.