第十二章:前沿文献与现代资产定价案例(2023—2026)
第十二章:前沿文献与现代资产定价案例(2023—2026)
现代资产定价面对的困难已经不只是“CAPM 是否成立”。研究者同时拥有数百个公司特征、大量宏观时间序列、文本披露和灵活机器学习模型。候选变量越多,拟合能力越强,越需要无套利约束、样本外评价、复现设计与经济机制来防止把噪声包装成风险溢价。
本章用三篇同行评议论文与两篇 2026 年工作论文建立一条完整链条:深度网络怎样进入随机贴现因子;“因子动物园”怎样做复现;气候文本怎样转化为风险暴露;机器学习预测怎样进入组合决策;语言模型怎样满足历史信息边界。材料检索截至 2026 年 8 月 1 日,属于课程定向更新,不是穷尽式综述。代码使用合成收益率,不构成投资建议或论文复现。
学习目标
完成本章后,你应能够:
- 把机器学习资产定价重新写回随机贴现因子与 Euler 方程;
- 区分收益预测、定价误差、Sharpe 比率和经济机制;
- 解释大量候选因子为何同时带来多重检验与共同主题信息;
- 设计发现样本、验证样本与跨市场复现;
- 说明文本暴露变量的构造效度、测量误差和定价解释;
- 避免把样本内最优模型、文本提及次数或显著 alpha 直接当成可交易因果结论。
- 识别工作论文的证据状态,并审计语言模型是否真正 point-in-time。
案例一:深度学习不是无套利条件的替代品
1. 统一起点:随机贴现因子
任何资产 的超额收益 在正确随机贴现因子 下满足:
传统线性因子模型令:
若公司特征与宏观状态很多,线性形式可能漏掉非线性和交互。深度学习的合理角色,是用灵活函数近似条件 SDF 或组合权重:
而训练目标仍要回到矩条件、定价误差或与之等价的经济准则。
2. Chen、Pelger 与 Zhu 的研究设计
Chen、Pelger 与 Zhu(2023 年在线发表,刊于 2024 年 Management Science 70 卷)用深度神经网络估计个股收益的条件资产定价模型。论文的两项关键设计是:
- 以无套利条件为准则,并通过对抗式方法构造信息量较高的测试资产;
- 从大量宏观时间序列中提取经济状态,使条件关系能够随时间变化。
论文报告其模型在所研究样本的样本外 Sharpe 比率、解释变异和定价误差上优于基准方法。正确表述是“在论文设定的样本、资产、信息集和评价指标下优于基准”,不是“深度网络已经发现真实 SDF”。
3. 对抗测试资产的直觉
若只在容易定价的组合上检查模型,错误 SDF 也可能看起来很好。对抗网络可被理解为寻找一个组合 ,使当前 SDF 的矩条件违背尽可能明显:
SDF 网络则努力最小化最难测试资产上的定价误差。这与 GMM 中选择有信息矩条件的思想相连;“对抗”不是脱离经济学的黑盒竞争。
4. 本科生与研究生的不同要求
本科生应能解释:模型预测高收益不等于该收益是风险补偿,交易成本和不可实现信息也会降低可交易性。研究生还应检查:
- 测试资产是否用验证数据构造,是否引入数据窥视;
- 超参数和早停是否只在训练/验证集选择;
- Sharpe 比率是否经过选择偏误和估计误差校正;
- 定价误差的经济量级是否优于简单模型;
- 模型在不同时期、市场和交易成本下是否稳定;
- 隐状态与风险机制是否具有可解释、可证伪的对应关系。
案例二:因子动物园究竟是危机还是信息
1. 多重检验的经典担忧
假设研究者检验 个真实 alpha 均为零的因子,每个检验使用 5% 显著性水平。若检验近似独立,至少出现一个假阳性的概率为:
时,该概率约为 99.4%。即使因子相关,挑选最大的 t 统计量仍产生严重选择偏误。发现样本中的显著性因此必须与样本外复现、经济先验和联合建模结合。
2. Jensen、Kelly 与 Pedersen 的不同观点
Jensen、Kelly 与 Pedersen(2023)构建了覆盖 93 个国家、153 个因子的全球数据,并用贝叶斯因子复现模型重新评价“复现危机”。论文报告:多数因子可以复现,候选因子可聚为 13 个主题,多数主题进入切点组合,并在新的全球数据中表现出样本外证据。
他们的重要论点是:大量相似因子不一定只是独立的数据挖掘尝试,也可能是同一潜在经济主题的多种噪声测量。若价值、动量或质量主题有许多相关代理变量,联合层级模型可以从横截面共享信息。
3. 为什么这不等于“所有因子都可信”
论文的结论来自特定贝叶斯先验、聚类、数据清理和复现定义。频率学多重检验与贝叶斯层级模型回答的问题不同:前者控制重复抽样错误率,后者在给定先验和似然下更新主题与因子可信度。高质量报告应同时给出:
- 原始研究定义与可复现实现;
- 发现样本、时间外与市场外结果;
- 因子之间的相关和主题结构;
- 交易成本、换手率、可卖空性和容量;
- 多重检验、选择后推断或层级收缩;
- 对替代构造、断点日期和微盘股处理的敏感性。
4. 一个实用的三层证据标准
| 层级 | 问题 | 最低证据 |
|---|---|---|
| 统计层 | 平均收益是否区别于噪声 | 置信区间、多重检验、选择后校正 |
| 复现层 | 换时期或市场是否仍存在 | 预先声明的样本外复现 |
| 经济层 | 为什么应获得风险补偿 | 风险、摩擦或行为机制及可证伪预测 |
某因子可以通过前两层却仍缺乏清楚机制;也可能具有强理论动机但当前估计不精确。两种情况都不应被简化成“有效/无效”二元标签。
案例三:把气候讨论转成公司层面风险暴露
1. 研究问题
行业碳排放或 ESG 评级通常变化慢,难以捕捉一家企业在某个季度面对的具体转型机会、实体风险和监管风险。Sautner、van Lent、Vilkov 与 Zhang(2023)使用上市公司季度业绩电话会议文本,构造随时间变化的公司气候暴露。
论文将机器学习关键词发现算法用于气候相关词组,分别捕捉:
- 机会暴露:绿色技术、产品需求和转型机会;
- 实体风险:极端天气、资产受损和供应中断;
- 监管风险:碳政策、合规与转型成本。
最终指标可理解为相关 bigram 在电话会议文本中的相对频率,并对季度序列做适当平滑。
2. 构造效度比回归显著更先
一个文本指标进入资产定价回归前,至少需要四类验证:
- 内容效度:被算法发现的词组是否真的表达气候暴露?
- 收敛效度:指标是否与已知排放、行业风险或气候事件合理相关?
- 区分效度:它能否区分机会、实体和监管,而不只是一般风险语气?
- 预测/结果效度:它是否预测绿色专利、绿色技术就业或市场定价对象?
论文的全球样本包含 34 个国家、逾 10,000 家企业,覆盖 2002—2020 年。作者报告指标可预测净零转型相关的实际结果,并包含期权和股票市场定价信息。
3. “被定价”不自动等于因果风险溢价
若高暴露公司具有不同收益,可有多种解释:
- 投资者要求承担气候风险的补偿;
- 暴露预示未来现金流变化;
- 文本披露反映管理层注意力或信息环境;
- 指标与行业、规模、盈利或政策周期共同变化;
- 期权价格反映尾部风险和预期波动,而非平均收益溢价。
所以需要分别检验现金流渠道、贴现率渠道、事件响应和横截面预期收益,而不能把一个显著系数统称为“气候风险被定价”。
4. 研究生扩展
研究生可以先按文本暴露 构造可交易或可检验的气候因子收益 ,再把它放入对所有资产共同的 SDF:
在这里进入组合形成或测试资产,而不是让每只资产拥有不同的 SDF。研究者必须解决 是资产特征还是风险暴露、气候创新如何构造、横截面和时间序列识别怎样分开,以及文本测量误差会如何衰减或扭曲风险价格。
案例四:2026 年的两条方法提醒
1. 预测误差要按最终决策的代价衡量
Wang、Gao、Harvey、Liu 与 Tao(2026)的 NBER 工作论文 Machine Learning Meets Markowitz 质疑常见的“两步法”:先让预测模型最小化所有资产的平均误差,再把预测收益送入组合优化器。若某些资产因风险约束、卖空成本或投资者偏好获得很大权重,它们的预测误差对最终效用更重要;普通预测损失却把各资产误差近似等量看待。
| 两步法 | 决策一体化思路 |
|---|---|
| 先优化预测指标,再优化组合 | 用最终组合目标反向约束预测 |
| 预测误差权重与投资者无关 | 误差代价随偏好、约束和摩擦变化 |
| 较低 RMSE 被当作主要胜利 | 还要看样本外效用、换手和风险 |
这不表示任何端到端网络都优于传统方法。更灵活的目标也更容易过拟合,且该文截至资料日是 NBER 工作论文,应把结果表述为尚待进一步同行评议与独立复现的研究证据。
2. “只把旧文本放进提示词”仍可能穿越
Kelly、Malamud、Schwab 与 Xu(2026)的 NBER 工作论文 Scaling Point-in-Time Language Models 指出:使用不受时间限制的互联网语料训练的语言模型,参数中可能已经编码未来信息。研究者即使只向模型输入 2017 年年报,也不能据此断言模型在模拟“2017 年投资者的信息集”。
他们按日历时间过滤训练语料并构造一系列历史模型检查点,目标是从模型训练阶段消除这种泄漏。对资产定价回测,最小审计表应包括:
| 对象 | 必须记录 |
|---|---|
| 原始文本 | 发布日期、时区、修订与可获得时间 |
| 模型 | 训练语料截止日、检查点与后续微调数据 |
| 特征 | 第一次可计算日期,而非数据库当前日期 |
| 证券集合 | 当时可见的上市、退市和成分信息 |
| 交易 | 信号形成、下单、成交与成本假设 |
浏览器实验:200 个候选因子与样本外复现
下面模拟 200 个候选月度因子,其中前 5 个具有正的真实月均收益,其余为零。我们在前 120 个月选择 t 统计量最大的因子,再在后 120 个月复核。一次运行不能证明一般规律;3 个输出问题分别是:发现样本有多少“显著因子”、赢家是否是真因子、复核是否保持同方向和显著。
Python:因子筛选、赢家诅咒与样本外复现
R:因子筛选、赢家诅咒与样本外复现
实验审计
- 把候选因子从 200 改为 20 和 2,000,观察发现样本显著数量与最大 t 值。
- 把发现样本延长而保持总样本 240 个月,说明发现精度与验证精度的权衡。
- 让 195 个零因子具有共同噪声,讨论检验相关性为何改变但不消除数据挖掘问题。
- 当前复现标准只是同方向且 ;真实研究还要核对构造、交易成本、市场覆盖和经济机制。
分层作业
本科生任务
选择一个公开因子,写一页“证据卡”:因子定义、排序变量、持有期、样本、平均收益、波动、换手率、发现期和至少一个样本外市场。若没有交易成本信息,要明确写“证据缺失”。
研究生任务
设计一项气候暴露资产定价研究。分别写出:文本指标构造、人工标注验证、气候创新、测试资产、SDF 矩条件、双重聚类或 Fama–MacBeth 推断、行业与规模控制、选择后校正、期权与股票市场的互证。最后列出至少三个无法由显著风险价格排除的替代解释。
一手文献与延伸阅读
- Chen, L., Pelger, M., & Zhu, J. (2023). Deep Learning in Asset Pricing. Management Science, 70(2), 714–750. DOI: 10.1287/mnsc.2023.4695.
- Jensen, T. I., Kelly, B., & Pedersen, L. H. (2023). Is There a Replication Crisis in Finance?. Journal of Finance, 78(5), 2465–2518. DOI: 10.1111/jofi.13249.
- Sautner, Z., van Lent, L., Vilkov, G., & Zhang, R. (2023). Firm-Level Climate Change Exposure. Journal of Finance, 78(3), 1449–1498. DOI: 10.1111/jofi.13219. 作者公开的气候暴露数据可用于进一步复现训练。
- Wang, Y., Gao, H., Harvey, C. R., Liu, Y., & Tao, X. (2026). Machine Learning Meets Markowitz. NBER Working Paper 34861. DOI: 10.3386/w34861. 工作论文。
- Kelly, B. T., Malamud, S., Schwab, J., & Xu, T. A. (2026). Scaling Point-in-Time Language Models. NBER Working Paper 35247. DOI: 10.3386/w35247. 工作论文。