Quant
量化投资文献与软件图谱
区分基础理论、经同行评审的近期研究、工作论文和实时软件文档。
量化投资文献与软件图谱
本页是课程选读图谱,不是系统综述,也不是策略推荐。链接与出版状态核验于 2026 年 8 月 1 日;软件接口会变化,研究报告必须记录实际版本。
基础:先建立经济与统计基准
| 问题 | 文献 | 阅读任务 |
|---|---|---|
| 均值—方差选择 | Markowitz (1952) | 找出期望收益、协方差和约束如何决定权重 |
| 多因子基准 | Fama and French (1993) | 区分因子暴露、异常收益和可交易组合 |
| 动量 | Jegadeesh and Titman (1993) | 重建排序期、跳过期和持有期 |
| 因子动物园 | Harvey, Liu and Zhu (2016) | 理解多重检验为何抬高发现门槛 |
| 机器学习资产定价 | Gu, Kelly and Xiu (2020) | 比较预测增量、非线性交互与样本外设计 |
经典结果是基准,不是永久有效的交易许可。每次复现都要重新处理资产池、退市收益、可用时点、成本和容量。
2023–2026:方法边界与新数据
| 状态 | 文献 | 本课程如何使用 |
|---|---|---|
| 同行评审 | Sautner et al. (2023) | 文本型公司气候暴露的构造、人工核验与经济验证 |
| 工作论文 | Didisheim et al. (2023) | 因子模型复杂度与样本外定价表现;不要简化成“越复杂越好” |
| 同行评审综述 | Giantsidi and Tarantola (2025) | 识别 2020–2024 金融预测深度学习方法和常见验证缺口 |
| 同行评审 | Jensen et al. (2026) | 用成本后、规模相关的可实现有效前沿评价策略 |
| 工作论文 | Wang et al. (2026) | 比较“先预测再优化”与经济目标联合训练 |
| 工作论文 | Kelly et al. (2026) | 用按月截断语料的语言模型审计文本回测的时间有效性 |
工作论文适合讲前沿问题,不应写成已形成学界定论。后续版本可能修改样本、方法与结论。
软件:把工具映射到研究职责
| 职责 | 官方文档 | 最低审计要求 |
|---|---|---|
| 表格与时点数据 | pandas | 键、时区、交易日历、available_at 和版本 |
| 计量与时间序列 | statsmodels | 公式、缺失处理、协方差类型和诊断 |
| 时间顺序验证 | scikit-learn time-series splitting | 训练、调参与测试不穿越;预处理只拟合训练窗 |
| 凸组合优化 | CVXPY | 目标、约束、求解器、容差、可行性和失败状态 |
| 浏览器实验 | Pyodide | 单元代码与静态结论一致,记录随机种子 |
本项目已集成 VitePress 的 Pyodide 代码块,本课程优先使用标准 Python 完成小算例,避免为了一个教学公式引入新的生产依赖。更大项目应使用锁定环境和独立测试。
数据并不因“常用”而可自由传播
市场、财务、分析师、新闻和订单簿数据常有不同许可、修订和标识符规则。研究包至少记录:
- 来源、许可和访问日期;
- 原始文件或快照版本;
- 证券标识符映射及有效区间;
- 公司行动、退市和复权处理;
- 财报发布日期与后续修订;
- 交易所时区、日历和撮合时点;
- 可公开的合成测试数据。
不能公开受限数据时,公开字段字典、访问路径、变换代码和可运行的合成夹具,而不是删除可复现说明。
六行论文阅读法
读一篇策略论文时,先提取:
- **对象:**市场、资产池、频率与样本期;
- **信息:**每个特征在决策时何时可得;
- **目标:**预测损失、定价误差、效用还是成本后收益;
- **验证:**训练、调参、测试和模型搜索如何隔离;
- **摩擦:**价差、冲击、换手、容量和约束如何处理;
- **状态:**同行评审、工作论文、预印本还是软件文档。