报告概述

该工作论文以S&P 500指数期权为研究对象,覆盖2011年至2023年的日度数据。报告在Surface HAR (SHAR) 模型基础上,引入回归树将期权曲面按货币性和到期日自动分区,并在每个分区内估计局部HAR参数,形成Tree-SHAR及其Bagged和Boosted集成版本。报告对比了随机游走、全局SHAR、固定网格分区等基准,为读者提供了一种兼具可解释性与预测精度的期权曲面建模框架。

报告的核心结论

数据驱动分区显著提升预测精度

相比全局SHAR模型和固定3×3网格分区,Tree-SHAR通过回归树自动识别货币性和到期日的异质区域,在样本外预测中均取得更低RMSE,表明最优分区边界应由数据而非主观划分决定。

Boosting集成方法在所有预测期表现最优

Boosted Tree-SHAR模型通过逐步修正残差,在1天、5天和22天预测期上均获得最低RMSE。相对于全局SHAR,22天期RMSE降低约13%(从5.910降至5.124),且所有改进均通过Diebold-Mariano检验,并被Model Confidence Set确认为唯一最优模型。

树结构随市场状态自适应调整

在2020年COVID-19压力期,树分区阈值显著左移,将更极端的OTM看涨期权单独分区,同时OTM看跌期权区域合并。局部系数显示,危机时期短期虚值看跌期权维持高日度持续性,而长期虚值看涨期权更依赖周度信息,反映了不同客户群的差异化动态。

报告回答的关键问题

机器学习如何改进隐含波动率预测?

报告通过回归树将期权曲面按货币性和到期日自动划分为同质子区域,并在每个子区域估计局部HAR参数(Tree-SHAR)。该方法允许不同区域采用不同的持续性参数,从而捕捉全局模型无法刻画的异质动态,显著降低预测误差。

期权曲面不同区域有何异质动态?

短期期权(<39天)日度持续性很高(β(d)接近1),而长期期权(>140天)更依赖周度和月度均值。深度OTM看涨期权在正常时期日度系数较低(0.744),但在危机时期转向依赖周度信息(β(w)=0.892)。这些差异全局HAR模型无法反映。

危机时期预测改进更显著吗?

是的。报告显示2020年COVID-19期间,Tree-SHAR及Boosted-SHAR相对于全局SHAR的误差降幅最大。例如22天期,全局SHAR的RMSE为12.177,而Boosted-SHAR降至10.745。树结构在危机时主动调整分区,更精细地捕捉不同区域的动态转变。

报告中的代表性数据

全局SHAR: 5.910, Boosted-SHAR: 5.124

22天期RMSE对比

2018-2023年样本外,值越低表示预测越准;Boosted-SHAR相比全局SHAR误差降低约13%。

OTM calls: 全局SHAR 3.721, Boosted-SHAR 3.075

Moneyness极端区域1天期RMSE(2020年)

2020年,深度OTM看涨期权是改进最大的区域之一,误差降幅约17%。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整的样本外预测误差表格,按年份(2018-2023)和不同预测期(1天、5天、22天)分解,展示随机游走、全局SHAR、固定网格、Tree-SHAR、Bagged-SHAR、Boosted-SHAR的RMSE。
  • Diebold-Mariano成对检验统计量表格,验证各模型间预测误差差异的统计显著性。
  • 基于货币性和到期日分组的交叉验证误差分解表,揭示Tree-SHAR在不同区域(如深度OTM、短期等)的改进幅度。
  • 树结构分区图(如2018年1月4日和2020年3月17日)及其对应的叶子节点HAR系数估计表,展示动态调整的模式。
  • 附录中提供了使用SVI方法替代AHBS拟合曲面的稳健性分析,以及选择最优叶子数的CART准则过程。
  • 数据描述:S&P 500 OTM期权2011-2023年日度数据,经流动性、价格合理性等过滤,最终样本786,867个合约。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告