报告概述

本报告属于多因子Alpha系列研究,聚焦于利用深度学习技术从高频价量数据中挖掘选股因子。报告首先分析了高频数据相比低频数据在信息量、拥挤度和样本独立性方面的优势,并指出机器学习是处理海量高频数据的有力工具。报告详细介绍了深层全连接神经网络模型的设计:以55个基于经验构建的高频人工因子(涵盖日内价格、成交量、盘前信息、特定时段及大成交量特征)作为输入,通过7层网络提取32个特征因子。实证部分在创业板和中证1000股票池中测试了这些因子的选股性能,并分析了因子之间的相关性与独立性。报告为量化投资者提供了一套完整的从高频数据到有效因子的自动化挖掘框架,有助于应对因子拥挤和超额收益下降的挑战。

报告的核心结论

深度学习模型能从高频数据中提取具有独立选股能力的特征因子。

通过深层全连接神经网络,报告从55个人工因子中学习得到了32个特征因子。相关性分析显示,这些特征因子与原始人工因子之间的相关性较低,说明神经网络成功捕捉了人工因子之外的增量信息,生成了相对独立的选股信号。

hf18因子在创业板股票池中表现出色,超额收益显著。

在2020年7月至2023年6月的样本外测试中,hf18因子的多头年化收益率达到27.25%,相对于创业板指数的超额年化收益率为25.50%,信息比率为1.04。分年度看,该因子在2021年后负IC占比超过85%,表现稳定。

hf13因子在中证1000股票池中具有稳定选股能力。

同期内,hf13因子在中证1000中取得11.25%的多头年化收益率,相对中证1000指数超额收益7.24%,信息比率0.64。分年度数据显示,2021年后正IC占比均超过70%,因子表现稳健。

高频数据因子结合深度学习是突破因子拥挤的有效途径。

报告指出,传统低频因子广为人知且收益空间有限,而高频数据体量大、噪声高,但通过深度学习自动化特征工程,能够挖掘出与低频信号相关性低、拥挤度低的新因子,从而在量化选股中获取更持续的超额收益。

报告回答的关键问题

深度学习如何用于高频数据因子挖掘?

报告采用“高频数据低频化+深层神经网络”的方法:先将分钟级行情数据加工成日频的人工因子(共55个),然后以这些因子为输入,训练一个7层全连接神经网络(隐层节点数未公开),通过交叉熵损失函数优化,从网络顶层隐层提取32个特征因子,这些因子即为选股信号。

高频因子挖掘对量化投资有什么价值?

高频数据体量大、信息密度高,且基于高频数据的因子开发流程复杂,难以被市场迅速模仿,因此因子拥挤度低。报告实证表明,深度学习挖掘的高频因子(如hf18)在样本外能持续产生显著超额收益,有助于缓解传统因子失效问题,为量化模型提供新的Alpha来源。

基于深度学习的高频因子在创业板和中证1000中表现如何?

在创业板,表现最好的hf18因子多头年化收益27.25%,超额创业板指25.50%,信息比1.04;在中证1000,表现最好的hf13因子多头年化收益11.25%,超额中证1000指数7.24%,信息比0.64。两个因子均呈现出稳定的分档单调性和逐年正超额收益。

报告中的代表性数据

27.25%

hf18因子多头年化收益率(创业板)

2020年7月至2023年6月,周度换仓,双边千三计费,剔除ST、涨跌停及上市不满1年股票。

25.50%

hf18因子相对创业板指超额年化收益率

2020年7月至2023年6月,同期创业板指年化收益率为-1.62%,多头组合超额收益显著。

11.25%

hf13因子多头年化收益率(中证1000)

2020年7月至2023年6月,周度换仓,双边千三计费,相对中证1000指数超额年化7.24%。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 深度学习模型的详细网络结构(包括各隐层节点数、激活函数、优化器等)和训练参数设置。
  • 55个高频人工因子的完整定义、计算公式及在创业板和中证1000中的分年度表现统计表。
  • 32个深度学习特征因子在两板块的完整表现统计,包括Rank_IC、多头/多空年化收益率等。
  • 最佳因子的分档表现图、累计收益曲线以及分年度收益与风险指标(最大回撤、波动率、信息比率等)。
  • 特征因子之间的相关性矩阵,以及特征因子与输入人工因子的相关性分析,证明因子的独立性。
  • 高频因子挖掘流程的图示,以及模型在训练集、验证集和样本外测试集的划分说明。
  • 风险提示:模型基于历史数据,存在市场环境变化导致策略失效的风险。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告