报告概述
本报告属于国金证券金融工程Alpha掘金系列,聚焦于利用生成流网络(GFlowNet)和AlphaEval评估框架进行分钟频因子挖掘与筛选。报告首先回顾了GFlowNet的原理及其在日频数据挖掘中的应用,随后重点介绍了分钟频数据快速计算框架的设计与实现,包括内存映射(MemMap)机制和两阶段计算架构。在此基础上,报告展示了分钟频特征挖掘的单因子表现,并与日频因子进行了信号增量对比。此外,报告引入了AlphaEval多维度因子筛选方法,从预测能力、时序稳定性、扰动鲁棒性、金融逻辑性和多样性五个角度对因子进行评估,并结合深度学习模型构建指数增强策略。通过阅读报告,投资者可以了解前沿的因子挖掘技术、高效的分钟频计算框架以及系统化的因子筛选流程,为量化投资研究提供新的工具和思路。
报告的核心结论
GFlowNet相比强化学习和遗传规划更擅于挖掘低相关性、高多样性的因子池
GFlowNet的优化目标不是寻找单一最优公式,而是按照奖励分布进行采样,天生具备多样性保证。在相同任务中,GFlowNet生成的因子之间相关性中位数仅不到0.04,而强化学习的batch内相关性中位数急速上升至1。这一特性使得GFlowNet非常适合构建多因子选股模型所需的低相关Alpha池。
分钟频因子在日频信号基础上提供了额外的增量信息
在日频因子基础上加入分钟频因子后,LGBM合成模型的多空年化收益率从124.14%提升至127.11%,多空Sharpe从8.83提升至9.01。尽管当前分钟频有效因子数量较少,但已显示出分钟频数据蕴含的独特信息能够增强因子组合的表现。
基于DPP的多样性筛选结合LGBM合成是构建因子组合的有效方式
在1134个待选因子中,通过DPP方式筛选出800个因子,并用LGBM模型合成,获得了22.51%的多头年化超额收益率和1.25的多头Sharpe,优于等权和线性回归等合成方式。其他角度(如PPS预测能力、RRE秩稳定性、金融逻辑性)的筛选在收益端没有明显提升,但RRE筛选可有效降低因子换手率。
筛选后的因子与AI模型融合后,在沪深300、中证500和中证1000上均实现稳定正超额收益
基于DPP筛选的800个因子,使用LGBM模型合成后构建指数增强策略,在沪深300、中证500、中证1000上分别实现14.80%、11.16%和17.42%的年化超额收益率,信息比率分别为2.96、2.07和2.78。各宽基指数均获得了稳定的超额表现,验证了因子挖掘与筛选框架的有效性。
报告回答的关键问题
GFlowNet与强化学习在因子挖掘中有什么本质区别?
GFlowNet与强化学习的根本区别在于优化目标。强化学习旨在最大化预期奖励,找到最优解,容易陷入模式崩溃,生成高度同质的因子。而GFlowNet按照奖励大小的分布进行采样(P(x)∝R(x)),天生保证多样性,能够广泛探索公式空间,挖掘出结构多样、相关性低的因子,更适合构建多因子组合。
分钟频因子挖掘面临哪些技术挑战?如何解决?
分钟频因子挖掘的主要挑战是内存瓶颈:分钟频数据量巨大,无法全部读入内存。报告采用MemMap机制,通过操作系统的虚拟内存按需访问数据,仅将需要的数据页加载到内存。同时,将完整公式拆分为日内block和日频tree两段,采用numba单线程计算和loky多进程并行,并引入持久化block cache加速重复结构的计算。
AlphaEval从哪些维度评估因子?有效性如何?
AlphaEval从五个维度评估因子:预测能力(PPS)、时序稳定性(RRE)、扰动鲁棒性、金融逻辑性和多样性。实验显示,多样性维度通过DPP筛选效果最好,能显著提升因子组合收益;RRE秩稳定性筛选虽然收益提升不明显,但能有效降低因子换手率;金融逻辑性筛选和PPS筛选在收益端未带来明显改善。
基于GFlowNet挖掘的因子在指数增强中表现如何?
基于GFlowNet挖掘的日频和分钟频因子,经AlphaEval筛选和LGBM合成后,用于沪深300、中证500、中证1000指数增强。年化超额收益分别为14.80%、11.16%和17.42%,信息比率均超过2,且各年超额收益稳定为正。其中沪深300增强近一年表现突出,截止5月底已实现7.01%的超额收益。
报告中的代表性数据
GFlowNet日频因子IC均值中位数
2010-01-01至2020-12-31(训练集2010-2018,验证集2019-2020),基于原始日频K线挖掘的99个因子,IC均值中位数达4.43%,多头年化超额中位数5.23%。
分钟频因子IC均值中位数
同上,基于分钟频特征挖掘的32个因子,IC均值中位数3.19%,多头年化超额中位数4.21%。因子平均长度11.22,可解释性较弱。
沪深300指数增强年化超额收益
回测区间未明确(截至2026年5月),基于DPP筛选的800个因子+LGBM合成,在沪深300上实现年化超额14.80%,跟踪误差5.00%,信息比率2.96。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- GFlowNet原理的详细数学推导:涵盖流匹配条件、Trajectory Balance目标函数、状态表示(Transformer encoding+手工特征)以及奖励函数设计(IC、多头IR、Barra相关性惩罚)的完整公式和训练流程。
- 日频数据挖掘的完整结果:包含基于原始日频K线、衍生特征和分钟聚合特征三组挖掘的因子数量、IC分布、相关性矩阵、因子表达式示例(含IC/ICIR/多头收益等统计值),以及因子长度和复杂度分布图表。
- 分钟频快速计算框架的架构详解:包括MemMap机制的工作原理、文件组织方式(按年份和通道的float32 memmap张量)、计算流水线(日内block+日频tree)、并行策略(numba+loky)、缓存机制(LRU持久化block cache)以及性能优势分析。
- 分钟频因子与日频因子的信号增量对比:通过LGBM合成模型,展示加入分钟频因子后多空收益、RankIC、多头超额等指标的提升幅度,以及多空净值曲线的对比图表。
- AlphaEval多维度筛选的实验设置与结果:包含所有待选因子池(深度学习隐藏层672个、国金金工因子库117个、GFlowNet因子345个)的构成,多样性筛选(时序相关性/DPP)的详细统计数据,以及预测能力、秩稳定性、金融逻辑性角度筛选后的因子表现对比表。
- 指数增强策略的构建细节与回测结果:包括沪深300、中证500、中证1000三个宽基指数增强的净值曲线、分年度收益、风险指标(年化收益率、波动率、最大回撤、换手率、跟踪误差等),以及历史超额收益的稳定性分析。
- 完整的因子表达式列表:报告中未展示全部因子,完整PDF包含所有筛选出的因子公式,便于投资者复现和进一步研究。
- 风险提示及免责声明:强调模型基于历史数据,政策环境变化可能导致时效性风险;策略假设回测条件可能与实际交易存在差异,需谨慎使用。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





