报告概述
本报告围绕“人工写因子”向“AI挖因子”的范式升级,构建了LLM-MCTS可解释因子迭代框架。MCTS负责公式搜索树中的选择、扩展、评测和回传,LLM负责生成金融假说、可执行表达式或Python函数、解释机制并审查数据合法性。该框架将候选生成、周度RankIC/IR评测、样本内选择、样本外检验和经验库沉淀组织成闭环,可覆盖日频Seed定向改造、低频Seed池批量挖掘和高频分钟行为挖掘。报告详细介绍了框架的运作逻辑、实验参数、案例分析和整体效果,为量化因子研究提供了一种高效、可解释的自动化迭代方法。
报告的核心结论
LLM-MCTS框架可系统化提升因子挖掘效率与解释性
报告构建的LLM-MCTS框架将MCTS的搜索控制能力与LLM的语义生成能力结合,在日频、低频和高频三个场景均取得显著效果。该框架不是一次性生成因子,而是通过闭环迭代不断优化,使候选公式在进入评测前已有可解释的金融含义,同时通过真实数据评测筛选出有效方向,兼顾了效率、质量和可解释性。
约三分之二样本内最优因子可外推到样本外
在29个日频价量Seed因子的定向改造实验中,所有Seed的最终入选因子在样本内均优于原始Seed,其中19个(约65.5%)在样本外仍保持优势。这表明框架能够稳定地改进因子,但样本内最优未必等于样本外最优,需要加强稳健性筛选。批量挖掘实验中,173个样本内优于原始Seed的候选中有143个(82.7%)样本外仍优于原始Seed,进一步验证了框架的有效性。
高频因子中高量脉冲次数机制表现突出
在高频因子挖掘实验中,基于成交量脉冲次数的高频因子(seedtxt_vol_up_num)表现最优,样本内RankIC为0.0839,样本外RankIC为0.0744,IC保留率达到0.89。该因子通过识别成交量进入高位状态的连续区间起点数,刻画异常放量事件次数,而非简单统计高量分钟总数,体现出交易状态切换带来的预测价值。
报告回答的关键问题
如何实现从人工写因子到AI挖因子的范式升级?
报告提出LLM-MCTS框架,将因子生成建模为公式搜索树,MCTS负责选择扩展节点并管理搜索预算,LLM负责提出金融假说和候选公式。通过反复迭代,系统能够自动探索大量潜在因子,同时保持可解释性,从而突破人工研究的效率和认知瓶颈。
LLM-MCTS框架如何平衡搜索效率与因子可解释性?
LLM在MCTS扩展时生成带有金融假说、方向、适用场景和组件解释的候选公式,确保候选在评测前已有可解释含义。MCTS使用reward和UCT机制决定搜索路径,既要利用高分分支也要探索未充分分支,避免过早收敛。同时样本内选择、样本外验证的规则防止过度拟合,最终保留的因子既有效又可解释。
高频因子挖掘中哪些机制最有效?
报告发现,高频因子中基于成交量脉冲次数(高量脉冲次数)的机制最有效,样本内外RankIC均超过0.07。此外,高量分钟收益波动、成交额加权实现波动率、尾盘相对开盘振幅等因子也表现优秀,验证了从日频公式扩展到分钟级交易行为机制的有效性。
报告中的代表性数据
日频Seed因子改进成功率(样本外优于原始Seed)
2024-01-01至2026-05-27,在29个日频价量Seed的定向改造中,最终入选因子中有19个在样本外(2024-01-01至2026-05-27)优于原始Seed,占比65.5%。
批量挖掘双优候选相关性(均值)
全区间(2019-2026),123个样本内外均优于原始Seed的候选因子之间,全局绝对相关性均值为0.2604,中位数为0.2148,90%分位数为0.5529,说明候选因子同质化程度较低,搜索发现了多样化的有效机制。
高量脉冲次数因子样本外RankIC
样本外区间(2024-01-01至2026-05-27),高频因子seedtxt_vol_up_num(高量脉冲次数)在样本外周度RankIC为0.0744,样本内为0.0839,IC保留率0.89,是当前30个可评测高频因子中表现最好的因子。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 详细阐述了从传统人工因子、深度学习、遗传规划到大语言模型的因子研究范式变革,分析了各自瓶颈与LLM-MCTS融合框架的优势。
- 完整介绍LLM-MCTS模型的运作逻辑,包括MCTS四个步骤(选择、扩展、评测、回传)、reward与UCT计算公式、virtual expansion机制,以及LLM在候选生成、逻辑假说、组件解释、逻辑审查和反馈吸收中的具体功能。
- 以vstd20为例,逐层展示LLM-MCTS搜索树的构建过程,包括第一层候选的生成与评估、第二层优化路径的决策依据,以及最终改进因子的样本内外表现对比。
- 汇总29个日频价量Seed因子的整体优化效果,从正式选择口径和候选池诊断口径两个维度进行评估,并给出部分Seed的代表性候选因子表现表。
- 深度剖析std20、cntn20、rank20三个优秀案例,从原始公式的金融逻辑出发,详细解释改进因子的构造思路、经济含义和指标提升幅度,并配有样本内外多空净值曲线图。
- 展示低频Seed池批量挖掘的实验设计、12个根节点选择、与前述实验的参数差异,以及批量挖掘的结果漏斗,包括样本内/样本外双优候选数量、去重公式数、经验库沉淀数和候选相关性分布。
- 提供高频因子挖掘的完整流程设计,包括LLM生成候选的机制分类、因子代码示例、30个可评测高频因子的表现表格,以及高量脉冲次数机制的经验拆解。
- 包含完整的风险提示章节,涵盖模型失效、过拟合、数据质量、大语言模型生成、交易成本与流动性等风险。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





