报告概述

本报告是兴业证券金工团队机器学习系列研究的第九篇,突破传统线性分域框架,创新性地引入面板树模型与风格因子结合,构建动态非线性股票分域体系。报告详细介绍了面板树的构建原理、分域训练流程以及基于代表域的模型优化方法,并在沪深300、中证500和中证1000指数上进行增强策略回测。研究旨在提升收益率预测模型的准确性与稳健性,为量化投资者提供更精细化的选股工具。

报告的核心结论

非线性分域训练能显著提升因子有效性

基于面板树将股票按风格因子非线性分域后,分别训练XGB模型,所得因子在全市场Rank IC均值约0.122,且在沪深300、中证500等股票池内Rank IC和ICIR均优于全域训练模型,说明分域建模能更好捕捉市场异质性。

局部集优化进一步改善分域效果

通过改进面板树筛选代表性样本子集(代表域),使正负样本更均衡,改造后因子Rank IC均值提升至0.123,且与风格因子相关性进一步降低。沪深300增强策略年化超额收益达12.8%,收益风险比2.14,超额最大回撤仅5.6%。

分域训练因子在宽基指数增强中表现稳定

repDomainXGB因子在沪深300、中证500和中证1000指数增强中,长期年化超额收益分别约12.8%、17.5%和24.1%,超额夏普比率均超过2,月度胜率75%以上,展示了跨市值板块的稳健性。

分域训练降低了因子对常见风格因子的暴露

与基准XGB模型相比,分域训练因子在市值、流动性、特质性波动率等风格上的相关系数明显降低,说明分域方法有效剥离了风格风险,更纯净地捕捉了Alpha。

报告回答的关键问题

如何用机器学习进行非线性股票分域?

报告引入面板树模型,以最大化全局夏普比率为目标,利用风格因子作为特征,通过滚动训练动态将股票划分为风格同质的子域。与传统线性分域(如按市值、行业)不同,面板树能捕捉因子的非线性交互,产生差异化的分域结果。

分域训练如何提升量化因子表现?

分域训练先通过面板树将股票分组,再对每个子域独立训练XGB模型。在特征标准化和标签标准化上采用域内处理,并融合不同域模型的预测。这种方式让模型更聚焦于特定域内的有效模式,从而提升因子Rank IC和分组收益,尤其在沪深300等股票池内效果显著。

指数增强策略中分域训练因子效果如何?

以repDomainXGB因子为例,在严格约束下(个股、行业、风格偏离限制),沪深300增强年化超额12.8%(2015-2025),中证500增强17.5%,中证1000增强24.1%,超额夏普均超2,最大回撤控制在6%左右,且各年度超额收益稳定。

面板树模型与传统决策树有何不同?

面板树以全局夏普比率最大化为分裂目标,而非传统树的局部纯度或MSE极小化;它内嵌面板数据结构,允许叶子节点收益随时间变化;输出的是可交易的多空组合权重,而非预测标签。这些特性使其更适合资产定价与因子挖掘。

报告中的代表性数据

0.122

全市场Rank IC均值

2015年初至2025年10月底,基础分域训练因子(domainXGB)在全市场周度测试中的Rank IC均值,标准差0.121,IC_IR为1.006。

12.8%

沪深300增强年化超额收益

2015年初至2025年10月底,repDomainXGB因子在沪深300指数增强测试中的年化超额收益率,跟踪误差6.0%,收益风险比2.14,最大回撤5.65%。

24.1%

中证1000增强年化超额收益

2015年初至2025年10月底,repDomainXGB因子在中证1000指数增强测试中的年化超额收益率,跟踪误差6.0%,收益风险比4.02,最大回撤6.17%。

以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。

完整报告包含什么

  • 完整的机器学习研究框架与方法论介绍,包括兴证金工团队自2020年以来的研究方向划分。
  • 面板树模型的详细原理、数学公式(如权重计算、分裂准则)及与传统决策树的对比表。
  • 基于风格因子的基础面板树构建过程,包含数据预处理、超参数设定、树生长算法。
  • 面板树有效性检验与分组结果特征统计,展示成分股占比、行业分布差异的图表。
  • 分域训练下XGB模型的完整框架,包括全域特征标准化、域内标签标准化、分域训练合并三个步骤。
  • 面板树改进为局部集优化的方法:模型预热与筛选策略,以及参与股票数目、正负样本平衡的对比分析。
  • 多头代表域与空头代表域模型的差异分析,包括特征重要性图和大类因子统计。
  • 复合因子相关性矩阵及指数增强测试的详细设定(约束条件、交易成本)。
  • 沪深300、中证500和中证1000指数增强的完整回测结果,包括分年度超额收益、风格暴露统计和相对净值曲线。
  • 风险提示:模型结果基于历史数据,市场转变时存在失效风险。

本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。

相关报告