报告概述
本报告围绕量化因子挖掘中深度表征学习与数据分布纠偏的核心命题,从IC损失优化的基线Transformer出发,沿最优传输理论与生成对抗学习两条主线,系统构建了全局分布对齐(GDA)、非平衡输出对齐(UOA)、双轨Sinkhorn网络(DTSN)、双轨对抗挖掘网络(DTAN)四个递进模型。报告覆盖全A股市场及沪深300、中证1000、国证2000指数增强策略,采用切片Wasserstein距离、非平衡最优传输、WGAN-GP判别器等先进方法,旨在解决传统因子挖掘中分布形态约束不足、多头区分度弱、跨期稳定性差等问题,为量化投资研究者提供从理论到实践的完整方法论。
报告的核心结论
全局分布对齐可提升因子对真实收益分布的拟合精度。
报告通过引入切片Wasserstein距离度量预测分布与真实收益分布的几何差异,在IC损失基础上叠加分布对齐目标,使GDA模型IC均值从基线0.0976提升至0.1045,多头组合年化收益率提升3个百分点,且因子分布检验中W1距离最小(0.090),分布形状拟合效果最优。
非平衡最优传输能有效聚焦多头端收益信息。
UOA模型通过KL松弛边缘约束与topk目标边缘增强,将传输代价向高收益区间倾斜,并引入条件状态感知机制自适应调节匹配强度。相比GDA模型,IC均值提升至0.1117,多头年化收益率提升近2个百分点至40.50%,最大回撤降低5.26个百分点,表明偏心分配策略显著增强多头选股能力。
潜空间历史模板锚定可提升因子稳定性。
DTSN模型在输出端UOT约束基础上,新增潜空间锚定轨,通过动态更新历史牛股潜特征记忆库,迫使中间层表征向经典高收益模式靠拢。相比UOA模型,因子IC均值提升至0.1137,多头年化收益率提升近2个百分点至42.19%,最大回撤降低1.3个百分点,超额收益稳定性和回撤控制均有改善。
对抗生成学习可自适应挖掘更深层分布差异。
DTAN模型用两个WGAN-GP判别器分别替代输出端UOT和潜空间切片Wasserstein,使分布度量在对抗博弈中进化。相比DTSN模型,IC均值提升至0.1173,多头年化收益率提升近3个百分点至45.04%,最大回撤降低近3个百分点,且在沪深300、中证1000、国证2000指数增强中分别实现13.36%、24.22%、31.75%的年化超额收益。
报告回答的关键问题
深度学习因子挖掘存在哪些可优化点?
报告指出当前深度学习因子挖掘存在两项可优化点:一是传统IC损失仅约束预测值排序方向,对分布形态缺乏约束,导致尾部区分度不足与跨期不稳定;二是深度Transformer网络在时序特征编码中缺少表征层面约束,模型可能将有效信号压缩至序列末端,造成潜空间漂移与过拟合。
最优传输理论如何应用于因子挖掘?
报告将最优传输引入损失函数,用切片Wasserstein距离度量预测分布与真实收益分布的几何差异,实现全局分布对齐;进一步通过非平衡最优传输(UOT)将传输代价向多头端倾斜,并引入条件状态感知机制,使模型在输出层和潜空间均实现分布纠偏,显著提升多头端选股精度。
对抗生成网络在因子挖掘中如何替代手工度量?
报告用WGAN-GP判别器替代手工定义的分布距离(如UOT和切片Wasserstein),通过Kantorovich-Rubinstein对偶形式,让判别器在对抗训练中自适应学习分布差异。生成器被迫与不断进化的判别器竞争,从而突破固定度量的局限,捕捉非线性分布差异,进一步提升因子IC和多头收益。
DTAN模型在指数增强策略中的表现如何?
DTAN模型构建的沪深300指数增强策略年化超额收益率13.36%,中证1000指数增强年化超额24.22%,国证2000指数增强年化超额31.75%。策略采用个股权重偏离不超过1%、行业权重偏离不超过2%、成分股权重不少于80%等约束,回测区间为2019年1月至2026年5月,月频调仓,体现了模型在不同市值风格下的稳健超额能力。
报告中的代表性数据
因子IC均值对比
2019年1月至2026年5月,DTAN模型在全A股范围内10日调仓RankIC均值,显著高于基线模型(0.0976)、GDA(0.1045)、UOA(0.1117)和DTSN(0.1137)。
多头组合年化收益率
2019年1月至2026年5月,DTAN模型全A股Top10%多头组合年化收益率,相比DTSN模型(42.19%)提升近3个百分点,信息比率1.82,最大回撤32.78%。
年化超额收益率
2019年1月至2026年5月,DTAN模型国证2000指数增强策略年化超额收益率,沪深300和中证1000分别为13.36%和24.22%。
以上数据根据报告摘要整理,具体统计口径和数值请以完整报告原文为准。
完整报告包含什么
- 完整市场数据与趋势图表:涵盖全A股、沪深300、中证1000、国证2000成分股内各模型的因子IC、分组收益、分年度超额表现等回测图表。
- 研究模型与评价维度:详细阐述基线Transformer、全局分布对齐、非平衡输出对齐、双轨Sinkhorn、双轨对抗网络五个模型的数学原理、损失函数设计和训练流程。
- 因子分布检验分析:从偏度、峰度、1D Wasserstein距离及Q-Q分位数偏差四个维度评估各模型输出因子与真实收益的形状差异,并给出9个分位点上的平均绝对偏差表。
- 指数增强策略回测:包含沪深300、中证1000、国证2000三个指数的增强策略构建细节(权重偏离约束、行业偏离、交易费率等)及分区间(近一月、三月、一年、三年)超额表现。
- 对抗网络训练工程细节:包括双轨判别器结构、梯度惩罚、噪声注入、潜空间记忆库预热与更新策略等关键参数设定。
- 总结与展望:归纳从手工约束到对抗学习的方法论演进,指出未来可升级判别器架构、引入市场状态自适应记忆库、应用谱归一化等稳定性技术。
本页内容由川海智库整理,用于帮助读者快速了解报告主题、核心观点和主要内容。由于报告量大、人工能力有限,部分观点、数据、统计口径或表述可能存在偏差,具体内容请以完整报告原文为准。





