AlphaEval:公式阿尔法挖掘的综合高效评价框架(KDD 2026)

原题:AlphaEval: A Comprehensive and Efficient Evaluation Framework for Formula Alpha Mining

一句话总结:AlphaEval 用预测力、时间稳定性、扰动鲁棒性、金融逻辑和信号多样性五维评分替代候选筛选阶段的完整回测;在 A 股与标普 500、八种挖掘方法上,它以 20 个进程将相对评价时间降低超过 25%,且高稳定性、高鲁棒性得分分别与较低换手率和最大回撤显著相关,但不能验证仓位、交易成本或路径依赖记账。

问题与动机

公式阿尔法挖掘会产生大量把市场数据映射为收益预测信号的表达式。现有工作通常用信息系数(Information Coefficient,IC,即因子分数与未来收益的横截面相关性)或历史回测评价候选:前者便于计算,却只测预测关系;后者能覆盖投资组合结果,却依赖仓位、成本和执行规则,而且单条策略必须沿时间顺序更新状态,难以大规模并行。

AlphaEval 的目标不是宣布某条策略可投入资金,而是在生成候选与完整回测之间提供统一、可并行的筛选层。它评价一套挖掘方法产生的因子集合,并尝试回答这些因子是否可预测、是否随时间稳定、是否抗输入扰动、是否具有可解释的金融逻辑,以及彼此是否重复。

关键观察 / 隐含假设

  • 观察 1:单一预测指标无法解释可交易性的多个风险面。 论文发现,相对排序熵(Relative Rank Entropy,RRE,衡量相邻时点资产排序的一致性)与年化换手率显著负相关,单变量回归系数为 -4.361、,解释 81.5% 的换手率方差(图 5(a)、表 4)。
    • 依赖假设:相邻时点排序变化主要对应真实调仓需求,而不是数据频率、停牌或组合规则造成的机械变化。
    • 可能失效场景:事件驱动、低频调仓或带持仓缓冲区的策略可能有高排序波动,却不产生同等换手。
  • 观察 2:输入扰动稳定性可作为部分下行风险的筛选代理。 扰动保真分数(Perturbation Fidelity Score,PFS,衡量加入高斯或重尾噪声前后资产排序的相关性)不低于 0.9 的因子组最大回撤显著更低;参数检验和非参数检验均给出 (图 4、图 5(b)、表 5)。
    • 依赖假设:按市场指数波动率标定的合成噪声能代表部署时的重要市场扰动。
    • 可能失效场景:制度切换、流动性枯竭和数据供应商修订不是独立同分布噪声,可能保留高 PFS 却在真实冲击下失效。
  • 假设 1:五维标准化加权分数能稳定代表候选质量。
    • 证据强度:中。2021–2024 年 A 股实验中,综合分数选出的组合累计收益高于任一单指标选择(图 2),但权重按同一评价轮次的候选分布标准化,排序可能随候选池改变。
  • 假设 2:大语言模型(Large Language Model,LLM)的金融逻辑评分可以补充统计指标。
    • 证据强度:中。GPT-4o 评分与专家排序的归一化折损累计增益(Normalized Discounted Cumulative Gain,NDCG)在多个截断位置约为 0.89–0.98(图 5(c)),但单一评审模型、提示词和 50–100 分区间可能带来系统偏差。

核心方法

AlphaEval 保留 IC 与秩信息系数(RankIC),将二者加权为预测力分数。时间稳定性用相邻交易日资产排序分布之间的散度构造 RRE;扰动鲁棒性则分别加入与市场日波动率匹配的高斯噪声和自由度为 3 的 Student-t 重尾噪声,再计算扰动前后排序相关性形成 PFS。

金融逻辑维度把因子表达式交给 LLM,要求从经济直觉、逻辑一致性和可解释性评分。多样性维度对候选因子输出的协方差矩阵做特征值分解,以归一化谱熵衡量信号是否集中在少数共同方向;低熵表示较强共线性,高熵表示因子集合可能携带更互补的信息。

五个分数在每个数据集和评价轮次内标准化,再按非负且和为 1 的权重组合。因为各指标可在因子、扰动样本或候选集合之间并行计算,框架避开了完整回测沿时间递归更新现金、仓位和成本的关键串行路径。

设计取舍

  • 以因子属性替代策略路径换取并行性:候选筛选更快,也能给出分维诊断;代价是无法覆盖仓位规模、风险预算、交易成本、市场冲击和路径依赖记账。
  • 合成扰动换取可重复的鲁棒性测试:高斯与重尾噪声易控制,但不能代表相关性突变、停牌、流动性危机或制度变化。
  • LLM 评审换取金融语义信号:可评价公式的表面经济直觉,却引入模型、提示词和预训练知识偏差;逻辑合理也不等于统计有效。
  • 轮内标准化换取跨指标聚合:不同量纲可被统一加权,但候选池或市场改变时,同一因子的综合分数未必可直接比较。

实验与结果

  • 在 Qlib 的 A 股与标普 500 数据上评价遗传编程、强化学习、生成式模型和 LLM 等八种挖掘方法;A 股训练、验证、测试期分别为 2010–2019、2020、2021–2024(§5.1、附录 C)。
  • A 股结果中 AlphaAgent 的预测力分数最高,为 0.041;AlphaGen 的稳定性和鲁棒性分别为 0.978 和 0.997;AutoAlpha 的多样性为 0.946,说明不同方法的优势不能由单一指标概括(表 2)。
  • 用综合 AlphaEval 分数筛选的 A 股组合在 2021–2024 年累计收益约为 130%,高于单用预测力或 LLM 逻辑评分的约 110%–120%,也高于稳定性或扰动鲁棒性筛选的约 30%–70%(图 2;数值按曲线读取)。
  • RRE 对年化换手率的回归系数为 -4.361,;PFS 以 0.9 分组后的最大回撤差异在 t 检验与 Mann–Whitney U 检验中均为 (表 4、表 5)。
  • 在可并行部分使用 20 个进程时,相对完整回测的评价时间降低超过 25%(图 5(d)、§5.6);论文未报告绝对时间、硬件或随候选规模变化的扩展曲线。

论断—证据表

论断证据评测边界置信度
五维评价比单指标筛选更能选出高历史收益的因子集合图 2、§5.3A 股 2021–2024;组合和候选池由作者固定
RRE 可作为换手率的筛选代理图 5(a)、表 4单变量回归;
PFS 可识别历史最大回撤较低的因子图 4、图 5(b)、表 5合成噪声;阈值 0.9;历史股票数据
无回测评价可降低候选筛选时间图 5(d)、§5.620 个进程;只报相对时间

批判性分析

论证链条

论文从“回测难并行、IC 维度过窄”推导出多维无回测评价,再用换手率、最大回撤、专家排序和运行时间分别验证各维度,主链条基本闭合。最重要的边界是:这些实验只说明五个代理指标与作者选择的历史行为相关,不能推出它们足以替代最终回测。论文在 §7 主动承认这一点,因此“无回测”应理解为筛选阶段的实现属性,而不是投资验证结论。

假设压力测试

PFS 的市场扰动模型把现实冲击压缩为独立高斯或 Student-t 噪声;相关性结构变化、涨跌停、缺失数据和成交约束可能形成完全不同的失败模式。RRE 与换手率的强关系也依赖作者的资产排序到组合映射。更换调仓缓冲、持仓上限或成交规则后,回归关系需要重新测量。

综合分数在候选池内标准化,意味着加入一批极端候选即可改变其他因子的相对位置。论文没有报告权重选择协议、跨市场校准或候选池污染攻击;如果把 AlphaEval 直接作为搜索奖励,搜索器还可能学会利用这些代理指标而不提高封存样本外收益。

实验可信度

跨 A 股、标普 500 和八种方法的覆盖比只测单模型更有说服力,RRE 与 PFS 也给出了显著性检验。薄弱处是图 2 的综合筛选收益仍来自同一历史协议,缺少嵌套时间切分、独立前瞻窗口和选择次数记账;效率实验只给相对柱状图,无法判断绝对成本和瓶颈是否随候选数量线性扩展。

系统性缺陷

开源实现改善了可复现性,但论文未讨论数据版本、评审模型版本、提示词变更和候选池变化如何使旧分数失效。PFS 要重复计算扰动后的所有因子,逻辑评分还依赖外部模型调用;当因子数和市场数增长时,缓存、版本化、失败重试和成本控制会成为新的评价系统问题。

局限与后续工作

  • 局限 1:只评价因子,不覆盖仓位、风险控制、执行、成本和路径依赖会计,不能替代完整回测或模拟交易。
  • 局限 2:逻辑分数依赖 GPT-4o 和固定提示词,跨评审模型稳定性证据有限。
  • 局限 3:实证只覆盖股票;期货、多资产、不同频率和跨市场泛化尚未完成。
  • 后续工作 1:在固定候选预算下加入封存时间窗口,比较 IC、AlphaEval 和完整回测筛选后的前瞻存活率。
  • 后续工作 2:注入相关性突变、缺失值、复权错误和流动性冲击,测量 PFS 对真实数据与市场故障的检出率。
  • 后续工作 3:把 AlphaEval 作为搜索奖励时记录查询次数,并测试搜索器是否出现代理指标投机以及封存集退化。

相关