AlphaPareto: Formulaic Alpha Discovery with LLM-Guided Multi-Objective Reinforcement Learning¶
会议: NeurIPS2026
arXiv: 2609.34188
代码: https://github.com/BiQiBaoWinner/AlphaPareto
领域: 强化学习
关键词: 公式化因子发现、多目标强化学习、因子池语义编码、帕累托优化、量化投资
一句话总结¶
AlphaPareto 用冻结 LLM 编码当前因子池,让 MaskPPO 在知道已有信号的条件下逐 token 搜索公式,并通过自适应多目标奖励兼顾预测力、排名稳定性、扰动鲁棒性与多样性,在 CSI300、CSI800 和全市场取得 3.92%、5.70% 和 10.10% 的样本外 IC。
研究背景与动机¶
公式化 alpha 是把历史价格、成交量等市场特征变成选股信号的数学表达式。它比纯黑箱预测器容易解释和审计,但单个因子通常无法跨市场环境保持有效,因此实际预测信号往往来自一个因子池:先对各因子做横截面标准化,再用拟合的线性权重组合为 mega-alpha。发现因子时,真正需要优化的不是某条公式单独有多强,而是它加入已有池后,能否贡献未被覆盖的信息。遗传编程通常独立搜索高 IC 表达式;AlphaGen 则通过池级奖励推进到协同因子发现,但仍存在状态与奖励不一致的问题。
具体来说,旧 RL 状态只包含正在构造的公式前缀,而奖励取决于当前池的组成。同一条完整公式在池为空、池内已有相似动量因子、池内缺少量价信号时,可能获得不同评价。池在跨回合更新,策略却看不到这部分上下文,只能从变动的奖励中间接猜测搜索方向。与此同时,单一 IC 只衡量平均预测相关性:高 IC 池仍可能在相邻交易日大幅改变股票排序、对扰动敏感,或者堆积高度重复的因子。提高平均预测力,并不自动解决这些结构性问题。
本文因此同时改变“策略知道什么”和“策略追求什么”:把当前池纳入状态,用冻结 LLM 的隐表示概括公式结构及组合权重;再把奖励扩展为四维,用最低目标水平表达偏好,并依据近期奖励分布求出标量化权重。LLM 在这里不是直接写公式的生成器,公式仍由 RL 策略搜索。核心 idea:让公式搜索显式感知当前因子池,并用在线帕累托正则化把池的多维质量反馈转化为可训练的奖励。
方法详解¶
整体框架¶
输入是历史市场数据、未来收益标签以及当前因子池;输出是一个容量受限的公式集合及其线性组合权重。每回合先进行因子池语义编码,再通过池条件公式搜索生成候选,合法候选加入池并重新拟合组合器后计算四维池奖励,最后用自适应帕累托标量化驱动 PPO 更新。
训练时,未来收益用于拟合组合权重和计算 IC;LLM 不接收反向传播。搜索结束后的预测阶段只执行已发现的公式、标准化及线性组合,不需要未来收益,也不需要让 LLM 再生成因子。框架图中的虚线明确表示训练反馈,而不是部署时的数据流。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
I["当前因子池<br/>公式与组合权重"] --> A["因子池语义编码"]
A --> B["池条件公式搜索"]
H["历史市场数据"] --> B
B -->|合法公式入池并重拟合| C["四维池奖励"]
Y["训练期未来收益"] -.->|组合拟合与 IC| C
C --> D["自适应帕累托标量化"]
D -.->|仅训练:PPO 更新| B
C -.->|下一回合:更新池| A
C -->|搜索结束:保留池与权重| O["预测:执行公式<br/>标准化后线性组合"]
关键设计¶
1. 因子池语义编码:把隐含的奖励上下文变成可见状态
作者先在概念上把状态扩展为“当前公式前缀 + 当前因子池”。这样,原来由池变化引起的奖励漂移就成为状态变化,而不是相同可见状态下的奖励函数变化。这里解决的是搜索过程的状态—奖励错位,不是证明真实金融市场本身变得平稳。
实际因子池由复杂表达式和拟合权重构成,直接拼接数值并不容易表达信号重叠、时间尺度和信息缺口。结构化 prompt 因此提供每条公式及其权重,引导冻结 LLM 关注因子风格、数据来源覆盖、权重集中和潜在盲点。附录中的 prompt 还要求给出下一因子的构造风格建议,但实际策略接口采用最后一层隐表示,而不是把这些文字建议直接当成新公式。
默认编码器是 Qwen-Embedding-4B,其池表示为 2560 维。编码器在 RL 期间完全冻结,每回合根据当前池重新计算表示,并在这一条公式的 token 搜索中复用。这样既向策略提供池上下文,也避免对 LLM 做昂贵的联合训练;但压缩表示是否保留足够信息,仍是经验假设,不能把它等同于无损的完整状态。
2. 池条件公式搜索:让下一 token 的选择取决于已有信号
公式采用逆波兰记法(RPN),特征与操作符按照栈式求值顺序组成 token 序列。策略从 BEG 开始,逐步选择价格、成交量、常数、时间窗口或操作符;无效动作掩码排除不符合表达式语法的下一步。选择 SEP 或达到最大长度后结束回合,再解析完整表达式。因此可解释性来自有限的公式语法与长度约束,而不是对黑箱预测器事后解释。
正在构造的前缀由两层 LSTM 编码。LSTM 表示与冻结 LLM 的池表示分别投影到 256 维共享空间,做逐元素乘法后,再由 FFN 映射到 128 维表示,送入 MaskPPO 的策略头和值函数头。乘法融合使前缀特征受到池上下文的调制:同样的构造进度,在不同池中可以对应不同的动作分布。
候选不是按孤立 IC 排序后简单加入列表。合法公式先临时加入池,组合器重新拟合所有成员的权重,再按拟合贡献保留至多规定数量的因子。新公式可能替代旧成员,奖励评价的也是更新后的整个池。这个流程把“生成公式”和“与已有公式协同”连接起来,同时保证池规模不会随着搜索无限增长。
可用输入包括 Open、High、Low、Close、Vwap、Volume;操作符包含横截面 Rank、四则运算以及时间序列均值、标准差、相关性等。表达式本身可以包含非线性变换,但最终 mega-alpha 仍是线性组合;这两个层面的非线性不能混为一谈。
3. 四维池奖励:评价更新后的组合,而不只奖励平均预测力
IC 是训练期逐日计算的“mega-alpha 与未来收益的横截面 Pearson 相关系数”的时间平均。它不是新因子的独立相关性,也不是相对上一池的 IC 增量。其余三项分别针对股票排名随时间的稳定程度、组合输出对扰动的保真度,以及池内信号在不同方向上的分散程度。
下面用 \(S\) 表示评价交易日数,\(M\) 表示更新后的池大小,\(\widehat{\boldsymbol\alpha}_s\) 表示当天 mega-alpha,\(\boldsymbol p_s\) 表示把股票排名除以排名总和所得的概率向量,\(\widetilde p_i\) 表示因子信号协方差矩阵第 \(i\) 个特征值占全部特征值之和的比例。三项定义可紧凑写为:
RRE(Relative Rank Entropy)对相邻日期的排名分布计算 KL 散度,再经倒数变换求平均;排名越一致,得分越高。它度量的不是每日 IC 的方差,也不直接度量收益稳定性。公式中的首项 1 是作者对第一个评价日的处理。
PFS(perturbation fidelity score)中的 \(\rho\) 是 Spearman 排名相关。扰动直接乘在 mega-alpha 输出上,不是先扰动原始价格再重算因子。噪声以相等概率来自 Gaussian 或 Student-\(t_3\) 分布,并缩放到与股票收益经验横截面方差匹配;前者模拟常规波动,后者近似重尾冲击。这是输出排名抗扰动的代理指标,而不是实际政策冲击下收益一定可靠的保证。
DH(diversity entropy)先从单个因子信号的协方差矩阵取特征值,归一化后计算熵,再除以池大小的对数。方差越均匀地分布在正交方向上,DH 越高;大量高度重复的因子会使方差集中于少数方向。这不同于 prompt 中的权重集中度诊断,也不等于简单数出池中有多少条公式。
四项形成向量奖励,仅在合法公式终止并更新池后评价。未完成公式得到零向量,终止后解析无效则得到各分量均为负一的向量。需要注意,DH 的原式在池大小为 1 时存在归一化边界问题,缓存未说明初始化时如何数值处理,复现应核对实现。
4. 自适应帕累托标量化:用最低目标水平替代固定手调权重
预测力、稳定性、鲁棒性和多样性并非总能同步提升。MAP(Multi-Human-Value Alignment Palette)用偏好向量 \(\boldsymbol c\) 指定各目标的最低期望水平,再根据采样到的四维奖励求非负乘子,而不是要求使用者直接给四项奖励指定固定权重。
令 \(\boldsymbol r_t\) 为四维奖励,\(T\) 为近期采样数量,经验对偶优化与最终 PPO 奖励为:
与“一开始给 IC 很大权重”相比,这个设计根据当前奖励分布解释目标阈值,产生可在线更新的标量奖励。它没有取消主观偏好,而是把偏好放在各指标原有单位下的目标水平中。阈值不可实现时如何处理、乘子是否稳定,同样需要在应用时关注。
作者把原本面向离线固定转移的 MAP 改成在线版本:先由随机策略收集预热奖励求初始乘子,随后周期性用近期奖励向量重新解对偶问题,并照常更新 PPO 策略和值网络。论文借用 MAP 的帕累托论证,但这不意味着有限样本的在线 PPO 必然找到完整有效前沿,也没有展示覆盖所有偏好的策略集合。
一个完整示例¶
可以把一个回合理解为“给已有池寻找下一块拼图”。假设当前池主要由价格变换构成,语义编码会把已有表达式及权重压缩为池上下文;策略据此逐 token 搜索,而不是让 LLM 直接补一条量价公式。这是机制示意,不是论文报告的具体发现轨迹。
当策略形成合法表达式并终止时,系统把它临时加入池,重新拟合线性权重,并可能淘汰贡献较小的旧因子。随后检查更新后的 mega-alpha 与未来收益的相关性、相邻日期股票排名的变化、输出在混合噪声下的排名保真度,以及成员信号协方差的谱熵。四项指标共同决定这次池更新的质量。
当前乘子把四维结果转为一个 PPO 奖励。到下一回合,池编码也随成员及权重变化而更新,因此策略既接到训练反馈,又能直接看到下一轮搜索面对的池上下文。最终部署保留的是公式与组合权重,不保留训练标签作为输入。
损失函数 / 训练策略¶
训练使用 MaskPPO:策略头负责带动作掩码的 token 选择,值函数头估计标量化回报,LLM 保持冻结。有限回合的折扣因子取 1,表达式最大长度为 15;池容量在 10、20 两个选项中由验证集调节。
附录给出 LSTM 隐维度 128、dropout 0.1、batch size 128、Adam 学习率 \(5\times10^{-4}\),组合模型的 \(\ell_1\) 正则强度为 \(5\times10^{-3}\)。池容量为 10、20 时,总步数分别为 250,000、300,000;不要把附录另列的优化步数/容忍度 10,000/500 当作整体搜索预算。
偏好阈值中,CSI300、CSI800、Market 的 IC 目标分别为 0.090、0.085、0.250,RRE/PFS/DH 分别为 0.95/0.93/0.80。它们是训练目标而不是样本外结果,不能据此声称测试 IC 达到 9%、8.5%、25%。
实验关键数据¶
主实验¶
预测目标是未来 20 日收益;训练、验证、测试期分别为 2013/07/01–2023/06/30、2023/07/01–2024/06/30、2024/07/01–2025/06/30。下表选取原文表 1 的代表基线,括号内为跨随机种子的标准差,均以百分数表示;缓存中的“55”是数学文本重复,附录 F、K 明确为 5 个种子。
| 方法 | CSI300 IC | CSI800 IC | Market IC |
|---|---|---|---|
| Alpha158 | 2.99%(—) | 4.77%(—) | 4.04%(—) |
| AlphaAgent | 0.51%(0.34%) | 0.48%(0.46%) | 1.10%(0.59%) |
| R&D-Agent-Quant | 2.39%(0.96%) | 2.45%(0.73%) | 1.48%(0.91%) |
| AlphaGen | 3.69%(0.66%) | 5.07%(0.63%) | 8.44%(1.09%) |
| AlphaQCM | 0.50%(0.95%) | 4.79%(0.34%) | 9.16%(4.22%) |
| AlphaPareto | 3.92%(0.46%) | 5.70%(0.87%) | 10.10%(1.01%) |
相对各市场最强基线,平均 IC 分别提高 0.23、0.63、0.94 个百分点。不过 Market 上对 AlphaQCM 的配对检验不显著,原文报告 \(t=0.65\)、\(p=27.60\%\);CSI300 对 AlphaGen 的 \(p=8.34\%\) 只符合作者采用的 10% 显著性水平,不能概括成所有比较都达到 5%。
消融实验¶
表 4 在相同预测任务下比较两个组件,括号仍为种子间标准差。LLM 表示池语义编码,MORL 表示四维奖励与 MAP 优化的组合,不是单独更换一个损失项。
| 配置 | CSI300 IC | CSI800 IC | Market IC |
|---|---|---|---|
| 无 LLM、无 MORL(AlphaGen) | 3.69%(0.66%) | 5.07%(0.63%) | 8.44%(1.09%) |
| 仅 LLM | 2.37%(0.68%) | 5.04%(0.42%) | 9.68%(0.83%) |
| 仅 MORL | 3.99%(1.27%) | 5.54%(1.03%) | 9.63%(0.80%) |
| 完整 AlphaPareto | 3.92%(0.46%) | 5.70%(0.87%) | 10.10%(1.01%) |
关键发现¶
- 池编码并非普遍有益:仅 LLM 在 CSI300 上低于 AlphaGen,却在 Market 上把 IC 从 8.44% 提高到 9.68%。完整方法也不是所有消融中的最高均值,CSI300 比仅 MORL 低 0.07 个百分点,但标准差低 0.81 个百分点。
- 附录 H 的 CSI800 等权四目标奖励为 4.92%(0.52%),MAP 为 5.70%(0.87%);自适应权重提高均值,但没有降低这一对照的方差。附录 I 的匹配随机噪声表示只有 4.22%(1.62%),不支持把池编码收益简单归因于噪声正则化。
- 全市场月度多头回测中,AlphaPareto 年化收益 58.92%、IR 2.62、Sharpe 2.59,最大回撤 −18.12%;AlphaGen 回撤 −15.91%,说明本文并非每项风险指标最优。附录的交易费用为单边 15 个基点,测试期只有一年。
- S&P 500 补充实验中,AlphaPareto 为 7.65%(0.13%),AlphaQCM 为 7.18%(0.84%)。这是另一市场的重新评估,并非把 A 股训练好的策略零样本迁移到美国市场。
亮点与洞察¶
- 奖励非平稳有时来自遗漏状态,而不只是环境发生不可控漂移。把影响奖励的池上下文显式暴露给策略,比仅给探索奖励增加不确定性更直接。
- LLM 的价值不必体现为直接生成最终答案。本文把它放在冻结上下文编码位置,由具备可执行语法和数值反馈的 RL 搜索器承担公式构造。
- 多目标“偏好”可以用原始指标单位下的目标水平表达。MAP 仍有主观阈值,但比缺乏量纲解释的固定权重更方便检查是否满足业务要求。
局限与展望¶
- 作者未系统研究 prompt 敏感性,且线性组合器可能遗漏更复杂的因子交互。更强编码器也未必更好:表 3 的模型规模效果并不单调。
- 冻结隐表示不保证充分描述完整池,PFS 只扰动组合输出,RRE 只约束排名变化。它们分别是上下文与鲁棒性的代理,不能替代市场状态、原始数据扰动和实盘交易的检验。
- MAP 只与简单等权标量化额外比较,尚不足以证明优于成熟 MORL 优化器。在线求解、阈值可行性和初始化阶段 DH 的边界处理值得进一步审查。
- 5 个种子及一年测试期限制了统计和经济结论的外推。LLM 生成基线还经过候选数和表达式格式调整,因此结果应理解为本文实验协议下的比较,而非这些方法在所有配置下的排名。
相关工作与启发¶
- vs AlphaGen:保留 RPN 与 MaskPPO 搜索主干,但从只看公式前缀、只奖励 IC,改为池条件状态和四目标反馈。
- vs AlphaQCM:后者用回报分布估计和探索奖励缓解奖励变化;本文直接补入导致变化的池上下文。Market 的均值优势并未通过作者的配对显著性检验。
- vs AlphaAgent / R&D-Agent-Quant:这些方法让 LLM 产生候选因子;本文冻结 LLM 编码池,由 RL 选择公式 token。二者的 LLM 参数量并不能直接作为搜索能力或计算预算的公平衡量。
- vs MAP / AlphaEval:前者提供偏好阈值与对偶标量化,后者强调多维因子评价;本文把这两类思路接到在线池级搜索,但修改了 PFS 的扰动位置与汇总方式。
评分¶
- 新颖性: 4/5 — 池上下文补全与多目标反馈结合明确,优化器主要借鉴已有 MAP。
- 实验充分度: 4/5 — 有组件消融、噪声对照、回测及美国市场评估,但测试窗口和 MORL 对照仍有限。
- 写作质量: 4/5 — 状态错位动机清楚,压缩状态、初始化边界及在线理论保证需要更充分说明。
- 价值: 4/5 — 为可解释公式搜索提供可复用的上下文编码与偏好优化路径,不构成投资收益保证。