跳转至

SAGE: Mitigating Long-Horizon Reasoning Biases via Topological Guidance

会议: NeurIPS 2026
arXiv: 2609.30192
代码: https://github.com/Susan571/SAGE-NeurIPS2026
领域: LLM 推理
关键词: 长程推理、结构先验、代数稀疏化、双曲几何、组相对策略优化

一句话总结

SAGE 在后训练中用“操作是否对应未解决约束”和“新状态是否接近目标结构”两类软势函数同时引导候选采样与奖励,在保留普通推理时解码的前提下改善长程推理;Qwen3.5-35B 的数学平均准确率由 GRPO 的 61.92% 提升至 64.86%。

研究背景与动机

长程推理的难点不仅是单步算不准,还在于每一步都有许多看似合理的后续,而真正通向成功的路径很少。只奖励最终答案的强化学习需要先采到完整成功轨迹,才有机会提高这类轨迹的概率。随着推理深度增加,分支数不断膨胀,模型容易把预算花在局部合法、却不再帮助解决问题的操作上。论文把这种采样偏向称为探索偏差;Andrews–Curtis(AC)群表示平凡化任务提供了具体例子:求逆、关系词相乘、共轭都可能是合法操作,但合法不代表能持续简化群表示。

另一种失败发生在已经展开的轨迹内部:早期的小偏离没有及时反馈,后续步骤继续沿着它推进,直到终点才暴露失败。这是累积偏差。过程奖励模型或形式验证器可以补充中间反馈,但前者依赖过程信号的构造质量,后者受到可验证领域的限制。另一方面,终点奖励过于稀少时,KL 正则化仍然持续把策略拉向参考模型,模型可能主要学到“不要改变”,而不是“如何完成长链”。论文的定理 3.5 在有界终点奖励与固定 KL 强度下刻画这种参考策略锚定;它不是对所有强化学习系统的无条件失败定理。

作者因此引入符号闭包分析(Symbolic Closure Analysis,SCA),用局部可容许性定义前缀闭合的轨迹集合,再把分析转成训练信号。这里必须区分两个问题:一条轨迹是否每步都符合规则,以及它是否最终成功;后者只是前者的子集。核心 idea:用残差—操作匹配减少无效探索,用双曲目标距离在终点之前提供结构反馈,并把两类偏好吸收到策略中,而不把结构评分器留在推理时。

方法详解

整体框架

SAGE 是后训练框架,不是推理时搜索算法。输入是任务提示、当前推理前缀和旧策略提出的候选操作或候选推理步骤;输出是经强化学习更新的语言模型策略。训练时先准备任务相关结构先验,随后计算代数稀疏化与双曲结构引导两类势函数,把它们用于候选重加权和轨迹奖励;测试时只调用训练后的模型。

符号任务的状态、操作和目标具有明确接口;数学与自由形式任务则依赖近似结构表示。冻结的参考模型编码前缀,固定探针预测尚未解决的结构约束,操作分类器把候选分到粗粒度操作类型,训练轨迹拟合出的子空间与目标锚点提供评分依据。这些模块不是新的推理时验证器,也不等价于正确答案判别器。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["训练提示与参考轨迹"] --> B["结构先验构建"]
    B --> C["代数稀疏化"]
    B --> D["双曲结构引导"]
    P["旧策略候选与前缀"] --> C
    P --> D
    C --> E["引导采样与优势"]
    D --> E
    R["训练终点奖励"] -.->|仅用于奖励与优势| E
    E --> F["策略更新"]
    F --> G["测试提示 → 直接解码"]

图中的结构先验、两类评分与引导过程都发生在训练时;虚线表示终点监督注入,不是测试数据流。两个评分分支并行计算,关键设计按结构先验、代数评分、双曲评分、联合优化的顺序展开。

关键设计

1. 结构先验构建:把“还没解决什么”变成可计算对象

SCA 首先定义局部可容许性:若一个前缀已经包含违规转移,保留这个前缀的后续轨迹都不属于局部合法集合。但前缀闭合不意味着模型一定能找出成功延续。附录 A 专门指出,局部合法集合内仍可有大量失败轨迹,因此把合法性提升当成完整解题能力提升是不成立的。

在 AC 中,残差来自当前群表示的生成元计数、关系词长度和未解决的关系词成分,目标是任务规定的平凡表示。数学任务的残差则描述变量、方程、操作类别和答案格式等未解决约束;自由形式任务使用提示要求和语义结构。目标锚点由提示与训练轨迹表示构造,不读取测试标签、标准推理链或标准答案来建立这些结构模块。

非符号任务中的残差探针用训练轨迹的结构伪标签做带正则化的回归,标签包含操作类别、约束覆盖、答案格式状态与格式一致性。按操作类型聚合残差后,取主方向形成对应子空间;这些探针与投影在引导训练之前固定。结构信号虽不依赖人工逐步正确性标注,却仍依赖操作分类、伪标签和任务接口,不能把它称为“没有监督或先验”。此外,联合训练奖励仍保留终点反馈;“结构模块不用终点正确性标签”不等于“整个训练不用终点奖励”。

2. 代数稀疏化:优先尝试能解释当前残差的操作

如果问题还卡在某类约束上,继续生成与这类约束无关的步骤,可能语言流畅却没有推进。SAGE 为每种操作建立子空间,把当前残差投影到候选操作对应的子空间,以被解释的残差能量占比作为兼容性分数:

\[ \Psi_{P}(r_t,S_j)=\frac{\|P_{S_j}r_t\|_2^2}{\|r_t\|_2^2+\varepsilon}. \]

这里 \(r_t\) 是未解决结构的表示,\(P_{S_j}\) 是操作子空间的投影,\(\varepsilon\) 避免分母退化。高分表示操作类型与残差更匹配,并不证明具体步骤正确,也不保证残差实际下降。数学操作类型包括化简、代入、数值求值、列方程、公式调用、分类讨论、约束检查和答案抽取;自由形式操作包括事实检索、比较、排除、聚合、推断、格式规范化和最终答案提交。

这类“稀疏化”主要通过软重加权集中探索,并不是把低分候选一律删掉。附录 C 用经典正交匹配追踪的稀疏恢复条件解释为何操作相关方向有可能被定位;该结果要求无噪声稀疏表示和字典相干性条件,不能直接升级为语言模型全局解题保证。非符号任务中的子空间兼容性尤其只是学得的代理信号,而不是硬可容许性证明。

3. 双曲结构引导:提前反馈候选状态与目标结构的距离

只关注当前残差容易忽略路径走向,因此另一分支评价“采取候选步骤之后”的状态。冻结的参考模型产生状态表示,固定线性投影降低结构表示维度,再径向映射到 Poincaré 球;目标锚点使用同样的表示管线。选择负曲率空间的直觉是,层级推理树随深度快速展开,双曲空间比欧氏空间更适合承载这类结构。

\[ \Psi_{H}(s_t,a_t,g)=\exp\!\left(-\frac{d_{\mathbb{D}_c}(E(s_t\circ a_t),E(g))}{\kappa}\right). \]

\(g\) 是目标结构,\(s_t\circ a_t\) 是执行候选之后的状态,\(d_{\mathbb{D}_c}\) 是曲率参数为 \(c\) 的 Poincaré 距离,\(\kappa>0\) 控制距离评分的锐度。候选状态越接近锚点,得分越高。它在终点之前提供反馈,但形式上是目标距离势函数,而不是显式的深度标签监督,也不是相邻状态距离改善量。

对 AC 而言,锚点有明确的平凡表示含义;对自然语言而言,语义锚点是否真的代表成功方向需要实验检验。随机打乱锚点和替换为欧氏距离的消融正是在检查结构对齐与几何选择,而非证明每个高分前缀都能成功。

4. 引导采样与优势:既改变探索路径,也让零终点奖励组能够更新

两类势函数按非负权重组合为 \(\Psi_{\mathrm{SAGE}}=\alpha\Psi_P+\gamma\Psi_H\)。非符号任务的动作不是单个 token,而是旧策略生成到分隔符、句子边界、答案标记、终止符或步长上限的一段推理。每个状态先采出有限候选集,再按长度归一化的旧策略对数概率与结构势函数重加权:

\[ P_{\mathrm{sample}}(a_t^{(k)}\mid s_t,\mathcal C_t) =\frac{\exp(\bar\ell_{\theta_{\mathrm{old}}}(a_t^{(k)}\mid s_t)+\lambda\Psi_{\mathrm{SAGE}}(s_t,a_t^{(k)}))} {\sum_{a\in\mathcal C_t}\exp(\bar\ell_{\theta_{\mathrm{old}}}(a\mid s_t)+\lambda\Psi_{\mathrm{SAGE}}(s_t,a))}. \]

\(\bar\ell\) 是候选内部 token 对数概率的平均值,避免仅因概率连乘而偏向更短步骤;\(\lambda\) 控制采样引导强度。归一化只在本次候选集 \(\mathcal C_t\) 内进行,不覆盖整个词表或所有可能续写。候选集未提出的操作无法被重加权选中,因此它的探索上限仍受旧策略候选覆盖率限制。

接着把每条轨迹的平均结构评分加到终点奖励上,并在同一 rollout 组内标准化:

\[ \widetilde R(\tau_i)=R_{\mathrm{term}}(\tau_i) +\eta\frac{1}{T_i}\sum_{t=1}^{T_i}\Psi_{\mathrm{SAGE}}(s_t^i,a_t^i), \qquad A_i=\frac{\widetilde R(\tau_i)-\operatorname{mean}_j\widetilde R(\tau_j)}{\operatorname{std}_j\widetilde R(\tau_j)+\varepsilon}. \]

\(\eta\) 控制奖励增强强度,\(T_i\) 是轨迹步数。平均而非直接求和避免长轨迹仅因多走几步就累计更多结构奖励。若组内所有终点奖励均为零,只要结构评分存在组内差异,优势仍能产生更新信号;若结构评分也完全相同,则这一机制不能凭空产生区分信息。

一个完整示例

考虑一个数学推理前缀已经列出变量,但尚未落实方程约束。旧策略可能提出“再解释题意”“建立方程”或“直接写答案”等候选。操作分类器将它们映射到相应类型,残差探针则表示当前未解决的方程与答案格式要求;代数稀疏化优先赋分给与这些要求对齐的操作。

随后逐个评价候选后的状态与提示条件目标锚点的双曲距离。一个操作类型正确、但执行后偏离目标结构的候选,不一定获得最高联合评分。采样器仍结合旧策略概率随机选择,并在多条完整 rollout 之间比较增强奖励,即使本组没有任何正确最终答案,也可能凭结构差异形成更新。

这是机制示意,不是论文提供的逐步数值案例,也不声称“列方程”一定胜过所有其他步骤。测试时模型不会再生成一批候选供上述探针评分,而是用已更新策略直接续写。

损失函数 / 训练策略

论文使用带 clipping 和参考策略 KL 惩罚的组相对更新,同一轨迹优势施加到各步骤并按轨迹长度平均。原文策略比率定义为 \(\rho_{i,t}(\theta)=\pi_\theta(a_{i,t}\mid s_{i,t})/\pi_{\theta_{\mathrm{old}}}(a_{i,t}\mid s_{i,t})\),分母不是结构重加权后的 \(P_{\mathrm{sample}}\)。由于 rollout 已由有限候选采样器改变分布,正文与附录 E 没有给出完整行为分布修正推导;不能把该比率解读成已证明无偏的引导采样重要性权重。

控制实验先用同一参考策略的 rollout 计算语义熵,一次性保留熵在上下阈值之间的训练提示。结构化答案采用规范化匹配,自由形式答案使用语义等价判断;GRPO、EMPO、PRM-GRPO 与 SAGE 在同一保留子集、预算和优化安排下比较。测试使用完整测试集,不按熵筛题,也不调用结构评分、聚类或局部检查器。

附录 E 提到适用时使用 AdamW,但没有在缓存正文中给出候选数、最大步长、探针维度等全部可直接复现实验的数值配置。训练集筛选与探针准备属于成本的一部分;“无额外推理时成本”不代表“训练时免费”。

实验关键数据

主实验

下表选取最能说明规模与任务差异的结果。数学平均准确率是原表七项任务的报告值;其余行为单项准确率,不能把它们混成同一个总平均。数值来自表 1、表 2,提升单位为百分点(pp),不是相对百分比。

模型 / 任务 GRPO (%) EMPO (%) SAGE (%) 相对两种 RL 基线中较优者的提升
Qwen3.5-2B / 数学平均 39.63 40.28 42.11 +1.83 pp
Qwen3.5-9B / 数学平均 43.16 44.84 47.95 +3.11 pp
Qwen3.5-35B / 数学平均 61.92 62.37 64.86 +2.49 pp
Qwen3.5-9B / MMLU-Pro 平均 39.33 37.91 39.99 +0.66 pp
Qwen3.5-9B / GPQA 18.21 21.11 20.86 -0.25 pp
Qwen3.6-27B / BBH-H 55.74 57.19 60.25 +3.06 pp
Qwen3.6-27B / ARC-C 51.78 53.26 57.11 +3.85 pp
Qwen3.5-35B / Putnam 19.48 19.97 22.62 +2.65 pp

9B 数学任务的 SFT 平均值为 44.93%,所以正文“超过最强基线 3.02 pp”与该 SFT 对照对应;表中的 3.11 pp 特意限定为 GRPO/EMPO 两种 RL 基线。SAGE 也不是每个单项都最高:2B 的 AIME24 为 15.72%,低于 GRPO 的 16.05%;27B 的 GPQA 为 32.51%,低于 GRPO 的 34.29%。

消融实验

表 3 在 Qwen3.5-9B 上固定训练子集、rollout 预算、解码限制、优化步数和 KL 系数。以下只保留定义明确的准确率;原表还列出 Rew./1k,但缓存没有充分解释奖励事件与分母口径,因此不把它当作已完整定义的自创指标展开。

配置 Olympiad 准确率 (%) BBH-H 准确率 (%) 说明
完整 SAGE 41.59 45.31 两种结构势函数联合使用
去掉双曲结构引导 39.84 39.06 相对完整模型下降 1.75 / 6.25 pp
去掉代数稀疏化 39.12 38.85 相对完整模型下降 2.47 / 6.46 pp
双曲距离替换为欧氏距离 38.01 38.02 相对完整模型下降 3.58 / 7.29 pp
打乱目标锚点 37.99 37.83 相对完整模型下降 3.60 / 7.48 pp

AC 数据包含 1190 个群表示,构造范围为 \(n\leq7\)、\(|w|\leq7\)。AC Validity 是语法和逻辑合法步骤的比例;Lean-Verified 是编译器检查通过的证明成功率。表 4 的 AC Path 列表示路径求解表现,但缓存未充分展开其独立判定细节;下面不将它混同于 Lean 验证成功率。

Qwen3.5-35B 配置 AC Validity (%) AC Path (%) Lean-Verified (%)
GRPO 54.28 23.05 14.64
EMPO 53.18 21.52 13.78
去掉双曲结构引导 57.02 27.14 18.82
去掉代数稀疏化 56.31 25.98 18.07
完整 SAGE 59.83 31.76 23.69

关键发现

  • 两种结构信号的互补性在 BBH-H 和 AC 都可见;AC 去掉双曲引导后 Lean 成功率下降 4.87 pp,去掉代数稀疏化下降 5.62 pp。局部合法率提高与端到端成功提升应分开评估。
  • 表 4 的 PRM 对照中,35B 的 Lean 成功率为 GRPO 14.64%、GRPO-PRM 17.36%、SAGE 23.69%。但 PRM 的 Olympiad/BBH-H 为 63.27%/59.12%,低于 GRPO 的 65.31%/63.29%,所以原文“PRM 改善 GRPO”不能推广到所有列。
  • “近 8 倍”来自图 3 对 Qwen3 与其基础模型的比较,不是本表相对 GRPO 的倍数,也不是解决 AC 开放问题的总体证明。缓存没有提供图中完整柱值,不据此反推数值。
  • 附录 H 给出自由形式任务五种子均值与标准差,例如 9B 的 BBH-H:SAGE \(45.31\pm0.71\)、EMPO \(44.04\pm0.82\)。标准差不是置信区间,不能据此直接宣称显著性;附录 F 的 Pass@64 约为 87% 对 GRPO 约 84%,这是多次采样预算下的近似图示结果。
  • 源文口径存在冲突:摘要与实验总述写 12 benchmarks、7 models/families,贡献列表与 checklist 写 13 benchmarks、8 models;设置列出多个系列与尺寸,不能直接等同于七个单独 backbone。实验总述写 3 baselines,设置实际列 SFT、GRPO、EMPO、GRPO-PRM 四种。
  • 另有数值不一致:正文 5.2 写 27B ARC-C 58.11%,表 2 与表 5 为 57.11%;表 2 的基础 35B ARC-C 为 45.37%,表 5 为 \(45.7\pm0.39\)。本文保留这些差异,主表采用表 2,不擅自统一源文。

亮点与洞察

  • 结构评分不只加入奖励,也改变训练轨迹的提出与选择。前者补充学习信号,后者改善在相同终点稀缺环境下能看到哪些路径。
  • 残差兼容性和目标距离分别回答“这步处理哪个未决约束”与“这步把状态带向哪里”。两者不同于简单提高采样熵,也解释了为何锚点打乱会破坏效果。
  • 把昂贵模块限定在训练时,是一种将结构偏好摊销到策略参数中的做法。它适合推理预算受限的任务,但需要同时报告训练 overhead 才能判断总成本。

局限与展望

  • 非符号残差、操作类别和目标锚点均为近似代理。可以进一步测试跨领域迁移、错误锚点与探针失配,避免把结构评分高误读为事实正确。
  • 理论集中界要求势函数能以正间隔区分合法与非法轨迹;这是强条件,不能仅由使用双曲空间推出。局部合法集合本身还包含失败轨迹,集中到该集合不等于集中到成功集合。
  • 有限候选集限制探索覆盖,且引导采样后的行为分布与原文策略比率之间缺少完整修正说明。值得比较不同候选数、直接旧策略采样与明确行为分布校正,而不先假定更新无偏。
  • 附录 I 报告使用 4 张 NVIDIA A100 与 2 张 NVIDIA H200,但未量化各组件时间或 GPU 小时。计算代数评分、双曲距离、探针和额外候选的训练成本仍需细分。
  • 模型/基准计数、单项最高声明和表文数值存在上述冲突,影响报告清晰度。代码链接来自原文,未在本次离线写作中核实可访问性或复现结果。

相关工作与启发

  • vs GRPO:两者均使用组相对奖励标准化;SAGE 额外用结构先验改变 rollout 采样与轨迹评分,并非仅将 GRPO 换一个名称。
  • vs EMPO:论文把 EMPO 作为探索导向的后训练对照;SAGE 显式表示残差—操作关系与目标几何。相同训练筛选子集有助于避免把提示保留差异误认为算法贡献。
  • vs GRPO-PRM:PRM 将终点标注向前缀分配以训练过程奖励,AC 还增加局部有效性目标;SAGE 的结构探针不用这些正确性标签,但整个 RL 框架仍用终点奖励,监督来源不能混说。
  • vs 推理时树搜索:SAGE 的候选重加权用于训练 rollout,不在测试时运行搜索或过滤。可迁移的研究方向是检验哪些结构先验能被策略长期内化,而不是默认增加测试时搜索预算。

评分

  • 新颖性: 4/5。把残差投影与双曲目标势函数同时接入采样和组相对奖励,设计有辨识度。
  • 实验充分度: 3/5。跨任务和结构消融较丰富,但成本、采样修正与部分指标口径仍不充分。
  • 写作质量: 3/5。理论与方法主线清晰,数量声明、最高表现措辞和表文数值不一致削弱严谨性。
  • 价值: 4/5。为稀疏终点奖励下的结构化后训练提供可复用思路,价值取决于代理质量与复现结果。