跳转至

Advancing Entropy-Level Credit Assignment in RLVR via Proximal Entropy Policy Optimization

会议: NeurIPS2026(作者自报 accepted)
arXiv: 2609.39402
领域: LLM 推理
关键词: 可验证奖励强化学习、信用分配、邻近熵、优势加权、数学推理

一句话总结

PEPO 将成功推理轨迹中 token 的更新权重改为相对邻域的不确定性,并保持每条轨迹的总权重不变,在数学推理主实验中优于所比较的 GRPO 与全局熵基线,但趋势鲁棒性和跨任务推广均有明确边界。

研究背景与动机

可验证奖励强化学习(RLVR)可以用最终答案是否正确监督大语言模型,却不知道推理过程中哪一步真正影响了答案。GRPO 通过同题多次采样的奖励比较估计优势,省掉价值网络,但同一回答中的每个 token 都继承同一个优势。因此,一段成功回答中的连接词、机械展开和决定解题方向的分叉位置会同时被强化。价值模型、过程奖励模型或额外分支采样能提供更细的信号,但会增加训练、内存或采样成本。本文选择已有策略分布的 token 熵作为轻量代理:模型在某一步面临多个可能延续时,该位置可能比确定性的语法续写更值得更新。

问题在于,高熵并不只意味着重要。80/20 在整个训练 batch 内选择熵最高的 20% token,因而可能把较难题目的普通 token 排在较容易题目的关键决定之前;推理开头的熵通常也比结尾高。论文在 Llama-3.2-3B-Instruct 上按每题 8 次生成的成功数分组:难题为 0–1 次、中等为 2–6 次、容易为 7–8 次,其平均原始熵分别为 0.315、0.270、0.221。这个差异说明全局排序会混入整条轨迹的熵基线,而不能直接说明难题中的每个 token 都更重要。位置分析也显示,原始熵在早期可以比序列均值高约 80%。

本文不是重新训练一个 token 价值估计器,而是改变比较对象:一个 token 应当首先和自身附近的生成位置比较,再决定它在该成功回答中应占多少更新权重。这种做法不需要额外正确性标签,却仍然只能得到重要性的代理,而不是每个 token 的真实因果贡献。核心 idea:用中心滑动窗口内的熵 softmax 构造相对邻域权重,经全序列重归一化后只加权成功轨迹,从而减少绝对熵水平对 token 信用分配的干扰。

方法详解

整体框架

PEPO(Proximal Entropy Policy Optimization)沿用 GRPO 的采样、答案验证和 clipped policy objective。对每道题生成一组回答,验证器给出二元奖励,组内奖励归一化得到每条回答的优势;另外,从生成时的策略分布取得各位置的 Shannon 熵。本文新增的处理仅发生在训练权重计算中:局部熵比较、全序列重归一化、成功轨迹上的优势调制。

需要区分两个层次的“归一化”。GRPO 在同题的多条回答之间比较奖励,判断哪条回答应被强化或抑制;PEPO 在一条成功回答内部比较各 token 的相对不确定性,决定既定优势如何分配。后者不能把失败答案变成成功,也没有生成新的过程正确性评分。

输入是已生成的完整轨迹及每个位置的熵,输出是用于策略更新的逐 token 优势。中心窗口会用到当前 token 后面的熵,因此它是完整 rollout 之后的训练侧权重计算,不是在线解码时只能看到前缀的决策规则。部署时仍按训练后的策略正常自回归生成,不增加验证器调用或额外分支。

三个关键设计依次为“局部相对熵”“全序列重归一化”“仅成功轨迹加权”。这是一项优势加权/目标函数改动,而非多阶段网络架构,下面用公式说明权重流向,不把采样和损失计算包装成新增模块。

关键设计

1. 局部相对熵:让 token 与邻居比较,而非与整个 batch 争排名

首先取得每个生成位置的策略熵。这里的熵来自整个词表的下一 token 概率分布,而非实际采样 token 的负对数概率;前者衡量可选延续的总体不确定性,后者只描述已经采到的那个结果。记第 \(i\) 条回答第 \(t\) 个位置的熵为 \(H_{i,t}\),以该位置为中心的窗口为 \(\mathcal{W}(t)\)。论文默认窗口大小 \(W=101\),即内部位置覆盖当前 token 及前后各 50 个位置。

“邻近熵”(proximal entropy)的核心定义为:

\[ e_{i,t}=\frac{\exp(H_{i,t})}{\sum_{k\in\mathcal{W}(t)}\exp(H_{i,k})}. \]

这个量并不是重新定义的 Shannon 熵,而是当前熵在邻域 softmax 中对应的相对份额。若邻域中的熵几乎相同,中心位置约占窗口的均匀份额;若某个位置比周围更不确定,它获得较大份额。于是,绝对熵不高但在确定性片段中形成局部突起的 token,也能得到较高相对权重。相反,处于整片高熵区域的普通 token 不会仅因区域整体不确定而自动占优。

附录的温度分析把上述指数中的熵除以温度,默认温度为 1。较小温度放大局部差异,较大温度使权重更平缓;这与生成采样温度不是同一个超参数。主方法既没有逐 token 正确性标签,也没有对高熵位置添加单独的正确奖励,仍是在已有成功信号上使用不确定性代理。

这种比较有一个严格成立的性质:给同一序列的所有熵加上相同常数,分子和分母中的指数因子会完全抵消。因此,序列层面的常数熵偏移不改变局部份额。它可以消除“同一轨迹整体熵更高”这一特定混杂项,但不意味着任何难度影响都能被消除;题目难度若改变局部起伏形态,仍会改变相对权重。

位置趋势的结论则只是近似。附录将原始熵分解为平滑趋势和 token 残差,在窗口内做局部 Taylor 展开。展开后,趋势在中心位置的常数项确实消失,但斜率仍进入分母;只有窗口内变化足够小,例如 \(|f'(t)|W/2\ll1\),并且曲率余项受控时,才可将其影响视为小修正。

尤其不能将“对称窗口”理解为任意线性趋势的精确抵消:偏移量虽然对称,但分母中的偏移还乘着不相同的残差指数权重,其加权和一般不为零。附录实际给出的是约 \(\mathcal{O}(f'(t)W)\) 的修正及曲率余项,而非无条件不变性。平滑单调本身也不足以保证附录假定的曲率随序列长度缩小。

序列两端需要补足窗口。实现使用 reflect padding,即用本条轨迹附近的熵镜像填充,避免零填充引入人为低熵邻居。镜像值仍保留常数平移不变性,但原始位置的趋势在边界被折返,不能直接套用内部对称邻域的趋势讨论。默认长轨迹中受边界处理影响的 token 比例约为 \(W/T_i\),作者估计约 5%;短回答时这一比例会更大。

2. 全序列重归一化:改变信用分布,而非直接增加整条回答的优势预算

局部 softmax 的分母因中心位置而异,每个 token 实际参与的是不同窗口。因此,将所有中心份额连起来得到的序列并不是总和为 1 的概率分布;直接拿它乘优势会改变整条轨迹的总体尺度,并使窗口大小影响更新强度。PEPO 对完整回答的这些份额再次归一化,再乘回答长度:

\[ c_{i,t}=T_i\frac{e_{i,t}}{\sum_{k=1}^{T_i}e_{i,k}},\qquad \sum_{t=1}^{T_i}c_{i,t}=T_i. \]

这样,平均 token 权重仍为 1,只是在回答内部从低相对不确定性位置向高相对不确定性位置重新分配。窗口份额越均匀,结果越接近标准 GRPO 的均匀权重;存在局部突起时,才出现较明显的差异。连续加权也不同于 80/20 的硬筛选:后者让大量 token 不参加更新,PEPO 保留各位置的非零信号,而让关键位置占更大份额。

总权重守恒是代数性质,而不是训练结果的守恒保证。它保证同一序列的标量优势权重总量与均匀加权相同,却不保证更新后的梯度范数、实际策略变化或 clipped objective 数值相同。原因是每个位置的概率比率、是否触发 clipping,以及对应参数梯度都不同;将优势搬到另一位置仍会改变优化方向。

附录的逐步消融有助于解释这两个设计为何应分开看:把全局熵硬筛选改为邻近熵硬筛选,先测试比较坐标系;再由硬筛选改为连续加权,才测试是否应保留其他位置的学习信号。它不是一次同时更改全部因素后,再把所有收益归给“局部性”。

3. 仅成功轨迹加权:避免将失败中的不确定探索位置过度惩罚

答案验证仍提供原来的二元奖励。对于奖励为 1 的回答,PEPO 把轨迹优势乘以前述权重;对于奖励为 0 的回答,保留原来的均匀优势。其实际规则可以写为:

\[ \hat A_{i,t}=\begin{cases} c_{i,t}A_i,&r_i=1,\\ A_i,&r_i=0. \end{cases} \]

这一非对称性很重要。失败回答中的高熵位置可能代表模型尝试了尚未成熟的解法;如果把负优势集中在这些位置,会更强地压制探索。成功回答至少拥有最终正确性的背书,强化其中的局部决策位置更有依据,但仍不能排除成功答案中的冗余、偶然正确或并不必要的步骤。

“只加权成功”也不等于“失败不参与训练”。失败 token 仍进入原来的 GRPO 目标,只是没有熵权重调制。如果一个采样组中的奖励全部相同,组内没有可区分的奖励优势,局部熵权重本身不会凭空创造正确性差异。论文未将此设计表述为对全同奖励组的解决方案。

附录逐步消融中,全轨迹连续加权的平均成绩为 57.53,成功轨迹连续加权为 58.01。这支持在该设置中保留正负样本非对称处理,但中间配置没有逐 run 不确定性,因而这 0.48 个百分点只能作描述性比较,不能据此断言统计显著或一般性优越。

损失函数 / 训练策略

优化器仍最大化标准 clipped surrogate,只把原来的 \(A_i\) 换成 \(\hat A_{i,t}\)。概率比率是当前策略与 rollout 旧策略在同一 token、同一前缀下的概率之比;上下 clipping 阈值限制过大的单步策略变化。训练目标按组内总 token 数归一化,不额外训练价值模型或过程奖励模型。

主实验采用 ROLL、DeepMath-103K,每题生成 8 条回答,训练 500 步。AdamW 学习率为 \(1\times10^{-6}\),下/上 clipping 阈值分别为 0.2/0.28;采样温度和 top-p 都为 0.6,最大回答长度为 4096。典型回答约 2000–3000 token,默认 101 的窗口约覆盖其 3–5%。

SPO 扩展称为 PESPO,沿用局部权重思路,但每题只有一条 rollout,优势由 SPO 而非同题 GRPO 组提供。它使用 VeRL 和 DAPO-Math-17K;所以可以在 SPO 设置内比较 PESPO 与其基线,但不能把它与主实验 PEPO 的差异简单归因于是否单流,框架和数据也发生了变化。

计算上,局部窗口处理不增加 rollout 数量,作者认为熵可复用生成引擎的现有计算。附录在同样 2 张 H200、500 步设置下,Qwen3-4B 的 GRPO/PEPO 总训练时间为 1 天 19 小时 25 分钟/1 天 19 小时 45 分钟;这是低额外开销的实测支持,不是逐 kernel 的零开销证明。

实验关键数据

主实验

下表摘录原文表 2,单位为准确率百分数,数值是 3 次独立 run 的均值 ± 样本标准差,不是置信区间。MATH500 为 avg@1;AIME2024、AIME2025、AMC 为 avg@16,即多次样本的平均正确率,不能当作“16 次至少成功一次”的 pass@16。Mean 是四个基准得分的等权平均,不是按题量加权。

模型 方法 AIME2024 AIME2025 AMC MATH500 Mean
Qwen3-1.7B GRPO 16.58 ± 0.44 18.65 ± 0.62 50.28 ± 0.99 80.27 ± 1.01 41.45 ± 0.50
Qwen3-1.7B 80/20 20.97 ± 1.48 20.83 ± 0.75 52.13 ± 0.44 80.73 ± 1.50 43.67 ± 0.30
Qwen3-1.7B PEPO 21.74 ± 1.06 22.43 ± 0.67 55.26 ± 1.11 82.67 ± 0.31 45.53 ± 0.46
Qwen3-4B GRPO 32.75 ± 0.54 23.54 ± 0.76 59.96 ± 0.68 84.33 ± 1.22 50.15 ± 0.43
Qwen3-4B 80/20 35.35 ± 2.47 30.62 ± 0.21 67.25 ± 1.53 89.73 ± 1.15 55.74 ± 0.86
Qwen3-4B PEPO 39.24 ± 1.27 31.81 ± 0.13 69.58 ± 0.59 91.40 ± 1.83 58.01 ± 0.14
Llama-3.2-3B-Instruct GRPO 7.22 ± 0.84 0.90 ± 0.52 21.43 ± 0.57 47.67 ± 1.33 19.31 ± 0.20
Llama-3.2-3B-Instruct 80/20 8.60 ± 0.61 0.49 ± 0.12 22.57 ± 0.91 47.67 ± 0.50 19.83 ± 0.03
Llama-3.2-3B-Instruct PEPO 9.10 ± 0.52 1.46 ± 0.55 24.12 ± 0.36 49.33 ± 0.12 21.00 ± 0.15

原表还包括 Entropy Adv.,其三个模型的 Mean 依次为 43.71 ± 0.52、54.91 ± 0.23、20.02 ± 0.44。表 2 内 PEPO 在各模型的四项均值上均优于所列训练基线;Qwen3-4B 相比 GRPO 的 Mean 提高 7.86 个百分点,相比 80/20 提高 2.27 个百分点。但 Llama 的 AIME2025 绝对准确率仍仅 1.46%,不能用相对改善掩盖任务尚未解决。

消融实验

原文表 12 在 Qwen3-4B 上逐步改变权重方案;此处保留作者报告的增量口径。

配置 四基准 Mean(%) 相对上一配置提升(百分点) 说明
全局熵,二元筛选 55.74 — 80/20
邻近熵,二元筛选 56.87 1.14 局部坐标系替换
邻近熵,全轨迹连续加权 57.53 0.66 中间配置未提供 run 级不确定性
邻近熵,仅成功轨迹连续加权 58.01 0.48 完整 PEPO

1.14 是作者对表 3 四项基准差值求平均后取整的结果;直接相减已四舍五入的 Mean 得到 1.13,两个口径不能混用。表 3 的 Qwen3-1.7B 替换实验 Mean 从 43.67 升至 44.58,但 AIME2025 从 20.83 降至 20.69,且其 AIME2024 的 22.01 高于 PEPO 的 21.74。因此“替换后每项都改善”或“PEPO 在所有比较中每项最好”都过强。

窗口消融(表 6)中,\(W=51,101,151\) 的 AIME2024 分别为 36.25、39.24、36.81,MATH500 分别为 90.67、91.40、92.27。默认 101 的四基准平均更好,但 151 在 MATH500 上更高;局部性并非越强越好,且不同基准对窗口的偏好不完全一致。

关键发现

  • 单流迁移有收益,但非每项最优。 表 4 中 SPO/PESPO 的 Mean 为 57.13 ± 0.42/58.93 ± 0.48;全局熵扩展的 Mean 为 54.65 和 55.99。PESPO 的 MATH500 为 90.67,低于 S-80/20 的 91.00。
  • 干预支持有限设置下的选择效率。 表 5 固定 Qwen3-4B Base、GRPO 替换 checkpoint、AIME2024 与预算,只改变 token 排序。替换 5% 位置时,全局熵/邻近熵的 avg@16 为 27.34/31.62;邻近熵在 10% 达到 33.33,全局熵在 30% 才达到。它支持该替换协议下的排名效果,不是普适因果归因保证。
  • 代码评测需保留训练边界。 表 10 的 LiveCodeBench 共 1055 题,GRPO/80/20/PEPO pass@1 为 31.75/41.04/46.35。这是 Qwen3-4B 单个 held-out split 的点估计;该评测未用于 RL 训练,但附录说明 ROLL 训练混合中包含另一个 KodCode 可验证代码数据源,不能说完全没有代码训练。

亮点与洞察

  • 从“绝对不确定性”改成“相对邻域的不确定性”,比直接调高熵奖励更针对信用分配混杂。可复用的是比较坐标系,而不是把高熵等同于正确推理。
  • 局部 softmax 与全序列重归一化各司其职:前者选择比较对象,后者控制轨迹内的标量预算。跨算法迁移时应保留这个区分,并重新核对优势估计和失败样本处理。

局限与展望

  • 没有与 PPO 等价值模型方法对比,无法证明轻量熵代理达到更昂贵信用估计的上限;主要覆盖小规模模型的数学推理,代码泛化证据有限。
  • 常数平移严格不变,但位置趋势只有小斜率、受控曲率下的近似鲁棒性;reflect padding 和短序列尤其需要单独评测。
  • 附录 E 声称简单窗口均值也移除了趋势,但没有说明额外去趋势变换。普通滑动平均一般保留缓慢变化的趋势,因此不能仅据文字和图注将其当成一般性数学结论。
  • 主文称训练使用 DeepMath-103K,附录 F 又说明 ROLL mixture 含 KodCode;训练数据构成存在描述不完整。更清楚的混合比例、边界分析和多 seed 代码结果会提高可复现性。
  • 附录 B 的窗口举例为 31/51/101,对应图 4 的偏差分析;真正的性能消融表 6 为 51/101/151,两者不应合并成同一个实验。

相关工作与启发

  • vs GRPO:保留组内奖励优势与 clipped objective,仅重新分配成功回答内的 token 权重;并没有补出一个真实的逐步价值函数。
  • vs 80/20 与 Entropy Adv.:前者按全局熵硬筛选,后者利用全局熵调制优势;PEPO 使用局部相对比较,并保留连续学习信号。表 3 的替换实验说明局部坐标系本身有贡献,但收益并非每项都单调。
  • vs ARES:论文将其描述为前向窗口算术平均加 batch 阈值,而 PEPO 使用中心窗口与相对 softmax。核心差异是参照系,不应把对称窗口包装成任意位置趋势精确抵消的证明。

评分

  • 新颖性: 4/5 — 用局部参照修正熵信用分配,改动小但问题定位明确。
  • 实验充分度: 4/5 — 有三模型、多 run、替换与单流分析,缺价值基线及广泛代码验证。
  • 写作质量: 3/5 — 核心机制清楚,但趋势措辞、部分推广概括与数据描述需谨慎核对。
  • 价值: 4/5 — 可低成本复用于 RLVR,但应将熵权重视作经验代理而非真实信用标签。