跳转至

ProAct: Agentic Lookahead in Interactive Environments

会议: ECCV2026
论文: ECCV 原文
代码: https://github.com/GreatX3/ProAct
领域: LLM推理
关键词: LLM 智能体、前瞻推理、蒙特卡洛树搜索、多轮强化学习、价值估计

一句话总结

ProAct 把"前瞻"从推理期搬进数据构建期:先用真实环境的 MCTS 探出未来轨迹、压缩成"观察→分析→结论"的因果推理链做 SFT(GLAD),再用无参数、靠随机策略批量 rollout 估值的蒙特卡洛批判器(MC-Critic)稳定 PPO/GRPO 训练,让一个 4B 模型在 2048 与 Sokoban 上大幅超过同规模与更大的开源基线。

研究背景与动机

长程交互任务(2048、Sokoban 这类需要几百步连续决策的游戏)要求智能体具备类人的 System 2 能力:在落子之前先在脑子里把若干条未来路径推演一遍、比出优劣再动手。Chain-of-Thought 与 ReAct 这类方法确实让 LLM 的推理变长了,但它们的推演场是模型自己的世界模型——模型用语言描述"我走这一步,棋盘会变成什么样"。问题在于,这个内部世界模型与真实环境的转移函数 \(P(s'|s,a)\) 并不一致。短程任务里这点偏差还能被后续步骤吸收掉,一到长程任务就会暴露:每一步的微小预测偏差被下一步当作事实继续推演,误差沿深度指数累积,最终整条计划与现实脱节。论文把这个现象命名为 simulation drift(模拟漂移)。它带来的后果是双向的:把推理链拉长(更"深"的前瞻)只会把幻觉和 context drift 一起放大,而退回到单步推理又完全看不到长期后果。

核心矛盾由此而来:要做前瞻就必须模拟未来,而唯一忠实的未来模拟器是环境本身;可恰恰在推理期向环境反复提问(ToT、RAP 那样在每个决策点跑 BFS/MCTS)是最付不起的开销——一条轨迹几百步,每步都搜一次,测试时成本直接爆炸。与此同时还有第二重困难:即便有了好的前瞻数据,把 LLM 当智能体做在线 RL 训练也不稳。策略梯度需要一个价值函数来判断"这个状态到底好不好",而传统深度 RL 之所以能训出准确的 critic,靠的是 MLP 策略可以每秒与环境交互成千上万步、攒出百万级样本;LLM 一步就要自回归生成成百上千个 token,一个 4B 模型生成一次"推理链 + 动作"需要 3–6 秒。交互吞吐低几个数量级,critic 的价值估计方差就下不来,训练频繁崩掉。

ProAct 的切入角度是把"前瞻"这件事整个挪个位置:不在推理期做,而在数据构建期做。用真实环境做 oracle 把未来探出来、让模型读着真实结果去写分析,再把整棵搜索树压缩成一条 token 级的自然语言因果链,让前瞻变成策略的一步直觉;同时对价值估计也做同样的锚定——不去硬训一个采样不足的 critic 网络,而是用随机策略在环境里跑一大批廉价的 Monte-Carlo rollout 来估状态价值。核心 idea:前瞻在真实环境里发生、在语言里被压缩、在策略里被内化,从而在不付推理期搜索开销的前提下得到既准确又稳定的长程决策能力。

方法详解

整体框架

论文把 LLM 智能体与环境交互建模成标准 MDP \(\mathcal{M}=\langle \mathcal{S},\mathcal{A},P,R,\gamma\rangle\),但与传统 RL 智能体不同,LLM 智能体在给出动作前会先生成一段推理链 \(z_t\),因此策略被写成推理与动作的联合分布 \(\pi_\theta(z_t,a_t\mid s_t)=\pi_\theta(z_t\mid s_t)\cdot\pi_\theta(a_t\mid s_t,z_t)\),即思考(deliberation)执行(execution)两步。ProAct 的输入是一个待训练的策略模型(Qwen3-4B-Instruct-2507)和一批可反复交互、可重置的交互环境;输出是一个推理期不再需要任何搜索的前瞻型策略。整个框架分两阶段串行:

第一阶段 GLAD(Grounded LookAhead Distillation,有据前瞻蒸馏) 负责把前瞻"造"出来并"压"进去。它在真实环境里用 MCTS 从当前状态出发探出若干条未来轨迹(含最优路径与死路),把这些原始未来直接读进 LLM 的上下文让它做分析并决策,允许它在发现当前分支劣于已探路径时输出 <BACKTRACK> 回退重探;一轮 episode 结束后,再用一个 teacher(或模型自己)把每一步那段冗长的搜索记录重写成一条紧凑的因果推理链,最后在 (状态, 压缩推理链, 动作) 三元组上做标准 SFT。第二阶段 MC-Critic 负责把前瞻"校准"到真实回报上:用免参数、靠随机策略批量 rollout 的 Monte-Carlo 批判器给出低方差的状态/动作价值,替换或混合进 PPO/GRPO 的优势估计里,做在线 RL 微调。下图的流向与「关键设计」同序同名。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["交互环境<br/>2048 / Sokoban"] --> B["环境探针式前瞻构建<br/>MCTS 采样真实未来"]
    B -->|当前分支劣于已探路径| C["回退重探<br/>BACKTRACK 自纠"]
    C --> B
    B --> D["认知压缩<br/>搜索树→因果推理链"]
    D --> E["SFT 内化前瞻<br/>推理期不再搜索"]
    E --> F["蒙特卡洛批判器<br/>随机策略批量廉价 rollout"]
    F --> G["MC-GRPO / MC-PPO 在线 RL<br/>低方差优势估计"]
    G --> A

关键设计

1. 环境探针式前瞻构建:让真实环境而不是模型的世界模型来回答"走这一步会怎样"

既然漂移的根源是模型在内部模拟未来,最直接的办法就是不模拟——把前瞻外置到环境里去。GLAD 的做法是:在每一个决策步 \(t\),从当前状态 \(s_t\) 起在真实环境中执行一次 MCTS,采样 \(N\) 条长度为 \(T\) 步的轨迹 \(\{\tau_1,\dots,\tau_N\}\)。这里有个关键细节:探针不只保留最优路径,也保留次优路径和死路,因为死路信息才是"为什么不能这么走"的监督来源。这批原始轨迹被直接塞进 LLM 的上下文,充当一张"ground-truth future map"。模型据此输出两样东西:一段 Analysis(对这些未来做比较与模拟,例如"轨迹 A 会导致一次合并,而轨迹 B 会锁死棋盘")和一个 Decision(下一步动作,或者一个特殊的 <BACKTRACK> token)。一旦分析显示当前分支比之前探过的备选更差,模型就发出 <BACKTRACK>,把状态回退到 \(s_{t-1}\) 重探。这条 "Probing–Decision–Reflection" 回路让数据收集阶段本身就带上了自我纠错能力,而且要强调的是:纠错后的恢复过程同样被记录进数据集,模型学到的是"怎么从坏局面里退出来",而不只是"别走坏棋"。

这个设计真正防止幻觉/自欺的地方在于监督信号的来源。模型在分析里写的每一个"未来",都对应它在上下文里刚刚读到过的真实转移;它不需要(也不被允许)凭内部世界模型去猜 \(P\)。前瞻的深度由探针的 \(T\) 步控制、分支宽度由采样条数 \(N\) 控制,二者都是数据构建期的算力旋钮而不是推理期的成本——论文正文未给出 2048/Sokoban 上 \(T\)\(N\) 的具体取值(见附录 A–C,⚠️ 以原文为准),但机制上它们决定了监督里"看到的未来有多远、多宽"。和纯 CoT/ReAct 的差别也正在这里:ReAct 的前瞻是一段没有外部校验的独白,ProAct 的前瞻是一次有环境回执的查询。

2. 认知压缩:把一棵带结构标签的搜索树压成一条"观察→分析→结论"的因果链

探针阶段产出的原始上下文又长又脏——满是搜索痕迹、结构标签、回退步骤。直接在这上面 SFT 既昂贵(token 太长)又容易过拟合到格式上:模型会学会复述 <search> 标签而不是学会判断局势。于是论文加了一步压缩:用一个 teacher 模型(或模型自己)把原始上下文合成为最终的推理路径 \(z\),并强制遵守四条原则。格式简化要求删掉全部结构痕迹,改写成自然语言("让我们看一下棋盘……""如果我向上移动,方块会合并……"),对齐预训练分布;显式因果链要求每步严格按 观察 → 分析 → 结论 展开,且分析必须依据探针阶段实际观察到的环境规则,把当前动作与未来状态显式连起来;未来趋势估计要求压缩后的推理不只解释"为什么选这个动作",还要解释"为什么其他动作被否掉"——例如"现在向左移动是安全的,但会挡住未来一次关键的合并";保留多样性要求推理保留搜索里的权衡过程,用"选项 A 对分数更好,但选项 B 更安全,考虑到长期我选 B"这种口吻,而不是斩钉截铁地宣布答案。最后在数据集 \(\mathcal{D}=\{(s,z_{\text{compressed}},a)\}\) 上做标准的负对数似然 SFT。

四条原则里真正承重的是第三、四条。要求模型解释"被否掉的动作为什么被否掉",实际上是在逼它做反事实推理:它必须能从真实观测到的轨迹里提炼出可迁移的环境动力学("这一格是死角,早填晚填都要还债"),而不是死记"这种盘面就该走上"。保留权衡则让策略不塌缩成一句口号,这与 RAGEN 观察到的"Echo Trap"是同一种担忧的另一种解法。和 VAGEN、WALL-E 这类显式强制生成世界模型状态的做法相比,ProAct 蒸馏的不是搜索树本身也不是状态估计的标签,而是搜索的结论——一棵树被压成一条链,推理时 token 开销与普通 CoT 同量级,但内容是从真值转移校准过来的。

3. 蒙特卡洛批判器:用随机策略的廉价 rollout 顶替训不起来的价值网络

第二阶段要解决的是价值估计。论文的诊断很干脆:LLM 智能体 RL 里 critic 训不好不是算法问题而是样本吞吐问题——传统深度 RL 的 MLP 策略能刷出百万级交互步,critic 自然准;LLM 一步要生成成百上千 token,采样率低几个数量级,训出来的 critic 方差高,反过来又把训练推崩。MC-Critic 的思路是干脆不训参数化的 critic:一个状态的价值,直接定义为从它出发跑 \(M\) 条轨迹、把折扣回报取平均。

\[V^{\text{MC}}_{\pi_{\text{random}}}(s_t)=\frac{1}{M}\sum_{i=1}^{M}\sum_{k=0}^{T-1}\gamma^{k}r^{i}_{k+t}\]

这样做是无偏估计、且方差随 \(M\) 增大而下降——但前提是用当前策略 \(\pi_\theta\) 去 rollout,而 4B 模型生成单步推理加动作就要 3–6 秒,为估一个状态跑 \(M\) 条轨迹在时间上完全不可接受。于是论文做了一个刻意的取舍:用随机策略 \(\pi_{\text{random}}\) 作为 \(\pi_\theta\) 的替身去做这 \(M\) 条 rollout。这样得到的 \(V^{\text{MC}}_{\pi_{\text{random}}}\) 在理论上肯定不如 \(V^{\text{MC}}_{\pi_\theta}\) 准确,但它极其便宜——在 2048 里随机策略 3 秒内能跑 1000 条以上轨迹,比 LLM 生成一步还快。这是一个非常"系统级"的观察:LLM 的一步与环境的一步代价差了好几个数量级,那就用环境那侧的廉价重复去替代模型那侧的昂贵估算。关键在于,随机策略的回报虽然低估了最优策略的水平,但它完全由真实环境动力学决定,因此它给出的"这个状态客观上有多好"不会像学出来的 critic 那样自欺。

把它接进策略梯度的方式有两种。接 GRPO 时(MC-GRPO),先按 Step-GRPO 的骨架跑一条轨迹、把访问过的状态存进状态池,训练时从池里随机取一批状态、每个状态采 \(G\) 个独立单步样本 \(s_{t_u},c^i_{t_u},r^i_{t_u}\),但优势不再用即时步奖励算,而是用 MC-Critic 估的动作价值

\[Q^{\text{MC}}_{\pi_{\text{random}}}(s_{t_u},a^i_{t_u})=r^i_{t_u}+\gamma V^{\text{MC}}_{\pi_{\text{random}}}(s_{t_u+1})\]

再做组内归一化。这里有个论文自己踩到的坑很值得记:如果同一组里 \(G\) 个采样动作恰好全一样,它们的 \(Q\) 也全一样,组内归一化后整组优势为 0,这个状态就再也拿不到梯度。常见的做法(DAPO 的动态采样)是把这类样本直接丢掉,ProAct 反过来想留着用——当动作全同时,把基线从"组内均值"换成"整个动作空间 \(\mathcal{A}\) 上所有动作 \(Q\) 的均值"(绝对基线),于是即便所有采样动作相同,只要该动作优于动作空间平均水平就仍能得到正优势。接 PPO 时(MC-PPO),底子是 Step-PPO:为绕开多轮场景下拼接全部历史导致 context 超限(如 32,768 token)的问题,Step-PPO 只让智能体看当前状态、丢弃历史,用 turn-level critic \(V_\phi\) 算 GAE。MC-PPO 则把 MC 值与 critic 值做凸组合 \(V^{\text{MC-PPO}}(s_t)=(1-\omega)V_\phi(s_t,c_t)+\omega V^{\text{MC}}_{\pi_{\text{random}}}(s_t)\)\(\omega\in[0,1]\) 是 MC 值的权重(公式按原文 Eq.(18) 复述,⚠️ 以原文为准),用一个低方差的外部信号去给方差偏高的学习 critic 兜底。至此 MC-Critic 完全即插即用:不新增任何可训练参数,任何需要状态价值估计的 RL 算法都能挂上去。

一个完整示例:2048 里一次决策如何被前瞻改写

以论文正文举的 2048 为例走一遍。设当前盘面为 \(s_t\),模型准备落子。第一步,探针:从 \(s_t\) 起在真实游戏里跑 MCTS,采出若干条长度为 \(T\) 的未来(具体条数与深度见附录 ⚠️ 以原文为准),其中轨迹 A 会把两块相同数字撞在一起形成合并、轨迹 B 则会把棋盘推向一个再也不能合并的僵局。第二步,决策:这些真实未来被写进上下文,模型写出分析——"轨迹 A 通向一次合并,轨迹 B 通向 gridlock",然后选定动作;如果它读到的是"当前分支比上一步淘汰的那条更差",它会改吐 <BACKTRACK>、退回到 \(s_{t-1}\)第三步,压缩:这段含搜索标签、含回退记录的长上下文被重写成一条人类口吻的链——"先看棋盘;如果我向上移动,方块会合并,但随后这个角会被锁住;向左移动现在是安全的,却会挡住未来一次关键合并;所以这里向上更好"。第四步,内化与校准:模型在 (s_t, 这条链, 选中的动作) 上做 SFT,得到"不用搜索也能说出这段话"的直觉;进入 RL 阶段后,在状态池里抽到 \(s_{t_u}\) 时采 \(G\) 个单步样本,用随机策略跑出来的一批 Monte-Carlo 回报给出每个候选动作的价值——若这 \(G\) 个动作互不相同就用组内相对基线,若全相同就换成动作空间的绝对基线,梯度照样有得算。

损失函数 / 训练策略

第一阶段是纯粹的监督学习:在 GLAD 数据集上最小化推理链与动作的负对数似然,2048 用了 25K 条轨迹、Sokoban 用了 8K 条,基座统一为 Qwen3-4B-Instruct-2507。第二阶段是在线 RL,两种配置都试过——从 GLAD 检查点继续微调,以及完全不经过 GLAD、直接从基座模型开练。MC-GRPO 的损失与 Step-GRPO 逐项一致,唯一的差别在优势的计算:把即时步奖励换成 MC-Critic 估的动作价值再组内/动作空间归一化,从而把优化目标从"这一步的即时收益"推向"这一步通向的长期回报"。MC-PPO 的损失是 Step-PPO 的裁剪策略损失加价值损失,只是价值目标换成了前面那个凸组合。评测指标方面,2048 用累计方块合并分数、Sokoban 用平均成功推箱数。

实验关键数据

主实验

在两个长程决策基准上评测:2048 是随机性环境,单条轨迹有数百轮、要求不确定性下的规划;Sokoban 是确定性规划任务,轮数较短但奖励稀疏。两者构成互补的漂移压力测试。带 * 的列表示在 SFT 和 RL 两个阶段都严格未见过的环境变体。

模型 2048 4×4 2048 3×3* 2048 3072* Sokoban Unseen Sokoban Action* Sokoban Symbol*
GPT-5 4040.0 1184.0 6962.0 1.89 1.83 1.94
Claude-4.5-Sonnet 166.7 109.3 120.0 1.06 0.78 1.33
Doubao-Seed-1.6 1877.3 300.0 2054.0 1.22 0.61 1.56
Doubao-Seed-1.8 4662.7 545.3 4210.0 1.80 1.44 2.00
UI-TARS-1.5 2616.0 466.7 3920.0 0.44 0.44 0.39
Qwen3-235B-A22B 634.7 274.7 2688.0 0.61 0.33 0.56
Qwen3-30B-A3B 838.7 230.7 1740.0 0.44 0.39 0.50
Qwen3-4B(基座) 721.3 187.3 1603.0 0.39 0.44 0.56
基座 + GLAD(本文) 3335.3 429.2 4565.7 0.72 0.52 0.67
基座 + GLAD + MC-Critic(本文) 4503.8 464.4 6013.7 0.94 0.60 0.70

消融实验

MC-Critic 的消融在两个互补设定下做:①从 GLAD 检查点出发做 RL 精调;②完全从基座模型开练(不给 GLAD 监督)。下表是两种设定在环境变体上的结果(训练分布上的标准设定结果以曲线形式给出,正文未给数值,见原文 Fig. 3)。

方法 2048 3×3 2048 3072 Sokoban Unseen-RL Sokoban Action Sokoban Symbol
从 GLAD SFT 检查点出发
Traj-GRPO 459.0 5457.0 1.10 0.60 0.64
Step-GRPO 457.0 5820.3 1.00 0.56 0.63
Step-PPO 487.3 6248.7 0.90 0.62 0.65
MC-GRPO 464.4 6013.7 1.05 0.60 0.70
MC-PPO 465.0 5818.1 1.18 0.62 0.68
从基座模型开练
Traj-GRPO 202.0 1760.7 0.50 0.73 0.90
Step-GRPO 188.0 1792.9 0.25 0.53 0.86
Step-PPO 202.7 1912.9 0.45 0.55 0.88
MC-GRPO 194.2 1754.7 0.55 0.80 1.03
MC-PPO 239.8 2229.1 0.53 0.96 0.98

关键发现

  • GLAD 的收益大到不像一个 SFT 步骤:在 2048 标准盘面上把 Qwen3-4B 从 721.3 拉到 3335.3(约 4.6 倍),而且一举超过大了两个数量级的 Qwen3-235B-A22B(634.7)与 Qwen3-30B-A3B(838.7)。更有意思的是规模在这两个游戏里几乎不买账——两个更大的 Qwen3 模型在 2048 上的得分甚至低于 4B 基座。这说明瓶颈不是参数容量而是有没有被环境校准过的前瞻监督,恰是本文的论点。
  • MC-Critic 在两种初始化下都有效,但"从零开练"时增益最明显:从基座直接开练时 MC-PPO 在 2048 3×3/3072 上分别拿到 239.8/2229.1,压过 Step-PPO 的 202.7/1912.9;Sokoban Action 上 0.96 对 0.55 几乎是翻倍。而在 GLAD 检查点上做精调时,消融反而不是一边倒:3×3 和 3072 上 Step-PPO(487.3/6248.7)仍是最好的,MC-PPO 只在 Sokoban Unseen-RL(1.18)和 MC-GRPO 只在 Symbol(0.70)上领先。一个合理的解读(本文未展开论证)是 GLAD 已经提供了相当强的长期视野先验,此时 MC 值的边际贡献被压缩,两种机制在功能上有部分重叠。
  • 轨迹级 GRPO 在长程任务上会失稳,而 MC-GRPO 稳住了:Sokoban 训练关卡大多几步就能解完,整条轨迹当作一个训练样本方差不大,所以 Traj-GRPO 表现与 MC-GRPO 相当;一旦轨迹变长(2048 是数百轮),回报方差累积,Traj-GRPO 明显退化,而 MC-GRPO 保持稳定并继续爬升。这正是把优势从"整条轨迹一个共享值"细化到"每个状态一个 MC 估值"的价值所在。
  • 超参配方(M 与 T)\(M\) 是每个状态的 rollout 条数、\(T\) 是每条 rollout 的最大步数。论文给出的结论是定性的:稠密奖励环境(2048)在交互效率允许的前提下 \(M\) 尽量大;稀疏奖励环境(Sokoban)\(M\) 不宜过大,更小的 \(M\) 反而更好;\(T\) 应设为一条成功轨迹的平均步数,不要过大。具体数值与曲线在附录 D,正文未列(⚠️ 以原文为准)。
  • 宣称与数据之间的落差需要打折扣看:摘要说 4B 模型"可与顶级闭源模型相比",这在 2048 上成立——4503.8 对 GPT-5 的 4040.0、6013.7 对 Doubao-Seed-1.8 的 4210.0 都是领先;但在 Sokoban 上差距仍然很大,未见过关卡 0.94 对 GPT-5 的 1.89、Doubao-Seed-1.8 的 1.80,大约只有一半。所以更准确的说法是:在随机、长程、需要前瞻的 2048 上追平了闭源第一梯队,在确定性、短程、稀疏奖励的 Sokoban 上明显还差一截。
  • ⚠️ 一个小的一致性问题:Tab. 1 中"基座 + GLAD + MC-Critic"的 Sokoban Unseen 列是 0.94,而 Tab. 2 中 MC-GRPO 的 Sokoban Unseen-RL 列是 1.05,两者看起来是同一配置。推测两表的留出划分不同(Tab. 1 的 Unseen 是 SFT 未见、Tab. 2 的 Unseen-RL 是 SFT 与 RL 都未见),但原文未明说,引用时以原文为准。

亮点与洞察

  • 把前瞻外置,而不是把推理拉长:ToT/RAP 的路线是"在推理期搜得更努力",ProAct 反过来把搜索只留在数据构建期,蒸馏的还只是搜索的结论而非搜索树本身。这个"search-then-compress"的倒置使得推理期 token 开销与普通 CoT 同量级,却拿着真值转移校准过的内容——是本文最值得迁移的一条思路。
  • 用"被否掉的动作"当监督:压缩原则里要求模型解释为什么其他动作被拒绝,这条看似只是写作规范,实际是整个 GLAD 逼模型内化环境动力学的抓手。任何做过程监督/推理蒸馏的工作都可以借这一条:只教"选什么"会退化成语料记忆,教"为什么不选"才逼出可迁移的判断规则。
  • 把 critic 换成"廉价策略的大量 rollout":MC-Critic 的洞察不是数学上的(Monte-Carlo 估价值是老技术),而是系统层面的——LLM 的一步(3–6 秒)与环境的一步(1000 条轨迹 <3 秒)差了几个数量级,既然如此就用便宜的那一侧做重复来替代昂贵的那一侧。在需要给 LLM 智能体配价值函数的任何场景(GUI agent、工具调用、多轮对话 RL)里,这个"用一个便宜代理策略做 rollout 估计"的模式都可以直接搬。
  • 退化组的绝对基线:组内 \(G\) 个动作全相同时优势全为 0 是个容易被忽视的细节,多数做法直接丢样本,本文改成拿动作空间全体动作的 \(Q\) 均值当基线,把这个状态的学习信号救回来。这是一个很小但即插即用的 trick,任何 GRPO 系变体都能用。

局限与展望

  • 评测环境只有两个格子游戏:全文只测了 2048 与 Sokoban,都是廉价、可无限重置、可高速模拟的环境——这恰恰是 GLAD 的探针成本最低、MC-Critic 的随机 rollout 最便宜的场景。论文的方法动机反复提"网页/具身/长程交互",但没有任何 GUI、具身或工具使用环境上的验证。探针成本高昂或环境不可重置(真实网页、物理机器人)时,GLAD 与 MC-Critic 的核心前提是否还成立,是最大的未答问题。
  • 随机策略替代是一个被承认但不被量化的偏差:论文坦白 \(V^{\text{MC}}_{\pi_{\text{random}}}\) 理论上不如 \(V^{\text{MC}}_{\pi_\theta}\),但没有测这个偏差有多大,也没有和"多花时间用 \(\pi_\theta\) 做少量 rollout""用一个训得更久的 critic"或"\(\varepsilon\)-greedy / 温度采样的中间态代理策略"做对比。既然替身策略的质量直接决定价值信号质量,这个设计空间值得系统扫一遍。
  • Step 系列丢掉了历史:Step-PPO/Step-GRPO 只让智能体看当前状态以避免上下文超限,这在部分可观测任务里会直接损失信息。论文把它当作工程折中一笔带过,没有做"带滑动窗口历史 vs 无历史"的消融。
  • 压缩链的忠实性没有被检验:SFT 后的模型学会了写出漂亮的权衡与反事实,但论文没有度量这条链里陈述的理由是否真的对应它实际选的动作(reasoning faithfulness)。存在学到一种"自信的权衡腔调"而非真正内化动力学的风险。
  • 超参配方过于定性\(M\)"尽量大"、\(T\)"取成功轨迹平均步数"都是方向性建议,定量结果全部推给附录 D,正文无法自足复现。补充一个跨环境的 \(M\)\(T\) 敏感性热力图会让这份配方可用得多。
  • 可改进方向:把替身策略从"纯随机"升级为"带温度的当前策略"并用重要性权重修正(\(\pi_\theta/\pi_{\text{random}}\) 加权),有望在不显著增加成本的前提下消掉一部分偏差;把 GLAD 的探针从 MCTS 换成更便宜的有模型引导的搜索,可望把它推到探针昂贵的领域。

相关工作与启发

  • vs CoT / ReAct:它们把推理链拉长来逼近 System 2,但未来始终在模型内部模拟,长程下 simulation drift 累积,越推演越幻觉。ProAct 让未来由真实环境给出,模型只负责读和比较,漂移在数据阶段就被掐断。
  • vs ToT / RAP:这类方法在推理期接显式搜索(BFS/MCTS),效果好但测试成本随轨迹长度爆炸,难以撑住几百步的交互。ProAct 把搜索搬到数据构建期,压成一条链内化进参数,推理期零搜索开销。
  • vs VAGEN / WALL-E:它们显式强制模型生成世界模型状态(状态估计、动力学模拟)或做神经符号对齐来接地。ProAct 认为不必克隆冗长的搜索痕迹或显式状态标签,而应压缩成一句自然语言的"未来趋势估计",同时保留权衡多样性——蒸馏的是判断,不是中间产物。
  • vs ArCHer / SWEET-RL / Turn-PPO:三者都用参数化的 critic(话语级分层价值、带特权信息的非对称 critic、turn-level critic + GAE)。ProAct 保留 Step-PPO 的 turn-level critic,但额外混入一个无参数的 MC 值;在 GRPO 路线上则干脆用 MC 动作价值替换即时步奖励,把信用分配从"整条轨迹共享"细化到"每个状态/动作"。
  • vs RAGEN / AgentGym-RL:它们解决的是多轮 RL 的基础设施与稳定性(Echo Trap、StarPO、课程式扩展交互长度)。ProAct 关注的是智能体内部推理过程的质量与价值信号的来源,两者正交,可以叠加使用。

评分

  • 新颖性: ⭐⭐⭐⭐ 把前瞻从推理期搬到数据构建期、并用"随机策略大量 rollout"替代参数化 critic,两个想法都直击 LLM 智能体 RL 的真实痛点,组合起来是新的。
  • 实验充分度: ⭐⭐⭐ 只有 2048 与 Sokoban 两个环境,主结果依赖 GPT-5 / Doubao 等闭源 API 的黑盒对比,超参与 \(M\)/\(T\) 分析被推给附录,双表之间还有一处口径不清;但 GLAD/MC-Critic 的消融在"从零开练"和"从 GLAD 检查点"两种设定下都做了,结构完整。
  • 写作质量: ⭐⭐⭐ 两阶段主线和方法动机写得很清楚,公式推导完整(GRPO/PPO 变体逐条列出),代价是正文被大量 LaTeX 与变体命名塞满,且关键超参一律"见附录"。
  • 价值: ⭐⭐⭐⭐ "环境做 oracle + 压缩成链 + 廉价 MC 值"这套组合对任何想把 LLM 智能体做长程训练的工作都有直接借鉴意义,4B 模型在 2048 上压过 235B 模型也说明这条路线的性价比。