跳转至

Beyond Prediction: Steering VLM Agents with Retrospective World Modeling

会议: NeurIPS2026
arXiv: 2609.39101
领域: 多模态 VLM
关键词: 回溯世界建模、逆动作归因、自一致性奖励、多轮智能体、信用分配

一句话总结

RWM 让 VLM 智能体根据相邻观测的文本信念状态反推前一轮动作,并把动作与转移的一致性转成训练奖励;完整配置在四类交互任务上取得原表报告的 0.81 Overall 成功率,但其提升同时涉及回溯推理、双层 GAE、外部评审和 SCR,不能全部归因于 SCR。

研究背景与动机

视觉语言模型(VLM)智能体不仅要理解一张图,还要在动作改变环境后继续决策。ReAct 将推理和动作交替组织,VAGEN 则进一步让模型先描述当前状态、推演候选动作的后果,再给出可执行动作。这种前瞻世界建模能够帮助规划,却也可能把模型自己的预测当成事实:例如推箱子时想象向上移动能推动箱子,却没有意识到墙壁使动作根本无效。只要推理语言自洽,模型就可能沿着一个错误的环境假设继续规划。

问题不只是预测不准,而是已发生的真实转移没有被充分利用。传统稀疏奖励只在任务完成时评价整条轨迹,很难指出哪个中间动作与环境变化不符。若智能体已经得到前后两次观测,就可以换一个问题:不是继续问“这个动作将导致什么”,而是问“看到这样的变化,什么动作最能解释它”。这样,失败动作、撞墙动作和与观测不符的解释都可能在下一轮提供反馈,而不必等待最终任务失败。

不过,逆推也不是天然可靠的裁判。上一轮动作在交互历史中明明白白地出现,模型可以复制答案而不理解转移;不同动作也可能产生相同观测。本文因此把回溯推理、隔离历史的评分接口和训练奖励组合起来,目标是让策略学会更容易被观测变化支持的行为,而不是给环境建立一个严格的物理因果证明。核心 idea:用相邻真实观测生成的双信念状态做逆动作归因,再以执行动作相对最强替代动作的评分间隔提供跨轮自一致性监督。

方法详解

整体框架

输入是当前视觉观测、任务目标和交互上下文,输出是环境可执行动作。同一个 VLM 策略承担信念状态描述、回溯解释、前瞻规划和动作输出,不另外训练一个独立的逆动力学网络。这里“世界模型”是策略内部的语言推理能力,不是可查询的真实状态转移器。

整个系统分成两条相关但不同的数据流。执行流在新观测到来后生成当前信念,对前一轮转移做回溯,再规划并执行当前动作。训练流把相邻信念送进隔离历史的评分接口,算出前一轮动作的 SCR,再把这个延迟信号回填到前一轮奖励中。评分不是在动作执行前凭预测状态验证动作,也不等于读取一次采样的回溯答案就给奖励。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    O["新观测与任务"] --> B["双信念回溯<br/>并做当前规划"]
    B --> A["执行当前动作"]
    A --> N["环境给出下一观测"]
    N -->|下一轮更新信念| B
    B -.->|相邻信念;训练评分| H["无历史评分"]
    H -.-> S["自一致性奖励"]
    S -.-> T["跨轮信用分配"]
    T -.->|仅训练;更新策略| B

实线表示执行与观测循环,虚线表示奖励计算和训练反馈。四个关键设计依次是双信念回溯、无历史评分、自一致性奖励和跨轮信用分配;其中 RWM-Base 只保留回溯推理结构和稀疏 PPO,完整的密集奖励训练流属于 RWM-Full。

关键设计

1. 双信念回溯:先解释已经发生的变化,再规划尚未发生的动作

智能体看不到 POMDP 的真实隐藏状态,只能从截图和上下文生成文本信念状态。第 \(t\) 轮开始时,它既有上一轮保存的信念 \(\hat{s}_{t-1}\),也能从当前新观测生成 \(\hat{s}_t\)。逆推使用这两个已经观测支持的描述,而不是上一轮想象的下一状态。原文特别说明,下轮信念会根据新观测重新生成;这一步避免把“预测成功”误当成“现实确实如此”。

\[ \hat{a}_{t-1}\sim\pi_\theta(\cdot\mid\hat{s}_{t-1},\hat{s}_t). \]

这个 \(\hat{a}_{t-1}\) 是模型对过去转移的内部解释,不是环境提供的动作标签,也不保证等于唯一真实原因。它回答前一轮发生了什么;随后模型结合当前信念、任务目标和回溯上下文,提出当前候选动作,预测它的后果,最终输出当前执行动作。第一次观测没有前一转移,回溯字段使用空标记,不计对应回溯奖励。

推理轨迹依次包含观察描述、回溯、当前动作推理、下一状态预测和最终动作。原文公式中的推理标签写法有 <Res>、<Rea> 两种,附录完整提示又使用 <reasoning>;这只是展示层面的标签差异,不应读成额外模块。真正重要的是区分过去的解释与未来的模拟:回溯不取消前瞻,前瞻也不能替代下一轮真实观测。

这一设计允许失败后的变化立即影响当前规划。例如发现玩家没有移动时,模型有机会修正“前方可通行”的假设。但它并没有在执行前拥有未来观测,因此不能保证阻止第一次错误动作。它更像跨轮闭环纠偏,而不是一个先验安全过滤器。

2. 无历史评分:让评分器看转移,而不是直接读取上一动作

如果回溯模型能读取完整交互历史,它只需找到上一轮最终答案,就能给执行动作很高分。训练奖励看起来改善,实际没有学到动作如何改变环境。RWM 的判别式评分接口因此只暴露两个信念状态和候选动作集合,不暴露完整动作历史。模型对有限动作空间中的每个候选动作给出“能否解释这次转移”的分数,而不是只生成一个胜出的动作。

形式上,评分向量是 \(v_t=F_\theta(\hat{s}_t,\hat{s}_{t+1};\mathcal{A})\),其中每个分量对应一个候选动作。这个接口由同一策略模型实现,但条件输入与通常的长历史决策输入不同。模型在常规推理轨迹里生成的 <Retro> 解释,与奖励使用的完整动作评分向量,在概念上必须区分;采样解释本身不能充当 margin-SCR 的数值定义。

实现说明存在需要保留的边界:正文第 4.2 节说分数来自候选动作 token 的 logits,而附录 A.2 和实际提示则要求模型给每个动作输出 \([-5,5]\) 内的整数分数。附录明确指定 \(S_{\max}=5\)、\(S_{\min}=-5\),因此归一化常数并非未知;但全文没有清楚交代原始 token logits 如何映射成这一受限整数评分,也没有给出多 token 动作名的聚合规则。不能据此补写“对整条动作序列求 log-probability”或“连续坐标逐 token 枚举”等实现。

隔离完整历史切断了直接抄上一答案的路径,却不等于信息泄漏被数学上完全排除。信念状态本来由观测与上下文生成,若其文字描述夹带“刚才向右移动”之类信息,评分器仍可能间接得到动作线索。作者的消融支持无历史接口有效,但没有单独审计信念内容泄漏;本文笔记因此不沿用原文“完全切断记忆利用”的绝对表述。

3. 自一致性奖励:奖励执行动作胜过最强替代解释,而非只奖励猜中

有限离散动作空间中,SCR 比较执行动作的分数与所有其他动作中最高的分数。这比“采样的回溯动作是否与执行动作相同”更细:即使二者都没猜中,弱支持和强烈反对也可以得到不同奖励;同时它明确引入最难区分的替代解释。

\[ r_t^i=\frac{v_t(a_t)-\max_{a\in\mathcal{A}\setminus\{a_t\}}v_t(a)}{S_{\max}-S_{\min}},\qquad r_t=r_t^e+\alpha r_t^i. \]

执行动作严格高于其他候选时,SCR 为正;被其他动作压过时为负;与最高替代动作并列时为零。在附录规定的受限整数评分下,分母为 \(10\),SCR 位于 \([-1,1]\)。这个有界性依赖分数确实满足所声明的上下界,不能直接推广到未经处理的原始 logits。外在奖励仍评价任务成功、格式遵循和步数代价,SCR 只是正则项;一个容易解释但无法完成任务的动作,不应压过真正推进目标的动作。

另一个对照是对评分做 softmax,再使用执行动作的 log-probability 减去均匀策略的 log-probability。它与 margin 方法共享判别评分,但转换方式不同:低概率执行动作可能受到远大于正确动作收益的负惩罚。直接 token 匹配则不需要评分,只给二值信号。附录声称 log-likelihood 的抽象范围可向负无穷延伸;若严格采用有限动作集合与 \([-5,5]\) 评分,其实际负界有限,不能把抽象论证误写成该具体实现必然无界。

混合动作空间并不是把离散 margin 公式原封不动搬到坐标上。ManiSkill 动作包含 pick、place、push 等类型和连续空间参数,附录 C.2 改为回溯类型与坐标:类型必须相同,再根据回溯坐标与执行坐标的欧氏距离给空间一致性分数。

\[ r_t^i=\mathbb{I}(\hat{u}_t=u_t)\left(1-\frac{\|\hat{p}_t-p_t\|_2}{D_{\max}}\right). \]

这里 \(D_{\max}\) 是最大距离,作者没有给出具体取值、坐标规范化细节或 push 的两组坐标如何组成参数向量。因此只能说明这是类型门控加距离惩罚,不能宣称连续动作经过有限候选 token 的完整 margin 排序,也不能擅自补上裁剪规则。它是 SCR 的任务适配版本,不是离散评分接口的已证明等价实现。

4. 跨轮信用分配:下一轮得到证据,奖励必须归回上一轮动作

第 \(t\) 轮动作的后果,要到第 \(t+1\) 轮观测出现后才能评分。因此此时计算的 SCR 属于 \(a_t\),而不是属于当前准备执行的 \(a_{t+1}\)。若奖励错贴到后一动作,智能体将因为前一转移被支持或被否定而更新无关动作,闭环监督就失去时间意义。RWM 明确将信号回填到产生该转移的轮次。

轮级奖励还不能直接拿来更新每个生成 token。RWM-Full 沿用 VAGEN 的双层 GAE:外层根据轮级奖励和 critic 先估计各轮优势,再把这份语义反馈注入该轮最后一个生成 token,内层沿该轮的 token 序列向前回传。这样,同一轮中形成观察描述、回溯、规划和动作的生成内容能收到与该轮结果对应的训练信号,不必只依赖整条轨迹末端的稀疏成功奖励。

这是一种奖励和优势的时间对齐机制,不是证明每个推理句子真实贡献多少的因果分解。尤其回溯与前瞻共用模型,信念、解释和动作可能共同适应奖励,获得高 SCR 并不自动说明它们与外部物理规律完全一致。训练的收益应由任务成功与动作有效性共同判断,而不能只看内部奖励变大。

一个完整示例

附录 E 的 Sokoban 案例中,最初箱子在玩家右上方,目标在箱子上方。模型规划先向右,让玩家来到箱子正下方,执行 Right。下一轮新观测确实描述“箱子在玩家正上方”,因此回溯使用原信念和这次新信念,而不是把上一轮预测直接当输入。

案例给出动作顺序 [Up, Down, Left, Right] 的评分 [-1,0,0,5]。Right 的分数是 \(5\),最强替代动作分数是 \(0\);按式 (5),这一转移的原始 SCR 为 \((5-0)/10=0.5\)。Sokoban 配置的 \(\alpha=0.1\),因而加到前一轮奖励中的 SCR 项为 \(0.05\),不是整轮总奖励。

此时当前规划改为 Up 推动箱子。再下一轮的回溯评分是 [5,0,-5,-5],同样支持刚刚执行的 Up;随后再执行 Up 将箱子推上目标。案例说明回溯奖励比动作输出晚一轮产生,也说明正文展示的分数向量并非一次 sampled Retro 动作。以上 SCR 算术是按原公式对原案例计算,并非新增实验测量。

损失函数 / 训练策略

RWM-Base 采用带回溯字段的推理结构,但只有稀疏任务与格式奖励,使用常规 token-level GAE;它并不包含密集 SCR。RWM-Full 同时采用双层 GAE、外部 LLM-as-a-Judge 对视觉状态估计及预测的评审,以及内在 SCR。外部评审使用 GPT-4.1 nano,这部分不能称为无外部监督;“内在”只准确描述 SCR 的来源。

策略通过 PPO clipping 更新,critic 是 VLM 最后隐状态上的标量价值头。二值 mask 排除环境提示,只对模型生成的推理与动作 token 计算策略梯度。附录还说明内层 token TD-error 通常包含相对参考模型的 KL 惩罚,但没有完整列出所有优化超参数。

骨干为 Qwen2.5-VL-3B,全局 batch size 为 \(128\),actor/critic 学习率分别为 \(10^{-6}\) 和 \(10^{-5}\),使用 \(4\) 张 H800 80GB。评测 temperature 和 top-p 都为 \(1.0\),最多生成 \(1024\) 个新 token,最大交互轮数为 \(4\)。这些短轮预算下的实验不能直接代表数百步长期交互性能。

实验关键数据

主实验

下表节选原表 1 的成功率,保留各任务组平均值与原表 Overall。训练方法均使用 Qwen2.5-VL-3B;Sokoban 平均覆盖 Standard/Hard,Navigation 平均覆盖 Base/Common Sense,ManiSkill 平均覆盖 Place/Stack/Drawer/Align。

配置 Sokoban 平均 Navigation 平均 ManiSkill 平均 FrozenLake Overall(原表)
Qwen2.5-VL-3B 0.06 0.25 0.00 0.09 0.08
Vanilla-PPO 0.16 0.29 0.00 0.21 0.12
ReAct-RL 0.24 0.38 0.00 0.30 0.17
VAGEN-Base 0.37 0.49 0.72 0.43 0.56
RWM-Base 0.52 0.66 0.94 0.75 0.76
VAGEN-Full 0.48 0.55 0.94 0.54 0.71
RWM-Full 0.66 0.68 0.97 0.77 0.81

原表 Overall 不是这里展示的四个任务组均值的简单平均,正文没有明确交代其聚合权重;例如 RWM-Full 四列简单平均为 \(0.77\),原表却为 \(0.81\)。本笔记保留发表数值,不自行修正,也不把 \(0.81\) 重新解释成四组等权平均。

同配置比较中,RWM-Base 对 VAGEN-Base 的原表 Overall 提升为 \(20\) 个百分点,RWM-Full 对 VAGEN-Full 为 \(10\) 个百分点。Sokoban-Hard 的 Base 对照为 \(0.46\) 对 \(0.33\),Full 对照为 \(0.63\) 对 \(0.46\)。Base 结果支持回溯结构本身有用,但由于 Base 没有密集 SCR,这 \(20\) 个百分点不是 SCR 的独立收益。

消融实验

下表来自原表 2,考察历史泄漏控制策略;原表未在标题中明确注明 Base/Full,因此保留其配置名称,不额外指定训练档位。

配置 Sokoban FrozenLake 说明
Qwen2.5-VL-3B 0.06 0.09 未训练骨干
VAGEN 0.41 0.43 前瞻对照
RWM,无遮挡历史 0.39 0.40 可从历史直接读出动作
RWM,动作 dropout,0.10 0.44 0.52 少量遮蔽动作相关 token
RWM,动作 dropout,0.20 0.50 0.59 中等遮蔽
RWM,动作 dropout,0.50 0.33 0.38 强遮蔽破坏上下文连贯性
RWM,无历史评分 0.58 0.75 只以转移为评分条件

关键发现

  • 无历史评分相对无遮挡历史提升 \(19\) 个和 \(35\) 个百分点,说明让模型“知道答案”不等于让它学会逆推;仅靠提示忽略上一动作不如输入隔离可靠。
  • Sokoban 权重分析给出:\(\alpha=0.50\) 时成功率从 \(0.58\) 降至 \(0.29\),内部奖励却更早饱和。SCR 过强会让容易解释的行为压过任务目标。
  • 正文报告 Sokoban 动作有效性超过 \(0.95\),VAGEN 曲线最高约 \(0.8\);这支持减少无意义移动,但它是任务指标证据,不是物理因果真实性的独立验证。
  • 三次评测、\(128\) 个测试案例的平均值没有配套置信区间或显著性检验;曲线中的近似值不应当作精确终点数据。闭源模型为 zero-shot,对比的是任务专门训练与通用零样本使用,而非相同训练预算。

亮点与洞察

  • 将“动作能否被结果解释”转成训练反馈,比仅检查动作字符串是否合法更贴近交互质量。最强替代动作的 margin 还让奖励表达解释之间的竞争,而非一次采样是否碰巧猜对。
  • 将奖励归回真正产生转移的轮次,是这个方法可复用的工程要点。任何依赖后续观测的智能体奖励都需要先解决时间归属,再讨论 token 级训练。
  • 消融揭示信息接口本身就是奖励设计的一部分。评分器若直接接触答案,复杂 reward 公式也无法阻止捷径。

局限与展望

  • 作者指出随机环境和多动作轮次会产生逆映射歧义:Up→Left 与 Left→Up 可能得到相同终态。只支持一个解释会错误惩罚另一条有效路径,集合式回溯是更合适的方向。
  • 作者承认长轮次 RL 的显存和 OOM 瓶颈;当前最大 \(4\) 轮、Sokoban 单箱子、FrozenLake 关闭滑动的设置,对真正长时程和随机动力学的证据有限。
  • 信念状态既是观测压缩,也是潜在的幻觉与动作泄漏载体。同一策略生成信念并评分,仍有协同迎合奖励的风险,需要独立观测核验或信念内容审计。
  • logits 与整数评分的对应、多 token 动作评分、ManiSkill 坐标处理未被充分说明。复现时需先明确这些接口,不能只凭公式宣称全动作空间已有统一实现。

相关工作与启发

  • vs VAGEN:VAGEN 强调观察和未来预测,RWM 增加已经发生转移的逆动作解释;Full 配置继承其双层 GAE 与外部评审,因此新增贡献不是整套训练基础设施。
  • vs ReAct:ReAct 提供自由形式推理与动作交替,RWM 为过去转移和未来模拟设置明确角色,并把过去的一致性转成训练信号。
  • vs 逆动力学好奇心方法:经典方法用逆模型学动作相关表征,再用前向预测误差鼓励探索;RWM 使用逆归因的一致性约束策略,主要是行为正则,而非奖励未知性。

评分

  • 新颖性: 4/5 — 将逆动作归因嵌入多轮 VLM 推理并用于奖励,组合有辨识度,但继承已有逆动力学与世界建模思想。
  • 实验充分度: 3/5 — 四类任务与泄漏消融有价值,但短轮预算、汇总口径和复现接口仍有限制。
  • 写作质量: 3/5 — 跨轮机制清楚,评分实现与部分绝对因果表述不够严谨。
  • 价值: 4/5 — 适合借鉴延迟观测奖励与输入隔离设计,不能把内部一致性当作真实因果保证。