Beyond Prediction: Steering VLM Agents with Retrospective World Modeling¶
会议: NeurIPS2026
arXiv: 2609.39101
领域: 多模态 VLM
关键词: 回溯世界建模、逆动作归因、自一致性奖励、多轮智能体、信用分配
一句话总结¶
RWM 让 VLM 智能体根据相邻观测的文本信念状态反推前一轮动作,并把动作与转移的一致性转成训练奖励;完整配置在四类交互任务上取得原表报告的 0.81 Overall 成功率,但其提升同时涉及回溯推理、双层 GAE、外部评审和 SCR,不能全部归因于 SCR。
研究背景与动机¶
视觉语言模型(VLM)智能体不仅要理解一张图,还要在动作改变环境后继续决策。ReAct 将推理和动作交替组织,VAGEN 则进一步让模型先描述当前状态、推演候选动作的后果,再给出可执行动作。这种前瞻世界建模能够帮助规划,却也可能把模型自己的预测当成事实:例如推箱子时想象向上移动能推动箱子,却没有意识到墙壁使动作根本无效。只要推理语言自洽,模型就可能沿着一个错误的环境假设继续规划。
问题不只是预测不准,而是已发生的真实转移没有被充分利用。传统稀疏奖励只在任务完成时评价整条轨迹,很难指出哪个中间动作与环境变化不符。若智能体已经得到前后两次观测,就可以换一个问题:不是继续问“这个动作将导致什么”,而是问“看到这样的变化,什么动作最能解释它”。这样,失败动作、撞墙动作和与观测不符的解释都可能在下一轮提供反馈,而不必等待最终任务失败。
不过,逆推也不是天然可靠的裁判。上一轮动作在交互历史中明明白白地出现,模型可以复制答案而不理解转移;不同动作也可能产生相同观测。本文因此把回溯推理、隔离历史的评分接口和训练奖励组合起来,目标是让策略学会更容易被观测变化支持的行为,而不是给环境建立一个严格的物理因果证明。核心 idea:用相邻真实观测生成的双信念状态做逆动作归因,再以执行动作相对最强替代动作的评分间隔提供跨轮自一致性监督。
方法详解¶
整体框架¶
输入是当前视觉观测、任务目标和交互上下文,输出是环境可执行动作。同一个 VLM 策略承担信念状态描述、回溯解释、前瞻规划和动作输出,不另外训练一个独立的逆动力学网络。这里“世界模型”是策略内部的语言推理能力,不是可查询的真实状态转移器。
整个系统分成两条相关但不同的数据流。执行流在新观测到来后生成当前信念,对前一轮转移做回溯,再规划并执行当前动作。训练流把相邻信念送进隔离历史的评分接口,算出前一轮动作的 SCR,再把这个延迟信号回填到前一轮奖励中。评分不是在动作执行前凭预测状态验证动作,也不等于读取一次采样的回溯答案就给奖励。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
O["新观测与任务"] --> B["双信念回溯<br/>并做当前规划"]
B --> A["执行当前动作"]
A --> N["环境给出下一观测"]
N -->|下一轮更新信念| B
B -.->|相邻信念;训练评分| H["无历史评分"]
H -.-> S["自一致性奖励"]
S -.-> T["跨轮信用分配"]
T -.->|仅训练;更新策略| B
实线表示执行与观测循环,虚线表示奖励计算和训练反馈。四个关键设计依次是双信念回溯、无历史评分、自一致性奖励和跨轮信用分配;其中 RWM-Base 只保留回溯推理结构和稀疏 PPO,完整的密集奖励训练流属于 RWM-Full。
关键设计¶
1. 双信念回溯:先解释已经发生的变化,再规划尚未发生的动作
智能体看不到 POMDP 的真实隐藏状态,只能从截图和上下文生成文本信念状态。第 \(t\) 轮开始时,它既有上一轮保存的信念 \(\hat{s}_{t-1}\),也能从当前新观测生成 \(\hat{s}_t\)。逆推使用这两个已经观测支持的描述,而不是上一轮想象的下一状态。原文特别说明,下轮信念会根据新观测重新生成;这一步避免把“预测成功”误当成“现实确实如此”。
这个 \(\hat{a}_{t-1}\) 是模型对过去转移的内部解释,不是环境提供的动作标签,也不保证等于唯一真实原因。它回答前一轮发生了什么;随后模型结合当前信念、任务目标和回溯上下文,提出当前候选动作,预测它的后果,最终输出当前执行动作。第一次观测没有前一转移,回溯字段使用空标记,不计对应回溯奖励。
推理轨迹依次包含观察描述、回溯、当前动作推理、下一状态预测和最终动作。原文公式中的推理标签写法有 <Res>、<Rea> 两种,附录完整提示又使用 <reasoning>;这只是展示层面的标签差异,不应读成额外模块。真正重要的是区分过去的解释与未来的模拟:回溯不取消前瞻,前瞻也不能替代下一轮真实观测。
这一设计允许失败后的变化立即影响当前规划。例如发现玩家没有移动时,模型有机会修正“前方可通行”的假设。但它并没有在执行前拥有未来观测,因此不能保证阻止第一次错误动作。它更像跨轮闭环纠偏,而不是一个先验安全过滤器。
2. 无历史评分:让评分器看转移,而不是直接读取上一动作
如果回溯模型能读取完整交互历史,它只需找到上一轮最终答案,就能给执行动作很高分。训练奖励看起来改善,实际没有学到动作如何改变环境。RWM 的判别式评分接口因此只暴露两个信念状态和候选动作集合,不暴露完整动作历史。模型对有限动作空间中的每个候选动作给出“能否解释这次转移”的分数,而不是只生成一个胜出的动作。
形式上,评分向量是 \(v_t=F_\theta(\hat{s}_t,\hat{s}_{t+1};\mathcal{A})\),其中每个分量对应一个候选动作。这个接口由同一策略模型实现,但条件输入与通常的长历史决策输入不同。模型在常规推理轨迹里生成的 <Retro> 解释,与奖励使用的完整动作评分向量,在概念上必须区分;采样解释本身不能充当 margin-SCR 的数值定义。
实现说明存在需要保留的边界:正文第 4.2 节说分数来自候选动作 token 的 logits,而附录 A.2 和实际提示则要求模型给每个动作输出 \([-5,5]\) 内的整数分数。附录明确指定 \(S_{\max}=5\)、\(S_{\min}=-5\),因此归一化常数并非未知;但全文没有清楚交代原始 token logits 如何映射成这一受限整数评分,也没有给出多 token 动作名的聚合规则。不能据此补写“对整条动作序列求 log-probability”或“连续坐标逐 token 枚举”等实现。
隔离完整历史切断了直接抄上一答案的路径,却不等于信息泄漏被数学上完全排除。信念状态本来由观测与上下文生成,若其文字描述夹带“刚才向右移动”之类信息,评分器仍可能间接得到动作线索。作者的消融支持无历史接口有效,但没有单独审计信念内容泄漏;本文笔记因此不沿用原文“完全切断记忆利用”的绝对表述。
3. 自一致性奖励:奖励执行动作胜过最强替代解释,而非只奖励猜中
有限离散动作空间中,SCR 比较执行动作的分数与所有其他动作中最高的分数。这比“采样的回溯动作是否与执行动作相同”更细:即使二者都没猜中,弱支持和强烈反对也可以得到不同奖励;同时它明确引入最难区分的替代解释。
执行动作严格高于其他候选时,SCR 为正;被其他动作压过时为负;与最高替代动作并列时为零。在附录规定的受限整数评分下,分母为 \(10\),SCR 位于 \([-1,1]\)。这个有界性依赖分数确实满足所声明的上下界,不能直接推广到未经处理的原始 logits。外在奖励仍评价任务成功、格式遵循和步数代价,SCR 只是正则项;一个容易解释但无法完成任务的动作,不应压过真正推进目标的动作。
另一个对照是对评分做 softmax,再使用执行动作的 log-probability 减去均匀策略的 log-probability。它与 margin 方法共享判别评分,但转换方式不同:低概率执行动作可能受到远大于正确动作收益的负惩罚。直接 token 匹配则不需要评分,只给二值信号。附录声称 log-likelihood 的抽象范围可向负无穷延伸;若严格采用有限动作集合与 \([-5,5]\) 评分,其实际负界有限,不能把抽象论证误写成该具体实现必然无界。
混合动作空间并不是把离散 margin 公式原封不动搬到坐标上。ManiSkill 动作包含 pick、place、push 等类型和连续空间参数,附录 C.2 改为回溯类型与坐标:类型必须相同,再根据回溯坐标与执行坐标的欧氏距离给空间一致性分数。
这里 \(D_{\max}\) 是最大距离,作者没有给出具体取值、坐标规范化细节或 push 的两组坐标如何组成参数向量。因此只能说明这是类型门控加距离惩罚,不能宣称连续动作经过有限候选 token 的完整 margin 排序,也不能擅自补上裁剪规则。它是 SCR 的任务适配版本,不是离散评分接口的已证明等价实现。
4. 跨轮信用分配:下一轮得到证据,奖励必须归回上一轮动作
第 \(t\) 轮动作的后果,要到第 \(t+1\) 轮观测出现后才能评分。因此此时计算的 SCR 属于 \(a_t\),而不是属于当前准备执行的 \(a_{t+1}\)。若奖励错贴到后一动作,智能体将因为前一转移被支持或被否定而更新无关动作,闭环监督就失去时间意义。RWM 明确将信号回填到产生该转移的轮次。
轮级奖励还不能直接拿来更新每个生成 token。RWM-Full 沿用 VAGEN 的双层 GAE:外层根据轮级奖励和 critic 先估计各轮优势,再把这份语义反馈注入该轮最后一个生成 token,内层沿该轮的 token 序列向前回传。这样,同一轮中形成观察描述、回溯、规划和动作的生成内容能收到与该轮结果对应的训练信号,不必只依赖整条轨迹末端的稀疏成功奖励。
这是一种奖励和优势的时间对齐机制,不是证明每个推理句子真实贡献多少的因果分解。尤其回溯与前瞻共用模型,信念、解释和动作可能共同适应奖励,获得高 SCR 并不自动说明它们与外部物理规律完全一致。训练的收益应由任务成功与动作有效性共同判断,而不能只看内部奖励变大。
一个完整示例¶
附录 E 的 Sokoban 案例中,最初箱子在玩家右上方,目标在箱子上方。模型规划先向右,让玩家来到箱子正下方,执行 Right。下一轮新观测确实描述“箱子在玩家正上方”,因此回溯使用原信念和这次新信念,而不是把上一轮预测直接当输入。
案例给出动作顺序 [Up, Down, Left, Right] 的评分 [-1,0,0,5]。Right 的分数是 \(5\),最强替代动作分数是 \(0\);按式 (5),这一转移的原始 SCR 为 \((5-0)/10=0.5\)。Sokoban 配置的 \(\alpha=0.1\),因而加到前一轮奖励中的 SCR 项为 \(0.05\),不是整轮总奖励。
此时当前规划改为 Up 推动箱子。再下一轮的回溯评分是 [5,0,-5,-5],同样支持刚刚执行的 Up;随后再执行 Up 将箱子推上目标。案例说明回溯奖励比动作输出晚一轮产生,也说明正文展示的分数向量并非一次 sampled Retro 动作。以上 SCR 算术是按原公式对原案例计算,并非新增实验测量。
损失函数 / 训练策略¶
RWM-Base 采用带回溯字段的推理结构,但只有稀疏任务与格式奖励,使用常规 token-level GAE;它并不包含密集 SCR。RWM-Full 同时采用双层 GAE、外部 LLM-as-a-Judge 对视觉状态估计及预测的评审,以及内在 SCR。外部评审使用 GPT-4.1 nano,这部分不能称为无外部监督;“内在”只准确描述 SCR 的来源。
策略通过 PPO clipping 更新,critic 是 VLM 最后隐状态上的标量价值头。二值 mask 排除环境提示,只对模型生成的推理与动作 token 计算策略梯度。附录还说明内层 token TD-error 通常包含相对参考模型的 KL 惩罚,但没有完整列出所有优化超参数。
骨干为 Qwen2.5-VL-3B,全局 batch size 为 \(128\),actor/critic 学习率分别为 \(10^{-6}\) 和 \(10^{-5}\),使用 \(4\) 张 H800 80GB。评测 temperature 和 top-p 都为 \(1.0\),最多生成 \(1024\) 个新 token,最大交互轮数为 \(4\)。这些短轮预算下的实验不能直接代表数百步长期交互性能。
实验关键数据¶
主实验¶
下表节选原表 1 的成功率,保留各任务组平均值与原表 Overall。训练方法均使用 Qwen2.5-VL-3B;Sokoban 平均覆盖 Standard/Hard,Navigation 平均覆盖 Base/Common Sense,ManiSkill 平均覆盖 Place/Stack/Drawer/Align。
| 配置 | Sokoban 平均 | Navigation 平均 | ManiSkill 平均 | FrozenLake | Overall(原表) |
|---|---|---|---|---|---|
| Qwen2.5-VL-3B | 0.06 | 0.25 | 0.00 | 0.09 | 0.08 |
| Vanilla-PPO | 0.16 | 0.29 | 0.00 | 0.21 | 0.12 |
| ReAct-RL | 0.24 | 0.38 | 0.00 | 0.30 | 0.17 |
| VAGEN-Base | 0.37 | 0.49 | 0.72 | 0.43 | 0.56 |
| RWM-Base | 0.52 | 0.66 | 0.94 | 0.75 | 0.76 |
| VAGEN-Full | 0.48 | 0.55 | 0.94 | 0.54 | 0.71 |
| RWM-Full | 0.66 | 0.68 | 0.97 | 0.77 | 0.81 |
原表 Overall 不是这里展示的四个任务组均值的简单平均,正文没有明确交代其聚合权重;例如 RWM-Full 四列简单平均为 \(0.77\),原表却为 \(0.81\)。本笔记保留发表数值,不自行修正,也不把 \(0.81\) 重新解释成四组等权平均。
同配置比较中,RWM-Base 对 VAGEN-Base 的原表 Overall 提升为 \(20\) 个百分点,RWM-Full 对 VAGEN-Full 为 \(10\) 个百分点。Sokoban-Hard 的 Base 对照为 \(0.46\) 对 \(0.33\),Full 对照为 \(0.63\) 对 \(0.46\)。Base 结果支持回溯结构本身有用,但由于 Base 没有密集 SCR,这 \(20\) 个百分点不是 SCR 的独立收益。
消融实验¶
下表来自原表 2,考察历史泄漏控制策略;原表未在标题中明确注明 Base/Full,因此保留其配置名称,不额外指定训练档位。
| 配置 | Sokoban | FrozenLake | 说明 |
|---|---|---|---|
| Qwen2.5-VL-3B | 0.06 | 0.09 | 未训练骨干 |
| VAGEN | 0.41 | 0.43 | 前瞻对照 |
| RWM,无遮挡历史 | 0.39 | 0.40 | 可从历史直接读出动作 |
| RWM,动作 dropout,0.10 | 0.44 | 0.52 | 少量遮蔽动作相关 token |
| RWM,动作 dropout,0.20 | 0.50 | 0.59 | 中等遮蔽 |
| RWM,动作 dropout,0.50 | 0.33 | 0.38 | 强遮蔽破坏上下文连贯性 |
| RWM,无历史评分 | 0.58 | 0.75 | 只以转移为评分条件 |
关键发现¶
- 无历史评分相对无遮挡历史提升 \(19\) 个和 \(35\) 个百分点,说明让模型“知道答案”不等于让它学会逆推;仅靠提示忽略上一动作不如输入隔离可靠。
- Sokoban 权重分析给出:\(\alpha=0.50\) 时成功率从 \(0.58\) 降至 \(0.29\),内部奖励却更早饱和。SCR 过强会让容易解释的行为压过任务目标。
- 正文报告 Sokoban 动作有效性超过 \(0.95\),VAGEN 曲线最高约 \(0.8\);这支持减少无意义移动,但它是任务指标证据,不是物理因果真实性的独立验证。
- 三次评测、\(128\) 个测试案例的平均值没有配套置信区间或显著性检验;曲线中的近似值不应当作精确终点数据。闭源模型为 zero-shot,对比的是任务专门训练与通用零样本使用,而非相同训练预算。
亮点与洞察¶
- 将“动作能否被结果解释”转成训练反馈,比仅检查动作字符串是否合法更贴近交互质量。最强替代动作的 margin 还让奖励表达解释之间的竞争,而非一次采样是否碰巧猜对。
- 将奖励归回真正产生转移的轮次,是这个方法可复用的工程要点。任何依赖后续观测的智能体奖励都需要先解决时间归属,再讨论 token 级训练。
- 消融揭示信息接口本身就是奖励设计的一部分。评分器若直接接触答案,复杂 reward 公式也无法阻止捷径。
局限与展望¶
- 作者指出随机环境和多动作轮次会产生逆映射歧义:Up→Left 与 Left→Up 可能得到相同终态。只支持一个解释会错误惩罚另一条有效路径,集合式回溯是更合适的方向。
- 作者承认长轮次 RL 的显存和 OOM 瓶颈;当前最大 \(4\) 轮、Sokoban 单箱子、FrozenLake 关闭滑动的设置,对真正长时程和随机动力学的证据有限。
- 信念状态既是观测压缩,也是潜在的幻觉与动作泄漏载体。同一策略生成信念并评分,仍有协同迎合奖励的风险,需要独立观测核验或信念内容审计。
- logits 与整数评分的对应、多 token 动作评分、ManiSkill 坐标处理未被充分说明。复现时需先明确这些接口,不能只凭公式宣称全动作空间已有统一实现。
相关工作与启发¶
- vs VAGEN:VAGEN 强调观察和未来预测,RWM 增加已经发生转移的逆动作解释;Full 配置继承其双层 GAE 与外部评审,因此新增贡献不是整套训练基础设施。
- vs ReAct:ReAct 提供自由形式推理与动作交替,RWM 为过去转移和未来模拟设置明确角色,并把过去的一致性转成训练信号。
- vs 逆动力学好奇心方法:经典方法用逆模型学动作相关表征,再用前向预测误差鼓励探索;RWM 使用逆归因的一致性约束策略,主要是行为正则,而非奖励未知性。
评分¶
- 新颖性: 4/5 — 将逆动作归因嵌入多轮 VLM 推理并用于奖励,组合有辨识度,但继承已有逆动力学与世界建模思想。
- 实验充分度: 3/5 — 四类任务与泄漏消融有价值,但短轮预算、汇总口径和复现接口仍有限制。
- 写作质量: 3/5 — 跨轮机制清楚,评分实现与部分绝对因果表述不够严谨。
- 价值: 4/5 — 适合借鉴延迟观测奖励与输入隔离设计,不能把内部一致性当作真实因果保证。