WALL-EVE: World Alignment with Rule Learning in Visual Environments¶
会议: ECCV 2026
论文: ECCV 原文
领域: 具身智能 / 强化学习
关键词: 世界模型, 规则学习, 模型预测控制 (MPC), 具身智能, 神经符号系统
一句话总结¶
针对视觉具身环境中生成式世界模型训练繁重且频现物理规则幻觉的缺陷,WALL-EVE 提出一种免训练的神经符号世界模型对齐范式,通过多模态解析与冲突驱动的 Python 规则归纳剪枝校准 LLM 状态转移预测,在模型预测控制下以仅 17% 的 token 消耗在 ALFWorld 和 Minecraft 任务中取得显著超越前序 SOTA 的成功率。
研究背景与动机¶
在复杂视觉具身环境中构建高精度、高效率的世界模型,是推动自主智能体具备前瞻规划与长程决策能力的核心基石。智能体需要依据历史交互轨迹与备选动作,准确预测未来环境状态的演变,从而避免盲目试错。然而,当前主流的视觉世界模型多依赖于端到端的视频生成架构(如 Sora、Genie、GAIA-1 等)。这类生成模型通常需要海量像素级计算与昂贵的数据集微调,不仅训练与推理开销极大,更致命的是生成模型往往聚焦于底层像素纹理与外观逼真度,缺乏对环境物理规律、物体交互因果与离散状态转移的语义级约束,频繁出现物体凭空消失、工具状态漂移或违反基本物理常识的严重“幻觉”。
这种失效的核心矛盾在于:具身决策真正依赖的是离散、确定且符合因果律的状态转移拓扑,而非全像素渲染的视觉细节;但完全依赖大语言模型(LLM)的通用常识直接预测具身动态时,又常因缺乏对特定模拟环境底层规则(如物品容积、合成配方、手持约束)的精确感知而产生局部未对齐偏差。已有方法尝试通过大规模强化学习微调或手工设计复杂 Prompt 尝试对齐,前者面临样本效率极低与灾难性遗忘的风险,后者则高度依赖人工先验且难以泛化到开放世界。
本文的切入角度是:大语言模型自身已经内嵌了丰富的通用世界常识,环境特有的未对齐动力学仅是少量局部确定性规则的缺失。因此无需重新训练重量级生成模型,只需借助多模态解析将视觉观测符号化为结构化文本,再通过智能体与环境交互中暴露的预测冲突反向归纳出显式规则。核心 idea:构建免微调的神经符号对齐世界模型,利用 LLM 从真实与预测轨迹的冲突中自动归纳、演化并剪枝可执行的代码级规则集合,仅在基线 LLM 出现预测分歧时进行残差纠偏,驱动无需策略网络训练的模型预测控制(MPC)实现低开销的前瞻规划。
方法详解¶
整体框架¶
WALL-EVE 的运作流程由感知符号化、神经符号世界模型前瞻预测、模型预测控制(MPC)行动决策以及冲突驱动的闭环规则学习四大部分构成。系统首先通过多模态解析器将第一人称视觉图像和任务文本规整为标准的 JSON 格式状态字典;在智能体决策阶段,LLM 充当前瞻优化器提出候选动作序列,由“LLM + 规则代码库”构成的世界模型进行前瞻状态展开并评估折现累积奖励,选出最优首步动作执行;当动作落地产生真实环境转移后,系统将预测转移与真实转移进行对比,一旦捕获预测失败或冲突,即触发多阶段的规则归纳、全轨迹提炼、代码化翻译与最大覆盖剪枝流水线,将提炼出的精准规则动态合并入规则库中,实现环境动力学的终身对齐。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Env["环境输入 (第一人称视觉 + 任务文本)"] --> Parser["多模态解析器<br/>检测器 + VQA + 文本结构化为 JSON 状态"]
Parser --> Agent["LLM 动作提议优化器<br/>基于先验提出 H 步候选动作序列"]
Agent --> WM["神经符号世界模型<br/>LLM 转移初筛 + 代码规则判定冲突修正"]
WM --> MPC["模型预测控制 (MPC) 决策<br/>计算累积奖励并选定最优候选动作"]
MPC --> Act["环境执行与轨迹收集<br/>记录真实转移 (s, a, s') 与预测转移"]
Act --> RL["闭环规则学习与更新<br/>冲突归纳 -> 轨迹提炼 -> 规则转代码 -> 最大覆盖剪枝"]
RL -->|更新最小规则集 R_Code| WM
关键设计¶
1. 多模态解析器:消除视觉噪点并构建语义统一状态
由于原始像素级观测充斥着遮挡、视角变换与随机干扰,难以直接作为离散逻辑推理的输入,WALL-EVE 设计了多模态解析模块 \(f_{\text{parser}}\)。对于文本信息 \(s_h^t\)(如任务目标),模块将其清洗规整为标准字段;对于第一人称视觉输入 \(s_h^v\),则协同目标检测器(在 ALFWorld 中使用微调的 Mask R-CNN,在开放式场景中使用通用视觉模型)提取交互物体的边界框与类别标签,并结合视觉问答(VQA)模块查询环境容器的开关状态与属性。多模态解析器将两者融合输出统一的 JSON 结构化状态:
$\(s_h = f_{\text{parser}}(s_h^t, s_h^v)\)$
该字典清晰记载任务描述、智能体现有手持状态、各个容器/位置所容纳的物品列表等。这种符号化处理从根源上规避了端到端像素生成的巨大开销,把连续的视听感知问题转化为语义明确、可供符号规则判定的离散状态表征。
2. 思维链解耦的转移预测:先成败后状态的两阶段建模
在开阔环境中直接根据当前状态 \(s_h\) 和动作 \(a_h\) 预测完整的下一个详细状态 \(\hat{s}_{h+1}\) 极其脆弱,容易被天气变化、无关生物等环境非确定性扰乱。为此,WALL-EVE 将环境动力学预测解耦为两步链式思维(CoT)推理:第一阶段仅预测动作在当前状态下能否执行成功,输出二值结果 \(\hat{suc}_h \in \{0, 1\}\);第二阶段若成功,则基于确定性的环境语义推导物品增减与状态迁移,若失败则状态保持不变:
$\(\hat{suc}_h = f_{\text{wm}}(s_h, a_h), \quad \hat{s}_{h+1} = f_{\text{wm}}(s_h, a_h, \hat{suc}_h)\)$
将复杂的全状态演化简化为以“成功/失败”为枢纽的判定问题,不仅大幅降低了 LLM 的认知负载,也为后续规则系统建立统一的符号化校验接口提供了标准锚点。
3. 闭环代码规则学习与最大覆盖剪枝:残差对齐与极简规则集构建
通用预训练 LLM 已经掌握绝大部分物理常识,仅在特定环境的边界条件上产生局部偏差。WALL-EVE 并不全面推翻重写世界模型,而是仅针对预测错误的转移集合 \(\mathcal{D}_{\text{inc}}\) 进行残差学习。当真实轨迹 \(\vartheta^{\text{real}}\) 与预测出现分歧时,系统启动包含五步的规则学习流程:
- 冲突归纳:Prompt 驱动的归纳 LLM \(f_{\text{gen}}\) 对比错误样本,提出能够解释失败原因的新自然语言规则 \(R_{\text{NL}}^{\text{new}}\);
- 全轨迹精炼:精炼模块 \(f_{\text{refine}}\) 结合所有历史交互记录校验规则一致性,修改可能与历史成功轨迹冲突的过拟合规则;
- 代码规则生成:代码生成模块 \(f_{\text{Code}}\) 将自然语言规则翻译为标准化 Python 函数,每个函数接收 (state, action) 并返回 (feedback, success, suggestion);
- 最大覆盖剪枝:如果无节制地累积规则,规则库会变得臃肿甚至互相抵触。WALL-EVE 将规则筛选建模为经典的最大覆盖问题(Maximum Coverage Problem),在候选规则集 \(\mathcal{R}_{\text{Code}}\) 中贪心求解能够以最小规则数 \(k\) 最大化覆盖预测错误转移 \(\mathcal{D}_{\text{inc}}\) 的最优子集 \(\mathcal{R}^*\):
$\(\mathcal{R}^* = \arg\max_{\mathcal{R} \subseteq \mathcal{R}_{\text{Code}}, |\mathcal{R}| \le k} \left| \bigcup_{r_{\text{Code}} \in \mathcal{R}} \mathcal{D}_r \right|\)$
未触发任何错误样本修正或引起代码执行异常的冗余规则被直接剔除,确保规则库极致精简且具备强鲁棒性。
4. 规则后验校验的免训练模型预测控制(MPC)
在推理与决策时,代码规则库充当快速前向模拟时的断言校验器(Post-prediction Guardrail)。当且仅当某条规则被触发且输出的成功标记 \(suc_h^{\text{Code}}\) 与 LLM 预测 \(\hat{suc}_h\) 出现矛盾时,系统强制以显式代码规则推翻 LLM 的错误预测:
$\(\hat{s}_{h+1} = \begin{cases} f_{\text{wm}}(s_h, a_h, suc_h^{\text{Code}}), & \text{若 } suc_h^{\text{Code}} \neq \hat{suc}_h \\ f_{\text{wm}}(s_h, a_h, \hat{suc}_h), & \text{其他} \end{cases}\)$
在 MPC 框架中,智能体以 LLM 作为优化器从当前状态提出多组跨越时域 \(H\) 的前瞻动作序列,经由规则对齐的世界模型展开预测,累积评估折现未来奖励并选出期望收益最高的序列首步执行。这种方式既利用了 LLM 的高质量动作提议大幅压缩了传统 MPC 随机采样的搜索空间,又通过确定性规则避免了幻觉导致的错误路径规划。
一个完整示例¶
以 ALFWorld 中“将两个杯子放在同一张桌子上”的任务为例:
1. 未对齐初态失误:初始状态下智能体拿起 cup 1,由于基础 LLM 世界模型缺失“双手只能持有一件物品”的环境隐式限制,在规划下一步动作 take cup 2 from countertop 2 时,LLM 世界模型误预测该动作为 Success,导致智能体直接在真实环境中执行拾取并遭遇底层报错。
2. 规则诱导与代码化:系统检测到真实结果(Failure)与预测结果(Success)冲突,将该步转移输入归纳模块。LLM 提炼出自然语言规则:“若当前手持已有物品,则再次拾取物品必然失败”,并进一步编译为 Python 判定函数 Rule_2_take(state, action):
def rule_2_take(state, action):
if action["name"] == "take" and state.get("in_hand") is not None:
return "hand is already holding an item", False, "put current item down first"
return "success", True, None
rule_2_take 迅速拦截并纠偏该转移为 Failure,赋予极低奖励;智能体优化器随即自适应调整前瞻序列,改为先执行 go to desk 1 \(\to\) put cup 1 on desk 1,清空手持后顺利拾取 cup 2,实现零试错直接通关。
实验关键数据¶
主实验¶
论文在 ALFWorld(家庭具身交互环境,测试集 134 个任务)以及 Minecraft(开放世界工艺与生存环境,MineDojo TechTree 涵盖木制到红石 6 个递进难度层级)上进行了全面评测。在 ALFWorld 中,视觉模式要求智能体从原始第一人称画面通过解析模块感知,文本模式则包含真值状态输入。
表 1:ALFWorld 任务成功率 (%) 与基线对比(原论文 Table 1 核心数据)
| 方法类型 | 方法 | 视觉模式均值 | 抓取 (Pick) | 清洁 (Clean) | 加热 (Heat) | 冷却 (Cool) | 寻找 (Look) | 双物体 (Pick2) | 文本模式均值 |
|---|---|---|---|---|---|---|---|---|---|
| 训练模型 | MiniGPT-4 | 16 | 4 | 0 | 19 | 17 | 67 | 6 | - |
| 训练模型 | InstructBLIP | 22 | 50 | 26 | 23 | 6 | 17 | 0 | - |
| 任务微调 | EMMA (专用训练) | 82 | 71 | 94 | 85 | 83 | 88 | 67 | - |
| 免微调 | ReAct | 50 | 66 | 31 | 61 | 70 | 32 | 39 | 54 |
| 免微调 | AdaPlanner | 62 | 83 | 75 | 54 | 63 | 46 | 35 | 91 |
| 免微调 | Reflexion | 68 | 79 | 71 | 51 | 72 | 61 | 74 | 86 |
| 免微调 | RAFA (前序SOTA) | 72 | 86 | 72 | 65 | 71 | 58 | 77 | 95 |
| 免微调 | WALL-EVE (本文) | 75 | 88 | 77 | 61 | 68 | 61 | 94 | 95 |
注:EMMA 针对 ALFWorld 专门微调,而其余均为免训练通用模型。在双物体复杂交互(Pick2)中,WALL-EVE 凭借手持逻辑规则的精准对齐达到了 94% 的高成功率。
表 2:Minecraft 各层级任务成功率与重规划轮次对比(原论文 Table 3 核心数据)
| 方法 | 平均成功率 (%) \(\uparrow\) | 平均重规划轮次 \(\downarrow\) | 木级 (Wood) | 石级 (Stone) | 铁级 (Iron) | 金级 (Gold) | 钻石 (Diamond) | 红石 (Redstone) |
|---|---|---|---|---|---|---|---|---|
| GPT-4o (原始基线) | 9 | 46.70 | 36 (35.50) | 19 (44.72) | 0 (-) | 0 (-) | 0 (-) | 0 (-) |
| DEPS | 37 | 35.36 | 83 (10.67) | 41 (33.26) | 33 (35.27) | 22 (45.29) | 24 (42.46) | 17 (45.22) |
| Plan4MC | 48 | 28.71 | 91 (5.77) | 75 (13.01) | 43 (34.03) | 32 (36.59) | 26 (39.38) | 21 (43.47) |
| Jarvis-1 / Voyager / GITM | 54 | 25.49 | 96 (3.42) | 92 (6.01) | 57 (23.93) | 29 (37.17) | 30 (39.80) | 22 (42.63) |
| Optimus-1 | 61 | 22.45 | 95 (3.29) | 94 (4.68) | 64 (21.69) | 41 (30.49) | 31 (39.88) | 38 (34.67) |
| WALL-EVE (完整方案) | 69 | 15.77 | 98 (1.64) | 91 (4.58) | 63 (19.38) | 69 (15.61) | 46 (27.08) | 48 (26.33) |
括号内数值表示重规划轮次(越低代表规划容错与一次性成功率越高)。在长链条高难度的 Gold、Diamond、Redstone 任务中,WALL-EVE 的领先优势尤为突出。
表 3:推演开销与 Token 资源消耗(原论文 Table 2 及 Table 4 核心数据)
| 评测基准 | 指标 | ReAct | AdaPlanner | Reflexion | RAFA / Optimus-1 | WALL-EVE (本文) |
|---|---|---|---|---|---|---|
| ALFWorld | 单任务平均 Token 消耗 \(\downarrow\) | 53,210.94 | 74,560.55 | 68,727.18 | 392,268.28 (RAFA) | 68,288.96 |
| 单任务 API 开销 (USD) \(\downarrow\) | 0.37 | 0.52 | 0.48 | 2.73 (RAFA) | 0.47 | |
| Minecraft | 单任务平均 Token 消耗 \(\downarrow\) | - | - | - | 70,566.67 (Optimus-1) | 60,348.71 |
| 单任务 API 开销 (USD) \(\downarrow\) | - | - | - | 0.48 (Optimus-1) | 0.41 |
消融实验¶
表 4:智能体与世界模型规则配置消融分析(原论文 Table 5,Minecraft 评测)
| 智能体 (Agent) 配置 | 世界模型 (World Model) 配置 | 任务成功率 (%) \(\uparrow\) | 重规划轮次 \(\downarrow\) | 架构影响机制解读 |
|---|---|---|---|---|
| LLM | 无 (Model-free) | 37 | 35.36 | 缺乏前瞻模拟能力,纯反应式行为易陷入死胡同 |
| LLM | LLM (未对齐基线世界模型) | 38 | 33.53 | 未经规则校准的世界模型误差大,MPC 前瞻增益微弱 (+1%) |
| LLM + 规则 | 无 (Model-free) | 61 | 23.13 | 规则硬编码于智能体 Prompt,具备强约束但缺乏多步前瞻 |
| LLM (自由采样) | LLM + 规则 (WALL-EVE) | 69 | 15.77 | 最佳解耦:智能体维持高熵采样探索,世界模型提供严格物理约束校验 |
| LLM + 规则 | LLM + 规则 | 67 | 16.59 | 智能体因规则限制陷入“熵塌缩 (Entropy Collapse)”,备选动作过于保守掉点 |
表 5:规则剪枝策略与数量上限消融(原论文 Table 7,Minecraft 评测)
| 规则剪枝配置 | 成功率 (%) \(\uparrow\) | 重规划轮次 \(\downarrow\) | 分析结论 |
|---|---|---|---|
| 无剪枝 (全量规则保留) | 12 | 46.79 | 冲突规则与噪声规则泛滥,过度约束导致决策逻辑严重瘫痪 |
| 最大覆盖剪枝 (上限 \(k=2\)) | 52 | 24.11 | 修正高频关键瓶颈,相比无剪枝显著恢复性能 |
| 最大覆盖剪枝 (上限 \(k=4\)) | 64 | 18.71 | 覆盖绝大部分残差错误,重规划轮次减半 |
| 最大覆盖剪枝 (无硬性上限,贪心收敛) | 69 | 15.77 | 仅保留高信息量且非冗余的有效规则,性能达全局最优 |
表 6:世界模型预测保真度评估(500 个独立测试转移,原论文 Table 8 核心数据)
| 评估指标 | 评测环境 | 纯 LLM 世界模型 | LLM + 规则对齐 (WALL-EVE) | 绝对提升幅度 |
|---|---|---|---|---|
| 成功/失败二值判定准确率 (%) \(\uparrow\) | ALFWorld | 73 | 94 | +21% |
| Minecraft | 65 | 85 | +20% | |
| 下一状态关键属性准确率 (%) \(\uparrow\) | ALFWorld | 70 | 93 | +23% |
| Minecraft | 59 | 77 | +18% | |
| 5 步递推状态展开属性准确率 (%) \(\uparrow\) | Minecraft | 31 | 68 | +37% |
关键发现¶
- 世界模型对齐才是 MPC 的性能胜负手:对比表 4 可见,在未引入规则时,给 LLM 智能体配置一个基础 LLM 世界模型几乎没有收益(成功率仅从 37% 提升到 38%),因为未对齐世界模型给出的错误模拟会诱导智能体选择灾难性路径;而一旦世界模型经过残差规则校准,成功率激增至 69%,证实了世界模型准确性是模型驱动智能体的核心瓶颈。
- 智能体与世界模型的“探索-验证”解耦优势:当把规则同时赋予智能体和世界模型时,成功率反倒由 69% 降至 67%(表 4 第 5 行)。作者指出这是由于在动作提议阶段过早引入严苛规则会导致 LLM 探索策略的“熵塌缩(Entropy Collapse)”,缩小了候选动作解空间;而保持智能体高熵发散提议、由世界模型负责逻辑严谨把关的非对称架构最为稳健。
- 长程多步前瞻的复合误差被有效遏制:在 Minecraft 连续 5 步的深层模拟展开中(表 6),未对齐的 LLM 因误差级联其属性预测准确率仅剩 31%,而规则对齐后的世界模型保持了 68% 的高准确率(相对翻倍),赋予了 MPC 在深层搜索树中找到长程全局最优解的能力。
- 极端轻量高效的推理成本:相比同样采用树搜索/复杂规划的 SOTA 方法 RAFA,WALL-EVE 仅耗费其 17% 的 token 和 17% 的 API 开销,原因在于轻量 Python 代码规则的执行耗时通常仅为毫秒级且零 token 成本,极大替代了原先需要依赖多轮大模型反思校准的沉重推演负担。
亮点与洞察¶
- 神经符号双轨协同的“残差对齐”思想:不同于从零学习世界模型或昂贵的端到端全量微调,WALL-EVE 认识到通用大模型已蕴含宏观物理常识,创新性地把动力学对齐降维为“残差局部规则学习”,用几条极简的 Python 代码规则便弥合了复杂模拟器与通用认知之间的语义鸿沟。
- 最大覆盖算法对对抗性规则噪声的抵御:将归纳后的规则精简形式化为经典组合优化中的最大覆盖问题,既剔除了仅覆盖正确转移的废弃规则与执行报错的不稳定代码,又用贪心策略实现了以最少规则覆盖最多未对齐样本,彻底解决了经验累积智能体规则库无休止膨胀导致过拟合的问题。
- 以符号规则校验替代高开销多轮 LLM 反思:在传统反射式智能体中,动作纠错依赖调用庞大参数的大语言模型逐轮自我反思(如 Reflexion、RAFA),导致 token 消耗指数爆炸;WALL-EVE 把环境反馈转化为本地确定性的代码断言守卫,在推理期间零 API 成本毫秒级判定可行性,极具工业部署性价比。
局限与展望¶
- 作者承认的局限:当前的规则归纳主要集中于离散状态和布尔型前置条件(如“是否手持空置”、“光照等级是否足够”),对于连续时空动力学(如刚体物理碰撞速度、流体扩散、连续力矩控制等)难以通过离散 Python 代码规则进行精确参数化覆盖。
- 实验与机制层面的局限:系统对感知前端的符号化解析器(Mask R-CNN / VQA)存在强依赖。虽然规则机制在宏观逻辑上对偶发的瞬时视觉噪声具备一定平滑能力(Table 6),但若目标检测器发生系统性结构性漏检(如连续数帧将特定容器识别错误),结构化 JSON 状态自始源便发生失真,将导致代码规则判定失灵乃至产生错误的规则归纳。
- 可改进方向:探索可微的连续神经符号规则机制,支持连续数值阈值的自适应梯度微调;同时将规则归纳引擎与少样本交互式 VLM 主动感知查询机制结合,使智能体在发现状态模糊时主动通过视觉提问澄清未知属性,降低感知前端的级联误差。
相关工作与启发¶
- 对比端到端生成式世界模型 (Genie, GAIA-1, Sora-based):生成式方法专注于下一帧的高清像素级合成,计算开销极其恐怖且在长期展开时不可避免地产生物体变形与物理悖论;WALL-EVE 绕开像素重建,通过视觉解析直接在离散语义状态空间做符号规则对齐,兼具高样本效率、确定性因果保真度与秒级前瞻推演速度。
- 对比基于代码构建世界模型的代理 (WorldCoder):WorldCoder 尝试用 LLM 从零编写完整的 Python 环境模拟器,在复杂动态环境下代码编写空间过于庞大且极易产生运行时 Bug;WALL-EVE 保留通用 LLM 承担 90% 的常识转移演化,仅针对 LLM 无法处理的边角冲突编写“断言式残差规则”,架构更为轻量且容错率极高。
- 对比反射式与记忆库智能体 (Reflexion, Voyager, Jarvis-1):前序方法主要将失败教训记录为文本形式的自然语言经验库或代码技能库(Skill Library),在决策时作为上下文提示输入给 Agent;WALL-EVE 证明将这些规则直接挂载到“世界模型验证端”比挂载到“智能体决策端”能带来更大的增益(提升幅度高出近 10%),并且利用 MPC 优化彻底替代了策略微调。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐(巧妙结合神经符号规则学习与无模型微调的 MPC 规划,将世界模型对齐规约为残差代码归纳与最大覆盖问题,思路极为清晰新颖)
- 实验充分度: ⭐⭐⭐⭐⭐(在 ALFWorld 和 Minecraft 两大代表性具身场景进行了多层级任务、长程递推属性准确度、视觉噪声鲁棒性及规则熵塌缩机理的详尽定量消融)
- 写作质量: ⭐⭐⭐⭐⭐(叙述逻辑严密,图表信息充实,理论建模形式化规范清晰)
- 价值: ⭐⭐⭐⭐⭐(为大模型在复杂视觉与具身场景中摆脱昂贵像素生成世界模型提供了切实可行、极具工程落地与算力节省价值的全新范式)