跳转至

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/DyMessi/JIT-Memory
领域: 机器人/具身智能
关键词: 具身规划, 交互安全, 智能体记忆, 测试时演化, 视觉语言模型

一句话总结

针对具身智能体在良性指令下因环境动态交互而频发物理风险的难题,提出了自演化即时记忆框架(JIT-Memory),通过拓扑信念图、意图触发事实规则、程序化元技能与免标注测试时验证回路,在不阻塞任务进度的前提下实现了主动式风险规避。

研究背景与动机

随着多模态大语言模型(VLM)与具身规划的结合,智能体在家庭服务等非确定性环境中的指令分解与闭环交互能力显著提升。然而,现有具身安全研究多局限于“恶意目标安全”(如指令直接要求将水泼向带电电器),所采取的防御手段大多为运行时安全护栏(Runtime Guardrails)或基于线性时序逻辑(LTL)的形式化拦截。这类机制本质上将安全等同于“拒绝执行”或“强制中止”,不仅严重中断任务执行,更无法应对家庭场景下由良性指令引发的动态风险。

在良性目标交互安全(Benign-goal Interactive Safety)中,任务本身完全合理(如“把苹果放进盘子”),但环境中的局部状态会随交互动态演变出物理危险(如盘子有灰尘、燃气灶未关、地面有水渍易滑)。此时智能体若机械中止任务则无法满足实用要求,而若贸然推进又会导致风险累积。这种困境的核心矛盾在于:交互安全并不是单纯的环境固有属性,而是由环境状态与智能体即将执行的行为意图共同构成的二元函数。现有基于即时视觉输入的感知存在局部遮挡下的“知觉遗忘”,而纯文本安全链(Safe-CoT)又容易引发过度谨慎,从而使得任务成功率急剧崩溃。

要突破“安全保障”与“任务推进”之间的两难权衡,智能体必须具备跨时步的持久危险状态追踪、基于前瞻意图的即时风险预警,以及可落地的程序化化解策略。核心 idea:将交互安全形式化为状态-行为二元函数,构建由拓扑信念图、事实规则与程序化元技能协同的即时记忆系统,并通过全自动的测试时“测试-验证-写入”闭环持续反思进化规避策略。

方法详解

整体框架

JIT-Memory 旨在为 POMDP 设定下的闭环具身规划嵌入轻量且高效的主动安全机制。在每个决策时步 \(t\),主规划器结合当前观测输出即时动作 \(a_t\) 与下一步前瞻意图 \(\tilde{a}_{t+1}\)。执行 \(a_t\) 后,系统并不盲目重新解析全景,而是以动作及前瞻意图的操作对象为局部焦点,利用辅助感知 VLM 增量修补风险完备拓扑信念图(RSG)。随后,事实记忆将前瞻意图作为探针,与 RSG 的局部子图进行确定性匹配;若检测到情境风险或持久时序风险,则激活经验记忆中对应的解耦元技能并注入规划提示词,指导智能体生成化解动作而绝不中止主任务。任务结束后,系统利用历史 RSG 快照自动验证轨迹因果性,反思提炼出案例补丁以更新经验元技能。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["环境局部观测 + 前瞻意图"] --> B["1. 风险完备拓扑信念图:增量补丁追踪"]
    B --> C["2. 意向对齐事实记忆:即时前瞻触发"]
    C -->|无风险时保持休眠| D["常规任务执行"]
    C -->|匹配风险条件| E["3. 程序化经验记忆:元技能推进引导"]
    E --> F["输出兼顾安全与进度的动作"]
    F --> G["4. 测试-验证-写入回路:免标注反思演化"]
    G -.->|更新经验池与元技能| E

关键设计

1. 风险完备拓扑信念图:以动作条件补丁克服部分可观测遗忘
在 POMDP 环境中,全景三维重建计算开销过大且易引入感知幻觉,而单帧图像规划又会随视角转动彻底丢失视野外的危险源(如转身后忘掉已开启的燃气灶或水龙头)。为此,工作记忆构建了风险完备拓扑信念图 \(G_t = (V_t, E_t, \sigma_t, \tau)\)。节点 \(V_t\) 与边 \(E_t\) 仅保留任务相关实体与拓扑关系,\(\sigma_t\) 维护一元动态属性(如 open、toggled_on、dusty),\(\tau\) 赋予通用的功能与安全标签(如统一将抹布、海绵抽象为 FUNCTION_CLEANING_TOOL,将纸张、布料归纳为 SAFETY_FLAMMABLE)。在状态更新时,系统提取焦点种子集合 \(S_{t+1} = \text{Args}(a_t) \cup \text{Args}(\tilde{a}_{t+1})\) 的 \(k\) 阶邻域子图 \(F_{t+1}\),驱动轻量辅助 VLM 仅对局部视野比对生成增量补丁 \(\Delta_{t+1}\) 并通过 \(G_{t+1} = \text{Merge}(G_t, \Delta_{t+1})\) 合并。这一设计极大降低了推理开销,同时确保视野外的未消除风险在图谱中长期保留。

2. 意向对齐事实记忆:利用前瞻意图实现确定性即时触发
传统记忆检索常依赖密集的语义向量相似度匹配,这在复杂家庭场景下极易被全局环境噪声误导,导致频繁误触发无关安全警告。事实记忆将人类安全先验编译为解耦的结构化规则元组 \(r = \langle \text{mode}, \phi_r, \psi_r, \mathcal{V}_r \rangle\),其中模式分为情境风险(Situational)与时序风险(Temporal)。情境风险规则建模负向可供性(Negative Affordance),即局部状态单独存在时无害,唯有与特定动作耦合才构成危险:

\[h^{\text{sit}}(G_{t+1}, \tilde{a}_{t+1}) = \mathbf{1}[\exists r \in \mathcal{R}_{\text{sit}}, \phi_r(G_{t+1}) \wedge \psi_r(\tilde{a}_{t+1})]\]

例如,盘子有灰尘本身并不构成即刻破坏,但当前瞻意图为 PLACE_ON_TOP(apple, plate) 时,规则条件严格匹配并触发介入。时序风险 \(h^{\text{tem}}(G_t) = \mathbf{1}[\exists u \in \mathcal{U}, u(G_t)]\) 则监控诸如龙头未关等持久义务。验证目标 \(\mathcal{V}_r\) 则被形式化为可计算的图查询条件(如 \(\neg\text{NEXTTO}(\text{SAFETY\_FLAMMABLE}, \text{FUNCTION\_HEAT\_SOURCE})\)),为后续自动审计提供确定性依据。

3. 程序化经验记忆:功能化解耦元技能与进度保留化解
单纯告知智能体存在何种风险并不足以生成可执行动作,而回传冗长的历史轨迹又往往因环境布局差异而难以泛化。经验记忆放弃具体的场景微观细节,将成功与失败经历提炼为六元结构的通用程序化元技能 \(m_r = \langle \textsc{Purpose}, \textsc{When}, \textsc{How}, \textsc{Grounding}, \textsc{Timing}, \textsc{Constraints} \rangle\)。其中,\(\textsc{How}\) 规范规避动作序列的标准范式(例如先擦拭表面再摆放食物);\(\textsc{Grounding}\) 指导智能体如何在当前 RSG 中寻找可替代工具(如抹布缺失时寻找替代清洁用具);\(\textsc{Timing}\) 尤为关键,它明确定义风险解除的时序窗口,严防智能体在烹饪未完成前提前关闭灶台导致任务中止。在提示词构建时,仅注入当前匹配规则对应的元技能 \(m_r\) 与一个验证成功的紧凑案例,严格约束上下文窗口。

4. 测试-验证-写入回路:基于因果案例对齐的闭环自演化机制
为了摆脱人工标注专家轨迹的依赖,系统在测试执行过程中启动自演化机制。任务运行结束后,系统利用历史 RSG 序列判定目标 \(\mathcal{V}_r\) 是否达成。若达成且任务成功,则定位触发步 \(t_r^{\text{on}}\) 到化解步 \(t_r^{\text{off}}\),切取出最小因果案例补丁 \(c_r = \{(a_t, G_t)\}_{t=t_r^{\text{on}}}^{t_r^{\text{off}}}\) 并存入正例池 \(\mathcal{B}_r^+\);若发生违规或死锁,则存入负例池 \(\mathcal{B}_r^-\)。当缓冲区达到阈值或遭遇连续失败时,驱动模型对比正反案例:

\[m_r \leftarrow \mathrm{Evolve}(m_r, r, \mathcal{B}_r^+, \mathcal{B}_r^-)\]

该更新专门纠正元技能中时序调度过早(Timing 偏差导致的主任务失败)或参数绑定错误(Grounding 失败),使安全技能在环境试错中持续打磨自愈。

一个完整示例

以厨房任务“将苹果洗净放入橱柜盘中”为例: 1. 状态跟踪与前瞻意图:智能体从冰箱取出苹果,预测下一步意图 \(\tilde{a}_{t+1} = \text{PLACE\_ON\_TOP(apple, plate)}\)。 2. 事实规则触发:RSG 中盘子节点带有 dusty 状态标签,事实规则库中 FOOD_ONLY_ON_CLEAN_PLACE 规则的 \(\phi_r(\text{dusty}(y)) \wedge \psi_r(\text{PLACE\_*}(\text{food}, y))\) 命中,情境风险标志位拉起。 3. 经验注入与化解:系统调用对应元技能 \(m_r\),提示智能体“清洁必须优先于摆放,在当前拓扑中定位水槽边的清洁布”;规划器据此优先插入 \(a_{t+1} = \text{WIPE(plate, rag)}\),待盘子状态更新为清洁后,无缝继续摆放苹果。 4. 时序闭环验证:洗苹果时水龙头被置为 toggled_on,时序规则锁定该持久义务。元技能指导智能体在完成清洗、放下苹果后再行关闭阀门。任务结束时,RSG 显示水龙头已关闭,全流程作为正向案例写入经验池。

实验关键数据

主实验

论文在基于 OmniGibson 搭建的具身交互安全基准 IS-Bench(包含 161 个日常家居任务及 388 个潜在交互风险)上展开综合评测。核心评估指标包括:任务成功率(Task Success, TS)、兼顾任务完成与无安全违规的安全成功率(Safe Success, SS),以及分别对应情境风险与时序风险化解率的 Pre 和 Post 风险规避率。

模型骨干 方法 任务成功率 (TS %) ↑ 安全成功率 (SS %) ↑ 情境规避率 (Pre %) ↑ 时序规避率 (Post %) ↑
Qwen3-VL-8B Vanilla 69.3 18.4 17.2 46.2
Qwen3-VL-8B Safe-CoT 57.6 30.2 40.0 61.1
Qwen3-VL-8B JIT-Memory (本文) 71.3 48.7 46.8 89.4
Qwen3-VL-32B Vanilla 70.5 25.2 16.7 76.0
Qwen3-VL-32B Safe-CoT 71.2 33.3 32.8 63.8
Qwen3-VL-32B JIT-Memory (本文) 76.9 58.7 61.5 94.1
GPT-4o Vanilla 77.7 35.3 15.4 72.0
GPT-4o Safe-CoT 71.7 31.2 29.5 72.3
GPT-4o JIT-Memory (本文) 81.3 66.2 70.9 96.8
GPT-5.2 Vanilla (参考) 78.0 28.0 20.6 71.7
GPT-5.2 Safe-CoT (参考) 74.7 45.3 39.3 77.2
Gemini-3.1-Pro-Preview Vanilla (参考) 88.0 25.8 21.3 61.3
Gemini-3.1-Pro-Preview Safe-CoT (参考) 82.0 46.0 38.7 81.3

消融实验

基于 Qwen3-VL-8B 骨干模型对核心组件进行的消融分析如下表所示:

变体配置 任务成功率 (TS %) ↑ 安全成功率 (SS %) ↑ 情境规避率 (Pre %) ↑ 时序规避率 (Post %) ↑ 机制说明
完整系统 (Full Model) 71.3 48.7 46.8 89.4 各模块协同,实现兼顾进度的精准安全化解
替换为全局密集检索 (Dense Retrieval) 62.0 24.0 26.8 76.0 全局文本相似度检索噪声大,分散规划注意力并降低任务进度
替换为单步重新解析 (Per-step Re-parse) 68.7 40.0 45.2 72.3 每步全图解析导致视野外危险状态丢失,时序风险处理下降 17.1%
仅提供具体经验案例 (Only Episodic) 68.0 21.3 28.0 42.0 原始轨迹场景过拟合,在未见环境中跨场景泛化极差
仅提供抽象事实原则 (Only Factual) 71.3 28.1 35.6 55.4 缺少具体落地流程与时机调度,模型无法输出准确规避动作
仅感知增强 (Perception-CoT) 65.2 20.0 17.2 42.8 显式空间描述未能带来安全前瞻推理与动作决策
仅图谱增强 (RSG-Augmented) 70.0 28.0 19.2 57.5 缺乏意图条件与化解元技能,情境风险规避率极低

关键发现

  1. 彻底打破“安全-进度”恶性权衡:基线方法如 Safe-CoT 在 Qwen3-VL-8B 上使任务成功率从 69.3% 暴跌至 57.6%,过度谨慎造成了严重的任务停滞。而 JIT-Memory 不仅使安全成功率从 18.4% 大幅跃升至 48.7%(绝对提升 +30.3%),更将任务成功率稳定在 71.3%,证明针对性前瞻干预比全程弥散式防范更高效。
  2. 8B 小模型逆袭超大商业模型:搭载 JIT-Memory 的开源 Qwen3-VL-8B 在安全成功率上达到 48.7%,直接超越了采用 Safe-CoT 的闭源巨型模型 GPT-5.2(45.3%)与 Gemini-3.1-Pro-Preview(46.0%),体现了显式结构化记忆在交互安全逻辑层面的优越性。
  3. 测试时演化有效校准时序冲突:在测试时自演化实验中,初始引导技能在 Episode 0 因时序调度过早(例如打水前先关水龙头)导致 TS 从 63.3% 降至 60.0%;随着经历 60 轮免标注的“测试-验证-写入”闭环迭代,模型自主学会了依赖等待,最终 TS 反超至 64.4%,SS 稳步升至 42.2%,验证了程序化技能自我纠错的闭环能力。

亮点与洞察

  • 将安全解构为状态与意图的二元耦合:改变了过去将危险视为环境静态属性的单一视角,揭示出“同一物理状态在不同行为意图下可由良性骤变为负向可供性”的本质,为具身交互安全提供了清晰的数学切入点。
  • 即时唤醒代替全时警惕:利用前瞻意图作为探针实现事实规则的确定性触发,在无风险阶段彻底保持静默,既保障了上下文窗口的紧凑,又规避了弥散式安全提示对常规规划逻辑的干扰。
  • 免人工标注的闭环演化范式:将时序逻辑形式的验证规范与历史拓扑快照相结合,构建出自动化的因果案例挖掘和自我演化流水线,为大模型在物理环境中的测试时持续学习(Test-Time Learning)开辟了新途径。

局限与展望

  • 依赖辅助感知模型的图谱构建精度:当前拓扑图维护依赖于 32B 规模的辅助 VLM 进行局部补丁推理,在微小物体状态(如极细微的液体溢出、暗处裂缝)的识别上仍可能存在感知漏报。未来可结合专用具身场景图解析器或具身三维体素记忆进行增强。
  • 规则完备性边界:事实规则库目前由人类高级安全规范预先离线编译生成,面对未被先验规则覆盖的开放式新奇危险源时,系统的自主演绎能力仍有待提升。未来可研究如何利用多模态常识模型在线自主发现并提炼未知危险规则。
  • 仿真到真机的迁移间隙:当前验证基于 OmniGibson 仿真平台,物理接触与液体、温度等连续物理变化仍经过了离散化抽象。在真实世界机器人上部署时,需要进一步应对传感器噪声、动作执行不确定性及低延迟响应要求的挑战。

相关工作与启发

  • vs Safe-CoT / HomeGuard:此类方法采用步步反思或全程注入全局安全提示,导致模型产生严重幻觉与过度防卫(如随意放弃执行),大幅压低任务进度;本文采用前瞻意图即时触发与拓扑图持久追踪,兼顾了任务进度与百分之百的针对性规避。
  • vs AgentSpec / Plug in the Safety Chip:现有形式化拦截框架多基于 LTL 规则对动作进行硬拦截(Action Blocking),本质上是“不求有功、但求无过”的停机防御;本文将形式化验证转化为指导性元技能的生成与因果挖掘,使智能体能够主动规划补救动作消解隐患。
  • vs Voyager / RoboMemory:通用具身记忆系统多围绕长程任务规划与场景建图展开,缺乏对细粒度安全可供性与持续性义务的时序建模;本文的“拓扑图+事实规则+程序元技能”三层结构为具身智能体的安全交互记忆架构确立了范本。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从“状态-意图二元耦合”视角系统解构具身交互安全,并提出即时触发与全自动演化的记忆架构。
  • 实验充分度: ⭐⭐⭐⭐⭐ 在 IS-Bench 上对多个开源及顶级闭源大模型展开了系统测试,包含详尽的模块消融、感知基准对比及长程演化曲线。
  • 写作质量: ⭐⭐⭐⭐⭐ 问题定义清晰严密,数学形式化表达规范,图文配合紧密,逻辑链条一气呵成。
  • 价值: ⭐⭐⭐⭐⭐ 有效破解了具身安全与任务推进相互掣肘的长期难题,所提出的免标注测试时学习机制对具身智能的自主可靠部署具有重要参考价值。