跳转至

HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM / 机器人/具身智能
关键词: 具身安全防护、情境风险、视觉定位、过程奖励、反事实安全配对

一句话总结

HomeGuard 用“先定位操作对象与环境约束、再判断风险”的上下文引导思维链及定位过程奖励训练独立安全防护模型,使 8B 模型在 HomeSafe-Bench 上的风险匹配率从 33.20% 提升至 74.90%,同时将安全场景误报率从 32.62% 降至 13.14%。

研究背景与动机

家庭机器人面临的危险并不总来自恶意指令。“把食物放进微波炉”本身很正常,但餐盘里残留的金属餐具会改变这条指令的安全性;“把瓶子放进柜子”也可能因为瓶中是有毒化学品、柜中存放食物而变得危险。这类情境风险取决于指令、目标物状态和周围环境的共同作用,只审查语言意图无法处理。

规则式防护可以把场景转成对象描述和逻辑约束,但拥挤家庭场景中的对象关系很难穷举,视觉描述错误也会沿规则链传播。直接让视觉语言模型(VLM)做整体安全判断更灵活,却容易忽视小物件,或者只要看到微波炉、电器等就泛化出不存在的危险。论文据此提出一个可检验的判断:瓶颈不只是缺安全常识,更是缺乏任务相关的视觉注意与证据定位;给基础模型真实目标框和约束框就能显著改善表现。

HomeGuard 因而选择独立于下游机器人架构的安全防护接口,让模型既说明“哪里危险”,也输出“危险在哪里”。核心 idea:用强制生成的目标区域与约束区域作为风险推理的中间证据,再通过定位过程奖励训练模型看对位置,避免把更多拒绝误当成更安全。

方法详解

整体框架

输入是家庭场景图像和自然语言指令,输出是安全状态、风险解释及被违反的安全原则,同时保留操作目标和环境约束的二维边界框。这里的“目标”是指令要求交互的对象或位置,“约束”是不一定需要操作、却会影响任务安全的背景对象。

上下文引导思维链(Context-Guided Chain-of-Thought,CG-CoT)依次执行意图筛查、交互目标检查、环境约束分析和综合风险评估。前三者不是额外调用的三个检测器,而是同一 VLM 被训练遵循的结构化输出过程;“主动感知”在本文中也不等于机器人主动移动相机采集新视角。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["场景图像 + 指令"] --> Intent["意图筛查"]
    Intent -->|无明确恶意| Target["交互目标检查"]
    Target --> Context["环境约束分析"]
    Context --> Judge["综合风险评估"]
    Judge --> Output["判断 + 解释 + 视觉锚点"]
    Intent -->|明确恶意,提前终止| Output
    Output --> Planner["下游规划器"]

图中是推理数据流;训练时另用带标注的 HomeSafe 数据先做监督微调,再用 GRPO 优化最终判断和中间定位。真实边界框只参与训练奖励或专门的 oracle 对照,不是常规部署的输入。下游规划器可利用模型预测的视觉锚点修改计划,但 HomeGuard 本身不是完整运动控制器。

关键设计

1. 意图筛查:先区分恶意命令与情境性危险

模型先检查指令是否明确要求破坏等恶意行为,存在明确恶意就提前结束推理。普通家务指令则不能因为语言无害而直接放行,必须继续检查画面中的执行条件。这一步把两类安全问题分开:语言层面已足够判断的命令不必绕完整视觉链,真正困难的情境风险则保留视觉核查预算。

2. 交互目标检查:把指令绑定到具体对象和状态

模型输出 [target_area][description][bbox][state],其中 bbox 包含左上角和右下角的二维坐标,state 描述材质、温度或空间位置等安全相关属性。目标不局限于被抓取的物品,也可包括准备放置物品的柜内空位。这样,“将瓶子放进柜子”不再只是两个抽象名词,而是特定瓶子与特定目的位置之间的操作。

这种显式绑定能防止模型把邻近但无关的物体当成指令目标。需要注意,输出了状态描述并不意味着传感器实际测量了温度或通电状态;本文仍从图像与语义线索推断属性,其可靠性受可见证据约束。

3. 环境约束分析:沿空间邻域与功能关联寻找隐含风险

确定目标后,模型寻找可能干扰执行的对象,并以 [constraint_area][description][bbox][state] 表达。空间邻域包括热源附近的可燃物、容器里的金属餐具、倒水位置旁的电子设备;功能关联则可以延伸到设备连接的电线,因此不是固定半径裁剪或只看最近物体。

目标与约束分开标注的重要性在于:模型可能准确定位了要操作的茶杯,却完全没注意到旁边的电脑。环境约束检查要求它解释风险是如何由材质、摆放关系、易碎性或活动状态产生的,而不是只列举画面里出现了哪些“危险类别”的物体。训练中两类边界框分别获得 IoU 奖励,避免整体定位指标掩盖背景约束漏检。

4. 综合风险评估:让拒绝和放行都有视觉依据

模型把前面得到的意图、目标状态和环境约束合并,判断实际执行是否违反安全原则。安全时输出 [safety_hazard]["no safety hazard"];不安全时给出 [safety_hazard][description][safety_principle][description]。推理过程使用 <think>...</think> 包围,最终判断另行输出。

这里追求的不只是二分类正确:同样回答“不安全”,若理由与真实危险不符,也可能无法指导下游改计划。因此训练还约束风险解释与原则类别。部署时,边界框为下游提供可操作的空间线索,例如先移走障碍再执行任务;这些二维框不是三维避碰证明,也不保证规划器一定正确使用它们。

一个完整示例

原文图 2 的任务是“把烤面包机左边的瓶子放进打开的柜子”。意图筛查认为它是普通收纳任务;目标检查却从瓶身警示标签识别出有毒属性,同时把柜中的空位识别为放置目的地。

环境约束分析接着发现空位旁有调味品和食物,而不是把“柜子里有位置”当成充分条件。综合评估因误食和污染风险拒绝直接放入,并指出食物与有毒化学品应分开存放的原则。关键变化不是命令更恶意了,而是视觉状态和邻域关系使正常命令产生了危险;这也解释了为什么只添加一段安全原则提示不够。

损失函数 / 训练策略

HomeSafe 以 CA-1M 和 SUNRGBD 的真实室内图像为基础,包含 10,257 个不安全场景和 5,710 个安全场景,风险分类覆盖 7 大类、33 条安全原则。生成流程先规划同一指令的危险与安全编辑方案,再对真实背景插入或替换对象,经过图像真实性过滤和风险一致性过滤,最后标注目标框、约束框、状态与推理轨迹。

反事实安全配对尤其重要:保留指令、改变触发危险的视觉因素,例如将金属容器换为陶瓷容器,使模型不能只靠指令关键词做判断。数据总量并非严格一比一配对,不能把两类样本数理解成相同数量的成对图像。原文说明测试集另经人工核验,与训练集严格不重叠;这并不等价于已经证明所有源场景层面的独立性。

第一阶段通过 LoRA 做监督微调(SFT),混合带视觉定位的四步推理样本和通用指令跟随数据,以学习安全原则、输出结构并保留通用能力。第二阶段采用强化微调(RFT),具体使用组相对策略优化(GRPO),同时优化最终结果与中间视觉证据。

结果奖励包含格式合规、安全二分类准确率、解释文本语义一致性和安全原则 ID 一致性。文本语义一致性使用 all-MiniLM-L6-v2 句向量的余弦相似度;原则 ID 检查额外限制风险类别,减少嵌入相似但类别不对的情况。

过程奖励分别计算预测目标框、约束框与真实标注的 IoU。中间框无法按规定格式解析就得零分,因此不再单设中间格式奖励;中间状态描述则没有逐字匹配奖励,避免合理的不同表达被错误惩罚。最终奖励组合这些信号后,按同一输入的多次采样结果进行组内归一化:

\[ A_i = \frac{r_i - \operatorname{mean}(\{r_j\})}{\operatorname{std}(\{r_j\})}. \]

这里 \(r_i\) 是第 \(i\) 个候选输出的总奖励,\(A_i\) 是 GRPO 的相对优势。指定文本缓存的公式 (1)、(2) 提取不完整,因此不猜补精确的总奖励加权式;缓存也不含文中引用的附录,无法从当前材料确认奖励权重、采样组大小及完整训练超参数。

实验关键数据

主实验

HomeSafe-Bench 包含 512 张不安全图像与 272 张安全图像。RIR 是不安全场景被正确识别为有风险的比例;RMR 衡量风险解释与真实描述的语义匹配,由 Qwen3-VL-235B-A22B-Thinking 判定;OR 是安全场景被误判为不安全的比例。T-IoU、C-IoU 分别衡量目标区域和约束区域的定位重叠。

下表摘录原文表 1。RIR、RMR、OR 的单位为 %,IoU 不使用百分比;高 RIR 必须结合 RMR 和 OR 一起看。

模型 RIR ↑ RMR ↑ T-IoU ↑ C-IoU ↑ OR ↓
Qwen3-VL-4B-Thinking 66.67 33.14 0.5902 0.2212 29.31
Qwen3-VL-8B-Thinking 67.58 33.20 0.5732 0.2694 32.62
Gemini-3-pro 87.45 60.98 0.6745 0.5217 25.23
AgentSpec 66.67 36.67 / / 28.41
HomeGuard-4B 90.00 63.72 0.6709 0.4873 21.96
HomeGuard-8B 90.98 74.90 0.7206 0.5562 13.14

相对同规模基础模型,4B 和 8B 的 RMR 分别提高 30.58、41.70 个百分点,OR 分别降低 7.35、19.48 个百分点。这里不是相对百分比提升,也不是总体分类准确率。8B 相对 Gemini-3-pro 的 RMR 高 13.92 个百分点,OR 低 12.09 个百分点。

消融实验

原文表 3 均围绕 Qwen3-VL-4B-Thinking。direct GT bbox 是向未微调模型直接提供真实目标框和约束框的 oracle 提示对照,不是部署时自动定位的公平替代品。

配置 RIR ↑ RMR ↑ T-IoU ↑ C-IoU ↑ OR ↓
去掉约束框 IoU 奖励 85.49 50.20 0.6764 0.2604 22.43
去掉目标框 IoU 奖励 90.00 56.27 0.5642 0.4239 37.03
去掉全部 IoU 奖励 90.98 50.98 0.5956 0.4052 42.35
direct GT bbox 84.71 51.96 0.7936 0.6242 22.79
direct CoT 70.07 43.50 0.6488 0.3302 23.53
direct principle 71.26 47.83 0.4308 0.2743 35.56
HomeGuard-4B 90.00 63.72 0.6709 0.4873 21.96

关键发现

  • 约束框监督直接影响“解释是否说对危险”:去掉它,RMR 从 63.72% 降到 50.20%,C-IoU 从 0.4873 降到 0.2604。仅准确看到操作目标并不足够。
  • 去掉全部 IoU 奖励后,RIR 从 90.00% 升到 90.98%,但 OR 从 21.96% 升到 42.35%。这种变化支持“定位监督减少无依据拒绝”,不能只以风险检出率给安全模型排序。
  • 原文表 2 中,8B 在 EARBench 的 RIR/RMR 为 94.73%/72.12%;但在 MSSBench 上 RIR/OR 为 77.63%/25.00%,不及 Gemini-3-Pro 的 85.53%/10.53%。跨域有效不代表所有数据集全面领先。
  • 第 4.5 节的 IS-Bench 规划实验中,Qwen3-VL-8B-Thinking 接入安全提示后,任务成功率从 61.36% 到 73.91%,安全成功率从 29.54% 到 45.65%,分别增加 12.55、16.11 个百分点。该结果不能替代实体机器人闭环安全验证。

亮点与洞察

  • 安全常识需要可定位证据。 真正的改进不只是让模型写更长的解释,而是让解释依赖具体区域。目标和约束的分别监督,使“看错对象”和“漏看周边风险”成为可区分的错误来源。
  • 反事实安全配对抑制类别捷径。 同一正常指令在不同视觉状态下可以安全或危险,迫使模型关注材质和对象关系。这比只增加更多危险指令更贴近家庭场景的实际矛盾。
  • 视觉锚点连接审查与计划修复。 输出一个拒绝标签只会停止任务,输出风险位置则能帮助规划器先消除条件性危险。论文的茶杯、茶壶与电脑案例展示了这种接口的潜力,但尚未证明几何安全保证。

局限与展望

  • 作者承认当前只处理二维图像,精确间隙、遮挡和三维可达性仍需深度或点云信息。二维框也无法直接约束机器人完整运动轨迹。
  • 静态风险判断不能覆盖运动中的人或物体,作者将视频时序建模及实体机器人长时程闭环部署列为未来工作。本文不能解读为已完成真实家庭机器人安全认证。
  • 从实验设计看,训练和自建测试都依赖编辑式合成,仍可能保留生成器特征或风险类别偏置。公开基准验证有价值,但还需要更自然、未编辑的真实家庭测试。
  • RMR 使用大模型裁判,奖励中的语义相似度也不是实际事故概率。当前缓存缺少附录中的裁判提示、更多实现细节,无法独立检查评判标准或精确复现训练。

相关工作与启发

  • vs ThinkSafe / Poex: 本文将它们作为基于提示的运行时防护对照,HomeGuard 则通过训练学习带视觉定位的判断过程。优势来自特定数据和监督,不能把结果理解成同样训练预算下的架构优劣结论。
  • vs AgentSpec: AgentSpec 以领域专用语言表达并执行规则约束;HomeGuard 用学习到的视觉证据处理更复杂的上下文。前者的可验证逻辑与后者的开放视觉理解是不同能力,学习式定位并未取代形式化保证。
  • vs 具身安全对齐: 直接训练规划器或动作模型的安全策略会与其行为接口耦合;HomeGuard 提供独立审查器,更便于接入不同规划器。可延伸方向是检验定位置信度能否决定“放行、补充观察、拒绝”的分级策略,而非继续只做二分类。

评分

  • 新颖性: 4/5。把目标/约束定位、反事实安全样本和过程奖励组合成具身风险防护接口,问题切入具体。
  • 实验充分度: 4/5。有自建集、四个外部基准、定位奖励消融与规划应用,但缺实体机器人闭环评估。
  • 写作质量: 4/5。方法与消融相互支持;提升的百分比口径需仔细区分,当前文本缓存存在公式损坏。
  • 价值: 4/5。为减少漏检和无依据拒绝提供可迁移机制,但静态二维判断不是部署安全保证。