HomeGuard: VLM-based Embodied Safeguard for Identifying Contextual Risk in Household Task¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM / 机器人/具身智能
关键词: 具身安全防护、情境风险、视觉定位、过程奖励、反事实安全配对
一句话总结¶
HomeGuard 用“先定位操作对象与环境约束、再判断风险”的上下文引导思维链及定位过程奖励训练独立安全防护模型,使 8B 模型在 HomeSafe-Bench 上的风险匹配率从 33.20% 提升至 74.90%,同时将安全场景误报率从 32.62% 降至 13.14%。
研究背景与动机¶
家庭机器人面临的危险并不总来自恶意指令。“把食物放进微波炉”本身很正常,但餐盘里残留的金属餐具会改变这条指令的安全性;“把瓶子放进柜子”也可能因为瓶中是有毒化学品、柜中存放食物而变得危险。这类情境风险取决于指令、目标物状态和周围环境的共同作用,只审查语言意图无法处理。
规则式防护可以把场景转成对象描述和逻辑约束,但拥挤家庭场景中的对象关系很难穷举,视觉描述错误也会沿规则链传播。直接让视觉语言模型(VLM)做整体安全判断更灵活,却容易忽视小物件,或者只要看到微波炉、电器等就泛化出不存在的危险。论文据此提出一个可检验的判断:瓶颈不只是缺安全常识,更是缺乏任务相关的视觉注意与证据定位;给基础模型真实目标框和约束框就能显著改善表现。
HomeGuard 因而选择独立于下游机器人架构的安全防护接口,让模型既说明“哪里危险”,也输出“危险在哪里”。核心 idea:用强制生成的目标区域与约束区域作为风险推理的中间证据,再通过定位过程奖励训练模型看对位置,避免把更多拒绝误当成更安全。
方法详解¶
整体框架¶
输入是家庭场景图像和自然语言指令,输出是安全状态、风险解释及被违反的安全原则,同时保留操作目标和环境约束的二维边界框。这里的“目标”是指令要求交互的对象或位置,“约束”是不一定需要操作、却会影响任务安全的背景对象。
上下文引导思维链(Context-Guided Chain-of-Thought,CG-CoT)依次执行意图筛查、交互目标检查、环境约束分析和综合风险评估。前三者不是额外调用的三个检测器,而是同一 VLM 被训练遵循的结构化输出过程;“主动感知”在本文中也不等于机器人主动移动相机采集新视角。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["场景图像 + 指令"] --> Intent["意图筛查"]
Intent -->|无明确恶意| Target["交互目标检查"]
Target --> Context["环境约束分析"]
Context --> Judge["综合风险评估"]
Judge --> Output["判断 + 解释 + 视觉锚点"]
Intent -->|明确恶意,提前终止| Output
Output --> Planner["下游规划器"]
图中是推理数据流;训练时另用带标注的 HomeSafe 数据先做监督微调,再用 GRPO 优化最终判断和中间定位。真实边界框只参与训练奖励或专门的 oracle 对照,不是常规部署的输入。下游规划器可利用模型预测的视觉锚点修改计划,但 HomeGuard 本身不是完整运动控制器。
关键设计¶
1. 意图筛查:先区分恶意命令与情境性危险
模型先检查指令是否明确要求破坏等恶意行为,存在明确恶意就提前结束推理。普通家务指令则不能因为语言无害而直接放行,必须继续检查画面中的执行条件。这一步把两类安全问题分开:语言层面已足够判断的命令不必绕完整视觉链,真正困难的情境风险则保留视觉核查预算。
2. 交互目标检查:把指令绑定到具体对象和状态
模型输出 [target_area][description][bbox][state],其中 bbox 包含左上角和右下角的二维坐标,state 描述材质、温度或空间位置等安全相关属性。目标不局限于被抓取的物品,也可包括准备放置物品的柜内空位。这样,“将瓶子放进柜子”不再只是两个抽象名词,而是特定瓶子与特定目的位置之间的操作。
这种显式绑定能防止模型把邻近但无关的物体当成指令目标。需要注意,输出了状态描述并不意味着传感器实际测量了温度或通电状态;本文仍从图像与语义线索推断属性,其可靠性受可见证据约束。
3. 环境约束分析:沿空间邻域与功能关联寻找隐含风险
确定目标后,模型寻找可能干扰执行的对象,并以 [constraint_area][description][bbox][state] 表达。空间邻域包括热源附近的可燃物、容器里的金属餐具、倒水位置旁的电子设备;功能关联则可以延伸到设备连接的电线,因此不是固定半径裁剪或只看最近物体。
目标与约束分开标注的重要性在于:模型可能准确定位了要操作的茶杯,却完全没注意到旁边的电脑。环境约束检查要求它解释风险是如何由材质、摆放关系、易碎性或活动状态产生的,而不是只列举画面里出现了哪些“危险类别”的物体。训练中两类边界框分别获得 IoU 奖励,避免整体定位指标掩盖背景约束漏检。
4. 综合风险评估:让拒绝和放行都有视觉依据
模型把前面得到的意图、目标状态和环境约束合并,判断实际执行是否违反安全原则。安全时输出 [safety_hazard]["no safety hazard"];不安全时给出 [safety_hazard][description] 及 [safety_principle][description]。推理过程使用 <think>...</think> 包围,最终判断另行输出。
这里追求的不只是二分类正确:同样回答“不安全”,若理由与真实危险不符,也可能无法指导下游改计划。因此训练还约束风险解释与原则类别。部署时,边界框为下游提供可操作的空间线索,例如先移走障碍再执行任务;这些二维框不是三维避碰证明,也不保证规划器一定正确使用它们。
一个完整示例¶
原文图 2 的任务是“把烤面包机左边的瓶子放进打开的柜子”。意图筛查认为它是普通收纳任务;目标检查却从瓶身警示标签识别出有毒属性,同时把柜中的空位识别为放置目的地。
环境约束分析接着发现空位旁有调味品和食物,而不是把“柜子里有位置”当成充分条件。综合评估因误食和污染风险拒绝直接放入,并指出食物与有毒化学品应分开存放的原则。关键变化不是命令更恶意了,而是视觉状态和邻域关系使正常命令产生了危险;这也解释了为什么只添加一段安全原则提示不够。
损失函数 / 训练策略¶
HomeSafe 以 CA-1M 和 SUNRGBD 的真实室内图像为基础,包含 10,257 个不安全场景和 5,710 个安全场景,风险分类覆盖 7 大类、33 条安全原则。生成流程先规划同一指令的危险与安全编辑方案,再对真实背景插入或替换对象,经过图像真实性过滤和风险一致性过滤,最后标注目标框、约束框、状态与推理轨迹。
反事实安全配对尤其重要:保留指令、改变触发危险的视觉因素,例如将金属容器换为陶瓷容器,使模型不能只靠指令关键词做判断。数据总量并非严格一比一配对,不能把两类样本数理解成相同数量的成对图像。原文说明测试集另经人工核验,与训练集严格不重叠;这并不等价于已经证明所有源场景层面的独立性。
第一阶段通过 LoRA 做监督微调(SFT),混合带视觉定位的四步推理样本和通用指令跟随数据,以学习安全原则、输出结构并保留通用能力。第二阶段采用强化微调(RFT),具体使用组相对策略优化(GRPO),同时优化最终结果与中间视觉证据。
结果奖励包含格式合规、安全二分类准确率、解释文本语义一致性和安全原则 ID 一致性。文本语义一致性使用 all-MiniLM-L6-v2 句向量的余弦相似度;原则 ID 检查额外限制风险类别,减少嵌入相似但类别不对的情况。
过程奖励分别计算预测目标框、约束框与真实标注的 IoU。中间框无法按规定格式解析就得零分,因此不再单设中间格式奖励;中间状态描述则没有逐字匹配奖励,避免合理的不同表达被错误惩罚。最终奖励组合这些信号后,按同一输入的多次采样结果进行组内归一化:
这里 \(r_i\) 是第 \(i\) 个候选输出的总奖励,\(A_i\) 是 GRPO 的相对优势。指定文本缓存的公式 (1)、(2) 提取不完整,因此不猜补精确的总奖励加权式;缓存也不含文中引用的附录,无法从当前材料确认奖励权重、采样组大小及完整训练超参数。
实验关键数据¶
主实验¶
HomeSafe-Bench 包含 512 张不安全图像与 272 张安全图像。RIR 是不安全场景被正确识别为有风险的比例;RMR 衡量风险解释与真实描述的语义匹配,由 Qwen3-VL-235B-A22B-Thinking 判定;OR 是安全场景被误判为不安全的比例。T-IoU、C-IoU 分别衡量目标区域和约束区域的定位重叠。
下表摘录原文表 1。RIR、RMR、OR 的单位为 %,IoU 不使用百分比;高 RIR 必须结合 RMR 和 OR 一起看。
| 模型 | RIR ↑ | RMR ↑ | T-IoU ↑ | C-IoU ↑ | OR ↓ |
|---|---|---|---|---|---|
| Qwen3-VL-4B-Thinking | 66.67 | 33.14 | 0.5902 | 0.2212 | 29.31 |
| Qwen3-VL-8B-Thinking | 67.58 | 33.20 | 0.5732 | 0.2694 | 32.62 |
| Gemini-3-pro | 87.45 | 60.98 | 0.6745 | 0.5217 | 25.23 |
| AgentSpec | 66.67 | 36.67 | / | / | 28.41 |
| HomeGuard-4B | 90.00 | 63.72 | 0.6709 | 0.4873 | 21.96 |
| HomeGuard-8B | 90.98 | 74.90 | 0.7206 | 0.5562 | 13.14 |
相对同规模基础模型,4B 和 8B 的 RMR 分别提高 30.58、41.70 个百分点,OR 分别降低 7.35、19.48 个百分点。这里不是相对百分比提升,也不是总体分类准确率。8B 相对 Gemini-3-pro 的 RMR 高 13.92 个百分点,OR 低 12.09 个百分点。
消融实验¶
原文表 3 均围绕 Qwen3-VL-4B-Thinking。direct GT bbox 是向未微调模型直接提供真实目标框和约束框的 oracle 提示对照,不是部署时自动定位的公平替代品。
| 配置 | RIR ↑ | RMR ↑ | T-IoU ↑ | C-IoU ↑ | OR ↓ |
|---|---|---|---|---|---|
| 去掉约束框 IoU 奖励 | 85.49 | 50.20 | 0.6764 | 0.2604 | 22.43 |
| 去掉目标框 IoU 奖励 | 90.00 | 56.27 | 0.5642 | 0.4239 | 37.03 |
| 去掉全部 IoU 奖励 | 90.98 | 50.98 | 0.5956 | 0.4052 | 42.35 |
| direct GT bbox | 84.71 | 51.96 | 0.7936 | 0.6242 | 22.79 |
| direct CoT | 70.07 | 43.50 | 0.6488 | 0.3302 | 23.53 |
| direct principle | 71.26 | 47.83 | 0.4308 | 0.2743 | 35.56 |
| HomeGuard-4B | 90.00 | 63.72 | 0.6709 | 0.4873 | 21.96 |
关键发现¶
- 约束框监督直接影响“解释是否说对危险”:去掉它,RMR 从 63.72% 降到 50.20%,C-IoU 从 0.4873 降到 0.2604。仅准确看到操作目标并不足够。
- 去掉全部 IoU 奖励后,RIR 从 90.00% 升到 90.98%,但 OR 从 21.96% 升到 42.35%。这种变化支持“定位监督减少无依据拒绝”,不能只以风险检出率给安全模型排序。
- 原文表 2 中,8B 在 EARBench 的 RIR/RMR 为 94.73%/72.12%;但在 MSSBench 上 RIR/OR 为 77.63%/25.00%,不及 Gemini-3-Pro 的 85.53%/10.53%。跨域有效不代表所有数据集全面领先。
- 第 4.5 节的 IS-Bench 规划实验中,Qwen3-VL-8B-Thinking 接入安全提示后,任务成功率从 61.36% 到 73.91%,安全成功率从 29.54% 到 45.65%,分别增加 12.55、16.11 个百分点。该结果不能替代实体机器人闭环安全验证。
亮点与洞察¶
- 安全常识需要可定位证据。 真正的改进不只是让模型写更长的解释,而是让解释依赖具体区域。目标和约束的分别监督,使“看错对象”和“漏看周边风险”成为可区分的错误来源。
- 反事实安全配对抑制类别捷径。 同一正常指令在不同视觉状态下可以安全或危险,迫使模型关注材质和对象关系。这比只增加更多危险指令更贴近家庭场景的实际矛盾。
- 视觉锚点连接审查与计划修复。 输出一个拒绝标签只会停止任务,输出风险位置则能帮助规划器先消除条件性危险。论文的茶杯、茶壶与电脑案例展示了这种接口的潜力,但尚未证明几何安全保证。
局限与展望¶
- 作者承认当前只处理二维图像,精确间隙、遮挡和三维可达性仍需深度或点云信息。二维框也无法直接约束机器人完整运动轨迹。
- 静态风险判断不能覆盖运动中的人或物体,作者将视频时序建模及实体机器人长时程闭环部署列为未来工作。本文不能解读为已完成真实家庭机器人安全认证。
- 从实验设计看,训练和自建测试都依赖编辑式合成,仍可能保留生成器特征或风险类别偏置。公开基准验证有价值,但还需要更自然、未编辑的真实家庭测试。
- RMR 使用大模型裁判,奖励中的语义相似度也不是实际事故概率。当前缓存缺少附录中的裁判提示、更多实现细节,无法独立检查评判标准或精确复现训练。
相关工作与启发¶
- vs ThinkSafe / Poex: 本文将它们作为基于提示的运行时防护对照,HomeGuard 则通过训练学习带视觉定位的判断过程。优势来自特定数据和监督,不能把结果理解成同样训练预算下的架构优劣结论。
- vs AgentSpec: AgentSpec 以领域专用语言表达并执行规则约束;HomeGuard 用学习到的视觉证据处理更复杂的上下文。前者的可验证逻辑与后者的开放视觉理解是不同能力,学习式定位并未取代形式化保证。
- vs 具身安全对齐: 直接训练规划器或动作模型的安全策略会与其行为接口耦合;HomeGuard 提供独立审查器,更便于接入不同规划器。可延伸方向是检验定位置信度能否决定“放行、补充观察、拒绝”的分级策略,而非继续只做二分类。
评分¶
- 新颖性: 4/5。把目标/约束定位、反事实安全样本和过程奖励组合成具身风险防护接口,问题切入具体。
- 实验充分度: 4/5。有自建集、四个外部基准、定位奖励消融与规划应用,但缺实体机器人闭环评估。
- 写作质量: 4/5。方法与消融相互支持;提升的百分比口径需仔细区分,当前文本缓存存在公式损坏。
- 价值: 4/5。为减少漏检和无依据拒绝提供可迁移机制,但静态二维判断不是部署安全保证。