SceneDiff: A Benchmark and Method for Multiview Object Change Detection¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://yuqunw.github.io/SceneDiff
领域: 3D视觉
关键词: 物体级变化检测、多视角感知、3D场景理解、无监督几何对齐
一句话总结¶
针对非重合相机轨迹下的场景物体变化识别难题,本文构建了首个涵盖 350 组视频与稠密实例标注的 SceneDiff 基准,并提出结合基础模型的前馈 3D 几何配准与区域级多线索对比的免训练算法。
研究背景与动机¶
物体级变化检测(确定场景中哪些物体在不同时间点被新增、移除或移动)是体现机器空间理解能力的核心基石,在家庭机器人整理、施工进度监控、仓库盘点以及灾后资产损毁评估中具有重要应用价值。然而,现实场景采集往往难以复现严格一致的相机轨迹;当拍摄机位和运动路径发生显著漂移时,视点变化带来的极端透视畸变、局部遮挡、视野出入界与复杂光照波动,往往会产生大量伪变化假象,导致传统图像差分或两视角匹配方法频频误判。
该领域长期的痛点在于真实多视角物体级基准的匮乏以及现有方案的技术范式限制。以往数据集要么强行假设机位近似恒定,要么仅提供全景语义分割标签或合成两视角图像对,无法评估系统在连续视频轨迹中跨视点持续追踪同一物理变化物体的能力。在算法端,依赖神经辐射场(NeRF)或 3D 高斯泼溅(3DGS)的合成对比方法必须依赖稠密全覆盖视角才能完成高精渲染,遇到大视角偏差或稀疏轨迹便严重失真;基于任务微调的 2D/3D 检测模型则受困于合成到真实的泛化鸿沟(sim-to-real gap)。
面对视角不一致与遮挡交织的矛盾,本文的切入视角是将文本差分工具的“先对齐后比对”思想扩展至多视角 3D 物理空间:先借助静态场景背景将变化前后的两路视频流联合注册到统一坐标系,再将对比粒度由充满噪声的像素/点云层级提升至语义完整的物体实例区域。核心 idea:利用前馈 3D 几何基础模型联合重构与共视选帧,基于单向深度投影构建遮挡感知可见性掩膜,融合重投影几何残差、DINOv3 稠密特征重投影及 SAM 区域池化匹配线索,在无任何额外训练的前提下实现稳健的多视角物体变化检测与时序实例关联。
方法详解¶
整体框架¶
SceneDiff 接收场景变化前后的两路连续视频序列作为输入,最终输出整个场景中所有发生物理变化的物体实例、跨视点 2D 分割掩膜及其变化属性标签(Added 新增、Removed 移除、Moved 移动)。算法流水线分为三个紧密衔接的阶段:首先利用 3D 视觉几何模型联合预测位姿与稠密深度,以双向共视度为准则筛选成对参考视角;随后在各视点对间计算非对称几何、稠密语义重投影及无几何约束的区域池化匹配三大残差线索,汇聚为视点区域变化得分;最后通过 3D 体素化反投影平滑滤波、阈值分割过滤、时序增量聚类与跨序列贪心匹配完成物体级变化检测与状态判决。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入变化前后视频序列<br/>I_pre 与 I_post"] --> B["几何回归与共视帧对筛选<br/>π3 联合重构 + 50% 共视度匹配"]
B --> C["非对称几何深度比对<br/>单向投影 + 遮挡感知掩膜 M_pre"]
B --> D["稠密语义特征重投影比对<br/>DINOv3 余弦差异 + 掩膜过滤"]
B --> E["无几何依赖区域匹配<br/>SAM 掩膜均值池化全局检索"]
C & D & E --> F["区域级综合变化打分与聚合<br/>加权融合 + 3D 体素反投影滤波"]
F --> G["视频时序实例关联与分类<br/>ConceptGraph 式增量聚类 + 状态判决"]
G --> H["输出 3D/2D 变化物体实例及类别<br/>Added / Removed / Moved"]
关键设计¶
1. 几何回归与共视帧对筛选:在非重合相机轨迹中锚定可比视角 由于前后两路视频的相机轨迹完全自由且非同步,直接盲目逐帧比对会导致极大的计算浪费与视角死角。本文直接调用前馈视觉几何基础模型 \(\pi^3\) 联合处理前后两路视频,一次性预测两序列中所有图像帧的绝对相机外参、内参及归一化深度图,并将整个重构点云对齐缩放至 \([-1, 1]^3\) 的统一单位立方体中。为在动态变化的运动镜头中选出最具参考价值的帧对,算法以双向几何重投影像素共视比例为判据:对于前序帧 \(I_n^{\text{pre}}\),筛选后序帧中双向共视度超过 \(50\%\) 或共视面积最大的帧 \(I_{n'}^{\text{post}}\) 组成成对视角对 \((I^{\text{pre}}, I^{\text{post}})\),保证后续差异比对在重叠可见范围内展开。
2. 非对称几何与语义重投影比对:利用单向深度几何消除遮挡歧义 跨视点比较最棘手的挑战在于因视角移动引起的物理遮挡极易产生虚假几何差异。针对此痛点,本文提出非对称几何残差准则:将前序图像像元按预测深度重投影到后序机位时,若该物体仅在前序场景存在(即被移除),其重投影深度必然小于后序背景的观测深度,产生稳定的正深度差;而负深度差可能源于正常的前后遮挡,无法直接作为前序变化的判据。因此,算法利用深度重投影差值 \(E_{\text{geom}}(p)\) 构建方向性可见性掩膜: $\(M_{\text{pre}}(p) = \left( E_{\text{geom}}(p) \ge \tau_{\text{occ}} \right) \land V_{\text{pre}\to\text{post}}(p)\)$ 其中 \(\tau_{\text{occ}} = -0.02\) 为鲁棒容差。在此掩膜过滤的有效区域内,进一步抽取 DINOv3 稠密多尺度语义特征图,计算前序特征与重投影后序特征的余弦不相似度 \(E_{\text{feat}}(p)\),将光照与细微视角干扰降至最低。
3. 区域级池化匹配与无几何依赖补偿:打破逐点噪声与刚性重构依赖 单点像素级的特征对比极度敏感于微小的位姿标定偏差和深度边缘锯齿。为此,本文采用 SAM 提取各帧的候选物体分割掩膜,将特征和几何残差聚合为区域级表征。更重要的是,针对大位移或极度视差下几何投影完全失效的场景,本文引入了无几何依赖的全局区域语义匹配 \(E_{\text{region}}(r)\):对 SAM 区域内的 DINOv3 特征执行均值池化,在后序整幅画面所有区域中做全局余弦检索,找出最佳匹配项: $\(E_{\text{region}}(r) = 1 - \max_{s \in \mathcal{R}_{\text{post}}} \cos\left(\bar{F}_{\text{pre}}^r, \bar{F}_{\text{post}}^s\right)\)$ 当区域在另一场景中即便位置突变也能找到语义极其一致的目标时,该匹配项可有效压低虚警;反之则强化变化置信度。最终将三者以权值 \(\lambda_{\text{geom}}=1.0, \lambda_{\text{feat}}=0.5, \lambda_{\text{region}}=0.1\) 线性加权,得到稳健的区域变化打分 \(\Delta^{\text{pre}}\)。
4. 3D 体素反投影滤波与跨帧实例增量关联:消除单帧误检并统一物体物理身份 单帧检测到的高分区域往往包含视点偶然反光或局部断裂,且同个物体在视频不同帧呈现为多个碎片。算法首先将各帧二维得分图反投影至 3D 空间进行体素化平均,再重新池化投影回各帧掩膜,利用最大熵阈值法分割出候选变化区域;随后借鉴 ConceptGraph 的增量建图策略,在单视频内依据 3D 点云近邻重合度与外观语义特征对候选区域进行序列合并,动态维护物体的均值语义特征与点云集合。最终在视频结束后,将两序列中的变化物理实例库通过外观特征余弦相似度(阈值 \(\tau_{\text{sim}}=0.7\))实施贪心两两匹配:匹配成功判定为“位置发生改变(Moved)”,未匹配的前序物体标为“移除(Removed)”,未匹配的后序物体标为“新增(Added)”。
实验关键数据¶
主实验¶
在本文提出的 SceneDiff 测试集(包含多样日常场景 SD-V 与第一人称烹饪厨房 SD-K 两大子集)上,与多视角 3D 变化检测(MV3DCD)、2D 目标变化检测(CYWS-2D)、3D 检测(CYWS-3D)、3D 高斯泼溅(3DGS-CD)以及基于 Qwen2.5-VL + SAM3 的大模型基线进行对比(如下表,引自原论文 Table 2):
| 数据集 | 方法 | 像素/图像 px/im IoU (%) | 物体/图像 obj/im AP (%) | 物体/场景 obj/sc AP (%) |
|---|---|---|---|---|
| SD-V (多样场景) | MV3DCD | 22.1 | - | - |
| SD-V | CYWS-2D* (微调) | - | 24.5 | - |
| SD-V | VLM (Qwen2.5-VL) | 22.9 | 7.1 | 5.3 |
| SD-V | 3DGS-CD | 14.7 | 1.0 | 0.5 |
| SD-V | SceneDiff (本文) | 39.1 | 43.8 | 22.8 |
| SD-K (厨房场景) | MV3DCD | 9.1 | - | - |
| SD-K | CYWS-2D* (微调) | - | 16.8 | - |
| SD-K | VLM (Qwen2.5-VL) | 12.4 | 3.6 | 2.1 |
| SD-K | 3DGS-CD | 4.8 | 0.1 | 0.1 |
| SD-K | SceneDiff (本文) | 20.8 | 20.9 | 10.6 |
在双视角经典变化检测基准 RC-3D 上,SceneDiff 同样取得显著优势(引自原论文 Table 5,指标为边界框 AP50):
| 方法 | 输入条件 | 双视均值 Both AP50 (%) | 存在视 Present AP50 (%) | 缺失视 Absent AP50 (%) |
|---|---|---|---|---|
| CYWS-2D | RGB | 14.0 | - | - |
| CYWS-3D | RGB (单目深度) | 41.0 | - | - |
| CYWS-3D* | RGB + 真实传感器深度 | 50.0 | - | - |
| SceneDiff (本文) | 纯 RGB (无需训练) | 65.3 | 72.3 | 59.1 |
消融实验¶
在 SD-V 测试集上分析几何骨干、语义提取网络及各项线索组合对检测性能的贡献(引自原论文 Table 6,数值展示与全模型 \(\pi^3 + \text{DINOv3}\) 的相对差异 \(\Delta\)):
| 实验配置分类 | 具体配置 | px/im IoU (%) | obj/im AP (%) | obj/sc AP (%) | 说明 |
|---|---|---|---|---|---|
| 完整方法 | \(\pi^3\) + DINOv3 | 39.1 | 43.8 | 22.8 | 基准配置 |
| 几何骨干替换 | VGGT + DINOv3 | -2.2 | -8.1 | -8.7 | 多视角几何精度下降明显 |
| 几何骨干替换 | FASt3R + DINOv3 | -23.7 | -39.8 | -22.4 | 密集配准失败导致雪崩式衰退 |
| 语义特征对比 | \(\pi^3\) + DINOv2 | +0.4 | +1.3 | -1.5 | 场景级多视角关联略逊于 DINOv3 |
| 语义特征对比 | \(\pi^3\) + DINOv1 | -3.0 | +1.5 | -2.7 | 基础语义不变性较弱 |
| 特征线索拆解 | 仅几何线索 \(E_g\) | +2.1 | -12.1 | -10.3 | 像素分割尚可,缺失语义致实例识别大幅暴跌 |
| 特征线索拆解 | 仅重投影外观 \(E_f\) | -6.1 | +0.1 | 0.0 | 维持了物体级核心表现,证明 \(E_f\) 最关键 |
| 特征线索拆解 | 仅区域匹配 \(E_r\) | -14.8 | -14.2 | -0.8 | 缺乏几何约束时误报率激增 |
| 特征线索拆解 | \(E_g + E_f\) (无 \(E_r\)) | -1.8 | -0.1 | +0.1 | 性能接近完整版 |
关键发现¶
- 重投影外观特征是决定性支柱:消融显示重投影特征 \(E_{\text{feat}}\) 是算法最核心的线索;单独使用几何深度残差 \(E_{\text{geom}}\) 虽然能勉强维持像素级边缘(px/im IoU +2.1),但在物体级 AP 指标上遭遇毁灭性滑坡(obj/im AP 从 43.8 暴跌 12.1 点至 31.7,obj/sc AP 暴跌 10.3 点),这是因为单纯深度无法感知扁平物体表面或微小物品的置换,且对三维重构噪声极度脆弱。
- 免训练基础模型组合击败任务微调:SceneDiff 全程不经历任何有监督微调,在 SD-V 上的 obj/im AP 达到 43.8%,远超在验证集精细微调后的专门检测网络 CYWS-2D(24.5%);在两视角基准 RC-3D 上更是以 65.3% AP50 大幅超越使用传感器实测深度输入的 CYWS-3D(50.0%)。
- 运行效率远超 NeRF / 3DGS 渲染比对流派:在 10 秒视频对的处理耗时中(Table 3),SceneDiff 仅耗时 159.4s(半精度优化后可降至 65s),显存占用 19.2GB,而基于 3DGS-CD 和 MV3DCD 的三维辐射场重构渲染方案需要反复优化迭代,耗时均突破 30 分钟且极易因视角外推不足而发散崩溃。
亮点与洞察¶
- 非对称可见性几何滤波准则:巧妙利用光路单向透视特性,只将正向重投影深度差视为可信变化依据,而将负向深度差直接交由方向性掩膜 \(M_{\text{pre}}\) 屏蔽,从数学上直截了当地解除了大视差场景中“真实变化”与“视线遮挡”的死结。
- 完全解耦的免训练模块化架构:整个框架由几何推断(\(\pi^3\))、实例分割(SAM)与语义抽取(DINOv3)纯级联构成,不仅即插即用、开箱适配任意室内外和具身视角,更具备天然的“模型红利”特性,伴随底层视觉大模型的能力进化而无缝升级。
- 闭环机器人桌面清理系统实证:论文不仅停留在离线数值刷榜,还落地驱动真实机械臂完成了基于前序整洁记忆的桌面收纳清理闭环:准确将新增的垃圾放入垃圾桶、并将被挪动的物品摆回最初位置,证明了其对于具身空间交互的强赋能潜力。
局限与展望¶
- 同质物体重排的固有物理歧义:对于外观几何完全相同的多件物品(例如多个相同的可乐罐彼此对调或替换),由于 DINOv3 语义与重投影外观难以区分同质纹理,算法倾向于判定为移动距离最短的非置换状态,此类高难度排列辨别仍需结合时间因果性持续追踪。
- 极端光照与无纹理环境下的姿态崩溃:系统的前提建立在高质量前馈三维重构的基础之上;当遭遇严重暗光、大面积白墙无纹理或视线完全无共视交叠的极度稀疏轨迹时,\(\pi^3\) 的位姿与深度估计出现断裂将直接导致下游差分全盘失效。
- 缺乏微观状态与材质形变认知:当前算法将物体视为刚性实体检测空间位移与增减,无法检测物体的细微语义状态改变(如白面包被烤成焦黄吐司、水杯装水)或微观表面物理损伤(如裂纹、划痕)。
相关工作与启发¶
- vs CYWS-2D / CYWS-3D: 传统检测基线多依赖特定合成数据训练的 2D 卷积或单目深度变形网络,在面对大幅度视差和未见实景时泛化能力骤降;SceneDiff 彻底抛弃端到端微调,借助 3D 几何前馈重构在全局空间注册,彻底解决了两视角方法的视差失真瓶颈。
- vs 3DGS-CD / MV3DCD: 神经渲染类方法依赖密集的环绕视角优化场景辐射场,推理需耗费半小时以上且抗外推能力极弱;SceneDiff 采用前馈式 3D 预测与多尺度图像掩膜池化,耗时降低一个数量级以上,并在大幅度轨迹偏转下保持极高的几何稳定性。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 首次定义非约束轨迹多视角实例变化检测基准,非对称可见性与免训练三维线索聚合设计巧妙
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖多样场景、具身厨房双子集与两视角外部基准,消融实验详实透彻并完成了真机闭环验证
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,问题陈述清晰,数学公式与图表表达洗练规范
- 价值: ⭐⭐⭐⭐⭐ 为具身智能、空间数字孪生和灾难巡检提供了不可或缺的多视角变化评估基石与基线范本