跳转至

Dynamic-Robust Photometric–Semantic Reconstruction for Open-Vocabulary 3D Scene Understanding

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/dmucby/SPAR
领域: 3D视觉
关键词: 动态场景重建, 开放词表3D场景理解, 新视角合成, 动态区域预测, 跨视点自监督学习

一句话总结

针对非受限动态环境中运动前景导致的特征几何冲突,SPAR 提出跨视点动态区域预测器与单阶段联合编解码框架,无需运动标注即可在单次前向传播中解耦瞬态干扰并自监督重构多视点一致的静态光度与连续语义场。

研究背景与动机

近年来,新视角合成(NVS)与开放词表语义分割(OVS)的融合推动了前馈式 3D 大模型的发展。诸如 LSM 与 SIU3R 等方法通过结合大重建模型与视觉语言模型,能够直接从稀疏且未校准姿态的图像中前馈推断场景的几何、外观与开放语义场,摆脱了单场景逐个优化神经辐射场(NeRF)或 3D 高斯泼溅(3DGS)的算力瓶颈。然而,现有前馈式 3D 基础模型背后隐藏着一条严格的前提假设:所有输入视点捕获的必须是完全静态的 3D 场景。

在真实世界视频采集中,该静态假设极易被移动的人体、宠物及瞬态物体所打破。由于动态前景在不同帧之间占据不同的 3D 空间坐标,其对应的 2D 像素区域无法在统一的静态世界坐标系中完成几何对齐与聚合。当现有模型强行将这些未解耦的动态区域输入潜在场景表征时,极易造成跨视点特征混叠与几何冲突,在 RGB 渲染中引入严重的鬼影伪影(ghosting artifacts),并致使下游 3D 语义场产生破碎与混淆的预测。虽然 WildRayZer 等近期方案尝试通过掩码抑制动态干扰,但它们通常聚焦于纯几何外观渲染,将外观重建与语义理解拆解为割裂的两阶段流水线,不仅导致误差级联,也忽略了高层语义对外观几何重构的潜在结构正则化增益。

本文的切入角度是打破动态检测、几何外观重建与语义场推断之间的割裂壁垒,在潜在空间聚合之前自适应剥离瞬态运动噪声,并利用任务间的强互补性实现端到端闭环。核心 idea:构建联合语义-几何编码架构 SPAR,在潜在空间融合前通过跨视点动态区域预测器过滤瞬态运动标记,并依托动态区域感知的自监督优化机制利用静态概率软掩码对光度与语义误差进行空间门控加权,实现无标注、单前向的动态鲁棒光度-语义一致性重建。

方法详解

整体框架

SPAR 采用统一的潜空间场景表征编解码架构,输入为未标定相机姿态的动态稀疏多视点图像,输出为目标视点的高保真 RGB 图像以及对齐连续开放词表文本特征的语义特征图。整个流程包含输入标记化与动态过滤、联合光度-语义场景编码、联合双头渲染解码以及动态感知自监督优化四个核心阶段。首先,系统推断每张输入图像的相机位姿并将其与图像/预提取语义特征融合为 Plücker 光线条件化的光度与语义标记;紧接着,跨视点动态区域预测器捕捉视点间运动不一致性,生成瞬态区域掩码并切除受污染标记;随后,场景编码器将清洗后的多视点标记与可学习的全局场景标记深度交互聚合;最后,联合渲染解码器以目标光线为查询,通过双分支 MLP 分别渲染目标视角的外观 RGB 与高维语义嵌入。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["动态多视点输入<br/>RGB与未标定姿态"] --> B["跨视点动态区域预测器<br/>多模态拼接+跨视点注意力"]
    B --> C["动态标记显式空间切除<br/>生成静态软掩码与硬过滤"]
    C --> D["联合光度-语义场景编码器<br/>全局标记与清洗标记交叉交互"]
    D --> E["双头联合渲染解码器<br/>目标视点光线查询与双头MLP"]
    E --> F["动态感知空间门控优化<br/>静态概率加权光度与语义重构"]

关键设计

1. 跨视点动态区域预测器:显式剥离潜在空间瞬态噪声 单视点图像缺乏足够的三维参考信息来区分物体的内在空间形状与动态位移。为了在潜空间聚合前精准剔除动态前景,SPAR 设计了 Cross-View Dynamic Region Predictor(CV-DRP)。对于输入视点图像 \(I_i \in \mathbb{R}^{H \times W \times 3}\),系统首先将其预提取的 LSeg 语义特征 \(F_{sem}^{(i)}\)、光度补丁标记 \(F_{pho}^{(i)}\) 与 Plücker 光线标记 \(T_{ray}^{(i)}\) 沿通道维度拼接,构建富含几何与语义线索的联合表征 \(F^{(i)} \in \mathbb{R}^{N \times 3D}\)。将成对的源视点与参考视点联合特征 \((F^{(i)}, F^{(j)})\) 输入由堆叠 Transformer 自注意力层构成的网络中,建模多视点极线与语义不一致性。最终通过轻量级 MLP 与双线性上采样输出与原图同分辨率的动态概率图 \(P_m^{(i)} \in \mathbb{R}^{H \times W}\),通过设定阈值 \(\tau\) 获得硬切除掩码: $\(M^{(i)} = \mathbb{I}(P_m^{(i)} > \tau)\)$ 在测试阶段,可选引入无监督 SAM2 对该概率先验做边界细化;在训练与推断过程中,该掩码直接作用于输入补丁标记,使得动态区域被物理隔绝在全局场景标记聚合之外,从源头消除了潜在表征的几何冲突。

2. 联合光度-语义场景编码器与双头解码器:统一潜在表征的深度跨模态交互 为了克服传统 3D 高斯或辐射场将高维语义压缩至点基元时造成的表征退化,SPAR 采用统一的全局场景标记交互机制。网络初始化一组可学习的全局紧凑场景标记 \(T_{scene} \in \mathbb{R}^{S \times D}\)(其中 \(S=768\)),并将其与经过动态掩码过滤后的静态光度标记 \(\tilde{T}_{pho,in}\) 及静态语义标记 \(\tilde{T}_{sem,in}\) 拼接为全局输入序列 \(T_{all}\)。通过 \(L=8\) 层的 Transformer 编码器执行自注意力交互,使抽象场景标记充分吸收不同视点间互相补充的几何纹理与高层类别共现先验,截取前 \(S\) 个标记即得到场景统一隐式潜编码 \(T_{scene}'\)。在渲染解码阶段,目标视点的 Plücker 光线分别映射为光度与语义查询标记 \(T_{ray\_pho}^{tgt}\) 与 \(T_{ray\_sem}^{tgt}\),与 \(T_{scene}'\) 拼接送入 \(12\) 层 Transformer 解码器。解码输出的目标特征分别流入外观渲染头 \(\text{MLP}_{pho}\) 与语义对齐头 \(\text{MLP}_{sem}\): $\(R_{pho} = \text{MLP}_{pho}(T_{out\_pho}) \in \mathbb{R}^{M \times 3}, \quad R_{sem} = \text{MLP}_{sem}(T_{out\_sem}) \in \mathbb{R}^{M \times C}\)$ 其中语义分支输出连续的高维嵌入而非固定类别概率,直接继承 CLIP 文本对齐的零样本开放词表辨识能力。

3. 动态区域感知自监督优化:重构驱动的无标注反向学习 动态物体的像素级时序标注成本极高且在开放视频中无法规模化获取。SPAR 提出一种无需真实运动掩码标签的自监督端到端训练范式。其核心洞察在于:静态多视点几何具有极强的几何一致性可解释性,而跨视点运动物体会在静态模型渲染时产生极大的重构残差。基于 CV-DRP 为目标视点预测的动态概率 \(P_m\),网络反转得到静态置信度权重 \(P_s = 1 - P_m\)。在计算目标视点重构损失时,以 \(P_s\) 作为空间连续加权门控,对光度残差与语义相似度损失进行重标度: $\(\mathcal{L}_{pho}^{dyn} = \frac{1}{\sum P_s} \sum P_s \odot \left( \| R_{pho} - I_{tgt} \|_1 + \lambda_{percp} \cdot \mathrm{Percep}(R_{pho}, I_{tgt}) \right)\)$ $\(\mathcal{L}_{sem}^{dyn} = \frac{1}{\sum \hat{P}_s} \sum \hat{P}_s \odot \left( 1 - \frac{R_{sem} \cdot F_{sem}^{tgt}}{\|R_{sem}\|_2 \|F_{sem}^{tgt}\|_2} \right)\)$ 其中 \(\hat{P}_s\) 为下采样后的静态权重。为了防止模型退化为将全图标记为动态的平凡解,引入平滑正则项 \(\mathcal{L}_{reg} = \frac{1}{HW}\sum_{i,j} \text{BCE}(P_m^{(i,j)}, 0)\)。同时,引入针对静态场景的 Copy-Paste 数据增强,将真实前景随机粘贴至静态场景模拟运动前景,并以合成掩码作为弱监督项 \(\mathcal{L}_{mask}\)。双向闭环协同优化下,渲染残差迫使预测器定位跨视点冲突区域,而预测的动态软掩码反过来净化重构监督流,实现完全自闭环端到端学习。

损失函数 / 训练策略

系统总优化目标为多项损失的加权和: $\(\mathcal{L}_{total} = \lambda_{pho} \mathcal{L}_{pho}^{dyn} + \lambda_{sem} \mathcal{L}_{sem}^{dyn} + \lambda_{reg} \mathcal{L}_{reg} + \lambda_{mask} \mathcal{L}_{mask}\)$ 权重设置遵循 \(\lambda_{pho}=1.0\)、\(\lambda_{percp}=0.2\)、\(\lambda_{sem}=0.1\)、\(\lambda_{mask}=1.0\) 以及 \(\lambda_{reg}=0.01\)。模型在 8 张 A800 GPU 上采用 Cosine 学习率退火进行训练。在预训练阶段随机以 10% 概率掩蔽光度标记以赋予模型处理空洞的能力;端到端微调迭代 20K 步,图像分辨率统一设置为 \(256 \times 256\),补丁大小为 \(16 \times 16\)。

实验关键数据

主实验

在非受限室内动态基准 D-RE10K 上,针对不同稀疏输入视点数量(\(n = 2, 3, 4\))进行动态新视角合成评测,输入图像均未标注位姿。结果表明 SPAR 在多视点输入下全面刷新了 SOTA 指标,特别是有效根除了移动物体的鬼影瑕疵。

方法 类型 2 Views PSNR↑ 2 Views LPIPS↓ 3 Views PSNR↑ 3 Views LPIPS↓ 4 Views PSNR↑ 4 Views LPIPS↓
NeRF On-the-go 逐场景优化 15.90 0.582 18.45 0.446 19.52 0.443
3DGS 逐场景优化 13.49 0.605 14.92 0.531 16.28 0.490
Spotless-Splats 逐场景优化 16.45 0.468 17.77 0.394 18.05 0.390
LSM 前馈式模型 10.92 0.636 11.48 0.638 11.42 0.644
SIU3R 前馈式模型 13.01 0.577 13.22 0.564 13.25 0.553
WildRayZer 前馈式模型 21.78 0.308 21.98 0.314 22.38 0.290
SPAR (Ours) 前馈式模型 19.97 0.339 22.15 0.283 23.33 0.263

在运动掩码质量评测中,针对动态区域分割准确率,SPAR 展现出了超越全监督方法的极高定位精度。

方法 监督方式 n=2 mIoU↑ n=2 Recall↑ n=3 mIoU↑ n=3 Recall↑ n=8 mIoU↑ n=8 Recall↑
Co-segmentation 自监督 9.6% 45.0% 13.7% 53.2% 16.3% 45.5%
Segment Any Motion 全监督 31.9% 47.2% 41.2% 57.1% 50.9% 70.8%
WildRayZer 自监督 53.9% 85.1% 52.1% 84.3% 54.2% 87.7%
Ours w/o Refine 自监督 75.9% 85.7% 75.7% 86.4% 76.6% 86.6%
Ours w/ Refine 自监督+SAM2 87.8% 84.7% 88.5% 86.2% 88.3% 85.6%

在 ScanNet 语义理解与视角合成基准测试中(输入 2 视点,预测目标视点),SPAR 同样超越了此前的前馈多任务基准: - 语义分割指标:SPAR 取得 0.5271 mIoU 与 0.8061 准确率(相比 LSM 的 0.5078 mIoU 与 0.7686 准确率显著提升)。 - 光度渲染指标:SPAR PSNR 达到 26.43 dB,超越 LSM(24.39 dB)、Feature-3DGS(24.49 dB)以及 SIU3R(25.10 dB)。

消融实验

消融实验深入验证了动态区域感知优化、语义辅助分支以及各辅助组件的核心增益。

配置 PSNR↑ SSIM↑ LPIPS↓ 说明
无约束基线 (Unconstrained) 15.66 0.489 0.532 忽略动态干扰导致严重鬼影与错位
基线 + 随机标记掩蔽 (Random Mask) 17.10 0.536 0.485 随机掩蔽仅提供有限的泛化正则化 (+1.44 dB)
+ 动态区域感知优化 (Ours) 19.97 0.627 0.339 精准切除动态冲突,光度性能跃升 (+4.31 dB)
完整模型去掉语义分支 (w/o Semantic) 19.77 0.615 0.356 仅做纯几何外观建模,缺乏语义结构先验
完整模型包含语义分支 (Ours) 19.97 0.627 0.339 语义约束带来结构增益,PSNR提升 0.20 dB
完整模型去掉预训练 (w/o Pre-training) 18.66 0.578 0.381 缺失通用重建先验,PSNR大幅下跌 1.31 dB
完整模型去掉Copy-Paste增强 (w/o CPA) 19.82 0.625 0.348 模拟动态数据缺乏导致掩码边缘感知轻微退化
完整模型去掉SAM2后处理 (w/o SAM2) 19.90 0.624 0.341 纯自监督原始掩码已足以支撑高质量 NVS

关键发现

  • 跨任务协同增益(Inter-task Synergy):通常认为在多任务学习中加入语义约束会挤占解码器对高频外观纹理的拟合容量,但实验证实加入连续语义分支后,PSNR 反而稳定提升了 0.20 dB(从 19.77 升至 19.97 dB),LPIPS 从 0.356 显著改善至 0.339。这表明开放词表语义特征为稀疏视点下模糊区域的静态几何重建提供了强有力的结构正则化。
  • 动态区域自监督捕获能力:在完全没有任何真实运动掩码监督的条件下,仅凭动态感知重构误差门控,未经过 SAM2 细化的原始预测模块(Ours w/o Refine)即可在 3 视点下斩获 75.7% mIoU,远超此前自监督基线 WildRayZer 的 52.1%,印证了多视点辐射一致性违背是极其强大的运动指示信号。
  • 极端稀疏视点与多视点扩展性:在仅有 3 或 4 个输入视点时,SPAR 凭借跨视点特征注意力与全局场景标记融合机制,展现出远高于 WildRayZer 的质量增长坡度(4 视点达到 23.33 dB,领先 0.95 dB)。而在 2 视点极难场景下,虽然受限于视差几何约束不足,但仍显著优于开源复现基准。

亮点与洞察

  • 潜在空间先验隔离优于渲染阶段惩罚:不同于在体积渲染或光栅化阶段简单用 loss 权重惩罚动态区域的做法,SPAR 在 Transformer 编码前直接将检测出的动态 patch 标记物理切除,防止动态物体污染全局隐式场景标记 \(T_{scene}\),从信息流源头杜绝了鬼影。
  • 语义场与外观场的共生增强:将连续语义嵌入融入三维全局场景表征,不仅赋予了模型零样本开放词表 3D 分割能力,更通过语义一致性约束反哺了几何与光度渲染,化解了多任务学习中常见的“性能负迁移”难题。
  • 泛化性强的无监督运动先验:该自监督动态区域预测范式无需依赖人工标注,且在未微调的情况下直接在 SpatialVID 大规模室外开阔场景上展现出稳健的前景单车、行人掩码解耦能力,具备极佳的通用落地潜力。

局限与展望

  • 极端两视点几何参考受限:在仅有两个输入视点且基线距离过大时,跨视点极线对应点稀疏,动态区域预测器的置信度容易下降,导致微小非刚性形变被误判为静态遮挡。
  • 高动态背景与光照变化适应性:当前模型基于光度一致性假设推导运动,对于水面波纹、剧烈阴影移动或动态天空等复杂自然环境中的“非刚性静态背景”,可能存在潜在的假阳性动态判断风险。
  • 下游具身交互的实时性延伸:当前架构依赖 Transformer 密集自注意力与连续语义上采样,未来可探索将场景隐式标记高效解耦并映射至轻量级 3D 高斯基元,以满足机器人边缘计算端的高帧率在线交互需求。

相关工作与启发

  • vs LSM (Fan et al., 2024):LSM 首次实现了未标定多视点图像到 3D 语义高斯的单前向预测,但完全假设场景静态,在动态输入下产生毁灭性鬼影,且其高斯基元特征压缩损失严重;SPAR 引入跨视点动态切除与连续全局潜在标记,既克服了动态退化又提高了语义保真度。
  • vs WildRayZer (Chen et al., 2026):WildRayZer 探索了动态环境下的自监督光度视角合成,但忽视了语义理解,且动态掩码质量受限(mIoU 仅约 52-54%);SPAR 通过光度与语义联合表征将自监督掩码 mIoU 提升至 75.7%(Refine 后达 88.5%),并首次实现了动态环境下的联合开放词表理解。
  • vs SIU3R (Wei et al., 2026):SIU3R 提出了免对齐的 2D 到 3D 语义提升方案以支持多任务 3D 理解,但无法应对真实采集中的瞬态前景位移;SPAR 补齐了前馈 3D 理解模型在非受限动态环境中的关键鲁棒性短板。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将前馈式开放词表 3D 理解与动态鲁棒视角合成统一,自监督动态解耦架构设计精巧。
  • 实验充分度: ⭐⭐⭐⭐⭐ 详尽评估了动态 NVS、运动掩码分割、ScanNet 语义理解及室外未见场景泛化,消融全面严谨。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,方法数学公式与架构推演逻辑自洽,图表组织紧凑清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为非受限真实场景下的机器人具身感知与 3D 视觉大模型构建提供了极具实用价值的前馈式范式。