PUF: Plug-and-Play Uncertainty-Aware Fusion for Online 3D Scene Graph Generation¶
会议: ECCV 2026
论文: CVF Open Access
代码: https://github.com/yyyyangyi/PUF
领域: 3D视觉
关键词: 场景图生成 / 3D场景图 / 不确定性感知 / 狄利克雷分布 / 即插即用
一句话总结¶
针对在线 3D 场景图生成中确定性融合忽略观测截断、2D 模型预测与 3D 几何表征三大不确定性的缺陷,提出免训练即插即用融合框架 PUF,通过概率化节点关联、双路狄利克雷证据累积及类别条件关系先验,在仅 15 ms 实时延迟下将 3DSSG 关系召回率大幅提升 18.1 个百分点。
研究背景与动机¶
在线 3D 场景图生成致力于从连续的 RGB-D 视频流中实时构建包含物体三维几何、语义类别以及物体间空间与谓词关系的全局图结构,是具身导航、机器人灵巧操作与空间多轮问答等具身智能任务的关键环境表征。离线 3D 场景图方法通常依赖完整点云重构与全局图卷积消息传递,不仅计算开销巨大、无法满足在线交互的实时性要求,而且高度依赖代价昂贵的三维真值标注。近年来,基于 2D 检测骨干直接向 3D 空间在线投影提升(lifting)的范式逐渐兴起,代表性方案如 FROSS 结合了轻量化 2D 场景图模型与 3D 高斯投影,实现了超越实时的运行速度。
然而,现存的在线 2D-to-3D 融合管线普遍采用完全确定性的硬决策合并策略,系统性忽略了在线观测过程中的三种本质不确定性:一是相机视场受限与局部遮挡引起的观测不确定性,尤其是成对物体关系需要两端物体在单帧内同时高质量被观测,极易因截断而失效;二是 2D 场景图预测模型本身输出的连续置信度分布被硬取最大值(\(\operatorname{argmax}\))截断,模型语义与谓词的内在不确定性被直接丢弃;三是单帧深度图存在传感器噪声,将 2D 框反投影为 3D 高斯或体素等粗粒度三维表征时引入了空间几何与位置的不确定性。现有方法在节点关联时强行设定绝对欧氏距离或空间交叠硬阈值,并在合并时直接覆盖标签,导致局部几何误差轻易否决语义正确的关联,且无法向邻近候选节点重新分配置信证据。
为打破硬决策融合带来的误差累积与关系稀疏瓶颈,本文的核心 idea 是将在线 2D-to-3D 场景图构建重塑为保留全量概率分布的免训练不确定性感知融合框架,利用空间与语义联合似然实现概率化节点关联,通过狄利克雷证据累积在候选节点间软分配观测证据,并借助贝叶斯类别条件关系先验自适应补偿稀疏共视边缘。
方法详解¶
整体框架¶
PUF 整体管线接收连续输入的 RGB-D 视频流 \(\{(I_t, D_t, T_t)\}\),无需存储全局历史帧即可在线维护全局有向场景图 \(\mathcal{G}=(\mathcal{V}, \mathcal{E})\)。在每一帧,系统首先利用实时 2D 场景图骨干网络(RT-DETRv2 检测器结合 EGTR 关系预测器)提取 2D 物体候选框的完整类别概率分布 \(\hat{p}_{obs}^c \in \Delta^{C-1}\) 与候选对之间的关系概率分布 \(\hat{p}_{obs,j}^r \in \Delta^{R-1}\);接着,通过深度反投影将检测框提升为局部三维观测节点,支持 3D 高斯分布 \(\Omega=(\mu, \Sigma)\) 或离散体素集 \(\Psi\) 两种空间几何后端;最后,进入不确定性感知融合阶段,计算当前观测与全局节点间的语义-空间联合似然与新生概率,基于狄利克雷累积器更新全局节点及边的证据分布,并在后处理中引入类别与空间关系先验补全稀疏未观测边缘。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入 RGB-D 视频流与相机位姿"] --> B["2D SGG 软分布输出与 3D 几何提升"]
B --> C["概率化节点关联<br/>语义空间因子化似然与独立边缘化"]
C -->|关联概率 beta <= 0.5 且超过阈值| D["狄利克雷证据累积<br/>语义软分配与空间更新解耦"]
C -->|新生概率 beta_birth > 0.5| E["初始化全局新节点与新边"]
D --> F["类别条件关系先验<br/>共轭先验补偿稀疏共现边缘"]
E --> F
F --> G["输出全局不确定性感知 3D 场景图"]
关键设计¶
1. 概率化节点关联:因子化联合似然与独立边缘化
传统方法在将当前帧检测关联到全局 3D 节点时,依赖硬性的空间交并比(IoU)或距离门控阈值,一旦几何反投影存在深度漂移就会直接导致关联失败。为此,PUF 将节点关联表述为语义与空间因子的联合似然度量: $\(L[obs, k] = L_{\text{sp}}(obs, k) \cdot L_{\text{se}}(obs, k)\)$ 其中空间因子 \(L_{\text{sp}}(obs, k)\) 根据 3D 表征后端进行连续量化:在 3D 高斯表征下,采用巴氏系数(Bhattacharyya Coefficient, BC)衡量两组高斯分布的连续空间重叠程度,\(BC = 1 - H^2\)(\(H\) 为海林格距离);在体素表征下,采用观测体素集在全局体素集中的包含度得分 \(|\Psi_{obs} \cap \Psi_k| / |\Psi_{obs}|\)。语义因子 \(L_{\text{se}}(obs, k)\) 则通过比较观测类别概率与全局节点狄利克雷后验均值向量 \(\bar{\alpha}_k\) 之间的 Jensen-Shannon 散度(JSD)实现: $\(L_{\text{se}}(obs, k) = \exp\left(-\frac{\text{JSD}(\hat{p}_{obs}^c, \bar{\alpha}_k)}{\sigma_{\text{se}}}\right)\)$ 超参数 \(\sigma_{\text{se}}\) 充当语义选择性带宽。为避免传统联合概率数据关联滤波器(JPDAF)指数级复杂的假设枚举,PUF 结合 DETR 框架单帧无重复检测的先验,引入局部新生先验 \(\lambda_{\text{birth}}\) 对所有全局候选节点似然进行独立归一化边缘化,得到关联后验 \(\beta[obs, k]\) 与新生概率 \(\beta_{\text{birth}}\)。当 \(\beta_{\text{birth}} > 0.5\) 时,确定为新物体并初始化全局节点;否则,将观测信息平滑分发给所有满足关联置信度 \(\beta[obs, k] \ge \beta_{\text{min}}\) 的候选节点。
2. 狄利克雷证据累积:语义软分配与空间更新解耦
为了完整保留多帧观测的置信度演化并表达模型不确定性,PUF 放弃单一的类别预测硬计数,将每个全局 3D 节点 \(V_k\) 的类别分布和有向边 \(E_{ij}\) 的谓词分布建模为狄利克雷共轭后验:\(\hat{p}_k^c \sim \operatorname{Dir}(\boldsymbol{\alpha}_k)\),\(\hat{p}_{ij}^r \sim \operatorname{Dir}(\boldsymbol{\phi}_{ij})\)。当观测与已有节点成功关联时,各候选节点的累积参数依据关联后验权重接收软分配证据: $\(\boldsymbol{\alpha}_k \leftarrow \boldsymbol{\alpha}_k + \beta[obs, k] \cdot \hat{p}_{obs}^c, \quad \forall k: \beta[obs, k] \ge \beta_{\text{min}}\)$ 边上的关系累积器 \(\boldsymbol{\phi}_{kj}\) 与 \(\boldsymbol{\phi}_{ik}\) 也按完全一致的关联权重和当前帧 2D 关系分布 \(\hat{p}_{obs,j}^r\) 与 \(\hat{p}_{i,obs}^r\) 进行双向软更新。尤为关键的是,PUF 提出了语义软合并与空间更新解耦准则:一个真实物体的语义类别在观测初期可能是 60% 椅子与 40% 桌子的模糊混合体,因此语义分布应当跨候选节点软融合;但该物体在物理空间上绝不可能分裂或漫延为多实体,若将空间几何平均分摊给所有候选节点将导致严重的三维几何位置漂移。因此,空间几何属性(高斯均值、协方差或体素占用)仅对后验最大匹配节点 \(k^* = \arg\max_k \beta[obs, k]\) 执行更新,有效保证了三维定位的几何保真度。
3. 类别条件关系先验:多因子共轭先验补全稀疏关系
在室内动态扫描中,因相机视场狭窄,大量物体对极少在单帧内同时完整出现(3DSSG 数据集中 25.3% 的真值物体对共视少于 10 帧,2.7% 从未在单帧共现)。针对这一严重的局部共视缺陷,PUF 引入与狄利克雷累积器完美闭环的贝叶斯共轭先验分布 \(\boldsymbol{\phi}_{ij}^{\text{prior}}\)。该先验由三个因子显式分解构成: $\(\boldsymbol{\phi}_{ij}^{\text{prior}} = P_{\text{cl}}(r \mid c_i, c_j) \cdot P_{\text{sp}}(\mu_i, \mu_j) \cdot P_{\text{ex}}(c_i, c_j)\)$ 其中 \(P_{\text{cl}}(r \mid c_i, c_j)\) 是在训练集标注统计上基于拉普拉斯平滑(\(\varepsilon = 0.1\))离线预计算的类别条件谓词概率;\(P_{\text{sp}}(\mu_i, \mu_j) = \exp(-\|\mu_i - \mu_j\|_2)\) 基于三维质心间欧氏距离在线计算,令物理距离遥远的物体对关联概率呈指数衰减;\(P_{\text{ex}}(c_i, c_j)\) 则是该类别对在训练集中存在任意交互关系的经验比例门控,用于抑制不合理关系的大面积虚警。对于存在观测的边缘,最终谓词分布直接采用贝叶斯后验 \(\boldsymbol{\phi}_{ij}^{\text{post}} = \boldsymbol{\phi}_{ij}^{\text{prior}} + \boldsymbol{\phi}_{ij}\);对于从未被单帧同时观测到的物体对,当先验最大分量 \(\max(\boldsymbol{\phi}_{ij}^{\text{prior}}) > 0.5\) 时,先验能够自动完成拓扑边缘补全,真正实现兼顾在线数据驱动与统计常识的鲁棒推断。
损失函数 / 训练策略¶
PUF 属于完全免训练(training-free)的推断期算法,本身不包含任何需要梯度回传训练的可学习网络参数。其所依赖的底层 2D 场景图网络采用预训练权重:在 3DSSG 数据集上,遵循 FROSS 的基线配置,使用由 3DSSG 训练集 2D 提取数据训练好的 RT-DETRv2-M 与 EGTR 组合;在 ReplicaSSG 数据集上,直接迁移由 Visual Genome 数据集预训练的模型,进行完全零样本(zero-shot)的泛化评测。先验统计信息 \(P_{\text{cl}}\) 与 \(P_{\text{ex}}\) 仅需对训练集真值关系执行一次轻量遍历统计即可获得。
实验关键数据¶
主实验¶
论文在室内场景基准 3DSSG 测试集与跨域零样本 ReplicaSSG 测试集上进行了系统评估。评估指标遵循标准协议,涵盖综合关系召回率(Rel. Recall)、物体检测召回率(Obj. Recall)、已知物体下的谓词分类召回率(Pred. Recall),以及用于评估长尾谓词平衡性的均值召回率(mRecall)。
在 3DSSG 测试集上与代表性离线点云方法、RGB-D+SLAM 方案及在线提升方案的对比如下:
| 方法 | 输入模态 | 关系召回 Rel. R@1 (%) | 物体召回 Obj. R@1 (%) | 谓词召回 Pred. R@1 (%) | 物体均值召回 mR@1 (%) | 谓词均值召回 mR@1 (%) | 延迟 Latency (ms) |
|---|---|---|---|---|---|---|---|
| 3DSSG [32] | 点云 (Point Cloud) | 12.9 | 37.4 | 22.0 | 26.2 | 14.4 | - |
| VL-SAT [33] | 点云 (Point Cloud) | 23.5 | 53.7 | 28.9 | 42.1 | 25.3 | - |
| OCRL [10] | 点云 (Point Cloud) | 25.2 | 58.5 | 30.1 | 49.6 | 27.1 | - |
| SGFN [35] | RGB-D + SLAM | 22.0 | 51.6 | 27.5 | 37.7 | 24.0 | 245 |
| MonoSSG [34] | RGB-D + SLAM | 23.3 | 53.8 | 28.4 | 43.8 | 26.6 | 283 |
| SCRSSG [40] | RGB-D + SLAM | 25.7 | 61.1 | 27.6 | 60.5 | 27.8 | 350 |
| VGfM [8] | RGB | 19.6 | 50.0 | 20.4 | 34.8 | 11.0 | 379 |
| IMP [37] | RGB-D | 19.7 | 49.5 | 20.9 | 34.7 | 13.8 | - |
| Kim et al. [13] | RGB-D | 9.1 | 59.0 | 7.1 | 51.0 | 8.0 | 454 |
| FROSS [11] | RGB-D | 27.9 | 62.5 | 33.2 | 63.8 | 18.1 | 13 |
| PUF-Voxel (本文) | RGB-D | 40.3 | 65.5 | 46.1 | 64.1 | 21.8 | 31 |
| PUF-Gaussian (本文) | RGB-D | 46.0 | 69.7 | 51.4 | 65.8 | 28.2 | 15 |
在零样本跨域数据集 ReplicaSSG 测试集上的对比表现(无先验条件):
| 方法 | 关系召回 Rel. R@1 (%) | 物体召回 Obj. R@1 (%) | 谓词召回 Pred. R@1 (%) | 物体均值召回 mR@1 (%) | 谓词均值召回 mR@1 (%) | 延迟 Latency (ms) |
|---|---|---|---|---|---|---|
| FROSS [11] | 22.5 | 26.2 | 28.0 | 29.1 | 20.6 | 14 |
| PUF-Voxel (本文) | 22.4 | 27.9 | 26.9 | 30.2 | 17.9 | 30 |
| PUF-Gaussian (本文) | 25.3 | 31.0 | 35.6 | 33.7 | 26.2 | 16 |
消融实验¶
论文在 3DSSG 测试集上对节点狄利克雷累积(含概率化关联)、边狄利克雷累积及关系先验进行了逐项正交消融:
| 节点累积 Node | 边累积 Edge | 关系先验 Prior | 3D 高斯 Rel. R@1 (%) | 3D 高斯 Obj. R@1 (%) | 3D 高斯 Pred. R@1 (%) | 3D 高斯 Latency (ms) | 体素 Rel. R@1 (%) | 体素 Obj. R@1 (%) | 体素 Pred. R@1 (%) | 体素 Latency (ms) |
|---|---|---|---|---|---|---|---|---|---|---|
| ✗ | ✗ | ✗ (FROSS) | 27.9 | 62.4 | 33.2 | 13.2 | 23.7 | 61.6 | 29.5 | 28.9 |
| ✓ | ✗ | ✗ | 31.3 | 69.0 | 36.6 | 14.6 | 28.6 | 64.9 | 33.4 | 31.0 |
| ✓ | ✓ | ✗ | 33.9 | 69.0 | 39.2 | 14.7 | 31.3 | 64.9 | 35.2 | 31.3 |
| ✗ | ✓ | ✗ | 27.9 | 62.9 | 33.7 | 13.5 | 24.2 | 61.8 | 30.6 | 29.2 |
| ✗ | ✓ | ✓ | 41.4 | 62.9 | 47.8 | 13.5 | 37.2 | 61.8 | 40.0 | 29.2 |
| ✓ | ✓ | ✓ (完整模型) | 46.0 | 69.7 | 51.5 | 14.8 | 40.3 | 65.5 | 46.1 | 31.3 |
关键发现¶
- 各模块收益明确且完全解耦:仅引入节点狄利克雷累积与概率关联,3D 高斯后端的端到端关系召回即由 27.9% 提升至 31.3%(+3.4%),物体召回从 62.4% 跃升至 69.0%(+6.6%);在此基础上引入边狄利克雷累积进一步使关系召回达到 33.9%(+2.6%);最终引入关系先验后,关系召回暴增至 46.0%(相比 FROSS 累计提升 18.1%)。
- 表征无关的通用性验证:无论在紧凑连续的 3D 高斯后端还是离散网格的 3D 体素后端,PUF 各组件均展现出严格一致的单调增益趋势,证实框架对不同 3D 几何表征具备高度普适性。
- 稀疏共视区间的先验行为:数据分桶分析显示,关系先验在共现次数低于 10 帧的稀疏区间提升最大,随共视帧数增长其边际增益平滑递减;且即使不加载先验(w/o Prior),PUF 在所有共视区间仍系统性超越 FROSS,证明概率融合机制本身对低频与高频观测均有本质改善。
- 超参数鲁棒性强:语义带宽 \(\sigma_{\text{se}} = 0.3\) 与新生先验 \(\lambda_{\text{birth}} = 0.4\) 在 3DSSG 和 ReplicaSSG 两个异构数据集上展现出完全一致的最优点,对轻微调参并不敏感。
亮点与洞察¶
- 不确定性全链路无损传递:以往在线 SGG 在 2D 识别后强行执行 \(\operatorname{argmax}\) 截断为独热标签,PUF 首次借助狄利克雷分布的共轭特性,将 2D 预测熵无缝保留至 3D 图谱累积器中,为下游具身决策提供了可信的置信度度量。
- 语义软平滑与空间单目标更新解耦:巧妙化解了“贝叶斯概率分配”与“三维实体不可分割性”的根本矛盾,允许语义标签在候选节点间概率混合,而严格将几何更新限制在最强候选上,彻底避免了三维场景图常见的空间几何重影与漂移。
- 免训练即插即用极速特性:无需对底层检测与 2D 场景图网络做二次训练或微调,额外融合耗时仅在 1~2 ms 之间(整体延迟仅 15 ms),比传统的全局 SLAM 优化快一个数量级,非常适合落地于计算资源受限的边缘移动机器人。
局限与展望¶
- 先验对统计分布的依赖性:类别条件关系先验强烈依赖于源域场景(如 3DSSG)中物体对关系的经验共现统计,若在全新未见的大相径庭场景(如缺乏监督的开放世界)中,离线统计先验可能引入域偏差或无法直接使用。
- 静态刚性场景假设:当前几何提升与狄利克雷累积均假设室内场景中的物体为静态刚体,未显式建模物体的动态位移或人机交互过程中的拓扑关系动态重组。
- 未来改进方向:可进一步探索结合开放词表大视觉语言模型(Open-Vocabulary VLM)的实时常识推理以替代离线统计先验,并将时间衰减机制引入狄利克雷累积器,以支持动态开放环境中的增量时序场景图生成。
相关工作与启发¶
- vs FROSS [11]: FROSS 奠定了 2D SGG 结合 3D 高斯投影的在线极速流水线,但其数据关联基于硬欧氏距离且合并阶段使用独热标签覆盖;PUF 继承其高效投影优势,提出了连续联合似然与狄利克雷累积,在几乎零额外耗时(15 ms vs 13 ms)的前提下实现了关系召回率近翻倍的质的飞跃。
- vs SGFN [35] & SCRSSG [40]: SGFN 与 SCRSSG 严重依赖重型密集 SLAM 稠密重构与全局后验统计重打分,推理延迟高达 245~350 ms;PUF 完全摒弃密集重建,利用概率化免训练融合在纯在线流式计算下全面反超其关系抽取质量。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次全面系统解构在线 3D 场景图三大不确定性,提出优雅的狄利克雷证据融合与语义-空间解耦机制。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 3DSSG 与 ReplicaSSG 双基准,提供高斯/体素双后端验证、详尽的正交消融与共视分桶分析。
- 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰完备,动机与机制阐述环环相扣,图表详实规范。
- 价值: ⭐⭐⭐⭐⭐ 兼具极高学术洞见与显著工程落地价值,即插即用、免训练、实时性强,为具身智能在线建图提供了优秀范式。