跳转至

Probing the 3D Object-Level Understanding of Pre-Trained Detection Transformers

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/reml-lab/DETRProbe3D/
领域: 3D 视觉
关键词: DETR, 探针分析, 单目深度估计, 3D目标定位, 表示学习

一句话总结

本文提出了一套探测 2D 检测 Transformer 隐式几何表征的方法体系,揭示了在完全没有 3D 监督信号训练下的 DETR 模型查询嵌入中,已自发编码了高度精确的目标级深度和 3D 相机坐标系空间位置信息。

研究背景与动机

以 DETR 为代表的目标检测 Transformer 模型通过编码器-解码器架构与目标查询机制,彻底重塑了 2D 目标检测范式。这些模型仅使用包含 2D 边界框与离散类别标签的普通图像数据集(如 COCO)进行端到端优化,并不依赖传统的人工先验或非极大值抑制。随着视觉基础模型的发展,研究者发现自监督视觉骨干(如 DINOv2、Stable Diffusion)在通用密集特征中蕴含了丰富的 3D 几何与物理线索,促使学界对无 3D 监督模型的几何感知能力产生了浓厚兴趣。

然而,过去的模型表征探测工作几乎完全聚焦于通用骨干网络特征、密集特征图或池化后的全图/区域特征,即便针对目标检测器的可解释性研究,也仅限于传统的卷积检测网络。针对当前主流的检测 Transformer,其最核心的决策载体——解码器输出的物体级查询嵌入(Object-level Query Embeddings),是否以及在多大程度上自发习得了物体的 3D 几何属性,此前在学术界依然是一片完全未知的空白。

理解 2D DETR 查询嵌入中的 3D 信息,对于厘清 Transformer 目标交互机制、评估 2D 预训练对 3D 感知任务的表征迁移价值至关重要。本文的核心 idea 是通过构建物体级单目深度与相机坐标系 3D 定位探针任务体系,在严格冻结 2D 检测器权重的前提下,利用轻量线性与非线性探针探测 DETR 系列模型解码器查询嵌入中涌现的 3D 空间理解能力。

方法详解

整体框架

本文构建了一套用于系统评测预训练 2D DETR 隐空间 3D 物体属性的探针评测管线。整个流程由预训练检测器前向推理、候选物体置信度初筛、多模型几何对齐过滤、以及冻结检测器下的轻量探针训练四个阶段构成。输入为单目 RGB 图像,预训练 2D 检测器生成一组物体级查询嵌入及其对应的 2D 预测框与分类概率;通过将筛选出的查询嵌入输入到独立的轻量探针网络中,最终直接预测物体的相机深度或 3D 空间中心坐标。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单目 RGB 图像输入"] --> B["预训练 2D DETR 前向推理<br/>提取解码器最后一层查询嵌入 q"]
    B --> C["物体置信度阈值初筛<br/>过滤前景概率低于阈值的背景查询"]
    C --> D["跨模型几何对齐与真值匹配<br/>IoU贪婪匹配建立探针监督对"]
    D --> E["探针表征预测与空间解码<br/>线性映射与双层 MLP 探针回归"]
    E --> F["输出 3D 几何属性<br/>物体深度 d 与 3D 空间中心 (x, y, z)"]

关键设计

1. 物体置信度阈值初筛与属性配对:构建无偏探针数据集 针对 DETR 模型固有的固定数量查询(如 100 或 300 个)输出机制,绝大多数查询槽位实际对应图像背景或低置信度候选,无法与真实场景中的具体物理对象形成有效对应。为构建可靠的探针训练监督对 \((q_n, p_n)\),系统首先对模型预测的前景分类概率向量设置前景置信度阈值 \(\tau = 0.5\),仅保留显著高于阈值的物体查询嵌入。对于单目深度估计任务,系统直接以检测器预测的 2D 边界框中心坐标在稠密深度图上采样标量深度 \(d_n\) 作为真值;对于 3D 目标定位任务,系统则将 2D 预测框与数据集标注的 2D 真实框计算交并比(IoU),执行贪婪双射匹配,将成功匹配样本对应的 3D 边界框下底面中心坐标 \((x_n, y_n, z_n)\) 绑定至对应的查询嵌入向量。

2. 跨模型几何对齐过滤机制:消除检测精度差异导致的评测偏差 不同检测 Transformer 变体在特征提取、注意力机制和检测精度上存在客观差异,其输出的有效检测集合并不完全重合。若各模型在完全不同的物体分布子集上评估探针性能,评测结果将混淆「检测召回能力的差异」与「隐空间 3D 表征丰富度的差异」。为此,本文设计了基于基准锚点模型(Anchor Model,实验中选用原始 DETR)的跨架构几何对齐机制。系统计算锚点模型的预测框与其他变体模型预测框之间的空间 IoU,以 \(\text{IoU} \ge 0.5\) 进行阈值过滤与贪婪匹配,最终强制保留所有候选 DETR 模型同时成功检测出的物体交集,从而在绝对公平一致的物体实例测试基准上横向比较不同架构的 3D 解码能力。

3. 双层非线性空间解码探针:探寻几何信息的流形非线性映射 探测模型隐空间表征复杂度需要区分信息的「线性可读性」与「非线性隐含性」。本文同时构建了单层仿射变换的线性探针 \(f_{\theta}^{\text{lin}}(q) = W q + b\) 与包含两层全连接及 ReLU 激活函数的非线性 MLP 探针 \(f_{\theta}^{\text{mlp}}(q) = W_2 \text{ReLU}(W_1 q + b_1) + b_2\)(隐层维度统一设为 256)。整个探测过程中检测器所有骨干与解码器权重严格保持冻结,探针网络仅以均方误差(MSE)为损失函数优化自身参数。对比两类探针的表现能够清晰揭示 2D 检测器在多层交叉注意力交互后所形成几何流形的非线性程度。

损失函数 / 训练策略

在探针模型的优化过程中,目标检测器权重完全冻结,探针模型独立训练。探针优化采用均方误差损失函数(MSE Loss):

\[\mathcal{L}_{\text{probe}}(\theta) = \frac{1}{M_{\text{tr}}} \sum_{n=1}^{M_{\text{tr}}} \| f_{\theta}(q_n) - p_n \|_2^2\]

实验中采用 Adam 优化器,基础学习率设为 \(10^{-3}\),批处理大小(batch size)设为 512。对于深度估计 MLP 探针,训练总轮数为 1000 个 epoch,其中前 20 个 epoch 进行学习率预热(warm-up),随后采用余弦退火(cosine decay)策略衰减学习率。评测指标采用平均绝对误差(MAE)、阈值准确率(\(\delta_1 < 1.25\))以及绝对相对误差(AbsRel)。

实验关键数据

主实验

论文在室外自动驾驶合成数据集 Virtual KITTI 2、室内真实场景 RGB-D 数据集 NYUv2 以及自动驾驶物理基准 KITTI 上分别对 5 种代表性 2D DETR 模型(DETR、Conditional DETR、Deformable DETR、LW-DETR、RT-DETR v2)进行了全面测试,并与专门的 3D 视觉基础模型 Depth Anything 2 及单目 3D 检测器 MonoDETR 展开对标。

单目深度估计主实验结果如下表所示:

模型 探针类型 Virtual KITTI 2 (室外) MAE (m) ↓ Virtual KITTI 2 AbsRel (%) ↓ Virtual KITTI 2 \(\delta_1\) (%) ↑ NYUv2 (室内) MAE (m) ↓ NYUv2 AbsRel (%) ↓ NYUv2 \(\delta_1\) (%) ↑
DETR Linear 1.01 8.29 93.10 0.58 24.30 57.22
Conditional-DETR Linear 1.13 9.07 92.57 0.53 22.52 60.96
Deformable-DETR Linear 1.06 8.34 91.78 0.56 23.45 59.91
LW-DETR Linear 1.26 9.84 91.38 0.59 25.30 58.70
RT-DETR v2 Linear 1.56 12.49 86.21 0.64 26.80 55.22
DETR MLP 0.54 3.62 98.81 0.51 20.20 65.48
Conditional-DETR MLP 0.69 4.39 98.67 0.50 19.99 66.78
Deformable-DETR MLP 0.65 4.05 98.94 0.54 21.49 63.65
LW-DETR MLP 0.88 5.63 98.01 0.55 22.65 62.70
RT-DETR v2 MLP 1.05 6.73 97.21 0.56 22.70 60.43
Depth Anything 2 (Zero-shot) - 1.49 9.13 97.88 0.61 24.21 59.57
MonoDETR (Zero-shot) - 3.83 39.82 64.72 10.59 497.72 0.00
MonoDETR (MLP head) - 0.47 3.14 99.42 0.75 21.49 62.50
Depth Anything 2 (MLP head) - 0.50 3.30 99.47 0.36 13.36 84.00

在 KITTI 基准上的 3D 目标空间中心定位预测实验中,各模型预测误差如下表所示:

模型 x MAE (m) ↓ y MAE (m) ↓ z MAE (m) ↓ 中心整体 MAE (m) ↓ 中心 AbsRel (%) ↓
DETR 0.33 0.12 1.03 0.50 2.40
Conditional-DETR 0.68 0.16 1.09 0.64 3.01
Deformable-DETR 0.66 0.16 1.04 0.62 2.90
RT-DETR v2 2.27 0.18 1.39 1.28 6.49
LW-DETR 2.28 0.17 1.20 1.22 6.01
MonoDETR (全3D监督) 0.19 0.06 0.64 0.30 1.41

消融实验

为验证探针性能究竟来自查询嵌入本身丰富的高维语义表征,还是仅靠检测器输出的 2D 边界框几何外形(尺寸与位置先验)推导而来,论文在相同实验配置下对比了以 2D 边界框 \((x, y, w, h)\) 作为输入的基线探针:

方法与输入表征 探针架构 Virtual KITTI 2 MAE (m) ↓ Virtual KITTI 2 AbsRel (%) ↓ Virtual KITTI 2 \(\delta_1\) (%) ↑ NYUv2 MAE (m) ↓ NYUv2 AbsRel (%) ↓ NYUv2 \(\delta_1\) (%) ↑
DETR 预测边界框 (Bbox) Linear 4.27 32.67 44.69 0.87 37.61 41.74
DETR 查询嵌入 (Embedding) Linear 1.01 8.29 93.10 0.58 24.30 57.22
DETR 预测边界框 (Bbox) MLP 1.02 7.09 95.76 0.77 32.98 51.83
DETR 查询嵌入 (Embedding) MLP 0.54 3.62 98.81 0.51 20.20 65.48

关键发现

  • 非线性探针显著优于线性探针:在 Virtual KITTI 2 上,DETR 嵌入的 MLP 探针将 MAE 从 1.01m 压缩至 0.54m,AbsRel 误差由 8.29% 锐减到 3.62%,证明 3D 几何特征以高度非线性的形式内嵌在查询表征流形中。
  • 超越零样本专业 3D 大模型:所有使用 MLP 探针的标准 2D DETR 模型在 Virtual KITTI 2 和 NYUv2 上的深度估计 MAE 均优于未经领域微调的 Depth Anything 2 零样本表现(例如 DETR 的 0.54m vs Depth Anything 2 的 1.49m)。
  • 与完全监督 3D 检测器差距微弱:在物体中位数距离达 25.3m 的 KITTI 测试集上,冻结的 2D DETR 经 MLP 探针解码的中心 MAE 达到 0.50m(相对误差仅 2.40%),与使用完整 3D 边界框监督训练的 MonoDETR(0.30m MAE)差距仅为 0.2 米左右。
  • 轻量化与实时化架构损失 3D 表征丰富度:RT-DETR v2 与 LW-DETR 在深度和空间定位误差上均显著高于标准 DETR 与 Deformable DETR,在 KITTI 上的中心定位误差翻倍(1.28m 与 1.22m),表明降低层数及限制跨尺度全注意力会牺牲细粒度几何线索的沉淀。
  • 低维子空间高度浓缩几何信息:PCA 降维实验表明,当查询嵌入压缩至仅 40-60 个主成分维度时,深度预测性能即可迅速饱和并逼近原维度表现,证明 3D 深度特征紧凑集聚于特定子空间中。

亮点与洞察

  • 实验视角的范式破局:跳出了过往探测工作仅局限于自监督骨干密集特征图的桎梏,首次将探针工具切入 2D Transformer 检测器的核心推理单元——目标查询嵌入(Query Embeddings),直观确证了高层目标级语义具备自发重构物理空间几何的能力。
  • 揭示 2D 检测表征对 3D 标注的信息超越:消融实验彻底排除了「探针仅依靠 2D 框透视外形反推深度」的质疑,嵌入探针相较框探针的巨大优势证明查询向量中沉淀了环境语境、物体类属尺度先验以及丰富的空间遮挡关系。
  • 对实时架构设计的深刻启发:阐明了在追求实时性(如 RT-DETR、LW-DETR)而剪裁跨尺度交互时,模型隐空间损失最严重的实际上是对下游空间任务极具价值的隐式几何理解力,为后续多任务与具身感知检测器的架构权衡指明了方向。

局限与展望

  • 作者指出的局限:目前探测的 3D 几何属性集中在物体标量深度与 3D 空间中心,尚未扩展至更为复杂的 3D 定向角(Yaw/Pitch/Roll)及物理三维包围框尺寸(长宽高);此外室内场景 NYUv2 受限于单目相机真值噪声,深度探测范围受到了一定制约。
  • 推断与潜在局限:数据对齐机制虽然排除了漏检干扰,但筛选后的交集可能偏向易检目标,潜在高估了恶劣光照或严重遮挡等极端工况下的几何感知能力;且探针模型引入的双层全连接层在一定程度上充当了隐空间到绝对物理尺度的坐标系校准器。
  • 未来方向:探究能否将 2D 预训练 DETR 的查询嵌入作为即插即用的几何先验直接接入单目 3D 检测与自动驾驶感知网络,避免昂贵的从头端到端 3D 训练。

相关工作与启发

  • vs Depth Anything / DINOv2 探针工作: 前期工作(如 El Banani 等人)集中证明了基础视觉大模型骨干网络含有密集几何特征,但需要密集的空间解码头;本文证明了面向离散物体的检测器查询同样隐式内化了精准的物理 3D 空间实体信息。
  • vs MonoDETR 等单目 3D 检测模型: MonoDETR 需要复杂的双通路深度引导编码器与昂贵的 3D 边界框标注训练;本文证明标准 2D DETR 已经完成了绝大部分 3D 几何特征的隐式抽取,仅需极轻量输出头即可达到极度接近的定位精度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性针对 2D 检测 Transformer 物体查询嵌入进行 3D 几何理解能力的深度探针分析。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 种主流 DETR 架构、室内外多源数据集、线性与非线性探针、PCA 压缩及 2D 框消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 实验协议设计严密,变量控制清晰,对齐过滤与基准对比逻辑极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 为单目 3D 检测的迁移学习与端到端具身目标表征理解提供了关键的基础认知与实验依据。