跳转至

Rethinking Detection Calibration: A Coordinate Perspective

会议: ECCV 2026
论文: ECCV 2026
领域: 目标检测
关键词: 置信度校准, 目标检测, 坐标级校准, 偏移方向估计, 可解释性

一句话总结

针对传统目标检测置信度校准仅衡量全框级 IoU 或精度而忽略各坐标轴向独立对齐与偏移方向的问题,本文提出后验校准框架 ReDC,通过坐标对齐比率(CAR)、置信度重编码(CR)与方向位移估计(DDE),在确定性检测器上实现了细粒度的坐标级置信度与偏移方向校准,同时精准逼近全框级 IoU。

研究背景与动机

在自动驾驶、智慧医疗与安防监控等安全关键领域,深度神经网络驱动的目标检测器不仅需要出色的检测精度,更需要具备可信的置信度估计。现代深度检测器普遍存在过度自信(overconfidence)现象,即对严重偏差甚至错误的预测赋予极高置信度。为了让预测置信度与真实经验精度保持一致,研究者广泛探索了置信度校准技术。然而与图像分类不同,目标检测中的经验精度严重依赖边界框定位质量,传统校准方法通常在检测框级别定义经验精度——例如采用固定 IoU 阈值下的查准率(Precision),或者直接校准置信度以逼近框级别的 IoU 值。

然而,这种框级别的经验精度存在严重的表征盲区。具有完全相同框级 IoU 的两个检测框,在空间几何上可能呈现截然不同的局部对齐状态与轴向位移。例如一个预测框可能在上下边界与真值完美贴合,而左右边界发生巨大偏差;又或者预测框由于向上偏移且尺寸偏小,导致在自动驾驶中被判定为更远的目标,从而推迟刹车决策。虽然概率目标检测器尝试通过为坐标预测高斯分布来建模局部不确定性,但这类方法通常将坐标方差坍缩为全框指标,无法指出具体的偏移方向,且要求检测器本身具备概率输出架构,难以直接应用于广泛部署的确定性目标检测器。

本文的切入点在于打破“将整个检测框视为单一校准单元”的传统范式,主张从细粒度的坐标与方向双重视角重构检测校准。本文的核心 idea 是:将边界框经验精度解耦为各坐标轴向的坐标对齐比率(CAR),通过轻量后验重编码网络将框回归特征注入分类 logits 预测坐标级置信度,并结合多层感知机预测各坐标相对于真值的偏差方向(DDE),最后将坐标级置信度与方向信息自底向上聚合以精准逼近全框 IoU。

方法详解

整体框架

ReDC 作为一个轻量级、与检测器架构解耦的后验校准(post-hoc calibration)框架,直接挂载于预训练且冻结参数的确定性检测器之上。给定输入图像,冻结的主干网络与特征提取器输出中间特征,分类头给出类别 logits,回归头输出预测框的四角坐标。ReDC 针对检测结果并行开展两项核心校准任务:一是利用置信度重编码器(CR)结合检测特征生成四个角点坐标的独立置信度;二是利用方向位移估计器(DDE)结合分类 logits 与几何外形属性预测各角点相对于真值的正负偏移方向。最后,ReDC 将坐标级置信度与方向信息聚合重构出全框的近似 IoU,兼顾局部细粒度分析与整体框级决策。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 + 预训练冻结检测器"] --> B["特征提取与预测分支<br/>分类Logits + 边界框坐标 + 中间特征"]
    B --> C["坐标对齐比率<br/>构建轴向相交长度与偏差比值作为校准真值"]
    B --> D["置信度重编码<br/>框回归特征调控分类Logits输出四坐标置信度"]
    B --> E["方向位移估计<br/>几何属性与Logits联合预测坐标正负偏差方向"]
    C & D --> F["坐标级校准评估与优化<br/>负对数似然损失对齐坐标置信度与CAR"]
    D & E --> G["自底向上聚合逼近全框IoU<br/>结合保序回归与Platt缩放输出全局校准分"]

关键设计

1. 坐标对齐比率:量化单坐标轴向经验精度 传统校准以整体 IoU 为目标,掩盖了不同坐标轴向的误差异质性。为精细定义各个角点坐标的真实定位经验精度,论文提出了坐标对齐比率(Coordinate-wise Alignment Ratio, CAR)。针对预测框 \((\hat{x}_1, \hat{y}_1, \hat{x}_2, \hat{y}_2)\) 和真值框 \((x_1, y_1, x_2, y_2)\),首先计算单坐标绝对偏差 \(\text{dist}_{x^l} = |\hat{x}^l - x^l|\)\(\text{dist}_{y^l} = |\hat{y}^l - y^l|\)(其中 \(l \in \{1, 2\}\) 分别代表左上与右下),以及沿 \(x\) 轴与 \(y\) 轴的相交线段长度: $\(\text{inter}_w = \max(0, \min(\hat{x}_2, x_2) - \max(\hat{x}_1, x_1)), \quad \text{inter}_h = \max(0, \min(\hat{y}_2, y_2) - \max(\hat{y}_1, y_1))\)$ 基于轴向相交长度和坐标偏差,各个角点坐标的 CAR 值 \(\bar{\mathbf{p}} = (\bar{\text{p}}_{x_1}, \bar{\text{p}}_{y_1}, \bar{\text{p}}_{x_2}, \bar{\text{p}}_{y_2})\) 定义为: $\(\bar{\text{p}}_{x^l} := \frac{\text{inter}_w}{\text{dist}_{x^l} + \text{inter}_w}, \quad \bar{\text{p}}_{y^l} := \frac{\text{inter}_h}{\text{dist}_{y^l} + \text{inter}_h}\)$ 该指标自然落在 \([0, 1]\) 区间内:当检测框在对应轴向无任何重叠时(\(\text{inter}=0\)),CAR 取值为 0;当该坐标与真值精确吻合时(\(\text{dist}=0\)),CAR 达到 1.0。完美校准的目标即为让预测的坐标置信度等于在所有该置信度预测框下的平均 CAR 值。

2. 置信度重编码:利用定位特征调控分类置信度 现有分类器输出的单一置信度无法反映几何角点的空间质量差异。置信度重编码器(Confidence Re-encoder, CR)设计为一个轻量全连接网络 \(\phi_{\text{CR}}\),将检测器回归分支倒数第二层特征 \(\hat{\mathbf{f}}_i = \phi_R[:-2](\phi_F(x_i))\) 作为输入,为四个坐标点生成个性化的缩放系数与偏置,从而对分类 logit 向量 \(\hat{\mathbf{z}}_i\) 进行坐标维度的特征重编码: $\(\hat{\mathbf{p}}_{(t, i)} = \sigma\left(\frac{\hat{\mathbf{z}}_i}{\phi_{\text{CR}_t}(\hat{\mathbf{f}}_i)} + \beta_t\right), \quad t \in \{x_1, y_1, x_2, y_2\}\)$ 其中 \(\sigma(\cdot)\) 为 Sigmoid 函数,\(\beta_t\) 为可学习偏置参数。通过这种设计,原本单一维度的分类得分被几何特征调制,转化为分别表征左、上、右、下四个边界对齐质量的独立置信度得分。

3. 方向位移估计:预测坐标相对真值的空间偏移矢量 对称的不确定性分布无法告知下游系统“预测框究竟是往左偏还是往右偏”,这在空间规划与避障控制中至关重要。方向位移估计器(Directional Displacement Estimator, DDE)旨在预测真值坐标相对于预测坐标的正负方向 \(\bar{s}_t \in \{+1, -1\}\)。DDE 采用多层感知机(MLP),不仅接收类别 logit \(\hat{\mathbf{z}}_i\),还联合编码了检测框的丰富宏观几何属性,包括中心点 \((\hat{\text{cx}}_i, \hat{\text{cy}}_i)\)、宽度 \(\hat{w}_i\)、高度 \(\hat{h}_i\)、面积 \(\hat{A}_i\) 以及宽高比 \(\hat{R}_i\)。针对各个角点预测连续 logit,在推理阶段结合验证集训练所得的类别阈值 \(\tau_t^c\) 判定方向: $\(\hat{s}_{(t, i)} = \begin{cases} +1 & \text{if } \sigma(\hat{z}^c_{s_{(t, i)}}) > \tau_t^c \\ -1 & \text{otherwise} \end{cases}\)$ 将二值方向预测与坐标置信度相乘,模型首次能够向系统显式输出“右边界偏大 15% 且需向内修正”等带方向的置信度信息。

4. 自底向上聚合:由坐标置信度与方向重构全框 IoU 为了兼容传统需要框级置信度的下游评测与决策模块,ReDC 证明了全框 IoU 在理论上可由坐标轴向对齐比率 CAR 及相对偏移方向唯一解析推导。当坐标级校准误差达到极小值时,预测置信度与真实 CAR 渐进等价。因此,ReDC 利用输出的 4 个坐标置信度与预测的方向矢量直接在几何上逼近交并比,并进一步在验证集上通过保序回归(Isotonic Regression, IR)或 Platt 缩放(Platt Scaling, PS)完成全框级校准对齐,使系统同时具备细粒度坐标感知与全局框级校准能力。

损失函数 / 训练策略

ReDC 采用两阶段串行训练方案,全过程冻结主检测器参数,训练极快且无需微调检测网络: 1. CR 训练:利用负对数似然损失(NLL / 交叉熵形式),使得预测的坐标置信度 \(\hat{\mathbf{p}}\) 拟合连续的真实 CAR 值 \(\bar{\mathbf{p}}\): $\(\mathcal{L}_{\text{cal}} = \mathbb{E}\left[ - \sum_{t} \left(\bar{\text{p}}_t \log(\hat{\text{p}}_t) + (1 - \bar{\text{p}}_t)\log(1 - \hat{\text{p}}_t)\right) \right]\)$ 2. DDE 训练:在 CR 训练完成后,利用二元交叉熵损失(BCE)训练 DDE,监督二值偏移方向标签 \(\bar{s}_t \in \{+1, -1\}\)。随后在验证集上基于方向准确率搜索各个类别的最佳判别阈值 \(\tau_t^c\)。 3. 评估指标定义:提出坐标级期望校准误差 C-ECE(在各分桶中评估平均坐标置信度与平均 CAR 之间的绝对差)和方向感知校准误差 Da-CE(在真正例 TP 集合上评估带有方向正负号的对齐偏差 \(\bar{\mathbf{U}} = \bar{s} \cdot \bar{\text{p}}\)\(\hat{\mathbf{U}} = \hat{s} \cdot \hat{\text{p}}\) 之间的绝对距离)。

实验关键数据

主实验

论文在标准目标检测基准 COCO(80类)与自动驾驶数据集 Cityscapes(8类)上进行了全面评测,主干检测器采用 Deformable-DETR (ResNet-50)。校准评估对比了未校准模型、传统后验校准(IR/PS for LaECE0)、以及训练期校准方法(BPC, Cal-DETR)。

在 COCO 数据集上的对比结果如下表所示:

方法 类型 \(C_{x1}\text{-ECE}\downarrow\) \(C_{y1}\text{-ECE}\downarrow\) \(C_{x2}\text{-ECE}\downarrow\) \(C_{y2}\text{-ECE}\downarrow\) D-ECE \(\downarrow\) \(\text{LaECE}_0\downarrow\) AP \(\uparrow\) LRP \(\downarrow\)
Uncalibrated (Deformable-DETR) - 17.3 17.4 17.4 17.2 14.9 12.7 51.3 57.3
TCD (NeurIPS'22) Train-time 18.0 18.1 18.1 17.5 14.4 13.1 51.3 57.1
BPC (CVPR'23) Train-time 15.5 15.3 15.3 15.2 11.3 12.8 50.3 58.4
Cal-DETR (NeurIPS'23) Train-time 14.0 13.9 13.9 13.6 9.8 11.7 52.5 56.2
IR for \(\text{LaECE}_0\) (ECCV'24) Post-hoc 12.0 11.9 11.8 11.9 2.4 7.8 51.0 57.3
PS for \(\text{LaECE}_0\) (ECCV'24) Post-hoc 13.9 14.0 14.0 13.8 2.3 9.7 51.3 57.3
ReDC (Ours, IR) Post-hoc 7.7 10.5 11.4 10.6 2.5 7.9 50.4 57.4
ReDC (Ours, PS) Post-hoc 7.6 10.4 10.9 10.9 2.4 10.0 50.3 57.3

在自动驾驶数据集 Cityscapes 上的对比结果如下表所示:

方法 类型 \(C_{x1}\text{-ECE}\downarrow\) \(C_{y1}\text{-ECE}\downarrow\) \(C_{x2}\text{-ECE}\downarrow\) \(C_{y2}\text{-ECE}\downarrow\) D-ECE \(\downarrow\) \(\text{LaECE}_0\downarrow\) AP \(\uparrow\) LRP \(\downarrow\)
Uncalibrated - 13.7 15.5 14.2 15.5 13.7 13.4 44.5 66.4
Cal-DETR Train-time 13.4 15.1 13.4 14.5 13.0 12.7 38.7 70.6
IR for \(\text{LaECE}_0\) Post-hoc 12.2 13.6 11.6 13.9 1.5 7.5 43.5 66.4
PS for \(\text{LaECE}_0\) Post-hoc 12.9 14.7 13.1 15.1 1.0 9.6 44.5 66.4
ReDC (Ours, IR) Post-hoc 6.9 11.1 10.3 11.3 1.2 6.5 42.5 67.0
ReDC (Ours, PS) Post-hoc 6.5 11.4 10.5 10.6 1.1 9.4 42.0 66.9

消融实验

论文在 COCO 数据集上以 5 个随机种子验证了方向位移估计(DDE)模块对坐标校准及全框 IoU 近似效果的影响:

方向位移估计 (DDE) \(C_{x1}\text{-ECE}\downarrow\) \(C_{y1}\text{-ECE}\downarrow\) \(C_{x2}\text{-ECE}\downarrow\) \(C_{y2}\text{-ECE}\downarrow\) \(\text{LaECE}_0\downarrow\) \(\text{LaACE}_0\downarrow\)
无 (w/o DDE) 11.22 (±0.058) 11.90 (±0.106) 10.42 (±0.054) 10.62 (±0.134) 9.96 (±0.022) 23.14 (±0.034)
有 (w/ DDE, 完整 ReDC) 11.18 (±0.038) 10.86 (±0.042) 10.26 (±0.074) 10.58 (±0.106) 9.88 (±0.022) 23.14 (±0.002)

此外,在模型无关性验证中,ReDC 跨架构应用在单阶段检测器 VFNet、二阶段检测器 Cascade R-CNN 与 Transformer 检测器 DINO 上,各架构的平均 Da-CE 分别大幅降低: - VFNet: Da-CE 从 48.1% 降至 25.7%(\(C_{x1}\text{-ECE}\) 从 22.9% 降至 12.9%); - Cascade R-CNN: Da-CE 从 19.3% 降至 28.1% 对应 baseline 显著优化(且 \(C_{x1}\text{-ECE}\) 从 16.5% 降至 10.6%); - DINO (ViT): Da-CE 从 42.9% 骤降至 26.0%(\(C_{x1}\text{-ECE}\) 从 18.3% 降至 9.4%)。

关键发现

  • 坐标校准断层显著解决:在 COCO 上,传统最强后验校准方法 IR for \(\text{LaECE}_0\) 的四个坐标 C-ECE 维持在 11.8%~12.0%,而 ReDC (IR) 在 \(x_1\) 坐标达到惊人的 7.7%(平均 C-ECE 9.8%~10.0%),且在 Cityscapes 上 \(x_1\) 误差低至 6.9%,大幅领先现有 SOTA;
  • 全框与坐标指标兼得:ReDC 并未因专注于坐标级校准而牺牲框级表现,在 COCO 上 \(\text{LaECE}_0\) 保持在 7.9%(优于未校准的 12.7%),在 Cityscapes 上 \(\text{LaECE}_0\) 达到 6.5%(超越此前最优的 7.5%);
  • 强鲁棒性与误差负相关特性:在 COCO-C 和 Foggy Cityscapes 域偏移设定下,ReDC 依然稳定维持最低的坐标校准误差(COCO-C 上平均 C-ECE 14.1%,Foggy Cityscapes 上 12.0%)。分析实验表明,在 \(y_2\) 轴出现大误差(Top 3%)的样本中,ReDC 预测的 \(y_2\) 置信度与像素几何误差呈现显著负相关,真正反映了物理空间中的不可靠程度。

亮点与洞察

  • 从“框级黑盒”到“坐标+方向解构”的范式转变:首次证明相同 IoU 掩盖了极具异质性的轴向对齐误差,将校准任务拓展为坐标连续精度与离散偏移方向的联合建模,立意深刻且切中实际决策痛点。
  • 即插即用的轻量后验架构:仅用两层小 MLP 提取已有回归特征和框几何特征进行重编码,不重训主干检测器,计算开销极小却能跨单阶段、二阶段及 Transformer 检测器通用落地。
  • 全新定量评价指标 C-ECE 与 Da-CE:填补了检测领域缺乏坐标细粒度与方向感知校准指标的空白,对自动驾驶中可信自感应(Self-awareness)与预测修复具有直接的方法论借鉴价值。

局限与展望

  • 复杂遮挡与非刚体变形挑战:CAR 与 DDE 依赖于外接矩形框的轴向投影与相交长度计算,对于极端非刚体目标(如复杂姿态人体、蜷缩动物),矩形角点的误差难以完全对齐语义部位边界。
  • 假正例无法评估方向:Da-CE 指标目前将假正例(FP)误差置为零,仅在 TP 集合上评估方向误差。未来可探索与开放世界检测或背景假警报联合建模的无真值方向校准。
  • 校准结果向回归预测的反哺:当前 ReDC 纯粹作为后验置信度评判模块,尚未将预测出的偏差方向和坐标置信度用于推理阶段边界框的闭环微调重回归,未来若形成“校准-修正”双向协同闭环将极具实用价值。

相关工作与启发

  • vs Kuzucu et al. (ECCV 2024, LaECE0):Kuzucu 等人提出将框级置信度对齐至连续 IoU 分数,但仍将整个检测框视为单一原子单元。ReDC 继承了该思想但将其推向细粒度极限,证明了 IoU 可由坐标级 CAR 解析导出,建立了坐标级校准与框级校准的统一数学关联。
  • vs GP-Normal / Küppers et al. (ECCVW 2022):GP-Normal 等概率检测器通过高斯分布建模坐标方差,但必须依赖特定的概率网络结构且无法预测具体的偏移方向(正向/负向)。ReDC 适用于任何确定性检测器,且在与实际坐标误差的相关性上大幅超越 GP-Normal(0.1771 vs 0.0263)。
  • vs Cal-DETR / BPC (NeurIPS 2023 / CVPR 2023):此类方法通过设计训练期损失函数重训整个检测网络,训练成本高昂。ReDC 作为后验校准模块,保持检测器主干冻结,在零精度损失前提下取得了更优越的细粒度校准度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次从坐标与方向的解耦视角重构目标检测置信度校准,突破传统框级黑盒局限。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 COCO、Cityscapes 及对应鲁棒性变体,横跨多种检测器架构并设计了严谨的定量消融与相关性分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学建模严密清晰,图表逻辑自洽,动机与可视化案例极具说服力。
  • 价值: ⭐⭐⭐⭐⭐ 对自动驾驶、机器人等安全关键决策场景具有高度即插即用的工程落地与理论指导价值。