跳转至

Local Spacing-Aware Hungarian Matching for Stable Point-Supervised Crowd Counting

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/kaijiang77/SAHCC
领域: 目标检测
关键词: 人群计数、点监督、匈牙利匹配、分配稳定性、局部间距先验

一句话总结

针对点监督人群计数中全局统一度量导致密集区域匹配竞争与分配震荡的问题,本文提出间距感知匈牙利匹配器(SAH-matcher),利用 k 近邻距离自适应重缩放目标几何匹配代价,并结合 CAS、HR 与 IR 过程级诊断指标,在零推理开销下显著提升密集人群定位与计数精度。

研究背景与动机

点监督人群计数与定位是计算机视觉中的经典基础任务,在智慧城市、安防预警与客流管理中具有广泛应用。相比于需要启发式高斯核生成伪密度图的传统密度图回归范式,以 P2PNet 为代表的纯点监督目标检测架构将计数与定位统一为集合预测问题,直接输出预测点并借助匈牙利匹配算法完成预测点与真实标注点间的一对一分配,无需依赖非极大值抑制(NMS)或峰值提取等后处理。然而,人工点标注通常仅标定人头中心坐标,缺乏显式的头肩尺度和边界框几何边界信息,现有一对一框架只能在全局范围内对所有目标采用统一、固定形式的欧氏距离几何匹配代价。

这一设置的核心矛盾在于:真实场景中人群密度极不均匀,且存在剧烈的透视尺度形变。在稀疏区域,点与点间距较大,固定的欧式距离足以清晰划分候选点的归属;但在极度拥挤的密集区域,相邻的真实目标在像素空间中紧挨在一起,候选预测点与多个相邻真实点之间的空间位移差异极其微弱。在全局固定几何权重的约束下,匈牙利算法极易发生“邻域诱导的错误分配”甚至严重的“邻居劫持”(即某个候选点虽被分配给目标 A,但在几何位置上却离相邻的目标 B 更近)。这种匹配模糊与错配直接向分类与定位分支注入错误监督信号,造成跨训练轮次的分配震荡,制约了高密度区域的模型收敛。

面对这一瓶颈,本文认为点标注虽然缺失显式包围框尺度,但真实标注点集的空间拓扑自身就蕴含着高保真的局部几何先验——任何一个真实点与其相邻近邻点的几何距离,天然反映了该区域的人群拥挤度与人头物理尺度。本文的核心 idea 是:将基于 k 近邻计算的局部间距先验显式引入匈牙利几何代价矩阵,对每个真实目标实施自适应的代价重缩放,使密集区目标获得更严苛的几何匹配排他性、稀疏区保持合理容差,从而在完全不改变全局一对一形式与推理结构的前提下彻底稳定点监督训练。

方法详解

整体框架

SAH-matcher 属于即插即用的训练期匹配器替换方案。网络骨干基于改进的 P2PNet 架构,前向传播时特征图经紧耦合的输出头分别预测前景分类置信度与点坐标偏移。在反向传播构建监督信号时,SAH-matcher 接收模型输出的候选点特征与离线预计算的真实标注点局部间距先验,逐目标计算几何调节权重并重构匹配代价矩阵,最终由标准匈牙利算法解算出一对一匹配指派关系。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与真实点标注"] --> B["k近邻局部间距先验估计<br/>计算目标平均近邻距离di"]
    B --> C["目标自适应几何匹配代价重缩放<br/>动态计算目标缩放因子αi"]
    C --> D["匈牙利单射匹配求解<br/>全局一对一最优指派"]
    D --> E["集合预测分类与定位回归监督<br/>更新检测头与特征提取骨干"]
    D -.-> F["匹配动态过程诊断体系<br/>评估CAS竞争模糊度与HR劫持率"]

关键设计

1. k近邻局部间距先验估计:以相邻目标距离刻画局部尺度与拥挤度 针对点标注缺乏显式尺度边界的问题,该设计旨在从点分布几何拓扑中廉价提取连续的局部密度表征。对于图像中的每个真实点标注目标 \(\mathbf{g}_i\),在排除自身的条件下检索其在欧氏空间中的 \(k\) 个最近邻标注点集合 \(\mathcal{N}_k(i)\),并计算平均欧氏距离作为该目标的局部间距先验: $\(d_i = \frac{1}{k} \sum_{\mathbf{g} \in \mathcal{N}_k(i)} \|\mathbf{g} - \mathbf{g}_i\|_2\)$ 局部间距 \(d_i\) 越小,说明该目标处于极其拥挤的核心区域,人头相互重叠且尺度狭小;\(d_i\) 越大则对应开阔稀疏背景。该间距先验可在数据预处理阶段离线生成,并在几何数据增广(如随机缩放、裁剪)时进行坐标系同步变换,为代价矩阵的动态校准提供可靠的空间几何基底。

2. 目标自适应几何匹配代价重缩放:动态惩罚高密度区域竞争错配 针对传统全局共享几何权重无法兼顾疏密场景、导致拥挤处候选点被邻近目标错误捕获的痛点,该设计在构建代价矩阵时引入目标级连续调节因子 \(\alpha_i\)。在具体实现上,匹配计算采用预设的固定网格锚点坐标 \(\mathbf{a}_j\) 作为候选参考基准 \(\mathbf{u}_j = \mathbf{a}_j\),将几何匹配与未收敛的早期坐标回归噪声解耦。每个目标 \(i\) 的调节权重定义为: $\(\alpha_i = \max\left(\alpha_{\min},\, \frac{\kappa}{d_i + \epsilon}\right)\)$ 其中 \(\kappa\) 为全局缩放因子,\(\epsilon\) 防止除零,\(\alpha_{\min}\) 设定下界以防止极其稀疏区域因间距极大导致几何约束失效。在此基础上,候选点 \(j\) 与真实目标 \(i\) 的综合匹配代价为: $\(C_{j,i} = \lambda_{\mathrm{cls}} C_{j,i}^{\mathrm{cls}} + C_{j,i}^{\mathrm{geo}} = -\lambda_{\mathrm{cls}} \hat{c}_j + \alpha_i \|\mathbf{u}_j - \mathbf{g}_i\|_2\)$ 在拥挤区域,\(d_i\) 极小使 \(\alpha_i\) 激增,几何位移惩罚剧烈放大,迫使匈牙利算法仅将极贴近真实中心的锚点匹配给该目标,极大地压缩了有效匹配半径;而在稀疏区域,较小的 \(\alpha_i\) 维持了对远距候选点的包容度。由于仅改变代价矩阵系数,全局一对一的置换矩阵约束被完整保留。

3. 匹配动态过程诊断体系:显式量化组内模糊度、劫持率与跨轮不稳定性 以往研究通常仅根据最终的计数 MAE/RMSE 间接反推匹配效果,缺乏对训练中间过程匹配质量的细粒度量化工具。本文建立了由竞争模糊度评分(CAS)、邻居劫持率(HR)和跨轮不稳定率(IR)组成的三维过程诊断体系。设当前指派映射为 \(\hat{\pi}\),定义目标 \(i\) 到匹配候选点的距离为 \(d_i^+ = \|\mathbf{u}_{\hat{\pi}(i)} - \mathbf{g}_i\|_2\),该匹配候选点到任意非目标真实点的最短距离为 \(d_i^- = \min_{k \neq i} \|\mathbf{u}_{\hat{\pi}(i)} - \mathbf{g}_k\|_2\)。据此定义每个目标的模糊度评分与整图均值: $\(\mathrm{CAS}_i = \frac{2 d_i^+}{d_i^+ + d_i^- + \epsilon}, \qquad \mathrm{CAS} = \frac{1}{M}\sum_{i=1}^M \mathrm{CAS}_i\)$ 当候选点远近分明时 \(\mathrm{CAS} \to 0\);处在竞争边界时 \(\mathrm{CAS} \approx 1\);而当 \(\mathrm{CAS}_i > 1\)(即 \(d_i^+ > d_i^-\))时,意味着发生了严重的“邻居劫持”——匹配给目标 \(i\) 的候选点在空间上竟然离旁边的目标更近。邻居劫持率则定义为整图发生严重劫持的目标占比: $\(\mathrm{HR} = \frac{1}{M} \sum_{i=1}^M \mathbb{I}[d_i^+ > d_i^-]\)$ 配合衡量前后 Epoch 匹配指派翻转比例的跨轮不稳定率(IR),该诊断体系使得匹配阶段的局部竞争状态在训练全周期可观测、可对比。

损失函数 / 训练策略

训练阶段获得最优单射匹配 \(\hat{\pi}\) 后,将匹配成功的候选集记为正样本集合 \(\mathcal{Q}^+\),其余未匹配候选点记为背景负样本集合 \(\mathcal{Q}^-\)。分类分支采用二值交叉熵损失(BCE),定位分支采用 L1 损失并直接监督预测回归坐标 \(\hat{\mathbf{p}}_{\hat{\pi}(i)}\): $\(\mathcal{L} = \frac{1}{Q} \left( \sum_{j \in \mathcal{Q}^+} \mathrm{BCE}(\hat{c}_j, 1) + \lambda_{\mathrm{neg}} \sum_{j \in \mathcal{Q}^-} \mathrm{BCE}(\hat{c}_j, 0) \right) + \lambda_{\mathrm{loc}} \frac{1}{M} \sum_{i=1}^M \|\hat{\mathbf{p}}_{\hat{\pi}(i)} - \mathbf{g}_i\|_1\)$ 训练使用 AdamW 优化器,批大小为 8,骨干学习率为 \(10^{-5}\),检测头学习率为 \(10^{-4}\)。默认超参数设为 \(k=4\)、\(\kappa=1.2\)、\(\alpha_{\min}=0.03\)、\(\lambda_{\mathrm{cls}}=1\)、\(\lambda_{\mathrm{loc}}=2 \times 10^{-4}\)。推理阶段完全抛弃匹配器,直接按置信度阈值过滤输出预测点,无任何附加计算开销。

实验关键数据

主实验

在五大主流人群计数基准数据集(ShanghaiTech Part A/B、UCF-QNRF、JHU-Crowd++、NWPU-Crowd)上对计数性能进行了全面评估,如下表所示:

方法类型 方法 SHHA (MAE/RMSE) SHHB (MAE/RMSE) UCF-QNRF (MAE/RMSE) JHU-Crowd++ (MAE/RMSE) NWPU (Test) (MAE/RMSE)
检测范式 TopoCount 61.20 / 104.60 7.80 / 13.70 89.00 / 159.00 60.90 / 267.40 107.80 / 438.50
回归范式 DM-Count 59.70 / 95.70 7.40 / 11.80 85.60 / 148.30 - / - 88.40 / 388.60
回归范式 MAN 56.80 / 90.30 - / - 77.30 / 131.50 53.40 / 209.90 76.50 / 323.00
点监督集合预测 P2PNet 52.74 / 85.06 6.25 / 9.90 85.32 / 154.50 - / - 83.28 / 553.92
点监督集合预测 CLTR 56.90 / 95.20 6.50 / 10.60 85.80 / 141.30 59.50 / 240.60 74.30 / 333.80
点监督集合预测 PET 49.34 / 78.77 6.19 / 9.69 79.53 / 144.32 58.50 / 238.00 74.40 / 328.50
点监督集合预测 APGCC 48.80 / 76.70 5.60 / 8.70 80.10 / 136.60 54.30 / 225.90 71.40 / 284.40
点监督集合预测 Ours (SAH) 47.23 / 75.17 6.14 / 9.50 76.91 / 135.92 58.32 / 250.62 68.90 / 306.70

在定位任务上,针对密集人群定位精度受距离阈值影响敏感的特性,在严格和宽松两类阈值下评估 F1-measure、Precision 和 Recall。在 SHHA 严格阈值(\(\sigma=4\) 像素)下,本文方法取得 48.9% F1(超越 APGCC 的 48.7% 与 P2PNet 的 40.6%);在 NWPU 严格阈值(\(\sigma_s = \min(w, h)\))下,本文 F1 达到 72.1%,大幅优于 APGCC 的 68.9% 与 P2PNet 的 67.5%。

此外,为了验证 SAH-matcher 作为通用即插即用组件的跨架构迁移能力,在不重新调优其他超参的前提下将其嵌入四种主流点监督架构中,下表展示了移植后的性能增益:

基准架构 变体 SHHA (MAE/RMSE) SHHB (MAE/RMSE) QNRF (MAE/RMSE) JHU (MAE/RMSE) 平均 \(\Delta\text{MAE}\)
P2PNet Baseline
+ SAH
54.70 / 89.06
50.30 / 81.86
6.29 / 10.18
6.11 / 9.97
93.81 / 164.21
85.81 / 151.43
62.23 / 269.70
60.85 / 264.30
-
-3.49
CLTR Baseline
+ SAH
66.53 / 114.74
65.20 / 108.89
7.53 / 13.16
7.49 / 12.62
93.49 / 166.72
91.11 / 154.90
64.17 / 257.45
62.74 / 258.86
-
-1.29
PET Baseline
+ SAH
51.90 / 83.64
49.76 / 80.99
6.56 / 10.23
6.76 / 10.95
95.66 / 162.57
88.99 / 164.32
59.98 / 252.52
59.05 / 250.93
-
-2.39
P2R Baseline
+ SAH
51.02 / 79.68
50.67 / 78.50
6.95 / 11.54
6.68 / 10.51
93.50 / 168.48
88.75 / 154.74
62.23 / 272.66
63.45 / 267.91
-
-1.03

消融实验

消融实验重点验证了自适应缩放机制的本质来源,证明性能提升源于依据空间密度的动态重缩放,而非对单一全局几何权重的简单微调:

实验配置 机制说明 SHHA MAE SHHA RMSE
全局固定权重 \(w = 0.01\) 几何惩罚极度松弛 51.82 85.64
全局固定权重 \(w = 0.04\) 适度增加几何惩罚 50.44 79.87
全局固定权重 \(w = 0.05\) (Baseline) 最优全局网格搜索常数权重 50.06 81.57
全局固定权重 \(w = 0.07\) 几何惩罚过强,稀疏区容差不足 50.53 81.68
SAH 动态目标级重缩放 按局部近邻间距 \(d_i\) 逐目标自适应缩放 47.23 75.17
SAH + 预测点参考坐标 (\(\mathbf{u}_j = \hat{\mathbf{p}}_j\)) 动态缩放但匹配绑定回归预测点 51.63 86.84
Baseline + 固定网格锚点 (\(\mathbf{u}_j = \mathbf{a}_j\)) 固定权重但匹配绑定空间锚点 50.70 81.76

关键发现

  • 密集区间距敏感性最强:过程诊断分析显示,在极密集区间(\(d_i \in [0, 10]\) 像素),基线匹配器的 CAS 高达 0.63、HR 达到 0.16(即 16% 的目标遭遇严重邻居劫持),而引入 SAH 后 CAS 降至 0.44,HR 暴跌至 0.02(劫持率下降 87.5%),跨轮不稳定率 IR 从 0.123 减半至 0.059。而在稀疏区间,两种匹配器的分配状态无显著差异,完全契合方法的设计初衷。
  • 解耦匹配参考系至关重要:以固定锚点 \(\mathbf{a}_j\) 作为几何匹配参考系可有效抵御网络初期未收敛预测点产生的随机游走;但在固定权重下使用锚点仅带来微弱改善(MAE 从 50.89 降至 50.70),只有与 SAH 动态重缩放结合才能彻底释放潜力(MAE 进一步大幅下降至 47.23)。
  • 计算开销极低:在 SHHA 上,离线预计算近邻距离后,SAH 仅引入 \(O(M)\) 的权重向量计算和 \(O(QM)\) 的广播逐元素乘法,端到端单次迭代耗时仅增加 10.50%(从 104.44 ms 增至 115.41 ms),在作物级高目标密度下额外开销衰减至 3.82%,推理期则零开销。

亮点与洞察

  • 将连续空间拓扑自然转换为匹配注意力:巧妙避开了人工定义先验框尺度的繁琐工程,仅利用点集内在的 \(k\) 近邻距离这一轻量指标,在代价矩阵层面对密集与稀疏目标施加非对称几何排他性,四两拨千斤地解决了拥挤场景分配歧义。
  • 构建了可解释的过程级匹配诊断工具:提出的 CAS 与 HR 填补了以往“只能根据最终验证集 MAE 盲猜匹配器优劣”的空白,将“邻居劫持”这一长期被忽视的退化机理显式数学化,对后续密集目标检测及 DETR 变体匹配研究极具启发意义。
  • 无缝即插即用且不伤推理速度:完全保留了标准匈牙利单射匹配的数学形式和时间复杂度,不改变网络前向推理路径和部署依赖,可无缝增强现存各类点监督框架。

局限与展望

  • 依赖相对可靠的人工标注空间拓扑:鲁棒性实验显示,在人为添加 10% 漏标或 \(\le 4\) 像素的位置扰动下 SAH 表现稳健;但当标注抖动达到 8 像素的极端严重损坏时,局部极近邻估计失真会导致局部调节权重 \(\alpha_i\) 异常发散,造成性能反噬(MAE 恶化至 65.50),需要手动增加权重截断保护(\(\alpha_i \le 0.08\))才能恢复常态。
  • 各向同性间距假设的局限:当前采用欧氏距离标量作为间距表征,隐式假设了局部空间密度的各向同性;在强透视倾斜路面或剧烈沿视线压缩的场景下,人头密集度在纵横方向差异显著,未来可探索结合局部协方差或张量椭球的各向异性间距建模。

相关工作与启发

  • vs P2PNet [ICCV 2021]: P2PNet 首创了基于点提议与匈牙利算法的人群点监督集合预测架构,但其使用全局固定常数权重衡量几何代价,在密集区无法区分相邻候选。SAH 保持了其高效简洁的骨干,通过局部间距重缩放从底层消除了密集区的错配与劫持。
  • vs APGCC [ECCV 2024]: APGCC 尝试通过引入辅助引导点与隐式特征插值来稳定训练,这增加了网络内部特征交互与训练结构复杂度。SAH 直接作用于外部匹配代价矩阵本身,以极其轻量的方式实现了相当甚至更优的稳定性与计数定位精度。
  • vs CLTR / PET: CLTR 与 PET 分别通过上下文邻域兼容性与四叉树分解来优化密集点匹配,模型结构较为沉重。SAH 证实了仅仅校准纯几何距离项的动态尺度,就能以更低的计算成本达到优异的性能提升。

评分

  • 新颖性: ⭐⭐⭐⭐ [从点拓扑无监督提取局部间距先验动态重缩放匈牙利几何代价,视角简洁优雅]
  • 实验充分度: ⭐⭐⭐⭐⭐ [跨五大基准、四类点监督架构,且具备完备的消融、抗噪鲁棒性测试与过程级动态诊断]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑层层递进,数学定义精确,问题剖析与实验证据闭环严密]
  • 价值: ⭐⭐⭐⭐⭐ [极具工程实用价值的即插即用组件,零推理开销,对密集目标集合预测领域具有通用启发]