HER-Count: Learning Hyper-Exemplar Representation for Generalized Zero-Shot Object Counting¶
会议: ECCV 2026
论文: ECCV 2026
领域: 目标检测
关键词: 零样本目标计数、超范例表示、多模态大模型、分层特征融合、全局判别性增强
一句话总结¶
针对零样本目标计数中基于局部裁剪块的范例难以覆盖类内多样性且易累积检测误差、而纯文本嵌入缺乏特定图像实例细节的问题,提出 HER-Count 框架,利用多模态大语言模型(MLLM)联合全图与文本类别合成超范例表示(HER),并通过多层视觉分层融合与样本文本双层全局判别性约束,实现了兼具高精度与快速推理的开放环境目标计数与定位。
研究背景与动机¶
目标计数旨在推断给定图像中特定目标对象的出现数量,在智能安防、人群监控、交通流量分析和微观细胞分析等工业及科研场景中具有广泛应用。早期的特定类别计数方法依赖对固定类别的密集点标注,严重受限于闭集设定,无法灵活适应现实世界中源源不断的新类别。近年来,无类别限制计数(class-agnostic counting)逐渐成为主流,主要分为少样本(few-shot)与零样本(zero-shot)两类设定。少样本方法依赖人工在测试图像中手动框选几个代表性的范例切片(exemplar patches)来进行跨区域相似度匹配,但手动标注难以在全自动业务管线中落地。为了彻底摆脱人工边界框约束,零样本计数仅以目标类别的文本名称作为指引,现有方法主要采用两类路线:其一是借助外部通用检测器(如 Grounding DINO)在输入图中自动检测并选取 1~3 个高质量局部切片作为范例;其二是直接利用预训练文本编码器将类别名称映射为文本嵌入,与图像区域特征进行跨模态匹配。
然而这两类范式在实际复杂场景中均存在本质缺陷。对于自动检测选取范例的方法,由于同类物体在同一幅图像中往往存在巨大的尺度缩放、多变视角、光照阴影及严重形变,区区 1~3 个局部切片不仅代表性极其狭窄,难以覆盖图像内部显著的类内外观差异,而且外部检测器一旦出现漏检、截断或假阳性误检,错误就会沿着“检测-选取-特征匹配”的多阶段流程不可逆地累积放大。对于基于文本嵌入的方法,类别文本向量仅仅停留在高维的通用语义抽象层面,完全感知不到当前图像内具体实例的视觉外观变异,无法捕捉实例级别的细节特征。此外,传统方法在后处理阶段往往直接对预测的密度图进行全局像素积分求和来获取数量,背景中轻微的弥散响应噪声累加后极易导致总数大幅偏差,同时也丢失了物体的空间定位信息。
面对局部图像块易失真与纯文本嵌入过于泛化的矛盾,本文的切入视角是:范例表示不必拘泥于从原图中物理裁剪出来的稀疏像素块,也不应脱离图像只靠离线词向量,而是可以直接让多模态大语言模型(MLLM)将整幅图像的全局视觉特征与目标类别的文本指令深度融合,在隐空间中合成出一种能够概括当前图像中该类所有实例外观特征的“超范例”。核心 idea:利用 MLLM 的跨模态交互能力将整图与类别文本联合编码为能够捕捉全局实例多样性的多模态超范例表示(HER),并通过视觉骨干网络的多层分层特征注入与样本/类别双层全局判别性约束,端到端实现抗噪精准的零样本目标计数与定位。
方法详解¶
整体框架¶
HER-Count 采用端到端的结构设计,整体流程包含四个阶段:超范例生成、多尺度分层特征融合、密度图解码与定位计数,以及面向隐空间表示的双层判别性联合优化。系统首先将输入图像与目标类别的文本序列拼接后输入多模态大语言模型,利用跨模态自注意力机制将全局视觉线索与类别先验压缩至末尾特殊标记对应的隐状态中,经由轻量投影层输出一组包含浅层纹理至深层语义的多尺度超范例表示(HER)。随后,在视觉编码器的主干特征抽取过程中,将不同层次的超范例逐级注入到对应的中间网络层中,引导视觉表征动态聚焦于与目标类别强相关的外观特征。最后,卷积解码器将融合后的多尺度高层特征解析为空间密度图,并采用局部极大值检测(LMD)直接滤除背景杂波、解码出物体的精确空间坐标与离散整数计数值。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入:图像 $I$ 与类别文本 $T$"] --> B["超范例表示生成<br/>MLLM 联合编码全图与文本,提取末 $n$ 层 </s> 隐状态合成 HER"]
B --> C["分层特征融合策略<br/>HFS 将多层超范例逐级注入视觉编码器中间特征层"]
C --> D["局部极大值检测解码<br/>卷积解码器回归密度图,LMD 滤波滤除背景噪声并输出坐标与计数"]
D --> E["双重联合优化目标<br/>密度图 MSE 回归损失与 GDE 样本/类别双层判别性对比约束联合监督"]
关键设计¶
1. 超范例表示生成:借助 MLLM 隐空间统一建模图文先验与全局实例变异 传统方法要么依赖外部检测器从图像中裁剪少数离散切片,容易放大局部遮挡或姿态变化导致的视觉偏差,要么仅使用脱离画面的类别文本向量。为解决这一痛点,本文采用多模态大语言模型(MLLM,具体采用 Qwen3-VL-2B)作为超范例合成器。模型由图像编码器 \(\Phi_I\) 与多模态语言编码器 \(\Phi_T\) 构成。给定输入图像 \(I\) 与类别文本 \(T\),首先通过 \(\Phi_I\) 将图像投影为视觉 Token 序列,在文本末尾拼接特殊结束标记 \(\texttt{</s>}\) 构成文本序列 \([T, \texttt{</s>}]\)。将视觉 Token 与文本 Token 拼接后统一送入深度为 \(L\) 的多模态语言主干 \(\Phi_T\)。在跨模态注意力机制驱动下,\(\texttt{</s>}\) 处的 Token 嵌入主动聚合了图像中所有符合该类别语义的实例视觉特征。取 \(\Phi_T\) 最后 \(n\) 层的 \(\texttt{</s>}\) 隐状态 \(\mathbf{e}_i[\texttt{</s>}]\)(\(i = L-n+1, \dots, L\)),分别经过轻量多层感知机(MLP)映射,生成一组层级化的超范例表示: $\(\mathbf{F} = \{\mathbf{f}_i \mid i = L-n+1, \dots, L\}\)$ 这种方式从根本上避免了离散检测器带来的边界框漂移与切片选择误差,同时借助 MLLM 丰富的预训练知识库,使超范例在未见类别上具备强大的零样本泛化能力。
2. 分层特征融合策略(HFS):在视觉编码器中间层逐级注入多尺度超范例引导 得到多模态超范例集合 \(\mathbf{F}\) 后,若仅简单地将其与视觉主干网络的最终输出特征做外积或逐元素相乘,高层表征的后置干预将导致视觉主干在浅层与中层阶段无法感知计数任务目标,只能进行无差别的盲目特征抽取。为此,本文设计了分层融合策略(HFS)。由于集合 \(\mathbf{F}\) 中的超范例来源于 MLLM 的不同深度层级,浅层对应局部几何与纹理信息,深层对应高级类别语义,正好与层次化视觉编码器(采用 HRNet-W32)逐层抽象的表征结构契合。在视觉编码器的第 \(i\) 层网络 \(P_i\) 中,上一层的中间特征 \(\mathbf{h}_{i-1}\) 在前向传播过程中与对应的超范例向量 \(\mathbf{f}_i\) 进行动态交互调制: $\(\mathbf{h}_i = P_i(\mathbf{h}_{i-1}) \odot \mathbf{f}_i\)$ 其中 \(\odot\) 表示通道维度的特征调制操作。通过在视觉编码器中间层自底向上逐级注入多尺度超范例引导,网络能够动态剔除无关背景干扰,使最终层提取的高维特征 \(\mathbf{h}_L\) 强力对齐特定类别的实例计数需求,为下游解码器提供纯净的目标线索。
3. 全局判别性增强约束(GDE):样本与类别双层自适应难例对比学习 仅仅依靠最终密度图的均方误差(MSE)损失对网络进行端到端反向传播,对隐空间超范例表示的约束是间接且微弱的,极易导致超范例在面对显著的类内形态变化时发生漂移,或在多类别共存场景中混淆相似语义。为此,本文提出全局判别性增强(GDE)约束,直接在 MLLM 最高层输出的超范例 \(\mathbf{f}_L\) 上施加监督。GDE 同时在图像样本级(Image Level)和语义类别级(Class Level)构建对比锚点:以各图像样本的超范例作为样本级锚点 \(A^I\),以各类别内所有样本超范例的平均向量作为类别级锚点 \(A^C\)。对于当前超范例 \(\mathbf{f}_L\),GDE 强制拉近其与正锚点(同图/同类)的余弦相似度,同时推远与全部负锚点的距离: $\(\mathcal{L}_{gde} = \overline{\log\left(1 + \frac{S_n^I}{\text{sim}(\mathbf{f}_L, A^I[p^I])}\right)} + \overline{\log\left(1 + \frac{S_n^C}{\text{sim}(\mathbf{f}_L, A^C[p^C])}\right)}\)$ 其中 \(\text{sim}(\mathbf{u}, \mathbf{v}) = \exp(\mathbf{u}^\top \mathbf{v} / \tau)\),\(\tau = 0.05\) 为温度系数,\(S_n^I\) 与 \(S_n^C\) 分别为所有负锚点相似度之和。该目标函数的对数比值形式具备自适应难例挖掘特性:当正样本相似度偏低或负样本过于接近时,梯度幅值自动放大,迫使网络重点关注困难边界样本与易混淆类别,从而极大强化了超范例的类内紧凑性与类间可分离度。
4. 局部极大值检测解码(LMD):抑制背景弥散噪声并显式提供空间定位坐标 主流密度图回归方法习惯于直接对整幅预测图 \(D \in \mathbb{R}^{1 \times H \times W}\) 的所有像素值求和得到总计数 \(N = \sum D\)。然而在真实场景中,大面积的背景区域常存在低幅值却分布广泛的伪响应残差,全局累加会造成显著的计数正向漂移,且该操作完全无法输出目标的空间分布位置。得益于高质量超范例与 GDE 约束下生成的密度图具有极高的信噪比与尖锐响应峰值,HER-Count 引入了在关键点检测中成熟的局部极大值检测(LMD)策略。在预测的连续密度图上应用 \(3 \times 3\) 局部最大值滤波并设置响应置信度阈值(设定为 0.05),精准提取离散的响应中心峰值坐标 \([x_k, y_k]\),并通过有效峰值点的数量直接得到确定性的整数计数结果。该设计不仅从机制上隔绝了背景微弱弥散噪声的积分放大效应,还以极低的计算开销赋予了模型实例级定位的能力。
损失函数 / 训练策略¶
模型的总体训练损失由两部分联合构成: $\(\mathcal{L} = \mathcal{L}_{mse} + \lambda_{gde} \mathcal{L}_{gde}\)$ 其中 \(\mathcal{L}_{mse}\) 为预测密度图 \(D\) 与高斯点标真实密度图 \(D^*\) 之间的均方误差损失: $\(\mathcal{L}_{mse} = \frac{1}{HW} \sum_{x, y} (D(x, y) - D^*(x, y))^2\)$ 损失平衡超参数设为 \(\lambda_{gde} = 0.1\)。训练时视觉主干采用 HRNet-W32,解码器由 4 层 256 通道的卷积层组成,输入图像分辨率统一调整为 \(384 \times 384\)。采用 AdamW 优化器,基础学习率初始化为 0.03 并遵循余弦退火策略衰减至 0,权重衰减为 0.05,批大小为 16。在 4 张 NVIDIA RTX 4090 GPU 上针对 FSC147 训练 100 轮仅需约 5 小时。
实验关键数据¶
主实验¶
在广泛使用的标准零样本目标计数基准 FSC147 上与代表性 SOTA 方法的定量对比结果如下表所示。评测指标为平均绝对误差(MAE)与均方根误差(RMSE):
| 方法 | 来源 | 输入尺寸 | Val MAE | Val RMSE | Test MAE | Test RMSE |
|---|---|---|---|---|---|---|
| ZSC | CVPR 2023 | 384 | 26.93 | 88.63 | 22.09 | 115.17 |
| CLIP-Count | ACM MM 2023 | 224 | 18.79 | 61.18 | 17.78 | 106.62 |
| PseCo | CVPR 2024 | 1024 | 23.90 | 100.33 | 16.58 | 129.77 |
| VA-Count | ECCV 2024 | 384 | 17.87 | 73.22 | 17.88 | 129.31 |
| DAVE (prompt) | CVPR 2024 | 512 | 15.48 | 52.57 | 14.90 | 103.42 |
| GeCo | NeurIPS 2024 | 1024 | 14.81 | 64.95 | 13.30 | 108.72 |
| YOLO-Count | ICCV 2025 | 640 | 15.43 | 58.36 | 14.80 | 96.14 |
| T2ICount | CVPR 2025 | 384 | 13.78 | 58.78 | 11.76 | 97.86 |
| HER-Count (本文) | ECCV 2026 | 384 | 13.56 | 55.52 | 14.23 | 95.31 |
在极具挑战性的跨数据集泛化评测(FSC147 训练直接迁移测试 CARPK 停车场航拍车辆计数)中,HER-Count 展现出压倒性的跨域鲁棒性:
| 方法 | 来源 | 范例标注(#Shot) | CARPK \(\to\) CARPK MAE | CARPK \(\to\) CARPK RMSE | FSC147 \(\to\) CARPK MAE | FSC147 \(\to\) CARPK RMSE |
|---|---|---|---|---|---|---|
| BMNet+ | CVPR 2022 | 3-shot | 5.76 | 7.83 | 10.44 | 13.77 |
| CounTR | BMVC 2022 | 3-shot | 5.75 | 7.45 | - | - |
| RCC | CVPR 2023 | 0-shot | 9.21 | 11.33 | 21.38 | 26.61 |
| CLIP-Count | ACM MM 2023 | 0-shot | - | - | 11.96 | 16.61 |
| VA-Count | ECCV 2024 | 0-shot | 8.75 | 10.30 | 10.63 | 13.20 |
| HER-Count (本文) | ECCV 2026 | 0-shot | 5.19 | 6.77 | 5.56 | 7.14 |
消融实验¶
在 FSC147 验证集与测试集上对 HER-Count 各核心组件有效性及输入模态构成的消融分析如下:
| 配置 | 核心改动 | Val MAE | Val RMSE | Test MAE | Test RMSE | 说明 |
|---|---|---|---|---|---|---|
| Baseline HER | 仅最后一层注入单特征,无 GDE | 16.85 | 67.96 | 17.17 | 107.65 | 基础超范例表示 |
| HER + HFS | 引入分层特征融合策略 | 15.53 | 59.71 | 15.71 | 96.12 | 逐层特征对齐显著降低误差 |
| HER + \(\text{GDE}^I\) | 仅加入图像样本级对比约束 | 15.18 | 60.35 | 16.25 | 97.97 | 样本内外观不变性提升 |
| HER + GDE | 结合样本级与类别级完整 GDE | 14.33 | 58.11 | 15.56 | 96.79 | 类内紧凑与类间判别并重 |
| HER-Count (Full) | 完整模型(HFS + 完整 GDE) | 13.56 | 55.52 | 14.23 | 95.31 | 各组件协同达到最优性能 |
不同输入信息源对超范例合成的影响对比:
| 输入信息源 | 机制说明 | Val MAE | Val RMSE | Test MAE | Test RMSE | 说明 |
|---|---|---|---|---|---|---|
| Image-only | 仅输入图像编码 HER | 16.55 | 60.56 | 16.83 | 101.76 | 缺乏类别指令,多目标易混淆 |
| Text-only | 仅输入类别名称编码 HER | 15.77 | 58.73 | 15.13 | 99.56 | 无法感知特定图像中的外观细节 |
| Multi-modal | 图像与类别文本联合编码 | 13.56 | 55.52 | 14.23 | 95.31 | 图文融合定制化表示,效果最佳 |
推理效率与模型轻量化分析(FSC147-Val,单张 RTX 4090 GPU,Batch Size = 1):
| 模型 | 参数量 | 推理速度 (FPS) | Val MAE | Val RMSE | 说明 |
|---|---|---|---|---|---|
| VA-Count | 0.95B | 6.4 | 17.87 | 73.22 | 依赖多阶段外部检测模块 |
| GeCo | 1.2B | 1.1 | 14.81 | 64.95 | 高分辨率双阶段计算缓慢 |
| T2ICount | 2.0B | 1.4 | 13.78 | 58.78 | 基于扩散模型多步去噪反向推断 |
| HER-Count (CLIP) | 0.44B | 27.1 | 14.73 | 59.64 | 轻量化变体,兼顾超高吞吐与高精度 |
| HER-Count (Qwen3-VL) | 2.1B | 14.1 | 13.56 | 55.52 | 端到端单步前向传播,推理速度超 SOTA 10 倍 |
关键发现¶
- 分层融合(HFS)是性能跃升的关键杠杆:在基线 HER 基础上加入 HFS 后,测试集 RMSE 直接从 107.65 骤降至 96.12(降幅达 11.53 点)。这证明了多模态大模型从浅到深的多尺度隐状态必须与视觉编码器的层级抽象对齐,单一的高层后置注入无法弥补前向骨干在浅层特征提取时的方向盲目性。
- GDE 约束极大压制了特征类内发散:定量距离统计表明,GDE 损失显著收窄了同类样本在隐空间中的特征余弦距离方差,同时拉开了易混淆类别的分布间距,有效化解了斑点、瓶盖不同颜色与姿态带来的假阴性漏检。
- 端到端前向推理突破了零样本计数的速度瓶颈:以往基于扩散去噪(如 T2ICount,仅 1.4 FPS)或高分辨率重采样(如 GeCo,仅 1.1 FPS)的方法难以落地,而 HER-Count 凭借简洁的单步多模态端到端融合架构,在 2.1B 参数规模下达到了 14.1 FPS,更轻量的 CLIP 变体进一步跃升至 27.1 FPS,且性能依然与 2B 规模的 SOTA 模型相当。
亮点与洞察¶
- 跳出切片物理框选思维,构建隐空间超范例:以往工作纠结于如何借助检测器裁剪出无瑕疵的局部真实图像块,却始终受制于有限切片对全局外观变异的代表性不足。HER-Count 创新性地将范例概念提升为连续高维隐空间的多模态表征,让 MLLM 自动聚合整图中所有实例的共性,构思极为巧妙。
- 用自适应对比损失直接监督大模型输出 Token:通常零样本下游任务仅在最终输出端加 loss,中间的大模型表征缺乏针对特定判别任务的约束。本文提出的 GDE 在样本级与类别级引入自适应梯度放大的对比损失,直接赋能 MLLM 的特定 Token 嵌入,该范式非常适合迁移至其他小样本多模态检测与分割任务中。
- 从积分求和回归到峰值定位检测:打破了传统密度图计数“求和即所得”的固定惯性,通过高信噪比密度图配合局部极大值滤波,既彻底消除了背景弥散低幅值噪声对总数的虚假抬升,又无损换取了实例中心定位坐标。
局限与展望¶
- 密集重叠与极小尺度目标的峰值粘连:在极高密度的工业密集细小颗粒场景下,相邻实例在下采样后的热力图上容易发生连通重叠,导致局部极大值点检测发生粘连漏检,未来需要探究更高分辨率的特征解析方案或结合自适应非极大值抑制策略。
- 对非目标显著背景相似物体的语义解析依赖:超范例在很大程度上继承了 MLLM 预训练模型的视觉-常识推理能力,如果图像中存在大量形态高度相似但类别不同的干扰物(如复杂纹理织物中的圆点 vs 纽扣),超范例偶有出现弱泛化偏差,后续可结合交互式负文本提示进一步提升鲁棒性。
相关工作与启发¶
- vs VA-Count (ECCV 2024):VA-Count 依赖显式检测选出 1~3 个高质量局部切片进行特征比对,容易因特定切片的外观局限而遗漏其他颜色的同类实例(如只能识别红瓶盖而漏掉蓝瓶盖),且多阶段管线推理缓慢(6.4 FPS);HER-Count 依靠多模态全图交互在隐空间中一次性捕获全部实例外观,不仅跨类别变异适应性更好,推理速度也提升一倍以上。
- vs T2ICount (CVPR 2025):T2ICount 仅依赖类别文本经扩散模型多轮去噪与层次化校准来生成计数热图,由于缺乏特定输入图像中的视觉实例先验,在多类混杂或复杂光照场景下容易形成大片粘连响应,且推理耗时长达 1.4 FPS;HER-Count 联合输入原图与类别文本,生成的超范例具备强烈的图像定制化属性,预测的密度图轮廓清晰、峰值锐利。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次打破传统局部切片与纯文本两极范式,提出基于 MLLM 的全图-文本多模态超范例隐空间表征]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 FSC147 各种指标对比、CARPK 零样本强力跨域迁移评测、各模块细致消融及多种模型规模测试]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密流畅,图表直观,公式推导严谨且动机分析透彻深入]
- 价值: ⭐⭐⭐⭐⭐ [为开放词表目标计数提供了兼具精度突破与工业级推理吞吐(14~27 FPS)的高实用价值端到端框架]