跳转至

Cross-token Guidance Transformer for Weakly Supervised Object Localization

会议: ECCV 2026
论文: ECCV 原文
领域: 目标检测
关键词: 弱监督目标定位, 视觉Transformer, 交叉Token引导, 注意力调控, 引导滤波

一句话总结

针对弱监督目标定位中单独依赖定位Token易受共存背景干扰导致扩散激活的问题,本文提出跨Token引导Transformer(CGTR),通过全局注意力调控模块与局部滤波调控模块实现类别Token与定位Token的跨尺度协同,在CUB-200-2011与ILSVRC上取得SOTA定位精度。

研究背景与动机

弱监督目标定位(WSOL)仅依赖图像级类别标签来训练目标定位器,显著降低了像素级和边界框级稠密标注的高昂成本。早期的WSOL方法多建立在卷积神经网络(CNN)与类别激活图(CAM)之上,通过对抗擦除、数据增强或特征挖掘促使网络探索非判别性区域。然而,受限于卷积操作局部感受野和全局上下文建模能力的不足,CNN往往仅能激活目标最具辨识度的局部区域(如鸟头或猫脸),难以覆盖目标整体。

随着视觉Transformer(ViT)引入WSOL领域,自注意力机制有效捕捉了长距离依赖。为了缓解分类任务(侧重高判别力局部)与定位任务(侧重完整边界)之间的优化冲突,近期代表性工作(如SAT)引入了与类别Token(Class Token, \(T_{cls}\))相互独立的定位Token(Location Token, \(T_{loc}\))。然而,这种割裂的设计彻底丢弃了分类过程蕴含的高层语义线索。在缺乏类别指导的情况下,定位Token在捕捉长距离相关性时极易被经常共同出现的背景上下文元素(如河流中的响尾蛇、人身前的手风琴、灌木丛中的麻雀)所误导,产生难以约束的背景扩散激活(Diffuse Activation)。

深入观察表明,类别Token生成的注意力图虽然边界较为粗糙,却能精准解耦类别主体与共存背景,具备极强的目标聚焦先验。因此,定位任务不应与分类彻底断绝交互,而应建立良性的跨Token引导机制。核心 idea:构建跨Token引导Transformer(CGTR),利用类别Token的高层语义作为全局先验与局部滤波模板,自顶向下约束定位Token的注意力分布与几何结构,在零新增参数下消除扩散激活并补全完整物体边界。

方法详解

整体框架

CGTR以预训练的DeiT-S为骨干网络,将图像切片序列与可学习的类别Token \(T_{cls}\) 及定位Token \(T_{loc}\) 联合拼接输入。网络前半部分由 \(M\) 个基础Transformer块捕捉全图基础特征,后半部分由 \((L - M)\) 个定位Transformer块执行空间查询注意力。在编码器内部,注意力调控模块(ARM)动态将类别Token的语义分布注入定位Token的注意力计算中;在编码器末端,滤波调控模块(FRM)以类别引导滤波对定位图进行保边平滑与结构重构;最终双路预测平均融合为高保真定位图。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入图像 + Patch Token<br/>拼接类别Token Tcls 与定位Token Tloc"] --> Base["M 个基础 Transformer 块<br/>全局特征抽取与多头自注意力"]
    Base --> ARM["注意力调控模块 ARM<br/>qloc 与 kcls 跨Token交互调制特征值"]
    ARM --> LocBlocks["(L-M) 个定位 Transformer 块<br/>空间查询生成 M_loc 与 M_cls"]
    LocBlocks --> FRM["滤波调控模块 FRM<br/>局部统计引导滤波迁移结构特性"]
    LocBlocks --> Fuse["双路融合与后处理<br/>M_loc 与 M_frm 像素级均值"]
    FRM --> Fuse
    Fuse --> Out["连通域提取与最小外接矩形<br/>预测目标边界框与前景掩码"]

关键设计

1. 注意力调控模块:跨Token语义注入抑制共存背景偏置 该设计旨在根除定位Token在自注意力计算中盲目扩散至相关背景的痛点。传统空间查询注意力仅依赖定位Token自身查询全部空间Patch,容易受到场景共存物体的语义混淆。ARM在多头自注意力内部介入:从投影特征中分别提取定位Token的查询向量 \(q_{loc}\)、类别Token的键向量 \(k_{cls}\) 与值向量 \(v_{cls}\),通过缩放点积注意力计算跨Token相关性得分 \(s_{lc}\): $\(s_{lc} = \text{Softmax}\left(\frac{q_{loc} k_{cls}^\top}{\sqrt{D}}\right)\)$ 随后利用此得分与类别值向量重构定位值特征: $\(\tilde{v}_{loc} = v_{loc} \cdot s_{lc} \cdot v_{cls}\)$ 将原值矩阵中的 \(v_{loc}\) 替换为 \(\tilde{v}_{loc}\) 后继续执行注意力更新。此举将单标签分类中“类别Token必然聚焦目标语义主体”的强归纳偏置全局显式注入定位流中。同时,模块在后 \((L-M)\) 层分别汇聚输出定位注意力图 \(M^\star_{loc}\) 与类别注意力图 \(M^\star_{cls}\),引入面积约束损失: $\(\mathcal{L}_{arm} = \left| \left( \frac{1}{hw} \sum_{i=1}^h \sum_{j=1}^w M^\star_{loc}(i,j) \cdot M^\star_{cls}(i,j) \right) - \xi \right|\)$ 通过超参数 \(\xi\) 迫使定位响应与类别语义响应在重叠面积上保持一致,直接惩罚脱离类别主体的扩散背景响应。

2. 滤波调控模块:语义引导滤波实现局部结构与边界细化 尽管ARM在全局语义上拉齐了定位区域,但浅层或深层注意力图仍存在局部响应破碎、边缘模糊的问题。FRM借鉴经典引导滤波思想,将粗糙但类别纯度高的类别注意力图 \(M^\star_{cls}\) 作为引导图像,去平滑和校准定位图 \(M^\star_{loc}\) 的局部几何拓扑。模块在 \(k \times k\) 局部滑动窗口内计算二者的均值 \(m^{avg}_{loc}\)\(m^{avg}_{cls}\)、方差 \(m^{var}_{cc}\) 与协方差 \(m^{cov}_{lc}\): $\(w_{loc} = \frac{m^{cov}_{lc}}{m^{var}_{cc} + \varepsilon}, \quad b_{loc} = m^{avg}_{loc} - w_{loc} \odot m^{avg}_{cls}\)$ 系数经过均值池化平滑为 \(w^{avg}_{loc}\)\(b^{avg}_{loc}\) 后,对类别图施加空间可变线性变换并截断至 \([0, 1]\) 区间,输出调控定位图 \(M_{frm} = \Phi(w^{avg}_{loc} \odot M^\star_{cls} + b^{avg}_{loc})\)。该操作自适应保留了高置信边缘,抑制了高频斑块噪声。同时引入信息熵正则化损失: $\(\mathcal{L}_{frm} = -\frac{1}{hw} \sum_{i,j} \left( M_{frm} \log(M_{frm} + \epsilon) + (1 - M_{frm}) \log(1 - M_{frm} + \epsilon) \right)\)$ 促使调控图的像素级概率趋于两极化(清晰的前景与背景),进一步强化边界陡峭度。

3. 双尺度协同定位:多层级响应无缝平均融合 最终预测阶段不偏废任一尺度,而是直接对ARM产生的多层平均定位图 \(M^\star_{loc}\) 与FRM生成的结构调控图 \(M_{frm}\) 取逐像素均值:\(M = \frac{1}{2}(M^\star_{loc} + M_{frm})\)。这种双路互补设计使得全局多层聚合语义与精细局部滤波结构形成互验,避免单一模块过平滑或过拟合局部极值。全流程不增加任何可学习参数,保持了极高的推理效率与优雅度。

损失函数 / 训练策略

模型采用端到端联合训练,总损失函数定义为分类交叉熵与两项调控损失的加权和: $\(\mathcal{L} = \mathcal{L}_{cls} + \mathcal{L}_{arm} + \lambda \mathcal{L}_{frm}\)$ 其中 \(\mathcal{L}_{cls}\) 监督类别预测头,\(\mathcal{L}_{arm}\) 约束激活区域面积一致性(目标面积超参设为 \(\xi = 0.37\)),\(\mathcal{L}_{frm}\) 为熵正则项,平衡因子设为 \(\lambda = 0.45\)。骨干网络采用DeiT-S,输入图像分辨率调整为 \(224 \times 224\)。在CUB-200-2011上使用AdamW优化器微调30个epoch,初始学习率为 \(1 \times 10^{-4}\);在大型ILSVRC数据集上训练1个epoch,初始学习率为 \(1.5 \times 10^{-5}\)

实验关键数据

主实验

在细粒度鸟类基准CUB-200-2011和大规模分类定位基准ILSVRC上,CGTR与主流CNN方法及最新Transformer方法进行了全面对比。

数据集 方法 骨干网络 Top-1 Loc (%) Top-5 Loc (%) GT-known Loc (%) Top-1 Cls (%)
CUB-200-2011 TS-CAM [ICCV21] DeiT-S 71.30 83.80 87.70 80.30
CUB-200-2011 LCTR [AAAI22] DeiT-S 79.20 89.90 92.40 85.00
CUB-200-2011 SAT [ICCV23] DeiT-S 80.96 94.13 98.45 -
CUB-200-2011 CDTR [TPAMI25] DeiT-S 81.33 94.06 96.89 83.87
CUB-200-2011 CGTR (本文) DeiT-S 81.80 94.40 98.68 82.29
ILSVRC TS-CAM [ICCV21] DeiT-S 53.40 64.30 67.60 74.30
ILSVRC SCM [ECCV22] DeiT-S 56.10 66.40 68.80 76.70
ILSVRC SAT [ICCV23] DeiT-S 60.15 70.52 73.13 78.41
ILSVRC CIAT [IJCAI24] DeiT-S 59.80 69.90 72.10 78.60
ILSVRC CGTR (本文) DeiT-S 60.35 70.68 73.33 78.39

在掩码分割质量(PxAP)评估上,CGTR在CUB-200-2011上达到90.22%,较TS-CAM的81.49%提升8.73%,明显优于SAT的89.87%。在ILSVRC的MaxBoxAccV2综合定位评价中,CGTR在 \(\delta=0.3/0.5/0.7\) 下分别达到84.66%、73.33%与56.52%,均值达71.50%,居同骨干模型首位。

消融实验

消融实验验证了ARM与FRM两大模块在定位精度上的增益与协同作用。

数据集 配置 / 变体 ARM FRM Top-1 Loc (%) Top-5 Loc (%) GT-known Loc (%)
ILSVRC (a) Vanilla基线 - - 56.86 66.56 69.10
ILSVRC (b) 基线 + ARM - 58.57 68.39 70.91
ILSVRC (c) 基线 + FRM - 58.22 68.11 70.58
ILSVRC CGTR (完整模型) 60.35 70.68 73.33
CUB-200-2011 (d) Vanilla基线 - - 76.25 87.87 91.77
CUB-200-2011 (e) 基线 + ARM - 79.43 91.89 95.96
CUB-200-2011 (f) 基线 + FRM - 78.36 90.46 94.39
CUB-200-2011 CGTR (完整模型) 81.80 94.40 98.68

超参数敏感性分析表明: - 损失平衡因子 \(\lambda\)\([0.40, 0.55]\) 范围内性能波动极小(ILSVRC Top-1 Loc 处于 60.28%~60.35%),在 \(\lambda=0.45\) 处达到最优点。 - 面积约束参数 \(\xi=0.37\) 时获得最佳定位平衡,过大或过小均会使激活区域偏离目标真实边界。 - 引导滤波核尺寸 \(k=3\) 表现最佳,随着 \(k\) 增大到5或7,过大局部窗口容易引入冗余模糊性导致定位精度下降。

关键发现

  • 单独添加ARM使ILSVRC上的GT-known Loc提升1.81%,CUB上提升4.19%;单独添加FRM分别提升1.48%和2.62%。二者联合使用展现出显著的超加和协同效应,总GT-known分别提升4.23%与6.91%,证明全局语义对齐与局部边缘滤波在功能上完全互补。
  • 可视化显示SAT经常在水面草木、潜水员气瓶、乐器演奏者身上产生强烈误激活;CGTR借助类别Token对共存噪声的天然免疫力,将激活边界干净利落地收敛在目标物主体范围内。

亮点与洞察

  • 反思Token解耦的盲目性:此前SAT为避免分类定位优化冲突将二者Token彻底剥离,CGTR敏锐指出“分类特征虽然聚焦局部,但其语义判别力是防止定位发散的最关键防线”,通过设计定向的单向交叉调控,既避免了反向梯度对分类性能的冲击,又为定位注入了语义罗盘。
  • 经典图像处理与自注意力的巧妙杂化:FRM没有盲目增加复杂的注意力层或卷积头,而是把经典Guided Image Filtering的闭式解无缝映射为张量运算,以 \(O(1)\) 的无参数开销完成了特征保边平滑。
  • 通用弱监督定位思想的可迁移性:类别引导局部滤波(FRM)与跨Token调制(ARM)的解法完全可以迁移至弱监督语义分割(WSSS)以及多模态弱监督定位(Grounding)任务中,用于剔除文本-图像对中的伪共现背景关联。

局限与展望

  • 单目标与显式单标签先验假设:ARM依赖单标签分类中类别Token与前景主体的高度吻合;若扩展至复杂多目标检测场景(如COCO中多类别共存且相互遮挡),单一类别Token不足以提供区分不同实例的独立空间线索。
  • 骨干网络依赖性:目前实验主要基于标准DeiT-S验证,尚未在更先进的自监督ViT(如DINOv2)或分层ViT(如Swin Transformer)上探究此类Token交互对原生Patch语义的影响。
  • 改进方向:可进一步探索自适应动态调整核大小 \(k\) 与面积惩罚权重 \(\xi\) 的网络结构,使模型能自适应大尺度目标(如公交车)与小尺度目标(如鸟喙、昆虫)。

相关工作与启发

  • vs TS-CAM (ICCV 2021): TS-CAM直接将语义感知Token与空间注意力图点乘耦合,未设立专用定位Token,容易导致分类与定位特征互相拉扯且边缘粗糙;CGTR采用专用双Token并通过ARM与FRM显式引导,在ILSVRC上Top-1 Loc超出近7个百分点。
  • vs SAT (ICCV 2023): SAT开创性提出了空间感知定位Token,但切断了类别Token的信息流动,致使其在复杂共存背景下频繁出现扩散激活;CGTR在保留独立定位流优势的同时重新引入类别引导,解决了共存噪声干扰。
  • vs Guided Filter (TPAMI 2012): 传统引导滤波处理RGB与灰度图的空域滤波,CGTR将其推广到Transformer高层隐式注意力图之间的特征级相互调控,赋予了传统算子在深度网络中的新生。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 重新审视分类与定位Token的隔离弊端,跨Token调控与无参数滤波机制设计简洁精巧。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖CUB和ILSVRC双基准、IoU多阈值分析、PxAP掩码评测及详尽超参数消融。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照详实,消融与对比实验分析切中要害。
  • 价值: ⭐⭐⭐⭐☆ 为弱监督定位领域的Transformer结构设计提供了兼顾高效与高精度的重要基线范式。