Learn to Rank: Visual Attribution by Learning Importance Ranking¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/dschinagl/AHA
领域: 可解释性
关键词: 视觉归因、摊销解释、置换学习、Gumbel-Sinkhorn、Vision Transformer
一句话总结¶
针对视觉归因方法在计算效率、因果忠实性与高分辨率空间细节间的三难困境,本文提出摊销混合归因框架 AHA,通过 Gumbel-Sinkhorn 连续松弛将离散的排序与 Top-k 掩码选择转化为可微置换学习,直接端到端优化 Deletion 与 Insertion 评估指标,单次前向即可生成像素级精细归因热力图。
研究背景与动机¶
深度神经网络的高复杂度使其预测逻辑高度不透明,在医疗诊断、自动驾驶等高风险领域,解释模型决策与保证预测准确率同样关键。视觉归因(Visual Attribution)旨在生成像素或区域级重要性热图以揭示决策依据。然而,现有后验(post-hoc)解释方法普遍受制于三难权衡:基于反向传播的方法(如 Grad-CAM、IG、LeGrad)虽计算极快并忠实于内部计算图,但强依赖特定架构,容易偏向低级纹理与边缘;基于扰动的方法(如 RISE、LIME、SHAP、TIS)通过遮挡输入测量输出变化,具备严格的因果解释性,但每次解释均需数百次前向推理,且在 Vision Transformer(ViT)中通常受限于 patch 离散标记表征,插值到像素空间后热图粗糙模糊;而已有的学习型摊销解释器(Amortized Explainers)多依赖启发式教师模型蒸馏或二元信噪比等严苛先验假设。
这种矛盾的核心在于:社区最认可的因果归因评测黄金标准(Deletion 与 Insertion 指标)本质上依赖对特征重要性的离散降序排序和硬 Top-k 截断,不可微性导致此前没有任何方法能让神经网络直接以这两个核心指标作为损失函数进行端到端梯度反传优化;此前尝试对齐指标的工作(如 MDA)不得不退回极耗时的单样本迭代优化。
本文的切入角度是:Deletion 和 Insertion 指标实际上只取决于像素或区域重要性分数的相对大小排列,而非绝对数值。因此,可以将度量优化重构为一个连续松弛的置换学习(Permutation Learning)问题。核心 idea:利用 Gumbel-Sinkhorn 将非连续的降序排序松弛为双随机置换矩阵与连续软 Top-k 掩码,使 Deletion 和 Insertion 曲线积分完全可微,从而训练轻量摊销解释器单次前向输出像素级精细热图,并支持测试期轻量梯度微调。
方法详解¶
整体框架¶
AHA 旨在为固定的预训练目标分类器 \(f\) 训练一个参数化的解释器网络 \(\Phi_{f,\theta}\)。输入图像 \(I\) 与目标类别 \(t\) 后,解释器输出与原图尺寸相同的稠密归因图 \(A\)。训练过程中,为了避免离散排序带来的不可导障碍,AHA 将归因图的分数排序转化为最优传输分配问题,利用 Gumbel-Sinkhorn 算法求解软置换矩阵,构造软 Top-k 掩码以生成可微的 Deletion 和 Insertion 扰动图像序列,直接将分类器在扰动序列下的输出概率积分(AUC)作为端到端损失函数。在推理阶段,解释器默认仅需单次前向即可输出清晰对齐物体轮廓的高分辨率热图;若追求极致保真度,亦可执行极少步数(如 \(T=3\))的测试期梯度微调。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 I 与目标类别 t"] --> B["解释器网络预测归因图 A"]
B --> C["区域划分与网格随机增强<br/>G×G 分块均值池化"]
C --> D["Gumbel-Sinkhorn 连续置换排序<br/>计算软置换矩阵"]
D --> E["软 Top-k 掩码构建<br/>累加生成平滑扰动序列"]
E --> F["可微 Deletion 与 Insertion 损失<br/>端到端反向传播更新解释器"]
F --> G["推理输出<br/>单次前向或测试期轻量微调"]
关键设计¶
1. Gumbel-Sinkhorn 连续置换排序:化离散排序为可微最优传输
Deletion 与 Insertion 评价指标依赖对归因值 \(a = \text{vec}(A) \in \mathbb{R}^N\) 的降序排列,传统硬排序具有阶梯跳变性质,梯度处处为零或未定义。AHA 抓住指标仅依赖相对次序的本质,引入理想排序目标位置向量 \(p = \frac{1}{N}[N, N-1, \dots, 1]^\top\),并构建归因分数与目标位置之间的相似度成本矩阵 \(L_{i,j} = -(a_i - p_j)^2\)。为促使优化过程探索不同置换排列,在相似度矩阵上叠加 Gumbel 噪声 \(\tilde{L} = (L + G)/\tau\)(其中 \(\tau\) 为温度参数),并利用 Sinkhorn-Knopp 算法进行交替行列归一化,将最优传输问题松弛为一个双随机矩阵 \(P^{\text{soft}}_{\pi_A} \in [0, 1]^{N \times N}\)。该矩阵构成了硬置换矩阵的连续可微逼近,允许下游关于扰动输出的梯度顺畅流回解释器参数。
2. 软 Top-k 掩码构建:可微扰动序列的构造与驱动机制
得到软置换矩阵后,原本离散的 Top-k 特征选择掩码被转化为对软置换矩阵前 \(k\) 行的累积求和:
利用这组随 \(k\) 递增的连续权重掩码,将输入图像 \(I\) 与空白参考图像 \(I_0\)(如黑色、均值或模糊图像)进行渐进式凸组合加权,构造出连续平滑的扰动图像序列 \(I_{\text{del}}^{\text{soft}, (k)}\) 与 \(I_{\text{ins}}^{\text{soft}, (k)}\)。该设计的精妙之处在于:优化并不是单纯寻找顺序,Sinkhorn 连续分配将数值差距转化为包含概率的分离度;若归因图模糊平缓,软掩码在前景和背景间呈现平摊模糊过渡,导致扰动后目标类别概率响应曲线扁平;只有当关键因果区域与背景形成显著数值分化时,软掩码才能在极小 \(k\) 时果断剔除或恢复决定性特征,从而激发出最小化 Deletion AUC 与最大化 Insertion AUC 的强劲优化驱动力。
3. 区域级排列与多重增强策略:破解高维计算瓶颈与高频对抗伪影
直接在图像的全像素尺度(如 \(224 \times 224 = 50{,}176\) 维)执行 \(N \times N\) 的 Sinkhorn 运算在显存与计算上不可承受,且直接在像素级做扰动极易让解释器退化为利用目标模型脆弱性的高频对抗触发器。AHA 采用区域级置换设计,训练时先将归因图通过网格均值池化降维到 \(K = G \times G\) 个局部不相交区域,在区域维度完成软排序后再双线性上采样回原图尺度进行图像扰动。同时,在训练迭代中动态随机采样网格尺度 \(G \in [7, 28]\) 并施加空间随机平移偏移,彻底破除特定网格对齐带来的空间感应偏差;并在完整的扰动序列中均匀采样 \(S \ll K\) 个离散步长(如 \(S=16\))近似曲线积分,将前向与反传开销严格控制在固定预算内。
4. 测试期自适应轻量微调:兼顾吞吐量与极限归因精度的混合推理
为了兼顾通用大吞吐场景与高精度单样本诊断需求,AHA 在推理阶段构建了灵活的弹性机制。默认情况下,冻结的解释器直接进行单次前向(\(T=0\)),耗时仅约 16ms;而在需要极限精度的场景下,可在测试样本上冻结主干仅对解释器解码头执行 \(T\) 步(通常 \(T=3\) 至 \(5\))梯度优化。为保证测试期调整的确定性与数值平稳性,测试微调关闭 Gumbel 随机扰动并固定最终训练温度 \(\tau = \tau_{\text{final}}\),利用极少数步数让归因图更进一步紧致聚焦于目标关键结构并深度压制杂散背景响应。
损失函数 / 训练策略¶
训练目标由可微 Deletion AUC、可微 Insertion AUC 与空间平滑正则项组合而成:
其中 \(\mathcal{L}_{\text{reg}}\) 将归因图 \(A\) 与均值滤波平滑后的图进行 \(L_2\) 范数惩罚,抑制孤立噪点伪影。实验中设定 \(\lambda_{\text{del}} = 1.0\)、\(\lambda_{\text{ins}} = 1.0\)、\(\lambda_{\text{reg}} = 2.5 \times 10^{-3}\)。解释器主干采用冻结的 DINOv3 ViT-L/16,仅训练类别条件注入的 DPT 风格解码头;在 ImageNet-1K 训练集上仅需单轮(1 epoch)训练,采用 AdamW 优化器(学习率 \(3 \times 10^{-4}\),权重衰减 \(10^{-3}\))及单周期余弦退火策略。
实验关键数据¶
主实验¶
在 ImageNet-1K 验证集(50,000 张图像)上,以冻结的 ViT-B/16 分类器为主干进行全量评测。所有扰动指标均针对黑图、均值图与高斯模糊图三种参考底图 \(I_0\) 取均值,评估预测类(Predicted Class)下的归因忠实性与运行效率。
| 方法 | Deletion↓ | Insertion↑ | Ins. - Del.↑ | Positive↓ | Negative↑ | Neg. - Pos.↑ | ADP↓ | PIC↑ | 推理耗时 |
|---|---|---|---|---|---|---|---|---|---|
| Grad-CAM | 0.2858 | 0.4982 | 0.2124 | 0.3346 | 0.5788 | 0.2442 | 84.33 | 4.36 | 0.014s |
| Integrated Gradients | 0.1857 | 0.5544 | 0.3686 | 0.2248 | 0.6347 | 0.4099 | 22.93 | 33.44 | 0.251s |
| Trans-Att. | 0.1654 | 0.5833 | 0.4178 | 0.1961 | 0.6654 | 0.4633 | 28.46 | 30.85 | 0.254s |
| Bi-Att. | 0.1600 | 0.5958 | 0.4358 | 0.2022 | 0.6789 | 0.4828 | 25.70 | 28.26 | 0.254s |
| TIS | 0.1420 | 0.6381 | 0.4961 | 0.1731 | 0.7222 | 0.5492 | 11.25 | 45.57 | 1.167s |
| ViT-CX | 0.1750 | 0.5714 | 0.3964 | 0.2149 | 0.6478 | 0.4328 | 12.55 | 43.50 | 0.860s |
| MDA | 0.1556 | 0.6112 | 0.4556 | 0.1933 | 0.6983 | 0.5050 | 48.67 | 13.27 | 13.645s |
| LeGrad | 0.1666 | 0.5666 | 0.4000 | 0.2036 | 0.6461 | 0.4425 | 20.39 | 34.34 | 0.006s |
| AHA (\(T=0\), 本文) | 0.1381 | 0.6112 | 0.4731 | 0.1714 | 0.6947 | 0.5233 | 15.87 | 36.82 | 0.016s |
| AHA (\(T=3\), 本文) | 0.1215 | 0.6485 | 0.5271 | 0.1491 | 0.7378 | 0.5887 | 12.47 | 42.27 | 0.547s |
消融实验¶
消融实验围绕训练期扰动步数 \(S\) 的采样敏感性,以及测试期微调步数 \(T\) 对 Insertion AUC 与 Deletion AUC 的递进影响展开(ViT-B/16,ImageNet 验证集):
| 配置 / 变量 | 设值 | Insertion AUC (Pred)↑ | Deletion AUC (Pred)↓ | 说明 |
|---|---|---|---|---|
| 扰动采样步数 \(S\) | \(S = 4\) | ~0.535 | - | 粗采样难以准确逼近曲线积分,优化欠佳 |
| 扰动采样步数 \(S\) | \(S = 8\) | ~0.580 | - | 指标快速攀升 |
| 扰动采样步数 \(S\) (基准) | \(S = 16\) | 0.6112 | 0.1381 | 性能收敛且计算代价可控 |
| 扰动采样步数 \(S\) | \(S = 32\) | ~0.613 | - | 算力翻倍但增益趋于边际平截 |
| 测试期微调 \(T\) | \(T = 0\) (单次前向) | 0.6112 | 0.1381 | 纯摊销推理,耗时 0.016s |
| 测试期微调 \(T\) | \(T = 1\) | ~0.628 | ~0.130 | 首步梯度更新增益最明显 |
| 测试期微调 \(T\) | \(T = 2\) | ~0.640 | ~0.125 | 进一步压制低对比度背景散斑 |
| 测试期微调 \(T\) | \(T = 3\) | 0.6485 | 0.1215 | 达到质量与延迟的最佳折中 (0.547s) |
| 测试期微调 \(T\) | \(T = 5\) | ~0.655 | ~0.118 | 曲线逐渐趋平,边缘极为锐利 |
关键发现¶
- 直接度量优化的越级表现:未经任何测试期微调的零样本配置下(\(T=0\)),AHA 的 Deletion(0.1381)便显著优于此前经过极高代价单样本优化的 MDA(0.1556)及各类注意力传播方法;在仅微调 3 步后(\(T=3\)),综合忠实度指标(Ins. - Del. 达到 0.5271)刷新了全场最优记录。
- 高分辨率轮廓保真度:相比基于 patch 标记切片(如 TIS、ViT-CX)产生的方块化斑块,AHA 得益于像素级解码器结合动态多尺度网格正则化,可视化热图能精确抠出目标物体部件(如斑马角、开罐器接触点),且背景平均降幅指标 ADP 极低。
- 算力收益边际收敛点清晰:训练期扰动点数在 \(S=16\) 时即达到平衡拐点,测试期微调在 \(T=3\) 时即可捕获超过 80% 的潜在微调增益,推理耗时依然远低于纯扰动方法。
亮点与洞察¶
- 将不可导评估指标转化为置换学习:巧妙指出 Deletion/Insertion 只依赖相对序关系的本质,借由 Gumbel-Sinkhorn 突破梯度阻断,首次使基于度量直接训练通用前向解释器成为可能。
- 空间平滑与尺度随机化抑制对抗捷径:通过区域均值池化、多尺度网格随机扰动和拉普拉斯式邻域正则,在保证像素级输出锐度的同时,根本性阻断了神经网络利用高频对抗噪声投机取巧。
- 连接摊销效率与测试期测试适应:既有单次前向的高通量实用价值,又无缝保留向特定样本回传梯度的能力,为高精度可解释性系统设计提供了兼顾速度与精度的范式。
局限与展望¶
- 目标模型重新训练成本:解释器与被解释模型的决策分布深度绑定,每引入一种新型分类器架构均需重新训练一次解释器,缺乏跨模型即插即用的零样本泛化能力。
- 代理指标的固有偏置:Deletion 与 Insertion 指标高度受制于所选参考底图(黑图、均值或模糊),即便本文在三种底图下取平均,仍然存在一定程度的分布外(OOD)扰动伪影。
- 依赖具有代表性的训练集:解释器的离线训练必须依赖目标模型训练分布相符的大规模无标注或有标注数据,对于缺乏公开训练集的闭源私有模型难以直接施展离线摊销。
相关工作与启发¶
- vs MDA (Metric-Driven Attribution):MDA 同样试图以 Deletion/Insertion 为目标,但采用逐样本迭代暴力搜索 patch 掩码,单张图耗时高达 13.6 秒;AHA 借助连续可微松弛将优化转移至离线训练,单图推理仅需 0.016 秒(提速超 800 倍),且输出为像素级连续平滑热图而非粗粒度 patch 块。
- vs TIS / ViT-CX:TIS 和 ViT-CX 强依赖 ViT 原生的 token 移除与交叉相关性打分,只能给出 \(14 \times 14\) 尺寸的 patch 权重,插值放大后边缘严重溢出;AHA 摆脱了 token 维度的束缚,端到端学习到了精准贴合物体真实解剖轮廓的高频归因。
- vs LeGrad / Transformer-Attribution:注意力反向传播方法虽极快(数毫秒级),但往往混杂浅层边缘纹理,易受梯度饱和干扰;AHA 完美继承了扰动方法的因果检验特性,热图聚焦度与因果保真度显著更高。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用 Gumbel-Sinkhorn 置换学习破解了归因评测指标长期不可微的死结,思路极具启发性。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 ImageNet-1K 50K 全量验证集、多类模型架构(ViT-B/16 与 ViT-B/32)、3 种参考底图平均及详尽的定性对比。
- 写作质量: ⭐⭐⭐⭐⭐ 概念铺垫自然,数学公式与连续松弛逻辑推导严谨清晰。
- 价值: ⭐⭐⭐⭐⭐ 为 ViT 及现代视觉模型的高保真、实时可解释性落地提供了极具实用价值的混合方案。