跳转至

Interpretable but Fragile? Robustness of Concept Bottlenecks under Geometric-Semantic Perturbations

会议: NeurIPS 2026(录用信息来自任务元数据)
arXiv: 2609.38625v1
领域: 可解释性
关键词: 概念瓶颈模型、生成器评测、语义扰动、随机平滑、认证鲁棒性

一句话总结

论文用共享生成器区分潜空间几何变化和生成器概念变化,比较普通分类器与概念瓶颈模型的预测稳定性及平滑分类器证书,发现可解释性不带来统一的鲁棒性优势,而是改变敏感性出现的位置;结论限于生成器原生输入及具体任务条件。

研究背景与动机

概念瓶颈模型(Concept Bottleneck Model,CBM)把图像分类拆成可解释概念预测和基于概念的类别判断。这样的接口让人能够检查模型依赖什么属性,却不能直接保证这些属性稳定,更不能保证最后的类别预测稳定。已有研究分别报告概念瓶颈能够过滤无关变化、提高预测鲁棒性,以及概念表示本身容易变化。这两种观察并不必然矛盾:解释是否稳定、类别是否稳定,原本就是不同问题。

常见的像素扰动很难说明到底改变了哪些语义因素。本文于是借助已有概念瓶颈生成器,在图像生成之前分别改变连续潜变量和离散概念状态,再把同一批图像交给不同分类器。生成器在这里是测量工具,不是本文新提出的分类网络。这样的安排能够固定外部变化,却不能把“生成器中的某个概念”自动等同于分类器内部概念,更不能保证每次语义改变都应该保留原类别。

因此,论文真正要回答的不是“CBM 是否更安全”的泛化判断,而是:在明确输入来源、扰动空间、评价层级和任务结构后,瓶颈在哪里过滤变化,又在哪里放大变化。核心 idea:通过共享的“扰动—生成图像—分类预测”接口,把经验敏感性和扰动空间匹配的平滑证书分开测量,再用类别相似性与概念词表变化解释鲁棒性方向为何会反转。

方法详解

整体框架

实验起点是一个预训练生成器,其内部插入已有的概念瓶颈自编码器(CB-AE)。潜变量先经过生成器前半部分,再被编码成显式概念表示,经解码和生成器后半部分得到图像。CUB 使用基于 StyleGAN 的生成器,默认选取出现频率较高的 15 个概念;RIVAL-10 使用 BigGAN,默认使用全部 18 个属性。生成器训练完成后冻结,并供所有下游分类器共享。

比较对象主要是共享预训练 ResNet-50 骨干的普通分类器和后处理概念瓶颈模型(Post-hoc Concept Bottleneck Model,PCBM)。普通分类器直接从图像特征预测类别,PCBM 通过概念激活向量风格的概念表示和决策头预测类别。本文关注冻结骨干的后处理模型,不能据此替代对联合训练或端到端 CBM 的验证。

生成器可以接受两类变化:一类是在连续潜空间内改变输入,再重新生成图像;另一类是在生成器的成对概念坐标中交换正、负状态,再解码图像。分类器始终接收图像,而不是直接接收被修改的生成器概念。因而,即使普通分类器没有显式概念接口,也可以接受完全相同的外部语义变化。

经验评测记录图像前后预测是否变化、生成器概念状态是否变化、PCBM 内部表示移动多少。认证评测则另外构造随机平滑分类器,并根据潜空间或概念空间的噪声分布推导稳定性范围。两种评测不是同一个指标,平滑后的预测器也不是未经平滑的基础分类器。

这是生成器驱动的评测与机制分析,不是一套新的多模块网络;因此不把数据集、指标和统计检验画成虚构的网络结构。下文依次解释共享参照、敏感性分解、空间匹配证书和任务条件控制。

关键设计

1. 共享生成器与一致预测参照:固定外部变化,但不冒充自然图像真值

论文首先筛出普通分类器与 PCBM 在未扰动生成图像上预测一致的样本,组成一致预测集合,并把共同预测作为参考标签。这个设计减少了起点分类意见不同带来的混淆:之后观察到的预测变化,不会只是两种模型本来就判断不同。然而,两者可能同时预测错误,因此参考标签不是人工标注真值,集合上的初始一致也不等于自然图像准确率。

这还带来一个条件选择效应:结果回答的是“双方已达成一致的生成图像附近发生什么”,而不是整个生成分布或真实测试分布上的表现。RIVAL-10 的官方数据划分用于训练与数据设置,不应把一致预测集合上的稳定性数字改写成该自然测试集的分类准确率。语义变化还可能改变合理类别,因此相对起点预测发生变化只能称为预测不稳定,不能一律称为识别错误。

潜空间变化以欧氏范数预算控制,其含义是生成器潜变量邻域中的连续变化,并非固定像素距离或实际物理变换。语义经验评测则均匀选择固定数量的不同概念,交换每个概念的一对正、负坐标。该操作的语义解释依赖生成器与概念标注的质量;“控制语义”不意味着完全解耦所有图像因素,也不意味着严格保留几何结构或类别。

不同模型内部无需一一对齐。附录把 PixPNet 加入相同外部接口,评测生成器语义变化后它的预测是否稳定,并没有直接修改 PixPNet 的局部原型。可以共用的是生成图像与预测级评测,不能因此声称生成器概念、PCBM 概念和 PixPNet 原型是同一种表示。

2. 分层敏感性度量:区分概念发生变化与决策受影响

概念翻转率(CFR)通过二值概念判别器检测生成器概念状态的变化;预测翻转率(PFR)看分类器最终类别是否改变;决策函数敏感性(DFS)则计算 PCBM 对两张图像预测的概念表示之间的欧氏距离。三者分别描述外部概念状态、输出类别和内部连续表示,不能互相替代,也不能把 DFS 当作普通分类器与 PCBM 共享尺度的表示距离。

把原始与变化后的图像分别记为原图和变化图,原文的归一化 CFR、PFR 与 DFS 可写为:

\[ \mathrm{CFR}=\mathbb{E}\!\left[\frac{1}{K}\sum_{i=1}^{K}\mathbf{1}[\mathcal{C}(c_i)\ne\mathcal{C}(\tilde c_i)]\right],\qquad \mathrm{PFR}(f)=\mathbb{E}[\mathbf{1}[f(x)\ne f(\tilde x)]],\qquad \mathrm{DFS}=\mathbb{E}[\|r(x)-r(\tilde x)\|_2]. \]

其中概念判别器描述生成器的概念状态,概念提取器描述 PCBM 的内部表示。本文给出的 CFR 是代理概念变化度量,不是人工重新标注的自然图像语义真值。PFR 表中使用百分数,公式本身是概率。

这里有必须保留的单位问题:方法定义 CFR 为概念变化的平均比例,但附录经验表的语义 CFR 直接写成固定翻转数量,几何列也出现超过 1 的值。不能拿这些表值直接代入上面的比例定义,更不能把“翻转数量”与“百分比”混用。笔记的数值表只抽取单位明确的 PFR,避免自行给原文 CFR 换算。

为什么要加 DFS?两个样本可以翻转同样多的概念,却分别碰到决策头依赖和不依赖的属性;甚至没有二值状态改变时,连续概念坐标也可能移动。DFS 能揭示这种内部漂移,因此比单纯计数更接近某些预测变化。但原文只是展示预算变化下的关联,并没有证明 DFS 是充分统计量,也没有建立概念漂移到类别翻转的因果定律。

3. 扰动空间匹配的随机平滑:证书约束的是新预测器与指定邻域

潜空间平滑对潜变量加入各向同性高斯噪声,多次生成图像并统计基础分类器的类别概率,取概率最大的类别形成平滑分类器。它认证的是“生成器与分类器的复合映射在潜空间中的平滑版本”。真实类别概率已知时,高斯证书由最高类别与最大竞争类别的概率差决定;实际评测则使用概率下界与上界。

\[ \hat f_{\mathrm G}(z)=\arg\max_y\mathbb P_{\delta\sim\mathcal N(0,\sigma^2 I)}[f(g(z+\delta))=y],\qquad \widehat R_{\mathrm G}=\frac{\sigma}{2}\left[\Phi^{-1}(\underline p_A)-\Phi^{-1}(\overline p_B)\right]. \]

标准解释要求最高类别的下界超过所有竞争类别概率的有效上界;否则应弃权。半径位于潜变量的欧氏空间,不能换写成像素半径、真实场景几何容差,也不能声称基础分类器在该邻域内处处不变。改变平滑噪声强度也改变平滑预测器,因此较大半径必须与其一致参照下的预测表现一起解读。

概念空间平滑采用另一种概率模型:每个概念独立地以给定概率交换正、负坐标,翻转总数随机。它不同于经验评测中“恰好选择固定数量概念”的分布。对这种伯努利交换噪声,原文使用 Hamming 立方体上的 Neyman–Pearson 概率转移界:把当前最高类别概率的下界转成邻域内的最坏下界,把竞争类别概率的上界转成最坏上界,要求两者始终分离。

\[ \hat f_{\mathrm C}(c)=\arg\max_y\mathbb P_{\eta\sim\mathrm{Bernoulli}(\rho)^K}[f(g_2(D(\mathcal F(c,\eta))))=y],\qquad \Delta^\star(c)=\max\{\Delta:\mathcal L_\Delta(\underline p_{y^\star})>\mathcal U_\Delta(\overline p_y),\ \forall y\ne y^\star\}. \]

这一定义的可支持范围是从同一个连续概念表示出发,通过成对坐标交换可达的离散轨道。Hamming 距离计算交换了哪些概念,不能据此认证任意连续概念向量:两个向量即使二值概念标签完全相同,也可能有不同幅值和不同解码图像。原文定理以二值标签距离描述全部概念表示,范围写得比成对交换机制直接支持的结论更宽;笔记只采用交换轨道内的保守解释。

原文用单侧 Clopper–Pearson 区间估计概率,并宣称整体认证置信度。单个类别的区间覆盖率却不自动成为多类别联合覆盖率;从同批样本选择最高类别、选取竞争类别、同时比较多个上界,都需要相应的联合误差或选择后推断说明。正文与算法没有交代这些误差如何合并,因此这里不把单个 95% 区间解释为已经验证的同时多类别 95% 证书。

实现说明还有另一处不能合并的差异:附录 B.4 与主认证表使用独立伯努利翻转,附录 C.4.2 却明确使用固定数量翻转并引用 Def. 5.7 / Cor. 5.6。当前全文中这些定义与推论引用无法对应到所展示的认证结果,也没有给出固定数量噪声与伯努利概率转移界等价的论证。该附录统计表不能当作同一噪声律下的精确复核。

认证结果报告平均半径时,只保留与参考标签一致且未弃权的样本。这样的条件平均可能在覆盖率下降时上升,所以必须同时报告覆盖:SmAcc 将弃权算作不一致,反映与参考标签一致且非弃权的比例;仍应另外区分总体非弃权率与一致且非弃权率。附录 D 的 CA@1 进一步以全部样本为分母,报告一致且可认证至少一次额外概念交换的比例,比孤立平均半径更接近总体证书覆盖。

4. 任务条件控制:让类别结构与词表设计暴露方向反转

原始 RIVAL-10 在若干预算下几乎没有预测翻转,如果只在这个设置里比较模型,很容易把任务本来就容易误读为某种架构的优势。作者保持 18 个概念不变,分别加入语义相似或不相似的新类别,使类别数量和类别间距离变化;相似性依据 ResNet-50 类别中心特征的欧氏距离估计,而非独立人工语义标尺。

控制实验还固定原始分类任务,把词表从 18 扩充到 27 和 36 个概念,新增属性借助大语言模型提出。这个实验检验的是特定词表与生成器下的敏感性,不只是一个抽象的概念维度效应。概念冗余、相关性、监督质量和生成器对属性的表达能力都可能一起变化,故“概念更多”不能自动理解成“信息更多且质量不变”。

原文观察到某些扩展类别设置下 PCBM 优于普通模型,但更换骨干后并非所有优势都保留。词表实验同样出现方向反转:中等大小词表在大幅语义变化下略有利,更大词表反而略不利。作者关于无关概念被下游头过滤、相关概念增加敏感性的解释是合理机制假设,但还需要逐概念使用权重与独立干预验证,不能把经验反转当成已确证的因果机制。

损失函数 / 训练策略

本文不以新增鲁棒训练损失为贡献。核心比较是冻结预训练骨干后使用普通分类头或 PCBM 概念路径,并在固定生成器上测量响应;不要把生成器训练目标或一般随机平滑知识误写成本文新提出的训练正则项。

主文设置段写每次使用 100 张图像,随后经验统计段与附录表写五个各含 200 张图像的配对子集。这是协议冲突,不是“100 次重复”;当前版本不足以将所有主表数字统一归到单一采样协议。认证段明确使用每样本 1000 次蒙特卡洛采样、五个 200 张图像子集,子集内无放回,但不同子集可以重叠。

附录 C.4.1 又先写生成器原生样本池为 1000,随后写从 400 张样本池抽子集,两者未解释关系。配对子集用于比较两方法,能减少共同样本差异,但子集重叠也提醒读者:重复子集的波动不等同于独立重新训练的模型不确定性。本文没有提供足够信息消除这些协议歧义。

实验关键数据

主实验

以下仅摘取附录 Table 1 的 PFR,数字为百分数,越低表示对起点预测越稳定;并非自然图像真值准确率。误差项按原表保留,不替原文统一所有表的聚合协议。

数据集 扰动预算 普通分类器 PFR (%) PCBM PFR (%)
CUB-200-2011 \(\epsilon=0.3\) 74.6 ± 1.6 76.6 ± 0.8
CUB-200-2011 \(\tau=5\) 77.7 ± 0.9 80.1 ± 0.6
RIVAL-10 \(\epsilon=0.3\) 0.00 0.00
RIVAL-10 \(\tau=5\) 0.72 ± 0.07 0.73 ± 0.09

CUB 两行中 PCBM 的预测变化略多;RIVAL-10 则接近饱和,不能用几乎相同的低翻转率证明概念瓶颈带来优势。跨数据集数值还依赖生成器、类别结构和概念词表,不能当作同难度条件下的直接排名。

附录 Table 3 的下列行展示随机平滑结果。每个“SmAcc / 半径”单元先给一致参照下的 SmAcc 百分数,再给一致且非弃权样本上的条件平均半径;潜空间与概念空间半径单位不同,不能比较大小。

数据集 平滑设置 普通分类器:SmAcc (%) / 半径 PCBM:SmAcc (%) / 半径
CUB-200-2011 \(\sigma=0.10\) 81.70 ± 2.39 / 0.1034 ± 0.0030 77.20 ± 2.14 / 0.0918 ± 0.0038
CUB-200-2011 \(\rho=0.10\) 59.13 ± 1.46 / 0.909 ± 0.151 57.60 ± 0.59 / 0.751 ± 0.061
RIVAL-10 \(\sigma=0.10\) 100.00 ± 0.00 / 0.2463 ± 0.0000 100.00 ± 0.00 / 0.2463 ± 0.0000
RIVAL-10 \(\rho=0.10\) 99.90 ± 0.01 / 6.560 ± 0.002 99.89 ± 0.01 / 6.558 ± 0.002

这些代表行不支持“PCBM 通常拥有更大认证半径”。同时,CUB 最低潜空间噪声下 PCBM 的 SmAcc 可以稍高,说明预测一致比例和条件半径仍是不同维度,不应写成在全部噪声强度上严格支配。

消融实验

下表结合附录 Table 2 的代表性配对检验、Table 6 的类别条件分析与 Table 8 的词表分析。配对差定义为普通分类器 PFR 减 PCBM PFR,负值有利于普通分类器;表内两种方法的展示均值不用于重新计算或替换原文配对统计。

分析配置 普通分类器 PFR (%) PCBM PFR (%) 配对差 (pp) 原始 p Holm p
CUB,\(\epsilon=0.30\) 74.6 ± 1.6 76.6 ± 0.8 -2.00 ± 1.21 0.021 0.098
CUB,\(\tau=5\) 77.7 ± 0.9 80.1 ± 0.6 -2.33 ± 0.84 0.004 0.032
CUB,\(\tau=10\) 90.0 ± 0.6 90.4 ± 0.4 -0.84 ± 0.49 0.018 0.098
RIVAL,增加相似类别,\(\epsilon=0.8\) 12.80 ± 1.41 9.55 ± 1.22 未报告 未报告 未报告
RIVAL,中等词表,\(\tau=10\) 8.74 ± 0.99 8.69 ± 0.88 未报告 未报告 未报告
RIVAL,较大词表,\(\tau=10\) 2.62 ± 0.18 3.06 ± 0.19 未报告 未报告 未报告

类别分析行对应新增 5 个相似类别、总计 15 类、18 个概念;中等与较大词表分别对应 27 和 36 个概念。未报告统计量的格子明确表示源表没有这些检验,不代表检验通过或不存在差异。

附录 Table 2 对全部 9 个预算做 Holm 校正,只有语义翻转预算为 5 的一行在 0.05 阈值下显著,其校正值为 0.032。虽然多个原始 p 小于 0.05,不能据此推广为全部预算都有显著差异。

关键发现

  • 原始任务与扩展任务给出不同方向:相似类别扩展能揭示普通模型与 PCBM 的差距,原始 RIVAL-10 的饱和结果则几乎不能区分它们。附录 DenseNet-161 实验中,一些相似类别设置反而让 PCBM 的 PFR 更高,说明 ResNet-50 的趋势不是架构无关定律。
  • 词表收益不单调。主文对 27 个概念的大预算 PFR 写 PCBM 9.29、普通模型 9.42,对 36 个概念写 3.11、2.65;上表保留附录 Table 8 的另一组数值。两处方向一致,但数字不同,不能静默统一。
  • 单纯概念计数不足以说明类别稳定性;DFS 提供了连续表示变化信息,但它与 PFR 的关联不能代替机制证明。原文把部分不同预算结果称为“相近”,应按具体数值理解,不能据此宣称严格单调关系。
  • 附录 D 支持外部评测接口用于 PixPNet,而非证明原型模型普遍更强。Table 14 中的高斯结果与主表保持一致,但语义 Table 15 在噪声概率 0.10 时给 ResNet SmAcc 75.25,主 Table 3 则给 59.13;Table 16 与 Table 3 的概念半径量级也明显不同,当前版本没有清楚解释差别。

亮点与洞察

  • 将“可解释”与“鲁棒”拆成独立目标,比给整个模型贴稳定或脆弱标签更有价值。生成器概念状态、PCBM 内部表示、输出类别与平滑证书分别回答不同问题,统一口径才能比较结果。
  • 共享外部变化而非强行对齐内部解释,使 PCBM 与局部原型模型可以在同一输入变化下测量。可迁移的是评测接口,不是概念空间与原型空间的数学等价性。
  • 饱和任务可能遮蔽差异,类别结构与概念词表应进入评测设计。尤其需要把总体证书覆盖与条件平均半径一起报告,防止只展示剩余容易样本上的漂亮半径。

局限与展望

  • 生成器原生输入、一致预测筛选与参考标签限制了外部效度;共同预测不是自然真值,语义改变也未必保留类别。需要真实样本与人工概念、类别复核,但不能直接把现有证书外推到该设置。
  • 成对交换的离散轨道是概念认证的可支持对象,原文关于任意同二值标签连续表示的宽泛表述需要额外假设。概率转移函数的完整构造与联合置信误差控制也应补充,不能仅引用名称便确认整体覆盖率。
  • 采样协议存在 100 张与五个 200 张子集、1000 与 400 样本池的冲突;C.4.2 的固定数量平滑与 B.4 的伯努利平滑不应合并,其 Def. 5.7 / Cor. 5.6 引用仍未解决。这些问题影响复现,需由作者明确版本与数据来源。
  • 展示均值与配对差存在不一致:CUB 的语义预算 10 展示均值差为 -0.4 pp,配对表为 -0.84 pp;潜空间噪声 0.05 的主表 SmAcc 差为 3.50 pp,统计表为 0.80 pp。当前文本不足以判断是否来自不同聚合或不同运行,笔记保留两种报告,不擅自改正。
  • 新词表由模型辅助提出,但属性相关性、监督质量与生成器可表达性未被充分分离。未来应在固定任务与固定生成器质量下报告逐概念贡献,并区分重复子集波动、模型训练波动和语义标注误差。
  • 压力测试结果只作为不同空间下预测敏感性不同的补充证据;这里不提供操作步骤,也不把单一压力测试或平滑后的改善升级为通用鲁棒性保证。

相关工作与启发

  • vs Koh 等的 CBM / Yuksekgonul 等的 PCBM:前者建立概念中介预测范式,后者允许借助冻结骨干构建后处理概念路径。本文主要研究 PCBM 在共享生成器变化下的响应,并没有证明所有 CBM 训练范式都呈现同样权衡。
  • vs Sinha 等 / Rasheed 等的鲁棒性研究:本文把概念层稳定性与最终预测层稳定性拆开解释,说明不同研究可以测到不同现象。这是对结论适用条件的澄清,不是把所有历史分歧实验性地逐一复现。
  • vs Cohen 等 / Lee 等的随机平滑:本文把既有证书思想搬到生成器复合映射的潜空间与离散概念交换空间。启发是先定义噪声律与允许的变化集合,再讨论证书,而不是用一种证书覆盖全部语义变化。
  • vs PixPNet:原型提供另一种内部可解释表示,本文附录说明可以保持其内部结构不变并使用共同外部评测。这个结果支持跨模型族测量,不支持概念和局部原型的一一对应。

评分

  • 新颖性: 4/5。统一扰动空间、评价层级和任务条件的视角清晰,证书主要复用已有理论。
  • 实验充分度: 3/5。覆盖多任务、词表和模型族,但采样协议、数字来源与认证假设仍需澄清。
  • 写作质量: 3/5。主线易懂,附录单位、统计差与噪声律不一致削弱了复现精度。
  • 价值: 4/5。适合作为可解释模型鲁棒性评测的设计参考,不宜作为普遍安全或自然图像鲁棒性承诺。