Caption Bottleneck Models¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/bariscagliyan/CaptionBottleneckModels
领域: 可解释性
关键词: 描述瓶颈、概念发现、纯文本分类、短语遮除、测试时干预
一句话总结¶
CaBM 将图像先转成去除类别名称的自然语言描述,再由独立的纯文本分类器识别类别,并从分类证据中发现概念,在切断视觉特征旁路的同时取得有竞争力但并非全面领先的分类表现。
研究背景与动机¶
概念瓶颈模型(Concept Bottleneck Models,CBMs)试图让图像分类先经过人能理解的属性,例如颜色、形状和局部纹理,再由这些属性决定类别。 难点不只是训练一个概念预测器,而是先决定哪些概念足以覆盖数据集中的判别信息。 专家逐图标注成本高,LaBo、LF-CBM 和 VLG-CBM 等方法因而利用语言模型提出候选概念,再借助视觉语言对齐建立监督。 但从类别名称出发生成的词表可能包含百科知识、同义重复或图中根本看不到的性质,也可能漏掉数据集特有的细节。 因此,“词表可以自动产生”并不等于“概念确实来自当前图像的证据”。
另一个问题是概念接口是否真的限制了信息通路。 连续概念分数可能携带超出其名义语义的信息,使分类器即使借助不可解释信号也能得到高准确率。 将概念硬化并独立训练可以减少这种泄漏,却常会损失细粒度信息;保留额外图像嵌入则又削弱了瓶颈的约束。 本文没有继续扩大属性字典,而是让离散的自由文本承担中间表示,以较丰富的描述保留视觉细节。 这里需要区分结构上的通路限制与描述内容的正确性:文本容易检查,并不意味着上游模型每句话都可靠。
现成的大型多模态模型(Large Multimodal Model,LMM)提供了可用的图像到描述接口,预训练文本编码器则能够学习描述中的类别差异。 作者据此把“看图”和“分类”分开训练,且让下游只能接触描述,不能回到视觉特征中寻找额外线索。 概念不再是分类之前必须准备的字典,而是在分类器训练完成后,从它实际使用的描述片段中提取。 这也解释了论文的任务定位:它研究可解释图像识别与概念发现,并非生成内容真伪检测。 核心 idea:用经类别名称清理的自然语言作为唯一跨阶段接口,先学习基于描述的分类,再用短语遮除证据发现开放词汇概念。
方法详解¶
整体框架¶
输入是带类别标签的图像数据集,输出包括图像预测类别,以及训练后提取的每类概念集合。 冻结的 LMM 先完成“多描述与类别清理”,独立文本编码器完成“纯文本分类与投票”,最后以“证据驱动概念提取”生成解释词表。 分类阶段不要求先有概念列表;提取出的概念是事后分析结果,不是必须再回填训练的额外瓶颈层。 原文图 2(第 5 页)将描述生成、文本分类和概念发现明确分开,方法细节见第 6–8 页。 下面的图保留这一时序,并把预测分支与训练后分析分支分开。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像"] --> B["多描述与类别清理"]
B --> C["纯文本分类与投票"]
C --> D["图像预测类别"]
C -->|训练后:正确分类的训练图像| E["证据驱动概念提取"]
E --> F["每类概念及重要性"]
“纯文本”修饰的是下游识别通路,而不是说整套系统不再需要看图。 测试图像仍需先由冻结 LMM 转成描述,之后的分类器才只读文本。 这一边界很重要:CaBM 排除了分类器直接读取图像嵌入的旁路,却没有消除生成描述所需的视觉计算。
关键设计¶
1. 多描述与类别清理:保留视觉细节,去掉显式标签捷径
作者先借助 LLM 设计一个固定提示模板,只提供数据集领域和类别粒度,而非逐类罗列标签来生成属性字典。 模板要求关注颜色、形状、纹理、部件及空间关系,并限制输出形式、避免分类学命名。 随后对全部图像复用这一模板,不为每张图重新设计一组人工概念。 冻结的 Qwen3-VL-2B-Instruct 在不同采样温度下生成互补描述:低温偏向常见且简洁的表述,高温引入更多措辞和组合变化。 这些描述是同一图像的文本多视图,而不是多个独立图像样本。 不同表达可以补充被某一条描述遗漏的属性,但作者并未因此保证每条描述都完整或真实。
提示词约束并不能彻底阻止模型说出类别名称,所以生成后还需要确定性的类别名称清理。 清理函数匹配类别字符串和上位类别术语,再将命中部分替换为数据集通用指代,例如“该物体”。 这一操作不要求预先定义视觉概念集,但仍需要知道哪些标签或分类学词语应当被过滤。 轻量文本规范化和保守的随机解码控制用于降低重复或退化生成的影响。 这里切断的是显式词汇捷径,不能据此声称模型无法通过上下文、同义表达或错误描述引入偏差。 原文第 6 页给出该阶段,实际使用的描述数和温度设置见第 9 页。
2. 纯文本分类与投票:让类别判断只能依赖描述
所有描述继承其来源图像的类别标签,用这些“描述—标签”样本训练 RoBERTa-base 和线性分类头。 文本经过分词和长度截断,编码器最后一层的分类位置表示送入线性头,得到每个类别的 logit。 训练时按描述计算分类损失;在数据划分时却必须按图像分组,同一图像的全部描述都留在同一分区。 否则不同措辞的近重复描述可能同时进入训练集和验证集,使评估高估泛化能力。 这一数据泄漏防护与概念瓶颈中的信息泄漏是两个不同层面,不能混为一谈。 上游 LMM 保持冻结,分类损失不会反向塑造描述生成器;下游也没有像素或图像嵌入输入。
测试时分别编码同一图像的全部描述,先平均类别 logits,再取最大值对应的类别。 这不是多数标签投票,也不是先对概率做平均;保留 logit 聚合的定义有助于复现原文。 多描述聚合可以降低单条描述措辞变化带来的预测波动,但不能恢复所有描述共同遗漏的视觉属性。 原文式 (5)(第 7 页)的聚合规则可写为:
其中 \(K\) 是该图像的描述数,每个 \(\mathbf z_i^{(k)}\) 都来自同一个文本分类器。 结构上的可检查性来自分类器只能利用显式文本,而不是来自对每个隐层维度赋予人工概念名。 因此,识别通路被约束了,但 RoBERTa 内部依然是需要归因分析的神经网络。
3. 证据驱动概念提取:先找候选,再用遮除检验其作用
概念提取只针对分类正确的训练图像,以减少把错误决策中的偶然短语当成稳定类别证据的风险。 对保留图像的描述,作者计算目标类别 logit 相对于 token 嵌入的梯度,并结合嵌入本身得到显著性。 特殊 token 的分数置零,非填充 token 的分数归一化,再把子词分数合并为词级分数。 随后枚举可变长度的词组,以跨度内的显著性总和提出候选,去除泛化填充词与边缘停用词。 每条描述通过贪心非极大值抑制保留最多 \(P\) 个候选,允许的跨度重叠上限是 50%。 因此每张图像最多产生 \(KP\) 个候选短语;这里的 \(P\) 是原文符号,正文未给出其固定实验取值。
梯度只负责降低候选搜索成本,最终重要性由实际遮除试验决定。 作者将短语对应 token 置为填充并关闭其注意力掩码,再观察目标类别 logit 是否下降,而不是只看热力图是否显眼。 原文式 (7)(第 8 页)定义短语的重要性为截断至非负值的 logit 下降:
其中 \(\tilde c\) 是清理后的描述,\(\tilde c^{\setminus p}\) 是移除短语 \(p\) 后的输入,提取时 \(y\) 为真实类别。 若删除短语不降低目标分数,就不给它正的重要性;若下降明显,说明它对当前文本决策有支持作用。 这衡量的是分类器对文本片段的依赖,不等于证明该短语在原图中真实存在。 作者再用训练好的 CaBM 文本编码器对候选短语编码,在每个类别内部使用 HDBSCAN 聚类,并将离群项标为噪声。 基于聚类中心相似度、子串与词重叠的后处理合并近重复表达,降低同义措辞造成的冗余。 每个簇选取与归一化中心余弦相似度最高的真实短语作为代表,并累加簇内短语的遮除重要性用于排序(第 8 页,式 (8)–(9))。 最终概念因而是描述里出现过的原词组,不是通过外部词典给连续潜变量猜一个名称。 需要注意,聚合得分是重要性之和而非出现次数归一化均值,因此概念频率也可能影响排序。
损失函数 / 训练策略¶
训练目标是描述级交叉熵,实际设置还使用 0.1 的标签平滑;这里不引入额外概念监督损失。 除 ImageNet-1K 使用 3 条描述外,其余数据集每张图像生成 5 条,温度集合为 0.7、0.9、1.1、1.3、1.5。 正文没有列出 ImageNet-1K 的 3 条描述究竟采用该集合中的哪几个温度,不应自行指定。 没有官方验证集时,按类别分层保留 10% 的训练图像作为验证集,全部描述随图像一同划分。 优化器为 AdamW,权重衰减为 0.05,使用余弦学习率调度与 6% 预热。 批大小为 16,通过梯度累积得到有效批大小 48;最大序列长度为 512。 训练最多 30 个 epoch,早停耐心值为 6,并使用系数 0.85 的逐层学习率衰减。 嵌入层和最低的两个编码器层冻结,其余可训练编码器层与线性头共同优化。 训练期加入词丢弃概率 0.1、短跨度丢弃概率 0.03 的轻量描述增强,增强应用概率为 0.3。 验证和测试不使用这些增强;测试阶段只做描述编码与 logit 聚合,概念发现不需要作为每次预测的前置步骤。 上述实现设置均来自第 9 页 §4.1;正文将算力和运行时间细节指向补充材料,本地缓存未包含该材料。
实验关键数据¶
主实验¶
以下摘录原文表 4(第 14 页):六个数据集的测试 Top-1 准确率,单位均为 %。 这些基线来自其各自论文,视觉骨干、概念构建和分类器输入并不统一,因此不能当作严格控制变量的架构优劣排名。
| 方法与分类输入 | CIFAR-10 | CIFAR-100 | CUB-200 | Food-101 | Flowers-102 | ImageNet-1K |
|---|---|---|---|---|---|---|
| LF-CBM,图像派生概念 | 87.30 | 68.80 | 58.60 | 77.70 | 94.40 | 67.50 |
| PS-CBM,图像派生概念 | 89.80 | 72.10 | 70.10 | 83.00 | 97.90 | 74.00 |
| HybridCBM,图像派生概念 | 97.93 | 86.22 | 84.25 | 92.62 | 99.23 | 83.67 |
| CaBM,仅描述文本 | 96.42 | 81.14 | 76.92 | 93.68 | 86.57 | 75.12 |
CaBM 在 Food-101 上为 93.68%,但在 Flowers-102 上为 86.57%,低于表中三个基线,说明自然语言保留判别信息的能力依赖具体数据集。 在 CUB-200 上它达到 76.92%,仍低于 HybridCBM 的 84.25%;论文结论是受约束通路下的竞争力,而不是全面最优。
消融实验¶
本地全文没有常规的去模块消融表;以下使用真实的概念质量分析与受控词表替换实验,不将它们伪装成组件消融。 概念质量来自表 1(第 10 页),评估数据为 CUB-200,三个指标均为原始数值而非百分数。 Purity 是每类平均概念嵌入与类名 CLIP 文本嵌入的余弦相似度,再对类别取平均。 Separation 是不同类别平均概念嵌入之间的平均成对余弦距离;Semantics 是 GPT-3.5 判断概念是否与目标类别关联的有效比例。
| 方法 | Purity | Separation | Semantics |
|---|---|---|---|
| VLG-CBM | 0.52 | 0.07 | 0.86 |
| HybridCBM | 0.40 | 0.80 | 0.46 |
| CaBM | 0.52 | 0.16 | 0.92 |
CaBM 的 Semantics 为 0.92,优于 VLG-CBM 的 0.86,但这不是人工核验图像属性后的准确率。 HybridCBM 的 Separation 最大;原文指出其正交正则化会直接增大类间距离,不能孤立地把该指标当成解释质量。 表 2(第 10 页)进一步固定 VLG-CBM 评估管线,只把原来的 LLM 生成概念换成 CaBM 发现的概念。 下表为 Top-1 准确率(%):ANEC-5 对应有效概念数 NEC=5,ANEC-avg 对 NEC ∈ {5, 10, 15, 20, 25, 30} 的结果取平均。
| 数据集 | 原词表 ANEC-5 | CaBM 词表 ANEC-5 | 原词表 ANEC-avg | CaBM 词表 ANEC-avg |
|---|---|---|---|---|
| CIFAR-10 | 88.55 | 88.87 | 88.63 | 88.97 |
| CIFAR-100 | 65.73 | 66.13 | 66.48 | 66.66 |
| CUB-200 | 75.79 | 76.25 | 75.82 | 76.34 |
这里评估的是概念词表在 VLG-CBM 中的下游效用,而非重新报告 CaBM 文本分类器的准确率。 三个数据集的小幅一致提升支持词表具有判别价值,但不能证明描述数、类别清理或聚类各自的独立贡献。
关键发现¶
- 表 3(第 12 页)在误分类最频繁的 20 个类别的测试子集上做概念注入;CUB-200 从 41.7% 提升到 55.5%,增加 13.8 个百分点。 注入的是已知真实类别的最高排名概念,分类器保持冻结;这是依赖真实标签的干预实验,不是全测试集常规精度或盲测用户研究。
- 图 5(第 13 页)展示补充眼部属性后,预测由 Shiny Cowbird 改为 Brewer Blackbird 的个例。 它说明修改文本接口可以影响预测,但并不单独证明所有提取概念都在视觉上忠实。
- 词表替换控制了下游评估器,比跨骨干主结果更能隔离概念列表的作用。 正文仍缺少描述数、温度、清理开关和聚类选择的受控消融,不能给这些组件排贡献大小。
亮点与洞察¶
- 最重要的设计是限制信息通路,而不只是让解释更好读。 分类器无法绕过文本去读取图像嵌入,使文本干预真正作用于预测所依赖的输入。
- 概念发现发生在任务训练之后,候选来自模型读过的真实描述片段。 这减少了外部概念字典的覆盖限制,同时保留了可回溯的词组出处。
- 梯度归因与遮除承担不同职责:前者快速筛选,后者检验实际分数变化。 这种分工可借鉴到其他文本中间表示,但需要同样检查遮除造成的输入分布变化。
局限与展望¶
- 作者明确指出,CaBM 不是给任意既有视觉黑箱追加解释头的方法(第 14–15 页)。 它需要部署新的 LMM 到文本分类流程,无法直接解释旧视觉骨干已经形成的内部表示。
- 从方法结构看,上游遗漏、幻觉与残余类别暗示仍可能成为下游证据。 后续可以评估描述对图像的事实一致性,但本文没有给出这类校验模块的结果。
- 仅从正确分类的训练图像挖掘概念,可能弱化对失败样本和少见外观的覆盖;这是阅读方法后的风险判断。 已知真实类别的概念注入也不能替代实际用户在不知道答案时的纠错评估。
- 缓存正文未提供推理成本、多个随机种子的方差或常规模块消融。 因此无法仅凭这些表判断生成开销、统计稳定性或各个设计的必要性。
相关工作与启发¶
- 对比 VLG-CBM / LaBo:它们先准备外部概念,再学习视觉证据与概念的对应;CaBM 先以自由描述分类,再挖掘概念。 表 2 的词表替换进一步说明,新词表也可以用于其他概念瓶颈管线,但这一复用实验不改变 CaBM 本身的文本识别架构。
- 对比 HybridCBM / CaptionCBM:HybridCBM 组合静态与动态概念;其 CaptionCBM 变体虽引入描述,推理仍依赖 CLIP 图像特征(第 4 页)。 因而标题或中间表示中出现 caption,不足以说明它与本文具有相同的信息通路约束。
- 对比 XBM / DN-CBM:XBM 分类器保留图像与文本输入;DN-CBM 先发现潜在概念,再借助外部词汇进行命名。 CaBM 的区别分别在于分类器只读文本,以及概念名称直接来自描述跨度,而非对潜变量的词典匹配。
评分¶
- 新颖性: 4/5。将严格文本接口与任务后概念发现结合,区别于仅使用描述辅助视觉分类的方法。
- 实验充分度: 3/5。分类、概念质量、词表复用和干预相互补充,但模块消融与成本证据不足。
- 写作质量: 4/5。总体流程清楚,但“无泄漏”需结合结构限定理解,不能扩展成语义正确性保证。
- 价值: 4/5。适合研究可检查的新分类流程,不适合作为已有黑箱的通用解释插件。