On the Reliability of Cue Conflict and Beyond¶
会议: ECCV 2026
论文: ECCV 2026
领域: 可解释性
关键词: 形状-纹理偏差; 线索冲突基准; 基准可靠性; 排名式度量; 敏感度与偏好分离
一句话总结¶
本文系统质疑了被广泛使用的 cue-conflict 基准在刺激构造与度量两端的可靠性,指出风格迁移线索纠缠、线索信息量失衡、比率型偏差掩盖绝对敏感度、受限标签空间扭曲预测四类问题,并用"人类感知定义 + 可控纯化生成 + 全标签空间 MRR 敏感度度量"的 REFINED-BIAS 框架给出替代方案,在 32 个训练策略模型、多类架构、OpenCLIP/DINOv2 大模型与多级量化模型上消解了原基准无法解释的矛盾结论。
研究背景与动机¶
理解神经网络究竟依赖哪些视觉线索,是打开模型决策黑箱的一条人可读通路。在这条线上,Geirhos 等人提出的 cue-conflict 基准(2018)几乎是事实标准:它用风格迁移把 A 类的形状与 B 类的纹理拼在同一张图上,用模型在冲突线索下的选择来定义"形状偏好/纹理偏好",并由此得出一个影响深远的结论——类人的强形状偏好与更高的域内准确率相关。此后大量工作沿用它来讨论形状偏差与泛化、鲁棒性的关系,近年仍有研究不断引用。但这个基准当年是作为"务实折中"被采用的:更纯净的刺激(如素描)会带来巨大的域偏移,风格迁移因此成了保留自然图像统计量、又能制造线索冲突的权宜方案——它的设计目标是"可行",而不是"可靠"。
本文的出发点正是这句被默许的前提。作者发现,风格迁移实例化后的 cue-conflict 图像在经验上相当不稳定:许多图像连人类都说不清其中的形状与纹理到底是什么,机器同样难以识别;形状(内容特征)与纹理(Gram 矩阵风格统计)是由风格迁移模型的内部特征定义的,二者的分离并不干净;拼接时也没有任何机制控制两条线索的相对信息量。这直接解释了近期文献中互相冲突的结论——同样用 cue-conflict,有工作说更强的纹理偏好带来更好性能,有工作说更强的形状偏好才是关键,还有工作指出 ImageNet 预训练的 ResNet-50 其实并不强烈依赖纹理。更麻烦的是度量方式本身:偏差被写成正确形状预测数与正确纹理预测数的比值,这个比值对绝对敏感度完全不敏感(8% 与 2% 的模型和 80% 与 20% 的模型得到同一个分数),而评估时又只把预测限制在预设的少数候选类里。作者举了一个很直观的例子:模型真实排序是 rabbit、cat、dog,而真值标签是 cat——在完整决策空间里模型答错了,可一旦把候选类裁剪成 {cat, dog},cat 就跃居第一,模型"看起来"正确用了线索,于是线索使用率被系统性高估。
据此,论文把可靠性拆成三个可验证的问题:cue-conflict 图像是否真的实例化了感知有效且可分离的形状/纹理线索?混合线索的构造是否保证了形状与纹理信息量可比的公平性?两条线索是否都能被人类与模型稳定识别?作者强调,此前的批评(Tartaglini 等填纹理轮廓、Burgert 等的受控抑制、Wen 等的全局形状退化、Doshi 等的纹理抑制形状线索)各自只解决了其中一个侧面,没有人把"线索怎么造、预测怎么评、敏感度怎么在全标签空间里量"这三件事放在一个框架里重做。本文的角度是整体重审:用人类感知标准而非模型启发式来定义并生成线索,用排名式指标在完整决策空间里同时给出偏好与绝对敏感度。核心 idea:把形状-纹理偏差的诊断从"风格迁移造冲突图 + 比率型精度偏差"改成"感知定义驱动的纯化线索数据集 + 全标签空间排名式敏感度度量",让偏好不再被线索有效性、线索配比与可识别性伪影混淆。
方法详解¶
整体框架¶
REFINED-BIAS 是一套"数据集 + 度量"的整合框架,目标是把形状-纹理偏差的诊断从"偏好"一路修到"偏好 + 敏感度"。它由三块构成:一套以人类感知标准定义的线索与平衡数据集(解决线索纯度与配比问题)、一条可控的纯化线索生成与人类逐图校验流程(解决可识别性问题)、以及一个在模型完整输出空间上计算的排名式敏感度度量(同时解决比率型指标掩盖敏感度、受限标签扭曲预测两个问题)。评估时,形状线索与纹理线索分别送入模型取全量 logits,各自算出一条敏感度曲线,再归一化成偏好——这样"模型能用到多少线索"与"模型更偏向哪条线索"被彻底拆成两个可分别比较的量。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["20 个 ImageNet 派生超类<br/>10 形状主导 / 10 纹理主导"] --> B["以人类感知定义重建线索与数据集<br/>每类 300 张源图,共 6,000 张"]
B --> C["可控纯化生成 + 人类可识别性校验<br/>形状线索 / 纹理线索双分支"]
C --> D["全标签空间上的 MRR 敏感度度量<br/>Shape-Sens / Texture-Sens"]
D --> E["偏好 = 敏感度归一化<br/>跨模型公平比较"]
关键设计¶
1. 以人类感知标准定义形状与纹理,并据此重建平衡线索数据集
风格迁移把形状当作"内容特征"、纹理当作"风格统计量",这个定义来自某个模型的内部表示,而不是来自人的知觉——于是"形状"可能只剩局部边缘,"纹理"可能把目标的轮廓一起带进来。本文改用可操作的人类感知定义:纹理是在大小不同的图像块内一致重复的图案(例如 honeycomb、dishrag 这类即使切成小块也仍然可辨的类别),形状是不重复的几何结构,并显式区分全局几何(整体轮廓/剪影)与局部几何(物体内部不重复的特征子结构)。这个区分不是文字游戏:ipod 与 comic book 的全局几何都是矩形,只有局部结构能把它们分开,而 cue-conflict 的内容特征恰恰只与局部边缘相关、跟不上整体形状。
在此基础上,作者选取 20 个 ImageNet 派生超类,其中 10 个形状主导(如 clock、hourglass)、10 个纹理主导(如 strawberry、brain coral),类别本身依据人的感知判断挑选,并要求形状或纹理其中一者是该类最具判别力的特征——这一条同时起到缓解 CNN 域偏移的作用。每类采集 300 张图像(10 张来自 ImageNet,其余来自网络),共 6,000 张,规模约为 cue-conflict 的 5 倍。这一点是必要的:cue-conflict 每类只用 10 张形状源图与 3 张纹理源图,共 1,280 张冲突图,且是从 7,680(160 × 48)个候选组合中挑选子集、部分源图被反复复用,图像级差异(如分辨率导致的纹理粗细变化)会直接污染偏好测量。扩大并均衡源图池,是为了让"类别差异"而不是"某几张源图的长相"决定模型的选择。
2. 可控的纯化线索生成与人类可识别性校验
有了定义之后,还要保证生成出来的图真的承载这两类信息。作者借鉴 Mohla 等人做线索分离的思路,但明确不照搬其协议:直接套用会产生数据质量问题——纹理线索带有局部与全局的形状泄漏,且分辨率被压缩;形状线索则被杂乱的背景淹没,结构完整性受损;Geirhos 等人的风格迁移方法更是把这些固有缺陷继承了下来。
本文的做法是重新设计一条精确可控的生成流程,让形状线索与纹理线索都以完整分辨率、干净地呈现(形状线索呈现目标的结构骨架,纹理线索呈现多尺度一致重复的图案),并对每一张生成的线索图做人工检查来兜底。这个流程的效果可以直接量化:在全部 ImageNet-1k 预训练 CNN 上,REFINED-BIAS 的平均 top-1 为形状 46%、纹理 63%;而 cue-conflict 在完整预测下只有 4%(形状)与 21%(纹理),即便把它惯用的受限标签预测也算上也只有 20% 与 30%。也就是说,前者让 CNN 能"看见"线索,后者很大程度上是在测量域偏移。作者还做了一次平行人类研究来检验可识别性:88 名被试各完成 100 个分类任务,任务在形状与纹理间均分。用 Fleiss' κ 衡量人类之间的一致性,REFINED-BIAS 的形状达到 κ = 0.98(近乎完全一致)、纹理 0.80(高度一致);cue-conflict 的形状只有 0.73,纹理更是跌到 0.29——这意味着它的纹理线索在人类眼里本身就歧义丛生。用"人类能不能稳定命名这条线索"作为线索质量的判据,是把基准本身也当成受试对象来检验,这是本文与以往"再设计一个基准"最不一样的地方。
3. 全标签空间上的 MRR 敏感度度量,把偏好与绝对敏感度拆开
度量的问题有两个来源。其一,传统偏差分直接建立在"线索是否被答对"的准确率上,长尾与难类会把整体数值压低或抬高;其二,ns/(nt+ns) 这类比值把准确率同时放进了分子和分母,一旦某条线索的敏感度整体下滑,比值反而可能上升,于是"形状偏差变大了"可能只是"纹理敏感度掉得更惨"。作者的两条修正也正好一一对应:把准确率换成排名式指标,并且只把它用在分母上。
具体地,模型对每张线索图输出完整 logits 并排序,取正确线索标签在该排序中的名次,用其倒数做平均,得到两条敏感度:
其中 \(N\) 为样本数,\(r_{\text{shape},i}\) 与 \(r_{\text{texture},i}\) 分别是第 \(i\) 个样本的正确形状/纹理标签在模型全量排序中的名次。偏好则由这两条敏感度归一化得到:
排名式指标(此处取 Mean Reciprocal Rank)之所以关键,是因为准确率把"第 2 名"和"第 100 名"同样记 0 分,而 MRR 给出 1/2 与 1/100 的差别——它衡量的是模型"离答对有多近",这正是线索利用率该有的颗粒度。又因为名次是在全量 logits 上算的,第 3 节里那种"候选类裁剪让 cat 从第 2 名变成第 1 名、模型凭空多出一次正确线索识别"的失真被从根上消除;敏感度只出现在分母中,也让跨模型的绝对量级比较第一次变得有意义。
一个完整示例¶
用论文的插图例子走一遍度量:模型对三张线索图分别给出完整排序。book 图上前三名是 book、clock、ipod,正确标签 book 排第 1,贡献 \(1/1=1.0\);clock 图上是 book、clock、ipod、tiger、zebra,正确标签 clock 排第 2,贡献 \(1/2=0.5\);ipod 图上是 book、clock、ipod、tiger、zebra,正确标签 ipod 排第 3,贡献 \(1/3\approx 0.33\)。三张图的 MRR 为 \((1.0+0.5+0.33)/3\approx 0.61\) ⚠️ 原图该处的汇总数值印刷为小数格式,以上按公式复算。
对照之下,传统做法的失真一目了然:若某模型的真实排序是 rabbit、cat、dog 而真值标签是 cat,它在完整空间里是错的;但当评估只保留 {cat, dog} 两个候选类时,cat 成为第一名,模型被记为"正确识别了线索"。这正是本文要在全标签空间上取排名的直接原因。
实验关键数据¶
实验围绕两个目的组织:先验证 REFINED-BIAS 本身是否正确(能否稳定复现已知的训练策略效应),再用它去看清偏差随架构、规模、量化如何变化。
主实验¶
表 1:线索质量的直接对照(人类一致性用 Fleiss' κ;识别率为 ImageNet-1k 预训练 CNN 的平均 top-1)
| 基准 | 形状 κ | 纹理 κ | 形状 top-1 | 纹理 top-1 |
|---|---|---|---|---|
| cue-conflict | 0.7276 | 0.2937 | 4%(全标签)/ 20%(受限标签) | 21%(全标签)/ 30%(受限标签) |
| REFINED-BIAS | 0.9836 | 0.7973 | 46% | 63% |
表 2:训练策略对偏好的影响(与"仅随机裁剪"基线做 t 检验,α = 0.05)
| 策略族 | 预期方向 | cue-conflict p | REFINED-BIAS p | 说明 |
|---|---|---|---|---|
| Mixed Aug | 形状 | 2.72e-04 | 0.002 | 两者都检出,本文连温和的纹理退化也反映出来 |
| Texture Dist | 形状 | 0.003 | 0.010 | 一致 |
| Shape Aug | 形状 | 0.181 | 0.018 | cue-conflict 不显著 |
| Contrastive | 形状 | 0.684 | 0.009 | cue-conflict 完全无法反映 |
| Adversarial | 无 | 5.19e-05 | 0.489 | cue-conflict 误报出比形状导向方法更强的形状偏好 |
实验设定了 32 个全部基于 ResNet-50 的 ImageNet-1k 预训练模型:基线只用随机裁剪,其余每个模型在基线之上只叠加一种训练策略(形状增强 3 个、对比学习 3 个、纹理扰动 5 个、混合增强 8 个、对抗训练 12 个)。固定架构只变策略,是为了把归纳偏置这个混杂因素隔离掉。
消融实验¶
表 3:偏好 / 敏感度与 ImageNet-1k top-1 准确率的相关性(Pearson r,均 p < 0.05)
| 基准与指标 | 固定架构、变策略 | 固定策略、变架构 |
|---|---|---|
| cue-conflict 偏好 | r = −0.927(纹理偏好越高越准) | r = 0.607(形状偏好越高越准) |
| REFINED-BIAS 偏好 | r = 0.549 | r = 0.897 |
| REFINED-BIAS 敏感度 | 形状 0.770 / 纹理 0.551 | 形状 0.939 / 纹理 −0.473 |
表 4:大规模模型与量化模型上的验证
| 设定 | 模型 | 指标 | cue-conflict | REFINED-BIAS |
|---|---|---|---|---|
| 大模型偏好(对 0.5 无偏好基线做 t 检验) | OpenCLIP ViT-B/32 | p | 0.276(不显著) | 0.002 |
| OpenCLIP ViT-B/16 | p | 0.037 | 0.002 | |
| OpenCLIP ViT-L/16 | p | 0.565(不显著) | 0.001 | |
| OpenCLIP ViT-S/14 | p | 0.030 | 3.18e-04 | |
| DINOv2 ViT-B/14 | p | 0.011 | 0.001 | |
| DINOv2 另一变体 ⚠️ 原文该行模型名在排版中与上一行混杂 | p | 5.26e-21 | 3.71e-04 | |
| 量化(ResNet18/34/50/101/152,FP32 → FQ2) | 五个 ResNet | ImageNet top-1 的 Kendall ρ | —(基准自身)−0.696 | — |
| 偏好 ρ | 0.644(形状偏好随量化增强而升) | −0.562(形状偏好下降) | ||
| 敏感度 ρ | — | 形状 −0.636 / 纹理 −0.584(两者都降) |
关键发现¶
- 原基准最常见的一类失败是"该显著的没显著"。 形状增强这类明确以形状识别为目标的策略,在 cue-conflict 上 p = 0.181、对比学习 p = 0.684,都被判为无效应;换成 REFINED-BIAS 后分别降到 0.018 与 0.009。这不是统计功效的偶然差异,而是线索本身没能被模型识别时,策略效果根本无从体现。
- 对抗训练是判别基准可靠性的试金石。 cue-conflict 报告对抗训练带来比形状导向方法更强的形状偏好提升(p = 5.19e-05),可对抗训练的目标是对抗不可见扰动,与形状感知无关,这个结论本身就不合理;在本文数据集上该变化不显著(p = 0.489),只是其偏好值落在纹理一侧。此外,基线 ResNet-50 在本文数据上纹理偏好为 0.49,而 cue-conflict 给出 0.77 ——后者与近期"ImageNet 预训练 ResNet-50 并不强烈依赖纹理"的结论相悖。
- 敏感度指标能看到偏好指标看不到的模型差异。 在偏好指标下,对抗训练看起来是"最会用纹理"或"最会用形状"的极端者(取决于用哪个数据集);而敏感度曲线显示对抗训练实际上没有提升任何一条线索的利用率,真正同时用起形状和纹理的是混合增强类模型。跨模型看,两条敏感度都随域内准确率上升(策略维度固定架构:形状 r = 0.770、纹理 r = 0.551),与"形状与纹理线索互补、共同使用才提升性能"的既有结论一致。
- 原有矛盾被消解。 cue-conflict 在两种设定下给出方向相反的结论——固定架构变策略时是纹理偏好越高越准(r = −0.927),固定策略变架构时反过来是形状偏好越高越准(r = 0.607),这让"究竟哪个驱动性能"无法回答;REFINED-BIAS 在两种设定下方向一致(r = 0.549 与 0.897),稳定指向形状偏好是更重要的性能贡献因子。
- 架构结论也更清晰。 在敏感度维度上,Swin 与 CMT 的形状敏感度高于原始 ViT(架构维度 r = 0.939),说明局部到全局的特征聚合确实改善了形状知觉;而 cue-conflict 的偏好指标看不出这个优势(CMT 几乎不变,Swin 反而形状偏好下降)。大模型侧同样如此:OpenCLIP 各变体在 cue-conflict 上无法稳定呈现形状偏好(ViT-B/32 p = 0.276、ViT-L/16 p = 0.565),在 REFINED-BIAS 上则全部显著;线性探测下形状与纹理敏感度都与准确率正相关(OpenCLIP r = 0.987 / 0.961,DINOv2 r = 0.879 / 0.991)。
- 量化是把结论逼到墙角的一个场景。 精度从 FP32 降到 FQ2 时,cue-conflict 报告形状偏好随量化增强而上升(ρ = 0.644),"模型更依赖形状了"——但同期域内准确率在下降(ρ = −0.696),这与它自己的核心论点(更强形状偏差对应更好识别性能)自相矛盾。REFINED-BIAS 给出的是形状与纹理敏感度同步下降(ρ = −0.636 / −0.584)、形状偏好也下降(ρ = −0.562),与准确率下降方向一致,说明它追踪的是视觉线索感知能力的整体退化。
亮点与洞察¶
- 把基准本身当受试对象。 用 Fleiss' κ 度量"人类能不能稳定说出这条线索是什么",把"线索是否可识别"从一句定性抱怨变成可检验的实验指标(纹理 κ 从 0.29 提到 0.80)。这套做法可以搬到任何依赖"刺激是否传达预期信息"的基准上(如鲁棒性基准的扰动强度、幻视基准的提示可辨性)。
- "只放在分母"是一条通用的指标修正原则。 识别出"准确率同时出现在分子和分母"导致比值失真,然后给出最小改动:换成排名式量、只保留在分母。任何比率型指标(如某类样本占比、偏差比、公平性比值)都可以先做这个自检,代价极低、收益明确。
- 用 MRR 而不是准确率来衡量线索利用率。 准确率把第 2 名与第 100 名一视同仁,MRR 用 1/2 与 1/100 保留"接近程度",让"模型其实快答对了"和"模型完全没看见"不再被混为一谈。这个替换在探测式分析(probing)与表征诊断里是很直接的迁移点。
- 全标签空间是整个论证的地基。 受限候选类会让一次裁剪凭空制造出正确预测(真值 cat、真实 top-1 rabbit 的例子),这提醒所有做 bias/短答评估的工作:只要对输出空间做过任何过滤,就必须报告完整空间下的结果作为对照。
局限与展望¶
- 作者承认:形状线索虽具备诊断清晰度,但可能无法完全刻画 3D 几何与视角依赖性;把纹理中的残留形状印象彻底剥干净仍是开放问题;线索类别数量继续扩展才能拓宽偏差分析的覆盖面。
- 本文可被追问之处:20 个超类的入选依赖人工感知判断,选类标准("形状或纹理为该类最具判别力特征")本身可能把结论限定在一个相对容易的类别子集上,模型在更难类别上的线索使用行为没有被覆盖;评估对象集中在 ImageNet-1k 派生类别与在其上训练的模型,未涉及检测、分割等多任务场景;量化分析只覆盖 ResNet 家族;此外,由于线索图由人工逐张检查,数据集的扩展成本较高,而论文未报告该流程的规模上限。
- 可改进方向:把敏感度度量从双线索推广到多线索联合(形状 / 纹理 / 颜色 / 深度)的敏感度向量;用同一套纯化线索去探测生成模型与多模态模型(CLIP 之后的图文对齐模型、扩散模型的条件编码器)的线索依赖;把"人类一致性 κ"接入到线索生成流程里做成自动筛选环节,以降低人工检查成本并提升可扩展性。
相关工作与启发¶
- vs cue-conflict(Geirhos et al., 2018):他们用风格迁移构造 1,280 张冲突图、以
ns/(nt+ns)度量偏差、评估只取形状与纹理两个候选类;本文改用感知定义驱动的纯化线索(6,000 张,约 5 倍)、在完整 logits 上算 MRR 敏感度、并把偏好与绝对敏感度拆开。本文保留了原基准的核心问题意识,但否定的是它的实例化方式而非它的洞见——论文自己也强调"是否仍在评估线索偏好?是,但更精确"。 - vs Mohla et al. (2022):本文的线索生成借鉴了他们的线索分离思路,但指出直接套用会留下纹理线索的形状泄漏与分辨率下降、形状线索的背景杂乱,因此重新设计了生成与人工校验流程。
- vs Burgert et al. (2025):他们通过受控抑制来分析特征依赖,但未完全处理低层纹理线索,且仍被比率型偏差限制;本文在结论上与其一致(ImageNet 预训练 ResNet-50 并不强烈依赖纹理),但把度量也一并修正了。
- vs Tartaglini et al. (2022):他们用纹理填充形状轮廓,忽略了局部形状特征,且仍使用相对偏差指标,跨模型比较的公平性受限。
- vs Wen et al. (2023) / Doshi et al. (2025):前者用全局形状退化测敏感度、后者用纹理抑制后的全局形状线索,各自只覆盖"形状敏感度"这一个侧面;本文主张把线索构造、预测评估、敏感度度量作为整体一起重做。
评分¶
- 新颖性: ⭐⭐⭐⭐ [不是新方法而是对事实标准的系统性重审,"数据集 + 度量"两处同时修正,并把基准自身纳入可靠性检验,角度扎实但属改进型贡献]
- 实验充分度: ⭐⭐⭐⭐⭐ [32 个训练策略模型、多类架构、两个大模型族、五档量化精度,加上 88 人人类研究,覆盖面在基准类论文里相当充分]
- 写作质量: ⭐⭐⭐⭐ [三个问题—三个设计的对应关系清楚,论证链条严密;部分图表的版面排版可读性一般,个别表格在版式中较为拥挤]
- 价值: ⭐⭐⭐⭐⭐ [提供了可直接使用的公开数据集与度量,并对"形状偏差 vs 性能"这一长期争议给出方向上一致的结论,对后续偏差研究有规范作用]