Adversarial Attack and Disturbance Detection by Hadamard-Coded Output Representations for Object Detection and Semantic Segmentation¶
会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5869
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/13695.pdf
代码: https://github.com/ifnspaml/HadamardPerturbationDetection
领域: AI 安全
关键词: Hadamard 编码、输出一致性、扰动检测、语义分割、目标检测
一句话总结¶
HadamardNet 将视觉模型的类别输出改成冗余码字,通过概率单纯形投影同时获得类别概率与一致性残差,在单次前向传播中检测异常扰动;其价值是提供额外的可靠性信号,而不是保证受扰动后的预测正确。
研究背景与动机¶
语义分割和目标检测模型不仅需要识别场景,还需要知道当前输入是否值得信任。 常见检测器直接使用最大类别概率或预测熵,但这些量描述的是模型有多确信,而不是预测是否符合内部约束。 当异常输入仍产生高置信度输出时,单纯依赖“不确定性升高”的告警规则可能失效。 通过图像变换比较多次预测可以补充证据,却需要多次前向传播;专门训练异常检测器又可能依赖有限的扰动类型,换一种分布后便失去优势。
Hadamard 编码提供了另一种切入点:每个类别不再对应一个独立输出位置,而是对应一组共同描述类别的二进制属性。 已有研究尝试利用这种输出冗余改善分类鲁棒性,但不能据此推断它已适合密集分割,或已能直接提供扰动检测信号。 本文指出,旧的码字解码主要关心最终类别,没有充分利用多个二进制预测之间可能出现的矛盾。 关键问题因而变成:预测出的软码字能否由某个合法的类别概率分布解释,以及为了让解释成立需要多大的修正?
作者把输出编码、合法概率解码与异常评分放在同一条推理链上,并把分割像素和检测对象视为不同粒度的分类位置。 这使同一种一致性定义能够跨越两种任务,而不用额外引入语言模型或图像重处理分支。 这里研究的是防御性可靠性监测,检测效果与原任务精度需要分别评价。 核心 idea:把冗余输出到合法概率分布的最小修正视为内部一致性证据,再参照干净数据下的正常变化判断输入是否异常。
方法详解¶
整体框架¶
输入是一张图像,感知模型为每个像素或对象输出软 Hadamard 码字,而不是直接输出 softmax 类别概率。 “冗余输出编码”改变分类分支的表示;“概率约束解码”产生合法类别概率和修正残差;“条件一致性评分”把这些局部证据汇总成图像级异常分数。 最终输出仍包含原本的分割或检测结果,同时增加一个可用于告警的可靠性信号。 目标检测中的边界框回归分支沿用基础模型设计,本文改变的是分类表示及其解码,而非整个检测架构。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像"] --> B["冗余输出编码"]
B --> C["概率约束解码"]
C --> D["条件一致性评分"]
C --> E["类别概率与任务输出"]
D --> F["图像级异常告警"]
关键设计¶
1. 冗余输出编码:让类别预测包含可检验的内部约束
对于包含 \(S\) 个类别的任务,作者从 Hadamard 矩阵中选取对应的列作为类别码字。 码长 \(L\) 是二的幂并满足 \(L\geq S\),不同码字具有相同的汉明距离;训练所用表示将双极性的正负元素转为零一元素。 网络分类头因此预测长度为 \(L\) 的向量,再经 sigmoid 得到逐位软输出。 这些数值表达的是编码位的预测,不是彼此竞争、总和必为一的类别概率。 这种区分十分重要:如果一开始就用 softmax 强制所有输出落入概率单纯形,后面便无法观察到同样的约束违背信号。
同一套编码可以用于每个分割像素,也可以用于检测模型中的分类位置。 其冗余不是重复运行多个模型,而是让一个类别同时由多个编码位表达,从而使相互矛盾的预测能够显露出来。 有效软码字可以被理解为类别码字按合法概率加权得到的混合;网络逐位预测却未必恰好落在这种混合的集合中。 本文正是利用这个差异构造检测证据,而非仅仅把 Hadamard 矩阵当作替换分类器的固定权重。 这也解释了为何需要下一步专门解码:直接取最大编码位没有类别含义,简单归一化也未必保留可解释的修正量。
2. 概率约束解码:同时输出类别分布和修正残差
解码器先利用 Hadamard 矩阵的正交性质,将软码字转换成一个尚未受约束的类别空间估计。 这个估计可能包含负值,也可能不满足概率总和为一,因此不能直接称为有效后验分布。 作者要求最终类别概率非负且总和等于一,并寻找满足这些条件所需的最小平方修正。 论文将这一问题归结为到概率单纯形的投影,得到距离未约束估计最近的合法概率向量。 投影的作用不是一般意义上的温度校准,而是在明确几何约束下完成概率恢复。
解码器保留投影后概率与投影前估计之间的类别空间修正向量,作为第二个输出。 如果修正较大,说明网络给出的各个编码位较难共同支持一个合法类别解释。 但修正较小并不能证明预测正确,更不能证明图像没有分布偏移;它只表示这一内部检验未发现明显矛盾。 论文同时讨论码字空间误差与类别空间误差,并把两种最小化问题的等价性证明放在补充材料中。 本笔记使用主文可核实的机制解释,不把类别空间残差误写成对所有可能感知错误的完整测量。
本地 PDF 文本抽取损坏了多处公式的运算符、范数和上下标,补充材料 B–E 的推导也不在该缓存中。 因此这里不重建式(11)–(16)的完整代数形式,不提供未经核对的投影实现。 可确认的是主文明确描述了概率约束、最小平方修正、单纯形投影以及“概率加残差”的双输出。 这一证据已经足以解释方法,但不足以逐式复现其全部数学证明。
3. 条件一致性评分:区分正常困难样本与异常残差
最直接的图像级评分是:对每个像素或对象的修正向量取 \(L_1\) 范数,再在图像内求平均。 它不需要额外回归模型,但存在一个直观问题:干净图像中本来难以识别的区域也可能产生较大残差。 只对残差设固定阈值,可能把大量低置信度、但并未受扰动的预测当成异常。 作者因此提出两种条件评分,以最大类别概率和类别分布熵描述局部预测的置信状态。 熵在这里是条件变量,而不再独自承担判别异常的任务。
回归评分先用干净数据学习:在给定置信状态时,残差的 \(L_1\) 范数通常有多大。 推理时比较实际残差与该预测值,将局部差异形成图像级回归误差,再取它相对干净训练集平均误差的绝对偏离作为异常分数。 这意味着相对正常关系的异常偏离才是检测依据,不是“残差越大越危险”的单向假设。 主文对图像级回归误差的公式抽取同样不完整,这里只保留可确认的计算含义,不猜测归一化细节。 回归网络的具体结构在补充材料 G 中,本地正文不能验证,因此不补写层数或隐藏维度。
分位数评分进一步考虑同一置信状态下正常残差本身有不同的分散程度。 回归网络预测条件 85% 分位点;图像级分数定义为实际残差范数超过对应分位点的像素或对象比例。 这一规则把正常波动较大的位置与本应稳定的位置区别对待,而不是把所有残差使用同一个绝对尺度比较。 85% 指正常条件分布中的分位点,不意味着每张干净图像都严格有 15% 的位置越界,也不是论文报告的检测准确率。 密集分割拥有大量像素,比例估计较稳定;对象数量较少时,同一比例会更离散,作者据此解释其在检测任务上的不稳定表现。
损失函数 / 训练策略¶
第一阶段训练感知模型,监督目标是预测软码字与真实类别码字之间的编码空间损失。 主文第 5 节明确说明最终采用均方误差;有关其他损失组合的消融仅指向补充材料 K,不能在本地核实完整数值。 目标检测保留标准边界框回归损失,再与编码分类损失加权组合;权重选择的消融位于未附带的补充材料 Q。 因此该方法需要训练使用新输出表示的模型,并不是把现成 one-hot 模型的 softmax 分数直接换个后处理名称。
第二阶段固定已训练的感知模型,从同一干净训练集收集概率与残差,训练轻量回归检测器。 均值回归使用均方误差,分位数回归使用 85% 分位数损失;主文报告该阶段使用 AdamW 训练 20 个 epoch。 两阶段均不需要异常扰动训练图像,这是相对于专门针对某一种扰动拟合检测器的区别。 推理时只需一次感知模型前向传播,再执行解码和轻量评分;“单次”不意味着回归器或投影完全没有成本。 本笔记仅讨论防御机制与实验结论,不涉及扰动生成流程。
实验关键数据¶
主实验¶
下表选取主文表 1、表 4 的总体结果,而不完整转录每种扰动的所有数据。 Cityscapes 使用 SegFormer MiT-B0,在训练集训练、验证集评测;VOC 使用 Faster R-CNN,在 VOC 2007+2012 trainval 训练、VOC 2007 test 评测。 Global AuROC 是把多个扰动类型与强度的检测输出合并后计算的 ROC 曲线下面积,数值越高越好,不是各配置 AuROC 的简单平均。 合并评测要求不同配置共享同一分数尺度,但 AuROC 仍是阈值扫描指标,并非已经选定部署阈值的检出率。 表中百分数后的区间为论文报告的三随机种子 95% 置信区间;FLOPs 越低计算量越小。
| 数据集/主文来源 | 方法 | Global AuROC(%,越高越好) | FLOPs(G) |
|---|---|---|---|
| Cityscapes,表 1 | 熵基线,单次 | 71.6 ± 0.2 | 122 |
| Cityscapes,表 1 | 特征压缩,三次 | 80.7 ± 0.6 | 366 |
| Cityscapes,表 1 | Hadamard + 直接残差 | 77.1 ± 0.7 | 123 |
| Cityscapes,表 1 | Hadamard + 分位数评分 | 80.2 ± 0.9 | 124 |
| VOC,表 4 | 最大后验基线,单次 | 61.2 ± 0.1 | 215 |
| VOC,表 4 | 特征压缩,三次 | 69.8 ± 2.6 | 645 |
| VOC,表 4 | Hadamard + 回归评分 | 74.4 ± 0.4 | 215 |
Cityscapes 分位数方法相对表 1 的熵基线提高 8.6 个百分点,但没有超过三次前向的特征压缩方法;主要优势是以较少计算获得接近的总体检测表现。 VOC 回归方法相对最大后验基线提高 13.2 个百分点,相对三次方法提高 4.6 个百分点。 这些是各自任务内的比较,不能因为 Cityscapes 的 AuROC 更高便判断该任务更容易或模型更安全。
原任务精度必须另看:表 2 中 Cityscapes 的 SegFormer 干净 mIoU 从 one-hot 的 76.4 ± 0.2 变为 Hadamard 的 76.5 ± 0.3,而 BDD100K 对应结果从 59.5 ± 0.3 降为 57.6 ± 1.5。 表 5 中 VOC 的 Faster R-CNN 干净 AP 从 41.0 ± 0.4 变为 40.4 ± 0.5;这里 AP 按 IoU 0.50–0.95 的 COCO 定义平均,不是 AP50。 所以不能笼统写成“检测更好且精度完全无损”。
消融实验¶
主文表 3 在 Cityscapes 验证集、DeepLabv3+ 上隔离了“一致性信号”与“Hadamard 表示”的贡献。 中间配置使用 sigmoid one-hot 输出,允许未约束类别估计产生不一致,再使用相同的单纯形投影和直接残差评分。
| 输出与检测方式 | Global AuROC(%,越高越好) | 所检验的因素 |
|---|---|---|
| one-hot + 熵 | 72.5 ± 0.1 | 常规置信度基线 |
| one-hot + 投影残差 | 76.9 ± 0.3 | 允许并测量概率约束违背 |
| Hadamard + 投影残差 | 80.4 ± 1.1 | 在相同评分原则下更换编码结构 |
前一步带来 4.4 个百分点,后一步再带来 3.5 个百分点,说明改进不能全部归因于“用了更长的码字”。 这项消融支持残差机制与编码结构都有效,但不直接证明任何特定码长在所有类别数下都是最优。
关键发现¶
- 分位数评分不是通用赢家:Cityscapes 的 SegFormer 受益明显,VOC 的 Faster R-CNN 更适合回归评分,需考虑每张图像可汇总的位置数量。
- 自然噪声仍是薄弱项:表 4 中回归方法对 Gaussian 与 S&P 的 AuROC 分别为 50.2 ± 0.5 和 51.2 ± 2.1,接近随机排序,整体 74.4 不能掩盖这些子项。
- 主文表 1 与表 2 的 SegFormer 熵基线总体 AuROC 不一致;这里的 8.6 点增益严格使用表 1 内部数值,不跨表拼接。
- 表 4 与表 5 的 Faster R-CNN 分位数总体结果也存在不一致,因此不选它作为定量主张;表 5 的逐项结果同样不支持回归评分在所有架构和数据集上都绝对最佳。
亮点与洞察¶
- 输出冗余成为可解释的监测信号。重点不只是类别之间距离较大,而是能够检查多个预测是否支持同一个合法概率解释。
- 单纯形投影同时服务于任务预测与异常检测。类别概率用于正常输出,修正量保留了常规归一化通常不会显式提供的证据。
- 条件评分把“困难但正常”与“违背正常关系”区分开。其防御价值在于减少仅凭低置信度告警的混淆,而不是宣称置信度本身无用。
局限与展望¶
- 作者明确讨论了对象数量较少导致分位数评分不稳定;主文同时报告部分数据集干净精度略有下降,表示替换并非完全免费。
- 读者判断:检测与纠错不是一回事,本文没有由异常分数推出分割或检测预测必然正确的保证,也没有给出完整的拒绝与接管策略。
- 读者判断:主文展示的受测扰动集合不等于对所有分布变化或适应性对手的可靠性保证;部署仍需单独评估阈值、误报和真实数据漂移。
- 证据范围:本地仅有主文与参考文献,回归器结构、证明、部分损失消融及额外数据集结果位于缺失的补充材料中,不能据此宣称已独立核实全部实验。
相关工作与启发¶
- 对比最大后验/熵检测:这些方法读取最终置信度;本文额外读取合法化输出所需的修正,并可把置信度作为条件信息使用。
- 对比特征压缩:后者通过输入变换后多次预测的一致性检测异常;本文利用单次输出内部的编码一致性,计算路径不同,且并非每个场景都更准确。
- 对比已有 Hadamard 分类与分割工作:本文强调概率约束解码和残差利用,并扩展至对象检测,而不是首次提出纠错输出编码这一概念。
评分¶
- 新颖性: 4/5。将概率约束解码与冗余残差检测结合,贡献明确,但编码本身有较长研究历史。
- 实验充分度: 3/5。主文覆盖多架构并提供机制消融,噪声弱项、表间不一致和补充材料缺失限制了结论强度。
- 写作质量: 3/5。机制主线清楚,但部分总结强于逐项表格,且本地公式抽取质量影响核验。
- 价值: 4/5。为视觉可靠性监测提供低附加计算的信号,价值集中在检测而非认证鲁棒性。