DnA: Denoising Attention for Visual Tasks¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3828
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/3290.pdf
代码: https://github.com/rjccv/DnA
领域: 视频理解 / 视觉表示学习
关键词: 去噪注意力、softmin、双值子空间、时空注意力、视觉探针
一句话总结¶
DnA 在共享键上用 softmax/softmin 双查询提取互补交互,再通过独立值投影和逐头可学习权重融合,在 ImageNet-1K 将 ViT-B Top-1 从 81.1% 提升到 81.9%,并改善视频分类及视觉探针问答,但需要额外参数与计算。
研究背景与动机¶
视觉注意力容易把“经常一起出现”误当成“当前任务真正需要”。识别胸甲时,穿戴者、头盔都可能吸引注意;识别动作时,背景中的显著物体也可能压过真正有用的手部和交互区域。标准 softmax 把较大相似度放大,将较低尤其较负的分数压到接近零,因而擅长选择强关联,却不擅长单独表达那些可能具有辨别价值的低分交互。这里的负交互是模型内部的学习结果,不等同于人工标注的背景区域。
Differential Attention 已尝试用两个注意力分布相减来抵消共同噪声,但两条分支最终仍聚合到同一个值表示中。如果两条分支都关注了有用区域,相减也可能把有用信号一起消去。本文关心的因此不只是“权重是否可以为负”,还包括两路信息究竟被编码到哪里:只改变权重而共享值表示,与同时改变交互选择和表示空间,并不是同一种设计。
作者借助子空间分类中主角度与误分类界的关系,提出将两路交互放到更可分的值表示中,并在图像、视频和视觉语言适配器上检验这一想法。核心 idea:保留高分交互,也显式学习低分交互,让两路信息经过独立值投影后再融合,避免在共享表示中直接抵消潜在有用信号。
方法详解¶
整体框架¶
DnA 是注意力算子的替换方案,不是扩散模型,也不是删除 token 的稀疏注意力。给定图像或视频 token,它生成两组查询、共享的一组键和两组值;正分支使用 softmax,负分支使用 softmin,各自完成加权聚合后按注意力头融合。ViT 的位置编码、分类 token、MLP 等其余组件保持原有结构,输出仍是能接回原 Transformer 的上下文化特征。
视频中有两种不同接法:TimeSformer 同时替换空间和时间自注意力;视频 LLM 则替换 VisCoP 视觉探针的交叉注意力,而不是改写整个语言模型的注意力。下图中的任务接入表示不同实验配置,不是先训练一个模型再串行跑完所有任务。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
IN["视觉 token<br/>或探针与视觉特征"] --> Q["双查询互补选择<br/>共享键"]
Q -->|正查询 softmax| VP["独立值投影<br/>正分支"]
Q -->|负查询 softmin| VN["独立值投影<br/>负分支"]
VP --> F["双值子空间融合<br/>逐头可学习权重"]
VN --> F
F --> T["任务接入<br/>分类或视觉探针"]
T --> OUT["图像与视频分类<br/>或视频问答"]
关键设计¶
1. 双查询互补选择:让被 softmax 压低的交互也有独立表达通道
每个头分别学习正查询与负查询,但二者与同一组键计算缩放点积。共享键保留共同的被检索 token 集合,独立查询则允许两路学习不同的选择标准。正路保持普通 softmax;负路使用 \(\operatorname{softmin}(z)=\operatorname{softmax}(-z)\),即分数越低,归一化权重越大。注意,两路查询不同,因此负路并不是正路权重的补集,也不是把正路注意力直接取负。
softmin 输出仍是非负、和为一的权重。“负”描述它对低分交互的偏好,而不是概率变成负数。作者以最大熵分布在相反符号期望约束下的形式解释 softmax 与 softmin 的互补性;这个论证给出了使用两个极端的动机,却不证明每个低分 token 都是噪声。哪一路学到对象、上下文或干扰因素,仍取决于端到端任务监督。
2. 双值子空间融合:让两路聚合不再共享同一个值表示
DnA 为两条分支分别学习值投影,得到 \(V_h^+\) 与 \(V_h^-\),随后用逐头标量 \(\alpha_h\) 控制负路贡献。按原文方法式整理,其单头输出为:
其中 \(d\) 是头维度,\(\alpha_h\in\mathbb{R}\) 可学习,并没有被规定永远为负。与两个分布相减后乘同一 \(V\) 相比,这个表达式允许同一 token 在两条分支中携带不同的特征方向。即便两路都关注某个区域,也不必在同一表示方向上直接抵消。融合后仍按多头注意力的组织方式拼接,供后续网络处理。
为什么独立投影可能有帮助?作者将相关与干扰交互类比为两个子空间附近的类别:在引用的低噪声分类模型中,更大的主角度可改善误分类上界。DnA 不在训练中显式加入逐步正交约束,而是研究随机初始化及训练迭代满足特定分布、有界性假设时的近似正交性质,并给出训练后子空间统计。它希望通过普通任务损失得到互补表示,而不额外求解正交约束优化。
这里需要区分设计目标和保证:独立投影不自动意味着正交,关于迭代权重仍独立同分布且次高斯的条件也不是任意训练过程都成立。正文统计存在明显右尾,说明部分头仍有较强重叠。因此合理的结论是“实测两路表示更分离”,而不是“所有头都严格正交,所以绝不会损失有效信号”。
3. 任务接入:分别处理时空自注意力与探针交叉注意力
对 TimeSformer,空间注意力处理同一帧的 patch 关系,时间注意力处理跨帧关系,DnA 在两个位置均替换原算子。这样,空间分支可以降低无关物体的影响,时间分支可以处理对动作判别无益的跨帧交互。实验使用 8 帧、224×224 输入;并未引入新的帧筛选器,也没有声称减少输入 token 数。
对 VideoLLaMA3 加 VisCoP 的设置,查询来自可学习视觉探针,键和值来自视觉编码器中间层特征。探针通过交叉注意力逐层提取紧凑的领域线索,强化冻结视觉编码器提供的表示,再送往语言模型。这里 DnA 的作用是改善探针读取视觉证据的方式,不能把结果解释成重训了整个视觉骨干,或将全部语言自注意力替换成 DnA。
预训练模型接入还要防止新分支破坏原来的有效行为。正路从预训练交叉注意力权重初始化,负查询和值投影从对应正路复制后缩小到 \(10^{-4}\);作者将此解释为避免相同初始化造成分支对称。这个初始化与从头训练 ViT 的随机初始化不是一回事,也应与理论部分的独立随机权重假设分开理解。
一个完整示例¶
以论文的木底鞋与旁边的猫为例,分类目标是鞋,但猫的显著外观可能吸走普通注意力。正查询学习聚合与鞋有关的交互,负查询通过另一套打分寻找互补的低分交互;这些区域分别进入独立值投影,再由融合结果支持分类。即使同一 patch 在两路都有权重,编码方向也可以不同,而不是像共享值空间中的相减那样必然消掉重叠贡献。
这只是帮助理解机制的定性示例,不意味着每张图都满足“正路只看鞋、负路只看猫”。论文展示的是梯度相关性可视化,没有给出这个样例的逐 token 权重或分支标注,因此不补造具体注意力数值。
损失函数 / 训练策略¶
方法沿用各任务训练目标,正文将其统一记为任务损失,没有要求另加显式正交正则,也没有为两路提供对象/背景标签。缓存中若干理论公式存在 PDF 文本抽取损坏,故这里只保留可明确核对的注意力计算式,不尝试重建误分类上界或正则项细节。
图像分类按 DeiT 配方从头训练 ViT-B:12 层、每层 12 头、patch 大小 16、头维度 64,ImageNet-1K 输入 224×224,使用 NVIDIA H100 训练 300 个 epoch。视频分类从上述图像权重初始化,再做 Kinetics400 预训练,随后在目标动作数据集微调;正文报告目标训练为 15 个 epoch。
视频 LLM 使用 EgoExo4D 中约 46K 个第一人称视频问答对,训练交互模块、视觉探针投影器和视觉嵌入投影器,并对 LLM 使用 LoRA。训练 3 个 epoch,初始学习率 \(10^{-5}\),对投影器和 LLM 使用余弦调度,评测温度为 0。正文未给出完整损失权重及所有实现超参数,不据此推断缺失配置。
实验关键数据¶
主实验¶
表中准确率单位为百分比,提升均为百分点。ImageNet 数字取原表 1 的 Test Set Top-1 列;Toyota 使用 mean-class accuracy,NTU60 使用 Top-1;Ego-in-Exo 使用四类任务平均准确率。各行的基线、指标不同,不将它们平均成统一收益。
| 数据集 / 协议 | 基线 | 基线结果 | Differential Attention | DnA | 相对基线提升 |
|---|---|---|---|---|---|
| ImageNet-1K,Test Top-1 | ViT-B | 81.1 | 81.5 | 81.9 | +0.8 |
| Toyota Smarthome,CS mCA | TimeSformer | 67.5 | 66.6 | 68.8 | +1.3 |
| Toyota Smarthome,CV2 mCA | TimeSformer | 59.5 | 59.4 | 63.5 | +4.0 |
| NTU60,CS Top-1 | TimeSformer | 81.2 | 81.5 | 82.4 | +1.2 |
| NTU60,CV Top-1 | TimeSformer | 88.6 | 89.1 | 89.2 | +0.6 |
| Ego-in-Exo PerceptionMCQ,平均 | VisCoP | 78.1 | 76.1 | 78.6 | +0.5 |
ImageNet 测试列中 Cog Attention 同样为 81.5%,因此 DnA 相比两种替代注意力的测试提升是 0.4 个百分点;验证列的对应差距才是 0.5 个百分点。视频问答基线必须选 VisCoP,而不是仅有 72.8% 的裸 VideoLLaMA3,否则会把视觉探针本身的收益也算给 DnA。
消融实验¶
可用缓存只有正文及参考文献。正文将参数匹配对照指向附录表 12,将组件和初始化消融指向附录 C.5 及表 13,但未包含其具体表格。下面列出可核验的机制分析,而不是伪造“去掉某模块”的实验;仅靠这些统计不能独立确定 softmin、双查询和双值投影各自贡献多少。
| 正文分析,ViT-B / ImageNet-1K | Differential Attention | DnA | 含义与边界 |
|---|---|---|---|
| 两分支输出平均余弦相似度 | 0.96 | 0.32 | DnA 输出更互补,不等同于全部方向正交 |
| Top-10 左奇异向量的 intruder 数分布峰值 | 6–7 | 8–9 | 原图 5 的峰值区间,不是均值 |
| 值矩阵归一化 Frobenius 内积均值 / 中位数 | 未报告 | 0.22 / 0.18 | 原图 6;右尾说明部分头仍重叠 |
| 参数量 | 86.6M | 100.7M | 增加投影有实际容量成本 |
| 每张图 GFLOPs | 17.6 | 21.1 | 计算量增加,不能称为零成本替换 |
intruder 分析对每个样本、层和头计算两路输出的 SVD,统计前 10 个左奇异向量中与另一分支向量余弦相似度低于阈值的方向,阈值设为 \(\cos(\pi/3)\)。统计使用 ImageNet-1K 每类 5 张、共 5K 图像,得到 720K 个计数;值矩阵相似度分析则覆盖完整验证集,得到 7.2M 个样本-层-头记录。归一化 Frobenius 内积即先分别除以各自矩阵范数,再计算内积;接近零表示整体矩阵对齐程度低,但不充分证明所有子空间主角度都大。
关键发现¶
- 最大视频收益出现在 Toyota CV2:59.5% 到 63.5%,而不是所有任务都提升 4.0 个百分点。跨视角结果支持其潜力,但尚不能单靠准确率确定是哪些干扰被消除。
- 视频问答提升集中在 Action 的 81.8% 到 83.1% 和 Task 的 86.1% 到 87.1%;HOI 为 79.3% 到 79.2%,Hand 保持 65.1%。平均提升不代表每一类都改善。
- ImageNet-A 上 DnA 准确率 27.7%,略低于 Differential Attention 的 28.1%,但校准误差列为 24.2 对 25.8、AURRA 为 40.7 对 39.7。可靠性指标获益不能写成所有鲁棒指标全面领先。
- 原表 1 报告 ViT-B 与 DnA 吞吐均为 909.1 img/s,但参数和 GFLOPs 同时增加。这个测量应限制在原实验设置内,不外推为任意硬件、批大小下均无开销。
亮点与洞察¶
- 注意力去噪不只取决于权重符号,也取决于值表示是否共享。将“选什么”和“编码到哪里”拆开分析,是比简单增加一条相减分支更有解释力的设计视角。
- softmin 为低分交互保留独立通道,却不要求概率为负。它可以与带符号的值表示及可学习融合共同工作,避免混淆负分数、负权重与负相关性三种概念。
- 从自注意力转到探针交叉注意力的改造较集中。对已有视频 VLM,优先在视觉证据读取处检验互补分支,是一个可复用的实验路线,但仍需验证其是否抵得上额外成本。
局限与展望¶
- 作者明确承认参数与训练成本增加,给出的额外参数范围约为视频 LLM 的 3% 到视频 Transformer 的 23%。未来方向是更高参数效率的实现,而不是已经完成轻量化。
- 理论是有条件的解释:低噪声子空间分类假设与训练权重分布假设,不能直接变成真实视觉模型每一步都保持正交的保证。视频适配中的复制初始化尤其应单独检验。
- 本笔记可核验的正文缺少具体组件消融和参数匹配数值,虽有相关附录指引,却不能据此排除所有容量因素。进一步复现应在匹配参数及计算预算下分别控制 softmin、双查询、双值投影和初始化。
- 视觉问答净收益为 0.5 个百分点,且并非所有类别上升;正文未提供这里所需的多次运行方差。应补足置信区间、不同随机种子与更广任务,判断小幅收益的稳定性。
- 近零矩阵内积可能包含不同方向贡献的抵消,不等价于严格子空间正交。可进一步联合主角度谱、逐头干预和受控背景替换,检验表示分离是否因果地带来去噪。
相关工作与启发¶
- 与 Differential Transformer 对比:后者对两个 softmax 分布做带系数差分并共享值表示;DnA 采用 softmax/softmin、共享键和独立值表示后加权融合。收益不能仅归因为“允许负注意力”。
- 与 Cog Attention 对比:Cog Attention 直接研究负权重的表达能力,DnA 更强调双路表示的几何分离。ImageNet 测试比较支持 DnA,但 ImageNet-A 的准确率与校准排序不同,需逐指标判断。
- 与 TimeSformer 对比:DnA 沿用时空分离结构,只替换两个注意力位置。它贡献的是聚合机制,而非新的视频分块方式或长视频采样策略。
- 与 VisCoP 对比:保留视觉探针读取中间层特征的适配框架,改变探针交叉注意力。研究启发是把互补表示放在视觉证据压缩入口,并用逐类问答结果检查哪些能力真正获益。
评分¶
- 新颖性: 4/5。将 softmin 互补选择与独立值子空间结合,清晰区别于共享值差分,但建立在已有带符号注意力与子空间理论上。
- 实验充分度: 4/5。覆盖图像、视频和视频 LLM,并有机制统计;当前缓存未包含关键附录消融,细粒度归因仍需核验。
- 写作质量: 3/5。架构和应用路径明确,但部分理论到实证的推断偏强,且验证/测试提升、校准指标命名需要细读区分。
- 价值: 4/5。提供可插入多种视觉模型的注意力改造,但部署前必须衡量真实计算开销与小幅收益的稳定性。