Attention-Logit Steering to Compositional Generalization for Continual VQA¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5723
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/12527.pdf
领域: 多模态VLM
关键词: 持续视觉问答、组合泛化、问题与证据耦合、MoE-LoRA、注意力引导
一句话总结¶
Q-STEER 用共享控制器把“给新任务增加专家容量”和“修正回答时看向哪里”联合起来,在无需推理任务标签、无需样本回放的持续 VQA v2 上取得 53.68 AP、4.51 AF,以及 51.00/51.48 的 Novel/Seen 组合得分。
研究背景与动机¶
持续视觉问答不是一次性学会所有题型,而是依次接触识别、定位、计数、颜色等任务,再要求模型仍能回答此前的问题。EWC、MAS 约束重要参数,回放方法重访旧数据,专家方法隔离不同任务的更新;它们主要防止参数改变损伤旧能力,却未必保证模型仍把问题里的对象与正确图像区域绑定起来。
例如,模型可能还认识“红色”,也还会回答颜色问题,但学习后续任务后,回答时从被问物体转向背景区域。这样的错误不等同于概念本身被遗忘:它是问题与视觉证据之间的耦合漂移,也会破坏已学技能与熟悉概念的新组合。另一方面,强迫新任务复现旧注意力分布也不合理,因为分布变化有时正是适应新问题所必需的。
核心 idea:把注意力漂移当作诊断输入而不是蒸馏目标,用同一问题条件控制器协调旧新专家混合与晚层注意力修正,让扩容承担可塑性、让证据路由承担保留。
方法详解¶
整体框架¶
输入是图像和问题,输出是自回归答案;多模态骨干冻结,学习对象是 LoRA 专家、共享控制器和低秩注意力修正基。每个后续任务开始前先用短探测决定是否激活候选专家;正式回答时,从问题 token 表示和一次仅含提示的诊断前向提取上下文与漂移,控制器同时生成专家权重、共享门控和注意力修正系数。
推理不需要任务 ID,但训练仍按已知任务边界执行探测与整合。图中的探测是任务级动作,诊断和控制则针对每个输入;旧任务注意力参考是整合后的数据集级统计,不是给每张新图寻找配对教师答案。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["图像与问题"] --> Drift["问题条件漂移诊断"]
Drift --> Controller["共享控制器"]
Probe["探测式专家扩展<br/>后续任务开始时"] --> Route["因子化旧新路由"]
Controller --> Route
Controller --> ICR["低秩注意力引导"]
Route --> ICR
ICR --> Output["生成答案<br/>任务结束后整合"]
关键设计¶
1. 问题条件漂移诊断:检测证据路由变化,但不强迫复制旧注意力
控制器的上下文只池化问题 token 的隐表示,避免 teacher forcing 时把真实答案泄漏给路由器。另一次 prompt-only 前向,在受控晚层提取答案起始查询位置指向视觉 token 的注意力分布,与此前任务整合出的参考分布比较。当前分布与参考分布均先平滑、再归一化;第一任务的参考来自冻结骨干,随后每个任务内固定参考,任务结束后才更新。
式 (3) 的核心是对各受控晚层的 KL 散度取平均:
这里比较的是注意力分布,不是答案概率,也不是注意力图监督。共享控制器接收问题上下文和这个标量,输出逐层旧新路由 logits、一个取值于 \([0,1]\) 的共享门控 \(\lambda(x)\),以及 ICR 的低秩系数和逐头系数。较大漂移并不被规则直接判成错误,模型仍由答案交叉熵学习如何利用它;这保留了新任务改变视觉关注方式的自由。正文没有完整给出参考统计的整合权重、平滑常数和控制器尺寸,不能把这些实现细节自行补成既定配置。
2. 探测式专家扩展:用候选利用率决定容量增长
每个可扩展层预分配 32 个 LoRA 槽位,最初激活 8 个。后续任务先用 128 个样本短暂开放候选非激活槽位,统计候选在当前任务上的平均路由权重,先在 token 维度平均,再在样本上平均。若其利用率超过当层利用率均值减去 \(\beta_{\rm thr}\) 倍标准差,就将候选正式激活;默认 \(\beta_{\rm thr}=0.5\)。这是一条基于使用情况的扩容启发式,不是通过新任务误差给出“容量不足”的严格判定。
扩容只修改 active mask,不改变参数张量形状,因而避免运行时重新搭建专家库。未激活专家在 softmax 前被赋予负无穷,从实际路由中排除;但是预分配参数仍占存储,并非未使用就没有成本。图 4 显示任一受控层最终最多激活 18 个槽位,仍有至少 14 个未用,说明这条任务流并未把 32 个槽位填满,而不是证明任意长期任务流都能保持低占用。
3. 因子化旧新路由:先分组归一化,再用共享门控混合
旧专家集合与新激活专家集合各自做 masked softmax,再用共享门控混合两组分布。相应的专家加权 LoRA 更新被加到冻结线性变换上。关键不是又增加一个 softmax,而是新专家 logits 增大时,不再直接挤压同一次归一化中的旧专家概率:
两组分布按各自槽位嵌入完整专家空间;没有候选被晋升时,直接绕过新分支。固定 \(\lambda\) 时,旧专家权重对新分支 logits 的交叉导数为零,但共享控制器仍会更新,因此这只是局部消除竞争路径,不是把旧路由完全冻结。前向使用软混合,反向只更新路由排名前 \(K=2\) 的专家;不能把它误读成前向只计算两个专家。后续任务已经整合的旧专家冻结,更新新专家、控制器和 ICR 基,以减少直接改写旧知识。
4. 低秩注意力引导:在 softmax 之前修正答案查询的证据分配
ICR 不直接匹配旧注意力,而是给晚层每个注意力头的 logits 增加输入相关偏置。查询和键分别投影到低秩空间,控制器产生的 \(\alpha\) 调节各低秩分量,再经共享门控和逐头系数 \(\gamma\) 缩放。根据原文式 (10)–(11),记注意力 logits 为 \(A_h^l\),则:
修正只作用于答案查询位置,而不是改写所有提示 token 的注意力。注意力在 softmax 之前被改变,意味着模型可以重新分配证据的相对权重,而不仅仅是在最终输出层修答案。默认只控制最后 6 层,低秩维度为 8、\(s_{\rm icr}=0.3\);共享 \(\lambda\) 同时约束新专家注入和注意力扰动,给两条适应路径共同的幅度控制,但也可能使本该独立变化的两种需求绑得过紧。
一个完整示例¶
以“杯子是什么颜色?”为机制示意,这不是原文新增的定量样本。模型先仅从问题 token 提取上下文,再用图像与问题做诊断前向,测量答案起始位置的视觉注意力与历史参考的差异;真实答案“红色”不参与这些诊断输入。
若当前任务之前已经晋升了候选专家,控制器分别给旧新专家组分配权重,再由同一个门控调节新专家贡献与 ICR 偏置。低秩引导作用于生成答案的位置,使关注杯子而非无关背景成为可学习的选择。训练时答案交叉熵提供监督,推理时直接生成答案;不需要提供这是“颜色任务”的标签,也不需要回放旧杯子图像。这里不能臆造具体漂移值、门控值或一次纠错成功率。
损失函数 / 训练策略¶
目标只有答案 token 上的标准自回归交叉熵,没有 KL 注意力匹配项。第一任务训练初始专家、控制器和 ICR 基;后续任务先探测,再冻结已整合专家,训练新专家及共享部件,最后整合专家和注意力参考。LoRA 秩与 ICR 秩均为 8,注意力 softmax 用 fp32。缓存正文没有明确列出完整学习率、优化器、训练轮数和精确骨干规格,无法据此声称已具备完整复现配方。
共享门控还有一个有限的理论解释:令旧路径预测边际为 \(m_{\rm old}(x)\),\(\Psi(x)\) 汇总各层 MoE 与 ICR 扰动及局部 Lipschitz 常数,原文给出:
因此只有满足 \(\lambda(x)\Psi(x)<m_{\rm old}(x)/2\) 时才能由该界保证旧预测不变。它依赖局部假设和未知扰动量,并非训练过程自动满足的保证,也不是旧预测一定正确的保证;完整推导位于本缓存未包含的补充材料。
实验关键数据¶
主实验¶
VQA v2 按 VQACL 协议依次学习 10 种题型,方法之间共享 LLaVA-style 初始化、任务顺序、答案集合、评估器和无任务标签推理设置。AP 是最终各任务表现均值;AF 是旧任务历史最佳表现与最终表现之差的均值,越低越好。令 \(a_{i,t}\) 为学完任务 \(i\) 后在任务 \(t\) 上的表现,原文式 (14) 为:
下表摘取原文表 1 的 AP/AF 与表 2 的平均组合得分;Novel 是未见技能与概念组合,Seen 是已见组合,均为百分制分数。
| 方法 | AP ↑ | AF ↓ | Novel ↑ | Seen ↑ |
|---|---|---|---|---|
| ER | 41.95 | 10.20 | 40.03 | 40.92 |
| DER | 41.16 | 11.28 | 39.14 | 39.86 |
| VQACL | 43.49 | 9.10 | 41.78 | 42.61 |
| CL-MoE | 42.63 | 10.56 | 41.02 | 42.09 |
| QUAD | 44.16 | 8.97 | 42.47 | 43.24 |
| Q-STEER | 53.68 | 4.51 | 51.00 | 51.48 |
相对 QUAD,AP 增加 9.52 个百分点、AF 减少 4.46 个百分点,Novel/Seen 分别增加 8.53/8.24 个百分点。三种子的结果为 AP \(53.62\pm0.28\)、AF \(4.55\pm0.15\)、Novel \(50.96\pm0.22\)、Seen \(51.43\pm0.24\);正文没有明确解释这些误差项的统计口径,不能擅称置信区间。提升并非覆盖所有题型:因果题为 23.61,低于 QUAD 的 25.53。
异构 CVIT 流上,Q-STEER 的 AP/AF 为 85.15/4.33,SMoLoRA 为 83.02/6.50。该协议混合各数据集原生指标,Flickr30k 的检索式原生分数可超过 100,不能把 CVIT 的 85.15 与 VQA v2 的 53.68 当作同一准确率比较。
消融实验¶
以下数据来自原文表 5。“移除因子化控制”同时移除旧新专家分组和共享门控,不是只改变归一化方式。
| 配置 | AP ↑ | AF ↓ | Novel ↑ | Seen ↑ |
|---|---|---|---|---|
| 完整 Q-STEER | 53.68 | 4.51 | 51.00 | 51.48 |
| 固定漂移输入 | 52.87 | 5.15 | 49.65 | 50.38 |
| 余弦漂移 | 53.14 | 4.91 | 50.12 | 50.82 |
| 移除因子化控制 | 48.73 | 7.62 | 44.91 | 45.62 |
| 移除 ICR | 51.94 | 5.90 | 47.88 | 49.26 |
| 移除扩展 | 50.96 | 6.47 | 47.11 | 47.85 |
| 移除 active mask | 51.28 | 6.28 | 47.54 | 48.12 |
| 移除 top-K | 50.41 | 6.89 | 46.35 | 46.98 |
关键发现¶
因子化控制消融的损伤最大,AP 降低 4.95、AF 增加 3.11 个百分点,但无法将这部分收益独立归因于分组 softmax。移除 ICR 后 AF 增加 1.39、Novel 降低 3.12 个百分点;移除扩展后 AP 降低 2.72 个百分点,两者支持保留与可塑性的分工,但作用并不完全互斥。
原文表 6 用 Evidence-Mass 衡量生成答案时,注意力落在与问题对象或属性名词最相似的前 10% 视觉 patch 上的质量;熵衡量注意力在视觉 token 上的分散程度。它们是定位质量代理,不是人工标注区域准确率,也不是因果证据;具体相似度模型和完整计算细节转引补充材料,当前缓存不能补全。
| ICR 配置 | Evidence-Mass ↑ | 注意力熵 ↓ | AP ↑ | AF ↓ |
|---|---|---|---|---|
| 无 ICR | 0.421 | 2.31 | 51.94 | 5.90 |
| 强度 0.1 | 0.456 | 2.20 | 52.76 | 5.22 |
| 强度 0.3 | 0.487 | 2.07 | 53.68 | 4.51 |
| 强度 0.5 | 0.473 | 2.14 | 52.98 | 4.96 |
强度并非越大越好;干预窗口同样如此,最后 6 层 AP 为 53.68,扩大到 8 层降至 52.94。原文表 4 报告 Q-STEER 附加参数 45.6M,FLOPs、显存、训练与推理开销分别为 +6.5%、+8.2%、+15.6%、+6.1%;CL-MoE 为 40.0M、+5.4%、+7.6%、+13.2%、+5.0%。开销已包含诊断前向,训练还包含探测,不能仅用低秩参数量推断运行成本;正文未完整列出测量硬件和归一化基线细节。
亮点与洞察¶
- 把漂移当输入而不是惩罚项,允许新任务合理改变注意力。可迁移的思路是让历史统计辅助决策,而不是把任何历史偏差都定义成错误。
- 分组归一化与门控共同控制专家竞争,低秩偏置则控制答案的证据路由。两条路径分别作用于参数适应与推理信息流,比单纯冻结骨干更具体。
- 利用率驱动的 mask 扩展避免动态改变参数形状。它兼顾持续增长与固定计算图,但不应掩盖预分配槽位的存储成本。
局限与展望¶
- 作者承认预分配专家占存储,诊断前向与逐任务探测增加算力;长期流还可能耗尽槽位。压缩、合并或回收专家是有针对性的后续方向。
- 作者承认 KL 漂移和 Evidence-Mass 不是因果解释,理论也只有充分条件。可补充遮挡关键区域、替换无关背景等干预测试,区分证据使用改善与答案先验变化。
- 作者指出共享门控可能不适合“需要新专家但不需要改注意力”等输入。分别设置但协调训练的路由与引导门控值得比较。
- 从实验设计看,复合消融不能分离分组归一化与门控贡献;正文缺少完整复现配置,当前缓存也没有补充材料。下一步应独立消融两者并报告测量环境、参考统计构建和误差项定义。
- 推理无任务标签不等于训练无任务边界;本文尚未证明跨骨干、无边界流或长期开放世界部署的可靠性,因果题也仍是明显短板。
相关工作与启发¶
- 与 QUAD 对比:QUAD 使用仅问题回放及注意力蒸馏;本文不存回放样本,也不优化注意力匹配损失,而让漂移决定如何路由和引导。两者对历史信息的使用方式不同,不能都概括为教师注意力监督。
- 与 CL-MoE 对比:两者都用模块化专家;本文额外以旧新分组和共享门控控制竞争,并直接修改晚层注意力 logits。性能提高伴随附加参数与诊断计算,比较应同时看效果和成本。
- 与 VQACL / SMoLoRA 对比:前者提供题型持续 VQA 评估背景,后者提供异构指令流协议。本文用两种流检验适应与保留,但这仍不是跨模型家族泛化的证据。
评分¶
- 新颖性: 4/5。把漂移诊断、因子化专家控制与 logit 引导组合成明确机制,但组成技术已有基础。
- 实验充分度: 4/5。包含主任务、组合划分、异构流、三种子、消融和成本;因果归因及独立门控消融仍不足。
- 写作质量: 4/5。清楚区分诊断和损失、代理和解释,但若干复现细节依赖未缓存的补充材料。
- 价值: 4/5。对持续多模态系统如何保留证据路由有启发,实际收益需结合额外前向和专家存储评估。