跳转至

Attention-Logit Steering to Compositional Generalization for Continual VQA

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5723
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/12527.pdf
领域: 多模态VLM
关键词: 持续视觉问答、组合泛化、问题与证据耦合、MoE-LoRA、注意力引导

一句话总结

Q-STEER 用共享控制器把“给新任务增加专家容量”和“修正回答时看向哪里”联合起来,在无需推理任务标签、无需样本回放的持续 VQA v2 上取得 53.68 AP、4.51 AF,以及 51.00/51.48 的 Novel/Seen 组合得分。

研究背景与动机

持续视觉问答不是一次性学会所有题型,而是依次接触识别、定位、计数、颜色等任务,再要求模型仍能回答此前的问题。EWC、MAS 约束重要参数,回放方法重访旧数据,专家方法隔离不同任务的更新;它们主要防止参数改变损伤旧能力,却未必保证模型仍把问题里的对象与正确图像区域绑定起来。

例如,模型可能还认识“红色”,也还会回答颜色问题,但学习后续任务后,回答时从被问物体转向背景区域。这样的错误不等同于概念本身被遗忘:它是问题与视觉证据之间的耦合漂移,也会破坏已学技能与熟悉概念的新组合。另一方面,强迫新任务复现旧注意力分布也不合理,因为分布变化有时正是适应新问题所必需的。

核心 idea:把注意力漂移当作诊断输入而不是蒸馏目标,用同一问题条件控制器协调旧新专家混合与晚层注意力修正,让扩容承担可塑性、让证据路由承担保留。

方法详解

整体框架

输入是图像和问题,输出是自回归答案;多模态骨干冻结,学习对象是 LoRA 专家、共享控制器和低秩注意力修正基。每个后续任务开始前先用短探测决定是否激活候选专家;正式回答时,从问题 token 表示和一次仅含提示的诊断前向提取上下文与漂移,控制器同时生成专家权重、共享门控和注意力修正系数。

推理不需要任务 ID,但训练仍按已知任务边界执行探测与整合。图中的探测是任务级动作,诊断和控制则针对每个输入;旧任务注意力参考是整合后的数据集级统计,不是给每张新图寻找配对教师答案。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["图像与问题"] --> Drift["问题条件漂移诊断"]
    Drift --> Controller["共享控制器"]
    Probe["探测式专家扩展<br/>后续任务开始时"] --> Route["因子化旧新路由"]
    Controller --> Route
    Controller --> ICR["低秩注意力引导"]
    Route --> ICR
    ICR --> Output["生成答案<br/>任务结束后整合"]

关键设计

1. 问题条件漂移诊断:检测证据路由变化,但不强迫复制旧注意力

控制器的上下文只池化问题 token 的隐表示,避免 teacher forcing 时把真实答案泄漏给路由器。另一次 prompt-only 前向,在受控晚层提取答案起始查询位置指向视觉 token 的注意力分布,与此前任务整合出的参考分布比较。当前分布与参考分布均先平滑、再归一化;第一任务的参考来自冻结骨干,随后每个任务内固定参考,任务结束后才更新。

式 (3) 的核心是对各受控晚层的 KL 散度取平均:

\[ d(x)=\frac{1}{|\mathcal L_{\rm late}|}\sum_{l\in\mathcal L_{\rm late}}D_{\rm KL}\!\left(p_{\rm cur}^{l}(x)\,\|\,p_{\rm ref}^{l}\right). \]

这里比较的是注意力分布,不是答案概率,也不是注意力图监督。共享控制器接收问题上下文和这个标量,输出逐层旧新路由 logits、一个取值于 \([0,1]\) 的共享门控 \(\lambda(x)\),以及 ICR 的低秩系数和逐头系数。较大漂移并不被规则直接判成错误,模型仍由答案交叉熵学习如何利用它;这保留了新任务改变视觉关注方式的自由。正文没有完整给出参考统计的整合权重、平滑常数和控制器尺寸,不能把这些实现细节自行补成既定配置。

2. 探测式专家扩展:用候选利用率决定容量增长

每个可扩展层预分配 32 个 LoRA 槽位,最初激活 8 个。后续任务先用 128 个样本短暂开放候选非激活槽位,统计候选在当前任务上的平均路由权重,先在 token 维度平均,再在样本上平均。若其利用率超过当层利用率均值减去 \(\beta_{\rm thr}\) 倍标准差,就将候选正式激活;默认 \(\beta_{\rm thr}=0.5\)。这是一条基于使用情况的扩容启发式,不是通过新任务误差给出“容量不足”的严格判定。

扩容只修改 active mask,不改变参数张量形状,因而避免运行时重新搭建专家库。未激活专家在 softmax 前被赋予负无穷,从实际路由中排除;但是预分配参数仍占存储,并非未使用就没有成本。图 4 显示任一受控层最终最多激活 18 个槽位,仍有至少 14 个未用,说明这条任务流并未把 32 个槽位填满,而不是证明任意长期任务流都能保持低占用。

3. 因子化旧新路由:先分组归一化,再用共享门控混合

旧专家集合与新激活专家集合各自做 masked softmax,再用共享门控混合两组分布。相应的专家加权 LoRA 更新被加到冻结线性变换上。关键不是又增加一个 softmax,而是新专家 logits 增大时,不再直接挤压同一次归一化中的旧专家概率:

\[ \widetilde g^{l}(x)=(1-\lambda(x))p_{\rm old}^{l}(x)+\lambda(x)p_{\rm new}^{l}(x). \]

两组分布按各自槽位嵌入完整专家空间;没有候选被晋升时,直接绕过新分支。固定 \(\lambda\) 时,旧专家权重对新分支 logits 的交叉导数为零,但共享控制器仍会更新,因此这只是局部消除竞争路径,不是把旧路由完全冻结。前向使用软混合,反向只更新路由排名前 \(K=2\) 的专家;不能把它误读成前向只计算两个专家。后续任务已经整合的旧专家冻结,更新新专家、控制器和 ICR 基,以减少直接改写旧知识。

4. 低秩注意力引导:在 softmax 之前修正答案查询的证据分配

ICR 不直接匹配旧注意力,而是给晚层每个注意力头的 logits 增加输入相关偏置。查询和键分别投影到低秩空间,控制器产生的 \(\alpha\) 调节各低秩分量,再经共享门控和逐头系数 \(\gamma\) 缩放。根据原文式 (10)–(11),记注意力 logits 为 \(A_h^l\),则:

\[ \Delta A_h^l(x)=(Q_h^lU_{q,h}^l)\operatorname{diag}(\alpha^l(x))(K_h^lU_{k,h}^l)^\top, \qquad A_h^l\leftarrow A_h^l+s_{\rm icr}\lambda(x)\gamma_h^l(x)\Delta A_h^l(x). \]

修正只作用于答案查询位置,而不是改写所有提示 token 的注意力。注意力在 softmax 之前被改变,意味着模型可以重新分配证据的相对权重,而不仅仅是在最终输出层修答案。默认只控制最后 6 层,低秩维度为 8、\(s_{\rm icr}=0.3\);共享 \(\lambda\) 同时约束新专家注入和注意力扰动,给两条适应路径共同的幅度控制,但也可能使本该独立变化的两种需求绑得过紧。

一个完整示例

以“杯子是什么颜色?”为机制示意,这不是原文新增的定量样本。模型先仅从问题 token 提取上下文,再用图像与问题做诊断前向,测量答案起始位置的视觉注意力与历史参考的差异;真实答案“红色”不参与这些诊断输入。

若当前任务之前已经晋升了候选专家,控制器分别给旧新专家组分配权重,再由同一个门控调节新专家贡献与 ICR 偏置。低秩引导作用于生成答案的位置,使关注杯子而非无关背景成为可学习的选择。训练时答案交叉熵提供监督,推理时直接生成答案;不需要提供这是“颜色任务”的标签,也不需要回放旧杯子图像。这里不能臆造具体漂移值、门控值或一次纠错成功率。

损失函数 / 训练策略

目标只有答案 token 上的标准自回归交叉熵,没有 KL 注意力匹配项。第一任务训练初始专家、控制器和 ICR 基;后续任务先探测,再冻结已整合专家,训练新专家及共享部件,最后整合专家和注意力参考。LoRA 秩与 ICR 秩均为 8,注意力 softmax 用 fp32。缓存正文没有明确列出完整学习率、优化器、训练轮数和精确骨干规格,无法据此声称已具备完整复现配方。

共享门控还有一个有限的理论解释:令旧路径预测边际为 \(m_{\rm old}(x)\)\(\Psi(x)\) 汇总各层 MoE 与 ICR 扰动及局部 Lipschitz 常数,原文给出:

\[ \|z(x)-z_{\rm old}(x)\|_\infty\leq\lambda(x)\Psi(x), \qquad m(x)\geq m_{\rm old}(x)-2\lambda(x)\Psi(x). \]

因此只有满足 \(\lambda(x)\Psi(x)<m_{\rm old}(x)/2\) 时才能由该界保证旧预测不变。它依赖局部假设和未知扰动量,并非训练过程自动满足的保证,也不是旧预测一定正确的保证;完整推导位于本缓存未包含的补充材料。

实验关键数据

主实验

VQA v2 按 VQACL 协议依次学习 10 种题型,方法之间共享 LLaVA-style 初始化、任务顺序、答案集合、评估器和无任务标签推理设置。AP 是最终各任务表现均值;AF 是旧任务历史最佳表现与最终表现之差的均值,越低越好。令 \(a_{i,t}\) 为学完任务 \(i\) 后在任务 \(t\) 上的表现,原文式 (14) 为:

\[ \mathrm{AP}=\frac{1}{T}\sum_{t=1}^{T}a_{T,t},\qquad \mathrm{AF}=\frac{1}{T-1}\sum_{t=1}^{T-1}\left(\max_{t\leq i\leq T}a_{i,t}-a_{T,t}\right). \]

下表摘取原文表 1 的 AP/AF 与表 2 的平均组合得分;Novel 是未见技能与概念组合,Seen 是已见组合,均为百分制分数。

方法 AP ↑ AF ↓ Novel ↑ Seen ↑
ER 41.95 10.20 40.03 40.92
DER 41.16 11.28 39.14 39.86
VQACL 43.49 9.10 41.78 42.61
CL-MoE 42.63 10.56 41.02 42.09
QUAD 44.16 8.97 42.47 43.24
Q-STEER 53.68 4.51 51.00 51.48

相对 QUAD,AP 增加 9.52 个百分点、AF 减少 4.46 个百分点,Novel/Seen 分别增加 8.53/8.24 个百分点。三种子的结果为 AP \(53.62\pm0.28\)、AF \(4.55\pm0.15\)、Novel \(50.96\pm0.22\)、Seen \(51.43\pm0.24\);正文没有明确解释这些误差项的统计口径,不能擅称置信区间。提升并非覆盖所有题型:因果题为 23.61,低于 QUAD 的 25.53。

异构 CVIT 流上,Q-STEER 的 AP/AF 为 85.15/4.33,SMoLoRA 为 83.02/6.50。该协议混合各数据集原生指标,Flickr30k 的检索式原生分数可超过 100,不能把 CVIT 的 85.15 与 VQA v2 的 53.68 当作同一准确率比较。

消融实验

以下数据来自原文表 5。“移除因子化控制”同时移除旧新专家分组和共享门控,不是只改变归一化方式。

配置 AP ↑ AF ↓ Novel ↑ Seen ↑
完整 Q-STEER 53.68 4.51 51.00 51.48
固定漂移输入 52.87 5.15 49.65 50.38
余弦漂移 53.14 4.91 50.12 50.82
移除因子化控制 48.73 7.62 44.91 45.62
移除 ICR 51.94 5.90 47.88 49.26
移除扩展 50.96 6.47 47.11 47.85
移除 active mask 51.28 6.28 47.54 48.12
移除 top-K 50.41 6.89 46.35 46.98

关键发现

因子化控制消融的损伤最大,AP 降低 4.95、AF 增加 3.11 个百分点,但无法将这部分收益独立归因于分组 softmax。移除 ICR 后 AF 增加 1.39、Novel 降低 3.12 个百分点;移除扩展后 AP 降低 2.72 个百分点,两者支持保留与可塑性的分工,但作用并不完全互斥。

原文表 6 用 Evidence-Mass 衡量生成答案时,注意力落在与问题对象或属性名词最相似的前 10% 视觉 patch 上的质量;熵衡量注意力在视觉 token 上的分散程度。它们是定位质量代理,不是人工标注区域准确率,也不是因果证据;具体相似度模型和完整计算细节转引补充材料,当前缓存不能补全。

ICR 配置 Evidence-Mass ↑ 注意力熵 ↓ AP ↑ AF ↓
无 ICR 0.421 2.31 51.94 5.90
强度 0.1 0.456 2.20 52.76 5.22
强度 0.3 0.487 2.07 53.68 4.51
强度 0.5 0.473 2.14 52.98 4.96

强度并非越大越好;干预窗口同样如此,最后 6 层 AP 为 53.68,扩大到 8 层降至 52.94。原文表 4 报告 Q-STEER 附加参数 45.6M,FLOPs、显存、训练与推理开销分别为 +6.5%、+8.2%、+15.6%、+6.1%;CL-MoE 为 40.0M、+5.4%、+7.6%、+13.2%、+5.0%。开销已包含诊断前向,训练还包含探测,不能仅用低秩参数量推断运行成本;正文未完整列出测量硬件和归一化基线细节。

亮点与洞察

  • 把漂移当输入而不是惩罚项,允许新任务合理改变注意力。可迁移的思路是让历史统计辅助决策,而不是把任何历史偏差都定义成错误。
  • 分组归一化与门控共同控制专家竞争,低秩偏置则控制答案的证据路由。两条路径分别作用于参数适应与推理信息流,比单纯冻结骨干更具体。
  • 利用率驱动的 mask 扩展避免动态改变参数形状。它兼顾持续增长与固定计算图,但不应掩盖预分配槽位的存储成本。

局限与展望

  • 作者承认预分配专家占存储,诊断前向与逐任务探测增加算力;长期流还可能耗尽槽位。压缩、合并或回收专家是有针对性的后续方向。
  • 作者承认 KL 漂移和 Evidence-Mass 不是因果解释,理论也只有充分条件。可补充遮挡关键区域、替换无关背景等干预测试,区分证据使用改善与答案先验变化。
  • 作者指出共享门控可能不适合“需要新专家但不需要改注意力”等输入。分别设置但协调训练的路由与引导门控值得比较。
  • 从实验设计看,复合消融不能分离分组归一化与门控贡献;正文缺少完整复现配置,当前缓存也没有补充材料。下一步应独立消融两者并报告测量环境、参考统计构建和误差项定义。
  • 推理无任务标签不等于训练无任务边界;本文尚未证明跨骨干、无边界流或长期开放世界部署的可靠性,因果题也仍是明显短板。

相关工作与启发

  • 与 QUAD 对比:QUAD 使用仅问题回放及注意力蒸馏;本文不存回放样本,也不优化注意力匹配损失,而让漂移决定如何路由和引导。两者对历史信息的使用方式不同,不能都概括为教师注意力监督。
  • 与 CL-MoE 对比:两者都用模块化专家;本文额外以旧新分组和共享门控控制竞争,并直接修改晚层注意力 logits。性能提高伴随附加参数与诊断计算,比较应同时看效果和成本。
  • 与 VQACL / SMoLoRA 对比:前者提供题型持续 VQA 评估背景,后者提供异构指令流协议。本文用两种流检验适应与保留,但这仍不是跨模型家族泛化的证据。

评分

  • 新颖性: 4/5。把漂移诊断、因子化专家控制与 logit 引导组合成明确机制,但组成技术已有基础。
  • 实验充分度: 4/5。包含主任务、组合划分、异构流、三种子、消融和成本;因果归因及独立门控消融仍不足。
  • 写作质量: 4/5。清楚区分诊断和损失、代理和解释,但若干复现细节依赖未缓存的补充材料。
  • 价值: 4/5。对持续多模态系统如何保留证据路由有启发,实际收益需结合额外前向和专家存储评估。