跳转至

Token-level Response-visual Attention Guidance for Multimodal LLMs Knowledge Distillation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/jhjangjh/TRAG
领域: 多模态 VLM / 模型压缩
关键词: 多模态大模型, 知识蒸馏, 注意力引导, 跨模态对齐, 熵驱动自适应加权

一句话总结

针对传统多模态蒸馏中仅关注 Prompt-Vision 注意力且采用统一监督目标的不足,TRAG 提出将跨模态注意力蒸馏聚焦于响应生成阶段(Response-to-Vision),并基于教师注意力熵自适应加权 Forward 与 Reverse KL 散度,在下游 VQA 与组合推理任务上大幅超越现有基线。

研究背景与动机

随着多模态大语言模型(MLLMs)在架构与数据规模上的持续扩展,其高昂的部署与计算开销催生了强烈的轻量化压缩需求。知识蒸馏(Knowledge Distillation, KD)作为压缩大模型的核心范式,在纯文本 LLM 中已取得显著成功;然而在多模态场景下,仅依赖自回归输出 token 的 logits 分布匹配,无法显式监督模型如何在生成过程中检索与对齐视觉证据。因为生成 token 在本质上是模型注意力机制整合视觉输入的副产物,若学生模型内部的跨模态注意力分配发生偏移,极易导致幻觉生成与推理失效。

为了提供更直接的内部监督信号,近期方法开始尝试跨模态注意力蒸馏(如 Align-KD、CompoDistill),但现有工作普遍默认以 Prompt 阶段的视觉注意力(Prompt-to-Vision)作为监督对象,并耗费大量精力设计教师与学生在不同网络深度间的层映射策略。深入实证分析表明,学生与教师在 Prompt-to-Vision 阶段的注意力相似度与下游性能几乎不存在可靠正相关,甚至标准 SFT 模型的 Prompt-to-Vision 相似度高于蒸馏模型但性能更差;相反,Response-to-Vision(响应-视觉)阶段的注意力相似度与下游基准表现高度正相关。与此同时,中间层网络在深度维度上呈现高度注意力冗余,但在响应序列的不同 token 间展现出极大差异:生成虚词(如定冠词)时注意力呈现弥散平滑的全局背景,而生成实体或动作词时则高度聚焦于局部关键物体。因此,在整个生成序列上强行采用全局固定的单一距离度量(如 Cosine 或固定 KL)存在根本性缺陷。

本文的核心切入点是回归响应生成的动态过程,将跨模态注意力监督重构为精细的 token 级自适应引导。核心 idea:将跨模态注意力蒸馏全面转向响应生成阶段(Response-to-Vision),通过聚合中间层注意力消除网络深度匹配负担,并利用教师模型注意力的香农熵动态调节 Forward KL(均值逼近、保证覆盖)与 Reverse KL(众数寻求、强化聚焦)的权重配比,实现 token 级的动态精细化视觉定位对齐。

方法详解

整体框架

TRAG 构建于标准自回归 MLLM 蒸馏框架之上,旨在让紧凑学生模型在自回归生成每个回复词时精准复刻大容量教师模型的视觉注意力分配行为。整个流水线首先提取多模态输入序列经过因果掩码 Transformer 解码器产生的跨模态注意力矩阵;随后隔离出属于回复序列的部分,并在最具代表性的中间层深度区间完成跨层平均与视觉维度重新归一化;最后针对每一个回复 token,计算教师注意力分布的香农熵以动态确定自适应调节权重,组合非对称 KL 散度进行监督。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入序列<br/>图像视觉 tokens + 指令 + 回复"] --> B["响应-视觉注意力解耦<br/>切分提取回复区间跨模态子矩阵"]
    B --> C["中间层注意力聚合与视觉归一化<br/>聚合相对深度0.3-0.6层并投影至概率单纯形"]
    C --> D["熵驱动自适应 KL 动态调控<br/>基于教师注意力熵动态组合 Forward 与 Reverse KL"]
    D --> E["端到端跨模态蒸馏目标<br/>联合 LM 与单模态损失完成三阶段训练"]

关键设计

1. 响应-视觉注意力解耦:将跨模态蒸馏重心由 Prompt 阶段彻底转移至 Response 生成阶段

以往的注意力蒸馏工作(如 Align-KD 与 CompoDistill)普遍在输入 Prompt 范围 \(I_P = \{N+1, \dots, N+L_P\}\) 内提取对视觉 tokens 的注意力 \(A_{P \to V}\)。然而实验证实,Prompt 编码仅代表初期的上下文理解,无法决定后续自回归解码时具体的视觉聚焦行为。TRAG 明确将抽取索引切换至响应 token 集合 \(I_R = \{N+L_P+1, \dots, N+L\}\),将监督目标直接定位在每个生成步骤的响应-视觉注意力向量 \(a_{l,i} = \{a_{l,i,j}\}_{j=1}^N\) 上。通过这种解耦,蒸馏损失精准约束学生模型在逐词生成阶段的视线落点,直接抑制生成阶段与视觉证据脱节造成的幻觉问题。

2. 中间层注意力聚合与视觉归一化:规避层间敏感对齐并消除注意力质量泄漏

在异构或不同层数的教师与学生架构中,逐层配对或分组层映射极为敏感且泛化性差。作者分析发现模型在相对深度 \([0.3, 0.6]\) 的中间层区间内注意力模式高度冗余且跨模态交互最为密集。因此,TRAG 放弃复杂的层选择启发式规则,直接在选定的学生中间层集合 \(\mathcal{M}_S\) 与教师中间层集合 \(\mathcal{M}_T\) 内计算跨层算术平均: $\(\bar{\mathbf{a}}_i^S = \frac{1}{|\mathcal{M}_S|}\sum_{l\in \mathcal{M}_S} \mathbf{a}_{l,i}^S, \qquad \bar{\mathbf{a}}_i^T = \frac{1}{|\mathcal{M}_T|}\sum_{l\in \mathcal{M}_T} \mathbf{a}_{l,i}^T\)$ 由于自注意力机制中 token 还会分配注意力给前序文本 tokens,截取出的视觉分量总和并不等于 1。为了将其转化为数学上严格合法的概率分布以执行信息论散度计算,TRAG 在视觉跨度 \(N\) 上实施局部重新归一化: $\(\tilde{\mathbf{a}}_i^S = \frac{\bar{\mathbf{a}}_i^S}{\sum_{j=1}^N \bar{a}_{i,j}^S + \epsilon}, \qquad \tilde{\mathbf{a}}_i^T = \frac{\bar{\mathbf{a}}_i^T}{\sum_{j=1}^N \bar{a}_{i,j}^T + \epsilon}\)$ 此举确保了教师与学生的注意力能够被置于相同的概率单纯形上进行精细化分布比对。

3. 熵驱动自适应 KL 动态调控:利用非对称 KL 动态权衡泛化覆盖度与模态锐度

对于生成词汇中的虚词(如“The”),注意力分布往往呈现全图均匀的弥散状态,需要学生保持广泛的背景上下文覆盖;而对于关键实体或动作(如“throwing”或“mound”),注意力则高度收敛在局部几何区域。如果使用均值逼近(mean-seeking)的 Forward KL \(D_{KL}(\tilde{\mathbf{a}}_i^T \parallel \tilde{\mathbf{a}}_i^S)\),它极度惩罚学生概率为零但教师有概率的区域,易导致注意力被动平滑拉伸,削弱对局部细节的捕捉;反之,众数寻求(mode-seeking)的 Reverse KL \(D_{KL}(\tilde{\mathbf{a}}_i^S \parallel \tilde{\mathbf{a}}_i^T)\) 会惩罚学生在教师低密度区域放置概率,促使分布高度尖锐化,但在处理全局上下文时容易遗漏背景支撑。TRAG 首先计算教师归一化注意力分布的香农熵: $\(H(\tilde{\mathbf{a}}_i^T) = -\sum_{j=1}^N \tilde{a}_{i,j}^T \log \tilde{a}_{i,j}^T\)$ 利用在线滑动更新的双端极值 \(H_{\min}\) 与 \(H_{\max}\)(动量因子 \(\beta=0.995\)),通过带截断的 Min-Max 映射将熵转化为权重因子 \(\lambda_i \in [0, 1]\): $\(\lambda_i = \mathrm{clip}\left(\frac{H(\tilde{\mathbf{a}}_i^T) - H_{\min}}{H_{\max} - H_{\min} + \epsilon}\right)\)$ 最终构建出逐 token 动态加权的跨模态蒸馏损失: $\(\mathcal{L}_{\text{cross-modal}}^{(\text{TRAG})} = \sum_{i\in I_R} \left[ \lambda_i D_{KL}(\tilde{\mathbf{a}}_i^T \parallel \tilde{\mathbf{a}}_i^S) + (1-\lambda_i) D_{KL}(\tilde{\mathbf{a}}_i^S \parallel \tilde{\mathbf{a}}_i^T) \right]\)$ 当注意力熵较高(背景词/功能词)时,\(\lambda_i \to 1\),以 Forward KL 主导实现广度覆盖;当注意力熵较低(关键实体词)时,\(\lambda_i \to 0\),以 Reverse KL 主导实现精准定位,在逐 token 级别达成动态最优。

损失函数 / 训练策略

训练采用三阶段课程安排: 1. 预训练蒸馏阶段(DPT):在 LLaVA-Pretrain-558K 上保持视觉编码器与学生语言基座冻结,仅微调 2 层 GELU-MLP 投影层,优化总损失 \(\mathcal{L} = \mathcal{L}_{\text{LM}} + \mathcal{L}_{\text{uni-modal}} + \mathcal{L}_{\text{cross-modal}}^{(\text{TRAG})}\); 2. 监督微调阶段(SFT):在 LLaVA-Instruct-665K 上放开学生 LLM 基座,仅优化自回归语言建模损失 \(\mathcal{L}_{\text{LM}}\); 3. 指令微调蒸馏阶段(DFT):继续在 LLaVA-Instruct-665K 上,冻结视觉编码器,对投影层与学生 LLM 全参数微调,再次联合最小化综合损失 \(\mathcal{L}_{\text{LM}} + \mathcal{L}_{\text{uni-modal}} + \mathcal{L}_{\text{cross-modal}}^{(\text{TRAG})}\)。其中 \(\mathcal{L}_{\text{uni-modal}}\) 继承 LLaVA-KD 的单模态视觉特征及关系蒸馏损失。

实验关键数据

主实验

在通用视觉问答(VQA,8 个基准测试)和细粒度组合推理(CR,3 个基准测试)上评估,对比了不同参数规模和不同基座架构的表现。

通用 VQA 基准评测结果(Avg6 排除 MMBCN 与 MMMU;Avg8 为全集平均):

规模 方法 语言基座 样本量 GQA ScienceQA TextVQA MME MMB MMBCN POPE MMMU Avg6 Avg8
≤4B (Teacher) TinyLLaVA Qwen2.5-3B 1.2M 63.0 76.1 60.1 71.6 73.1 70.4 87.8 41.3 71.9 67.9
≤2B TinyLLaVA (SFT) Qwen2.5-1.5B 1.2M 61.7 70.9 58.4 70.4 70.6 64.0 86.0 39.2 69.7 65.1
≤2B LLaVA-KD Qwen2.5-1.5B 1.2M 62.5 71.6 59.7 70.0 71.0 66.6 86.7 35.8 70.2 65.4
≤2B TRAG (本文) Qwen2.5-1.5B 1.2M 62.6 73.2 60.0 71.2 70.8 69.3 87.2 38.7 70.8 66.6
≤2B TinyLLaVA (SFT) Qwen1.5-1.8B 1.2M 60.9 65.2 47.7 61.3 57.8 56.2 83.4 34.8 62.7 58.4
≤2B CompoDistill Qwen1.5-1.8B 1.2M 61.2 66.5 53.5 67.0 64.5 63.0 85.5 34.1 66.4 61.9
≤2B LLaVA-KD Qwen1.5-1.8B 1.2M 62.3 64.7 53.4 69.1 64.0 63.7 86.3 33.6 66.6 62.1
≤2B TRAG (本文) Qwen1.5-1.8B 1.2M 61.7 66.9 55.6 67.0 66.6 63.3 86.8 35.2 67.4 62.9
≤0.5B TinyLLaVA (SFT) Qwen2.5-0.5B 1.2M 58.6 61.2 47.9 62.3 59.3 52.4 85.1 30.4 62.4 57.1
≤0.5B LLaVA-KD Qwen2.5-0.5B 1.2M 59.8 60.6 52.0 64.7 61.3 57.0 86.4 28.3 64.1 58.7
≤0.5B TRAG (本文) Qwen2.5-0.5B 1.2M 60.2 62.7 52.0 68.1 61.7 57.7 87.6 31.3 65.3 60.2
≤0.5B TinyLLaVA (SFT) Qwen1.5-0.5B 1.2M 56.7 60.9 46.6 59.4 55.2 51.8 83.9 31.9 60.4 55.8
≤0.5B CompoDistill Qwen1.5-0.5B 1.2M 59.1 61.1 48.2 63.8 59.6 54.9 85.7 34.0 62.9 58.3
≤0.5B LLaVA-KD Qwen1.5-0.5B 1.2M 59.6 60.6 49.9 64.5 60.1 55.5 85.9 30.2 63.4 58.2
≤0.5B TRAG (本文) Qwen1.5-0.5B 1.2M 59.5 62.1 48.9 65.2 60.9 54.6 86.5 30.9 63.8 58.5

多模态组合推理(Compositional Reasoning)基准评测:

基座架构 模型规模 方法 SugarCrepe BiVLC Winoground CR 综合平均
Qwen1.5 4B (Teacher) TinyLLaVA 87.3 93.2 70.1 83.5
Qwen1.5 1.8B TinyLLaVA (SFT) 74.8 83.8 62.6 73.7
Qwen1.5 1.8B KD (Logits) 76.1 85.3 61.5 74.3
Qwen1.5 1.8B LLaVA-KD 76.6 85.5 60.9 74.3
Qwen1.5 1.8B CompoDistill 81.7 86.5 62.2 76.8
Qwen1.5 1.8B TRAG (本文) 83.1 89.1 67.2 79.8
Qwen1.5 0.5B TinyLLaVA (SFT) 52.8 56.5 50.2 53.2
Qwen1.5 0.5B LLaVA-KD 66.9 74.5 51.7 64.4
Qwen1.5 0.5B CompoDistill 72.1 78.6 56.6 69.1
Qwen1.5 0.5B TRAG (本文) 73.4 80.2 57.3 70.3
Qwen2.5 3B (Teacher) TinyLLaVA 88.1 94.6 75.0 85.9
Qwen2.5 1.5B TinyLLaVA (SFT) 87.9 93.3 70.3 83.8
Qwen2.5 1.5B TRAG (本文) 87.3 93.8 73.9 85.0
Qwen2.5 0.5B TinyLLaVA (SFT) 75.1 85.1 57.0 72.4
Qwen2.5 0.5B TRAG (本文) 78.9 87.1 59.6 75.2

消融实验

1. 查询 Token 作用域消融(Qwen2.5-0.5B):

监督查询 Token 类型 VQA 平均 (Avg8) 组合推理平均 (CR Avg) 结论说明
Prompt 阶段仅监督指令 token 58.6 69.2 缺乏生成时刻的视觉指引,对推理贡献微弱
Prompt + Response 混合监督 58.4 71.2 引入 Prompt 阶段强行对齐反而干扰 VQA 生成
Response 阶段仅监督生成 token (TRAG) 60.2 75.2 关键跨模态对齐信号集中在生成期,提升最显著

2. 注意力匹配目标损失函数对比:

匹配损失设计 VQA 平均 (Avg8) 组合推理平均 (CR Avg) 特征分析
Cosine Similarity(余弦相似度) 58.7 72.5 几何方向对齐,忽视概率密度集中度
MSE(均方误差) 58.2 74.4 极端惩罚绝对差值,CR表现较好但VQA较差
单向 Forward KL(前向 KL) 57.6 73.9 均值逼近导致分布弥散过度,削弱锐度
单向 Reverse KL(反向 KL) 58.1 73.4 众数寻求过度收缩,丢失必要上下文
JSD(对称 JS 散度) 57.9 71.6 固定均等混合未能匹配逐 token 异质性
熵自适应加权 KL(TRAG Ours) 60.2 75.2 动态权衡泛化与锐度,双榜均显著达到最优

关键发现

  • 生成期注意力是多模态蒸馏的核心信号:消融表明将监督由 Prompt 切换到 Response 使得 CR Avg 直接从 69.2 飙升至 75.2(+6.0 点),彻底证伪了“必须蒸馏 Prompt 视觉注意力”的传统惯性假设。
  • 自适应非对称 KL 解决 token 间异质性矛盾:任何单一的距离度量(无论是 Cosine、MSE 还是固定单向 KL)均在某个维度遭遇天花板,而通过香农熵区分“宽背景”与“尖实体”,使学生模型在 30%-60% 深度层的注意力真实保真度(Cosine Similarity)从 SFT 的 0.18 和 CompoDistill 的 0.41 飞跃至 0.72。
  • 小模型获益最显著且随教师尺度具备良好扩展性:在 ≤0.5B 极轻量级模型上,TRAG 取得了最大的相对提升(例如 Qwen2.5-0.5B 上 VQA Avg8 从 57.1 升至 60.2,CR Avg 从 72.4 升至 75.2),且教师容量越大(从 1.5B 扩至 3B/4B),TRAG 传递的组合能力越强。

亮点与洞察

  • 反直觉的经验发现与批判性反思:敏锐揭示了以往蒸馏工作中过分看重 Prompt-to-Vision 注意力的误区,用详实的统计相关性证明只有 Response-to-Vision 能够预测下游模型能力。
  • 优雅的自适应信息论设计:没有引入额外的分类头或复杂的强化学习超参数,而是直接利用教师自身注意力分布的香农熵作为动态调节器,利用 Forward 与 Reverse KL 的内在互补性实现无缝切换。
  • 可迁移的中间层聚合范式:通过直接对深度 0.3-0.6 的注意力进行跨层算术平均并重归一化,彻底摆脱了学生与教师因层数不同而引发的层匹配超参调优难题,极具通用性。

局限与展望

  • 作者承认的局限:方法目前基于因果注意力的密集提取,在极长回复文本生成时,缓存与计算注意力矩阵会带来一定的训练内存峰值开销。
  • 进一步观察的局限:实验主要在单图静态 VQA 及组合推理数据集上展开,未对高分辨率多切片图或长视频跨帧注意力引导进行验证;此外,文本生成的采样随机性在非贪心解码时对注意力模式稳定性的影响尚未充分探索。
  • 未来改进思路:可探索将基于熵的非对称注意力引导扩展至视频多模态模型的时间步对齐,或与测试时计算(TTC)引导策略相结合以优化高难度视觉推理链。

相关工作与启发

  • vs LLaVA-KD: LLaVA-KD 侧重于单模态维度的对齐(视觉特征 logits 与 token 间关系矩阵),忽视了跨模态注意力路径的显式监督;TRAG 则补齐了最具鉴别力的响应期跨模态注意力监督,两者可无缝正交融合。
  • vs CompoDistill: CompoDistill 依赖复杂的层分组并统一在 Prompt 阶段施加余弦相似度损失;TRAG 证明了 Prompt 引导的低效性,将其简化为中间层聚合并在 Response 阶段引入 token 级自适应 KL 引导,大幅简化了超参并提升了保真度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 颠覆了前人将 Prompt 阶段作为视觉注意力蒸馏标配的固有范式,开创了响应期熵自适应引导。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 8 项通用 VQA 与 3 项组合推理评测,跨越两代 Qwen 多种规模,并附带深入的注意力保真度与消融分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 论点极其鲜明,从实证观察引出方法设计,逻辑环环相扣,图表直观精炼。
  • 价值: ⭐⭐⭐⭐⭐ 为轻量级多模态模型的精细化压缩与内部机制对齐提供了极为清晰、高效且易复现的落地范式。