跳转至

HAS: Highlight-guided Attention Steering for Multimodal LLM Video Summarization

会议: ECCV 2026
论文: ECCV 官方页面
PDF: Open Access PDF
领域: 多模态VLM
关键词: 视频摘要、多模态大模型、注意力导引、免训练推理控制、时序显著性

一句话总结

针对传统视频摘要硬采样关键帧导致上下文断裂与信息不可逆丢失的顽疾,HAS 提出一种推理期连续注意力导引机制,利用提示词条件化的平滑高光分布轻量介入冻结多模态大模型的交叉注意力头,在保留完整视频上下文的同时引导模型聚焦精彩片段。

研究背景与动机

随着视频生成、长视频分析以及交互式智能体的迅猛发展,视频数据体量已经远远超越了人类日常的消费能力,视频摘要作为快速导航与高效内容检索的关键技术变得愈发重要。近期基于多模态大语言模型(Video-MLLM)的视频理解范式将连续视频抽帧投影为视觉 token 序列,展现出出色的指令遵循与摘要生成能力。然而,现有多模态视频摘要方法(如 LLMVS、AKeyS 等)几乎无一例外地沿用“先打分筛选离散关键帧/片段,再拼接子集输入大模型”的两阶段离散硬抽取范式。

这种硬性截断机制面临着严峻的内在矛盾:首先,现实中人类观看并总结视频的认知过程是“完整浏览全片、回忆时重点聚焦高光精彩时刻但保留背景过渡脉络”,而非断章取义地只看几张孤立抽帧;其次,硬抽取直接剥离了得分偏低但承载逻辑因果与平缓过渡的背景帧,造成严重的不可逆信息瓶颈——后续无论分配多大的语言生成预算,丢弃的细节证据都无法被重新恢复,严重损害了视频理解的全局连贯性与事实忠实度;最后,硬抽取在数据输入端人为过滤帧,实质上废弃了多模态大模型本身依赖自注意力与交叉注意力权衡时序重要性的原生容量。

为了打破离散截断的局限,本文探索了更为轻量、可控的推理期干预路线:能否将视频作为一个连续且完整的视觉序列完整输入给冻结的 MLLM,同时引入一个外部的高光分布作为“导师信号”,在注意力层面上平滑引导计算资源的分配?核心 idea:将提示词条件化的时序高光分数校准为连续分布,并映射为视觉 token 级别的时序导引向量,在推理阶段通过门控可学习强度加性干预少部分视觉交叉注意力头,实现全局上下文无损输入下的高光软引导。

方法详解

整体框架

HAS 的整体工作流可以划分为两大阶段:时序连续高光分布的构建与校准、推理期视觉交叉注意力导引的轻量注入。对于给定的原始视频帧序列和用户文本提示词,系统首先调用通用的现成高光检测模块预测时序显著性曲线,经插值与极值归一化得到有界的平滑高光分布;随后将其在空间维度复制扩展至各个画幅的视觉 token,构建对数空间的时序导引向量;最后在冻结的多模态大模型自回归解码生成摘要文本的过程中,仅对一组稀疏候选交叉注意力头的预激活 Logits 施加门控偏置,使得模型在注意力竞争中自发强化高光片段权重,同时温和保留非高光背景。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:视频帧序列 F + 文本提示词 q"] --> B["阶段 1:连续高光分布校准<br/>粗粒度打分 → 线性插值 → MinMax归一化"]
    B --> C["阶段 2:视觉 Token 向量化扩展<br/>帧级复制到 P 个 Token 并施加对数平滑"]
    C --> D["阶段 3:门控交叉注意力导引<br/>稀疏注意力头偏置注入,保持基座完全冻结"]
    D --> E["输出:高忠实度连贯摘要 O*"]

关键设计

1. 连续高光分布校准:消除硬抽取带来的不可逆信息瓶颈 现存高光检测或片段检索工具(如基于文本查询的 QVHighlights、QD-DETR 方案)给出的时序显著性得分通常存在时间窗口离散、边界跳跃和噪声振荡的问题,无法直接作为平滑的注意力偏置。为建立可靠的时序先验,HAS 复用现成高光生成器得到原始得分序列后,首先针对目标视频帧长进行一维线性时序插值,消除不同帧采样率带来的错位;随后执行 Min-Max 极值归一化,将得分约束至 \([0, 1]\) 闭区间内,获得严格有界且时间连续的高光分布向量 \(h = [h_1, \dots, h_T]\)。该连续分布彻底抛弃了“低于阈值即丢弃”的截断做法,使得视频全部 \(T\) 个时序切片均获得合理的权重表达,为模型保留完整的背景因果上下文。

2. 视觉 Token 向量化扩展:桥接帧级先验与多模态序列表征 多模态大模型的视觉编码器(如 CLIP 或 SigLIP)会将每一帧图像切块为 \(P\) 个视觉 token(patch/tubelet),然而外部高光检测模块仅能在帧/剪辑级别提供标量分数。如果直接在宏观帧粒度加权,将无法对接到 Transformer 解码器细粒度的 token 交互矩阵中。HAS 将帧级标量分数 \(h_t\) 沿着空间视觉 token 维度广播复制 \(P\) 次,并在对数空间下构建全局视觉导引向量: $\(\mathbf{V} = \log\left(\mathrm{Repeat}(\mathbf{h}, P) + \epsilon\right) \in \mathbb{R}^{TP}\)$ 其中 \(\epsilon\) 为防止零概率塌陷至 \(-\infty\) 的数值稳定极小常数。引入对数变换的机制在于:在注意力机制中对 unnormalized Logits 执行加性偏置,数学上严格等价于在指数化 softmax 前对原始注意力权重进行乘性重加权。非零极小值 \(\epsilon\) 确保低分背景帧始终保留微弱但非零的注意力权值,贯彻了“降低关注但不遗忘”的软导引原则。

3. 门控交叉注意力导引:极简可控的推理期前向干预 为了在不破坏多模态底座泛化能力与生成连贯性的前提下注入导引信号,HAS 避免对模型进行全参数或 LoRA 微调,仅介入自回归解码时的少量视觉交叉注意力头。设所选注意力头为 \((\ell, m) \in \mathcal{S}\),当前文本查询到全体视觉 token 的注意力原始 Logits 为 \(\mathbf{A}^{(\ell, m)}\),HAS 通过门控因子 \(g_{\ell, m} = \sigma(a_{\ell, m})\) 与头专属强度标量 \(\beta_{\ell, m}\) 对 Logits 进行行级平移: $\(\tilde{\mathbf{A}}^{(\ell, m)}_{i, :} = \mathbf{A}^{(\ell, m)}_{i, :} + g_{\ell, m} \beta_{\ell, m} \mathbf{V}\)$ 未选中的注意力头和常规自注意力层则完全保持原样,直接送入标准 Softmax 归一化。该设计赋予了注意力头自由调整其对视觉高光敏感度的弹性,使得解码器在输出词元时天然偏向高光帧的表征信息,同时避免了硬掩码截断引起的幻觉与语法破碎。

损失函数 / 训练策略

HAS 遵循极简且计算友好的两阶段策略:MLLM 基座模型和高光生成模块在全生命周期内均完全冻结,无需任何参数更新。仅有一组超轻量的标量门控与强度参数 \(\Theta = \{a_{\ell, m}, \beta_{\ell, m}\}\) 需要校准。校准仅需在独立的小规模留出集(held-out set)上运行一次标准 Teacher-Forcing 交叉熵损失,并辅以 \(L_1\) 稀疏正则化惩罚项: $\(\min_{a, \beta} \mathcal{L}_{\mathrm{NLL}}(a, \beta) + \lambda_s \sum_{(\ell, m) \in \mathcal{S}} g_{\ell, m}\)$ 其中 \(\lambda_s\) 控制活跃注意力头的稀疏程度。优化过程只需在 CPU 或普通单卡上使用 Adam 优化器快速迭代收敛;在测试部署阶段,校准好的 \(\{a, \beta\}\) 被完全固化,整个系统蜕化为纯前向推断,额外显存与延迟开销几乎可以忽略不计。

实验关键数据

主实验

论文在视频到视频(V2V)、跨模态双语/图文(VideoXum)以及长文本科学报告(VISTA)三大基准家族上全面评测了 HAS 的表现。所有实验均运行于英伟达 L40S GPU 环境。

在衡量时序显著性与人类标注相关性的一致性评估中(SumMe 与 TVSum 数据集),以 Kendall's \(\tau\) 和 Spearman's \(\rho\) 作为排序相关系数:

方法类型 方法 SumMe \(\tau\) SumMe \(\rho\) TVSum \(\tau\) TVSum \(\rho\)
基线 Random 0.000 0.000 0.000 0.000
纯视觉 VASNet 0.160 0.170 0.160 0.170
纯视觉 CSTA 0.246 0.274 0.194 0.255
视觉+文本 CLIP-It – – 0.108 0.147
视觉+文本 A2Summ 0.108 0.129 0.137 0.165
LLM驱动 LLMVS (CVPR 2025) 0.253 0.282 0.211 0.275
LLM驱动 V2Xum-LLaMA 0.296 0.378 0.222 0.293
本文方法 HAS (Ours) 0.298 (\(\pm0.02\)) 0.335 (\(\pm0.03\)) 0.224 (\(\pm0.02\)) 0.299 (\(\pm0.03\))

在统一跨模态摘要基准 VideoXum 上,HAS 显著增强了视觉到文本(V2T)、时序重要性估计(V2V)以及图文语义对齐度(V2VT):

方法 V2T: BLEU-4 V2T: ROUGE-L V2T: CIDEr V2V: F1 V2V: Spearman V2VT: FCLIP V2VT: Cross-FCLIP
Frozen-BLIP 0.0 1.4 0.0 16.1 0.011 – –
Vid2Seq-HCV 2.7 19.8 8.3 25.1 – 0.899 0.200
VTSUM-BLIP 5.8 25.1 23.1 23.5 0.258 0.894 0.247
V2Xum-LLaMA-7B 5.8 26.3 26.9 29.0 0.298 0.931 0.253
V2Xum-LLaMA-13B 5.7 26.2 25.3 31.6 0.276 0.957 0.251
HAS (Ours) 6.0 (\(\pm0.03\)) 26.7 (\(\pm0.3\)) 28.0 (\(\pm0.8\)) 32.0 (\(\pm0.5\)) 0.304 (\(\pm0.02\)) 0.963 (\(\pm0.01\)) 0.258 (\(\pm0.007\))

消融实验与分析

在 VISTA 科学长讲座视频摘要基准上,针对长文本上下文的事实一致性(FactVC)与视频对齐(VideoScore)进行评测:

评估配置 / 模型基座 RLsum BERTScore VideoScore FactVC (事实一致性)
LLaVA-NeXT-Interleave (Zero-shot) 22.68 81.40 1.73 40.12
mPLUG-Owl3 (Zero-shot) 22.84 81.39 1.77 42.07
Plan-mPLUG-Owl3 (Zero-shot) 22.97 81.45 1.86 47.37
GPT-o1 (Zero-shot) 24.37 82.63 2.17 51.36
Gemini 2.0 (Zero-shot) 24.29 82.64 2.02 52.02
HAS (零样本外挂,平均多基座) 23.94 82.05 2.03 50.11
mPLUG-Owl3 (全量有监督微调) 32.91 84.22 3.28 71.94
Plan-mPLUG-Owl3 (全量有监督微调) 33.25 84.37 3.33 75.41

此外,在零样本跨数据集泛化实验中(在 SumMe 上校准,直接在 MR.HiSum 50 支视频子集上测试),VASNet 为 \(\tau=0.364 / \rho=0.364\),LLMVS 为 \(\tau=0.440 / \rho=0.440\),而 HAS 进一步提升至 \(\tau=0.450 / \rho=0.450\),显示出强大的域外泛化稳定性。

关键发现

  • 预算饱和曲线的分野揭示了软导引的根本优势:在 VISTA 覆盖率随帧预算 \(T\) 增长的消融分析中(Fig. 2),硬筛选方法(Hard Selection)在预算较小时便早早达到性能饱和平台,即便追加帧数也无法挽回最初丢失的事实依据;而 HAS 在中高预算下展现出持续向上攀升的 ROUGE-Lsum 和事实单元召回率(Fact Recall),验证了软注意力的保留效应有效弥补了硬截断的不可逆信息损失。
  • 跨架构即插即用泛化:将 HAS 挂载至 mPLUG-Owl3、LLaVA-NeXT-Interleave、Video-LLaVA、LLaMA-VID、Video-ChatGPT 和 Video-LLaMA 等 6 种结构迥异的开源视频 MLLM 上,均观察到显著的 \(\Delta \text{FactVC} > 0\)(正向事实一致性提升)。这证明软导引机制不依赖于特定视觉编码器或语言模型的微调权重,属于通用的推理期控制层。

亮点与洞察

  • 将离散硬截断升维为连续注意力重加权:传统方法将高光检测仅作为预处理阶段的截断过滤器,HAS 巧妙将其转化为连续先验与对数空间内的 Logits 偏置,在概念上打通了高光检测与 MLLM 注意力控制的壁垒。
  • 极简前向推理开销与零基座侵入性:无需训练或微调动辄数十亿参数的视频大模型,仅利用极少量门控标量即可完成对注意力焦点的精确牵引,部署代价极低。
  • 跨模态与跨任务迁移性:该方法本质上是一种轻量级的“外部知识偏置注入器”,其将时序/空间重要性映射到对数空间并施加门控偏置的设计,可无缝迁移至具备类似需求的文档定位问答、长音频定位理解及具身轨迹规划等长上下文多模态任务。

局限与展望

  • 对初始高光质量的强依赖性:HAS 自身不具备端到端重新挖掘高光的能力,其性能表现高度受制于前置现成高光提取器(如 QD-DETR 或 QVHighlights 预训练模型)的质量。当下游查询非常冷门或视频场景极度复杂时,有偏的高光先验可能误导大模型的注意力聚焦。
  • 缺乏粗细粒度结合的动态时序边界捕捉:目前软导引在全局帧级别进行平滑,对于极度短促但关键的突发动作或细粒度微小事件,其加权可能被平滑算子稀释。未来可探索“全局平滑导引 + 局部高分辨率自适应缩放”的粗细联合架构。

相关工作与启发

  • vs LLMVS (CVPR 2025):LLMVS 采用“单帧打分 \(\to\) 离散过滤选取关键帧 \(\to\) 文本组合拼接总结”的离散打分路线,导致上下文因果割裂;HAS 保持完整时序帧输入,用连续高光软向量在注意力层面引导,兼顾了高光敏锐度与全局背景连贯性。
  • vs PASTA & FarSight:PASTA 与 FarSight 确立了在推理期干预注意力矩阵以消除幻觉或突出焦点的先例,但它们主要针对静态文本或单张图像的离散 Mask;HAS 首次将提示词条件化的时序高光连续分布引入视频 MLLM 交叉注意力中,拓展了推理期注意力干预的应用边界。

评分

  • 新颖性: ⭐⭐⭐⭐☆(首次提出使用连续高光先验作为时序导引向量对视频 MLLM 进行推理期交叉注意力重加权,构思精巧)
  • 实验充分度: ⭐⭐⭐⭐⭐(覆盖 V2V、V2T、V2VT 以及长视频讲座四大主流基准,跨越 6 种主流开源视频模型验证即插即用性)
  • 写作质量: ⭐⭐⭐⭐☆(数学建模清晰,从连续时序先验到对数偏置的推导逻辑自洽)
  • 价值: ⭐⭐⭐⭐⭐(无需微调大模型、即插即用、开销极低,为工业界长视频摘要落地提供了一种优雅实用的解法)