跳转至

QSVideo: Query-Conditioned Semantic Temporal Retrieval for Video Understanding

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/human-analysis/QSVideo
领域: 视频理解
关键词: 视频理解 / 多模态检索 / 时序检索 / 视觉语言模型 / 长视频与流式视频

一句话总结

针对长视频与流式视频理解中均匀采样与原始查询带来的相关性偏差、多样性匮乏及时间塌缩问题,QSVideo 提出解耦的问题语义重要度分析与三维细粒度语义排序器 QSRanker,并结合 L2 视觉距离度量与自适应时序窗口遍历策略 QSRetrieval,在极低帧预算下显著提升了视频大模型的问答精度与检索吞吐。

研究背景与动机

随着多模态大语言模型(VLM)在视觉与语言交互领域的突破,视频问答与时序推理能力取得了长足进展。然而,当前视频大模型在处理长时程视频时普遍表现出明显的性能衰退,且模型推理的显存开销随输入视频帧数呈线性甚至二次方激增。面对动辄数十分钟的长视频或持续输入的实时流式视频,无差别地增加输入帧数不仅无法带来稳定的精度增益,大量与提问无关的背景帧反而会严重干扰语言模型的注意力分配,造成所谓的长上下文信息稀释与幻觉。

人类在观看和理解长视频时展现出截然不同的信息获取范式:人们通常首先根据所提问题形成目标假设,主动在时空维度检索支撑证据,既聚焦于语义强相关的画面片段,又刻意避免反复查看内容高度重复的相似切片,并在宏观时间跨度上收集互补线索。现存基于检索或帧选择的视频增强方法尝试模仿该过程,但普遍存在三大根本缺陷:一是相关性估计偏差,直接使用原始问题(尤其是带有多项选择干扰项的复杂 QA)作为检索 Query,极易引入语义噪声,引导排序器匹配到无关帧;二是视觉多样性受限,仅按单一相关性分数贪心检索 top-K 帧,往往导致选出的证据帧全部挤在同一短片段内,形成视觉高度冗余、信息增益极低的近重复集合;三是时间塌缩,模型倾向于过度聚焦狭窄的局部时段,无法覆盖在远端时间戳分布的关键线索。

本文的核心切入角度在于:要实现真正高效且鲁棒的视频检索,必须将问题理解与视觉细粒度匹配解耦,并在特征空间与时序拓扑中联合约束相关性、多样性与时间覆盖度。本文的核心 idea 是:将视频检索拆解为以 LLM 为核心的意图改写与结构化语义重要度加权、轻量级 VLM 的目标-动作-位置三维细粒度语义排序(QSRanker),并配合 L2 视觉距离去冗余与面向长视频全局锚点扩展、流式视频逆向优先的时间窗口自适应检索算法(QSRetrieval),在严苛低帧预算下全面释放下游视频大模型的推理潜能。

方法详解

整体框架

QSVideo 的整体管线由三个协同模块构成:负责将复杂输入问题转换为结构化检索提示并评估语义偏好的问题解析器(Question Analyzer)、负责度量视频帧在实体属性/动态动作/空间环境三个维度匹配程度的语义排序器(Semantic Ranker),以及负责在时间轴上平衡相关性、视觉多样性并自适应长视频与流式视频场景的检索器(QSRetrieval)。最终,选出的高信息密度关键帧被送入任意即插即用的视频 VLM(如 MiniCPM-o 2.6、InternVL2、LLaVA-OneVision 等)完成下游多模态推理。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入原始问题与全视频候选帧序列"] --> D1["问题解析与语义重要度建模<br/>LLM提取检索意图并预测目标/动作/位置权重"]
    In --> D2["细粒度三维语义排序<br/>轻量VLM计算目标/动作/位置语义匹配分"]
    D1 & D2 --> D3["兼顾相关性与多样性的时序窗口检索<br/>结合L2视觉距离与时间窗口分区去冗余"]
    D3 --> D4["长视频与流式视频自适应时序对齐<br/>长视频全局锚点扩展 / 流式时序逆向优先遍历"]
    D4 --> Out["检索高密关键帧并输入视频VLM完成问答"]

关键设计

1. 问题解析与语义重要度建模:意图解耦与动态权重分配

直接将未经处理的自然语言问答对(尤其是多选问答中的干扰选项)作为跨模态检索的输入,往往会导致检索模型被错误选项中的实体或动作引导,进而给出有偏差的排序。本设计采用冻结的纯文本大语言模型(Qwen3-4B)作为问题解析器 \(W\)。其核心机制是将原始提问 \(\hat{q}\) 改写为聚焦关键证据的紧凑检索查询 \(q\),滤除任务引导词与干扰选项的干扰。同时,不同查询对视觉线索维度的依赖具有强烈的异构性(例如辨识衣着倾向于目标维度,分析动作速度倾向于动作维度,辨识地点倾向于位置维度)。解析器输出查询 \(q\) 及目标(Object)、动作(Action)、位置(Location)三个维度的离散重要度权重:

\[(q, w_o, w_a, w_l) = W(\hat{q}), \quad w_o, w_a, w_l \in \{1, 2, 3, 4, 5\}\]

权重反映了回答该问题所需各类型证据的关键程度。通过 Softmax 归一化得到 \((\tilde{w}_o, \tilde{w}_a, \tilde{w}_l)\),直接为后续多维打分提供自适应指导,从源头上消除了干扰项带来的相关性估计偏差。

2. 细粒度三维语义排序:多面解耦评分与高效对齐微调

现有 VLM 检索器大多仅让模型输出二分类的 "yes/no" 判定,单一标量分数既无法捕捉跨模态图文对齐的丰富语义层级,也难以针对性强化弱势维度。本设计构建了一个轻量级的专用语义排序器 \(R_\theta\)(基于 Qwen3-VL-4B-Instruct)。该排序器接收改写后的查询 \(q\) 与视频候选帧 \(v\),在目标、动作和空间位置三个独立维度输出结构化语义相关性评分 \((o, a, l) \in \{1, 2, 3, 4, 5\}^3\)。综合相关性得分表示为各维度评分与归一化重要度权重的内积:

\[\mathrm{Score}(q, v) = \tilde{w}_o \cdot o + \tilde{w}_a \cdot a + \tilde{w}_l \cdot l\]

为了使轻量 VLM 掌握这种结构化打分能力,作者从 LLaVA-Video-178K 中构建了包含 35K 视频-问题对的微调数据集 Video-Ranker-35K,并利用强大的高阶模型(Qwen-VL-30B)对每对图文在三个维度上进行自动化伪标签标注。训练阶段采用 LoRA 参数高效微调,冻结 LLM 语言基座以防止通用推理能力灾难性遗忘,仅微调视觉编码器与特征映射层(Vision Tower & Merger),针对 5 个离散打分类别计算交叉熵分类损失 \(\mathcal{L}_{\mathrm{SFT}}\)。

3. 兼顾相关性与多样性的时序窗口检索:L2 距离与非重叠分区

如果仅依照综合相关性得分贪心选择 top-K 帧,模型倾向于选择画面内容高度近似的连续帧,造成证据冗余与关键信息遗漏。本设计利用排序器视觉编码器提取的全局视觉表征 \(g = f(v)\)(通过对所有视觉 token 进行均值池化获得),并采用欧氏距离(L2 距离)\(d_{ij} = \|g_i - g_j\|_2\) 代替常用的余弦相似度。L2 距离同时包含方向变化和特征模长信息,对画面的布局微调、视角移动与细粒度外观变化更为敏锐。在基础检索阶段,通过权衡参数 \(\lambda\) 联合最大化相关性得分与最小视觉距离:

\[v^* = \arg\max_{v \in \mathcal{A}^c} \left\{ \lambda \cdot \mathrm{Score}(q, v) + (1 - \lambda) \min_{v' \in \mathcal{A}} \|f(v) - f(v')\|_2 \right\}\]

为彻底消除局部“时间塌缩”,QSVideo 将整段视频帧序列 \(\mathcal{V}\) 在时间轴上划分为 \(K\) 个互不重叠的时间窗口 \(\{\mathcal{V}_i\}_{i=1}^K\),硬性约束每个时间窗口内最多选取一帧候选,从时序结构底层强制保证了全视频的宏观时间覆盖范围。

4. 长视频与流式视频自适应时序对齐:全局锚点扩展与逆向优先遍历

不同类型的视频对人类注意力的时序遍历要求显著不同。针对离线长视频,人类习惯于在记忆中“跳跃定位”至最相关的事件锚点,随后在该锚点附近细查;而针对持续接收的在线流式视频,人类必须优先掌握最新近的事态发展,再由近及远逆序回溯起因。QSVideo 为此设计了两种时间窗口遍历与参考帧更新机制: - 长视频(全局锚点与局部扩展):维护待选窗口集合 \(\mathcal{U}\)(初始包含全部窗口)。在迭代轮次 \(t\) 中,首先从剩余可用窗口包含的所有帧中挑选出全局得分最高的一帧作为全局锚点 \(a^{(t)}\),确定其所属窗口索引 \(i^{(t)}\);随后在时序半径 \(r\) 约束的局部邻域 \(\mathcal{N}^{(t)} = \{i \in \mathcal{U} \mid |i - i^{(t)}| \le r\}\) 内,以锚点 \(a^{(t)}\) 为视觉距离参考基准,分别在各邻域窗口中依据相关性与 L2 多样性选择最佳帧: $\(v_i^* = \arg\max_{v \in \mathcal{V}_i} \left\{ \lambda \cdot \mathrm{Score}(q, v) + (1 - \lambda) \|f(v) - f(a^{(t)})\|_2 \right\}\)$ 完成局部扩展后将已访问窗口剔除,循环迭代直至选满 \(K\) 帧。该策略能有效捕获分布在不同远距离时间段的关键证据。 - 流式视频(逆向优先遍历):窗口从最新到达的当前时段(第 \(K\) 窗口)开始遍历。在最新窗口 \(\mathcal{V}_K\) 中纯粹依靠相关性得分选出第一帧 \(v_K^*\);随后逐级向历史早期的窗口 \(i = K-1, \dots, 1\) 逆向回溯,并以前一时刻已选出的相邻窗口帧 \(v_{i+1}^*\) 作为视觉距离参考: $\(v_i^* = \arg\max_{v \in \mathcal{V}_i} \left\{ \lambda \cdot \mathrm{Score}(q, v) + (1 - \lambda) \|f(v) - f(v_{i+1}^*)\|_2 \right\}\)$ 该设计严格遵循了流式问答“强依赖当下、弱依赖久远”的时间因果性,同时抑制了相邻时段内的视觉重复帧。

实验关键数据

主实验

QSVideo 在具有代表性的离线超长视频基准 LVBench(103 个超长视频,平均时长达 67 分钟,涵盖 6 类评估任务)以及在线实时视频基准 StreamingBench(涵盖 10 项细粒度理解任务的流式评测)上进行了全面评测,验证了在严格低帧数限制下的 SOTA 性能。

基准 / 模型 骨干规模 评测帧数 综合准确率 Overall (%) 实体识别 ER / 目标感知 OP 关键信息 KIR / 事件理解 EU 推理能力 Rea / 因果推理 CR
LVBench
MiniCPM-o 2.6 (基线) 8B 16 38.9 37.1 37.5 46.3
MiniCPM-o 2.6 (基线) 8B 32 42.0 41.4 39.2 48.3
InternVL2-40B 34B 16 39.6 37.4 43.4 42.5
Qwen2-VL-72B 72B 48 41.3 38.0 38.3 46.5
SEAL 34B 16 45.9 47.9 51.5 43.3
GLM-4V-Plus 闭源商业 \(\le 300\) 48.7 46.2 54.1 46.5
GPT-4o 闭源商业 60 48.9 48.9 48.1 50.3
QSVideo (Ours) 8B 16 45.8 (+6.9↑) 47.3 49.8 50.8
QSVideo (Ours) 8B 32 49.1 (+7.1↑) 51.1 54.6 53.2
StreamingBench
MiniCPM-o 2.6 (基线) 8B 8 64.44 67.30 71.43 71.09
InternVL2 8B 8 68.52 76.02 68.94 60.94
LLaVA-OV 7B 8 72.12 79.29 72.67 72.66
QSVideo (Ours) 8B 8 77.68 (+13.24↑) 83.11 80.12 79.69
MiniCPM-o 2.6 (基线) 8B 16 65.12 69.21 72.67 77.34
InternVL2 8B 16 70.52 75.20 75.16 64.84
LLaVA-OV 7B 16 73.76 79.56 73.29 79.69
Claude 3.5 Sonnet 闭源商业 20 74.04 82.45 76.39 73.77
StreamForest 7B 1fps 77.26 83.11 77.50 82.81
QSVideo (Ours) 8B 16 79.36 (+14.24↑) 84.47 81.99 82.81

消融实验

1. 超参数 \(\lambda\) 敏感性消融(LVBench)

参数 \(\lambda\) 调节了检索目标函数中相关性得分与视觉多样性(L2 距离)之间的权重分配。下表展示了在 16 帧与 32 帧设置下 \(\lambda\) 对不同任务及总准确率的影响。

预算帧数 \(\lambda\) 综合得分 Overall (%) 实体识别 ER (%) 事件理解 EU (%) 关键信息 KIR (%) 时序定位 TG (%) 推理 Rea (%) 摘要 Sum (%)
16 0.1 46.1 46.7 44.2 49.8 37.3 50.2 32.8
16 0.3 45.6 47.3 43.3 49.1 33.6 48.3 31.0
16 0.5 46.0 47.6 42.3 51.2 35.9 50.7 31.0
16 0.7 45.6 47.0 41.7 50.9 35.0 50.2 31.0
16 0.9 45.8 47.3 41.7 49.8 35.5 50.8 32.8
32 0.1 48.2 49.0 45.1 53.6 38.2 51.7 34.5
32 0.3 48.3 51.1 44.4 54.3 36.4 51.2 31.0
32 0.5 48.2 51.3 44.5 54.0 35.5 52.2 29.3
32 0.7 48.7 51.3 45.0 55.0 39.1 51.7 32.8
32 0.9 49.1 51.1 45.6 54.6 39.6 53.2 32.8

2. 即插即用泛化性验证(StreamingBench 上叠加不同视频 VLM 基座)

将 QSVideo 提取的高质关键帧无缝迁移至不同开源骨干网络,在 8/16/32 帧设置下均实现稳定提升:

骨干模型 评测帧数 基线准确率 (%) 叠加 QSVideo 后准确率 (%) 绝对增益 \(\Delta\)
MiniCPM-V 2.6 8 帧 66.36 70.96 +4.60%
MiniCPM-V 2.6 16 帧 70.24 71.84 +1.60%
MiniCPM-V 2.6 32 帧 70.80 72.96 +2.16%
InternVL2 8 帧 68.52 71.28 +2.76%
InternVL2 16 帧 70.52 72.24 +1.72%
InternVL2 32 帧 71.52 72.92 +1.40%
LLaVA-OneVision 8 帧 72.12 74.48 +2.36%
LLaVA-OneVision 16 帧 73.76 74.68 +0.92%
LLaVA-OneVision 32 帧 73.56 74.40 +0.84%

3. 推理延迟与吞吐量分析(34 分钟 LVBench 视频,2048 候选帧)

方法 模型参数规模 候选帧数 选取帧数 端到端总延迟 (s) 吞吐量 Throughput
SEAL 34B 2045 16 1702.24s 1.2 fps
AdaReTaKe 72B 1024 - 178.15s 5.8 fps
QSVideo (16 帧) 8B 2048 16 88.73s 23.1 fps
QSVideo (32 帧) 8B 2048 32 91.17s 22.5 fps

关键发现

  • 相关性排序在证据定位中的决定性作用:在 LVBench 的时序参考区间评估中,细粒度三维排序的 QSRanker 在 Recall@10 (33.20% vs. 32.43%)、Recall@50 (50.65% vs. 46.77%) 和 Recall@100 (58.20% vs. 52.78%) 上全方位超越单一分数的传统 Ranker,证实了解耦分解出 Object/Action/Location 能捕获更精准的复杂时空线索。
  • 流式短时上下文同样极度依赖检索:在通常被认为只需均匀采样的 60 秒短窗口流式视频场景中,QSVideo 在 8 帧和 16 帧下分别相对基线暴增 +11.32% 和 +14.24%,在事件理解、片段摘要等长因果链任务中优势尤为显著。
  • 计算效率与推理吞吐极高:相比使用 34B 大模型逐帧检测过滤的 SEAL,QSVideo 实现了 18.7× 到 19.2× 的推理加速,结合数据并行与批处理后,三维语义打分阶段可由 608s 缩减至 61s。

亮点与洞察

  • 多面语义解耦与查询条件重加权:传统检索盲目依赖单一余弦相似度或二进制是非判定,而 QSVideo 创新性地将视觉关联分解为目标、动作、位置三个可解释正交维度,并借助 LLM 实现查询驱动的维度权重量身定制,既避免了错误选项误导,又提供了清晰的语义可解释性。
  • 时序对齐的认知拟人化设计:针对长视频“跳跃锚定后局部探测”与流式视频“把握当下并逆序回溯”的认知分流,优雅地统一在时间窗口非重叠划分与 L2 视觉特征去冗余框架下,为不同时序特性的多模态检索提供了极其自然的算法归宿。
  • 低帧高精的高性价比落地范式:仅用 8B 轻量级模型与 32 帧输入,就在 67 分钟超长视频评测中超越了 72B 参数量以及动辄输入数百帧的庞大模型(如 GPT-4o 的 60 帧和 GLM-4V-Plus 的 300 帧),为端侧算力受限环境下的长视频理解开辟了实用路径。

局限与展望

  • 作者承认的局限:微调语义排序器时依赖离线高阶大模型(Qwen-VL-30B)生成的伪标签,存在由教师模型带来的潜在标注偏置;同时当前的候选帧池建立在密集均匀初采(如 2048 帧)之上,对于数小时以上的极长视频,初采阶段的特征提取仍存在显存与计算时间开销。
  • 延伸发现的局限:在长视频的摘要类任务(Sum)中,QSVideo 提升不明显(16/32 帧均为 32.8%,甚至在个别消融设置下略有波动),说明对于需要全片全局背景感知的全局宏观提问,强过滤式的时空稀疏采样可能丢失了背景过渡信息。
  • 未来改进思路:可引入多尺度分层检索,在粗筛阶段使用轻量级时序事件边界检测(Temporal Action Localization)定位关键事件候选,再调用 QSRanker 进行细粒度评分;此外可为全局摘要型提问设计专门的全局记忆流混合分支。

相关工作与启发

  • vs SeViLA / FRAG / Frame Selector: 以往跨模态帧选择方法多直接将原始多选问答输入预训练 VLM 生成单一边界分或是非二元判断,极易被多选项中的干扰项误导;QSVideo 通过专门的问题解析器提取纯净查询并计算三维语义重要度,从源头上净化了检索意图。
  • vs SEAL: SEAL 采用三个独立的大型目标检测、动作识别、场景检测模型进行显式定位并硬性融合,计算开销极其昂贵(吞吐仅 1.2 fps);QSVideo 统一在轻量级多模态模型内进行多维度隐式语义打分,并采用批处理与并行加速,在精度更优的同时推理速度快了 19 倍。
  • vs StreamForest / QueryStream: 此类流式视频模型大多需要维护复杂持久事件记忆树或设计专用时序交互结构;QSVideo 无需重新预训练复杂的记忆模块,以完全即插即用(Plug-and-Play)的形式适配任意现成 VLM,灵活性与工程复用价值极高。

评分

  • 新颖性: ⭐⭐⭐⭐ [三维语义解耦打分结合长视频锚点与流式逆向遍历,时序检索机制设计清晰巧妙]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 LVBench 与 StreamingBench 两大基准,包含详尽消融、多模型即插即用验证及延迟剖析]
  • 写作质量: ⭐⭐⭐⭐⭐ [动机叙述层层递进,数学建模与图表设计干净规范,逻辑严密自洽]
  • 价值: ⭐⭐⭐⭐⭐ [为解决长视频/流式视频理解中的计算开销与信息稀释提供了高精度低开销的标准方案]