跳转至

ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

会议: ECCV 2026
论文: ECCV 2026
代码: https://geppa.github.io/ReQuest
领域: 视频理解
关键词: 关键帧选择 / 长视频问答 / 多模态大模型 / 不确定性路由 / 自适应 NMS

一句话总结

ReQuest 用一个从 MLLM 自身回答里蒸馏出来的轻量选择器估计每一帧提供的视觉证据量,再用同一次推理的预测熵同时决定"要不要多想一轮"和"选帧时该多密",在不微调底层 MLLM 的前提下稳定提升长视频问答准确率,并把第二轮推理的算力只花在模型真正不确定的问题上。

研究背景与动机

长视频问答的第一道硬约束是视觉 token 预算:把整段视频送进多模态大模型(MLLM)并不现实,帧数一多,每帧能分到的分辨率就被压低,细节丢得更快。于是实践中几乎都退回到均匀采样——按固定间隔取 K 帧。但帧预算怎么分配本身很微妙:取得太少,决定性画面可能整个落在采样点之外;取得太多,冗余帧挤占分辨率、反而稀释了有效信息。论文在 Qwen3-VL 上把输入帧数从 256 一路加到 2048,准确率在 512 帧达到峰值 70.0%,1024/2048 帧反而回落到 68.7%/67.7%——"帧更多"不等于"证据更多",这是长视频"大海捞针"问题最直接的实证。

已有的应对思路是问题条件化的帧选择:用 CLIP / SigLIP 这类视觉语言编码器计算帧与问题的相似度,把看起来相关的帧挑出来,代表方法有 BOLT、MDP3、Q-Frame、AKS。它们便宜,却有一个结构性盲点——依赖的是视觉内容与问题文本的字面相似。当答案所需的关键物体压根没有出现在问题里时,相似度排序会退化:论文在 Video-MME 的 400 道"问题中不含关键物体"的题目上做对照,基于 SigLIP 特征的相似度选择只有 48.0%,甚至低于均匀采样的 51.3%。另一条路线是把选择本身交给 MLLM(Frame-Voyager、MLLM-based frame selection),语义理解更强,但算力太贵,只能接受"多阶段稀疏采样"的折中(例如 3600 → 128 → 32 帧)——第一阶段一旦漏掉证据,后面再精细也无力回天。更根本的是,长视频里问题中的词与答案的关联强度并不均匀,简单的帧—文本余弦相似度并不等于这一帧对正确推理轨迹的真实贡献。

矛盾于是很清楚:要看懂问题意图就得有 MLLM 级别的能力,要全局扫描整段视频又必须便宜到能逐帧跑,现有方案二者不可兼得。本文的切入角度是不拿 MLLM 当选择器,而是把 MLLM 对"这段画面有没有用"的判断力蒸馏进一个 BLIP 级别的轻量选择器,让问题理解从一次昂贵推理变成一次廉价前向;同时承认一个前提——并非所有问题都需要精挑细选,均匀帧上模型已经答得很确定的题,再选一次帧纯属浪费。核心 idea:用 MLLM 在"只给某个视频片段"与"完全不给视觉输入"两种条件下正确选项概率之差,作为每个片段视觉贡献的伪标签来训练轻量选择器;再用首轮推理的预测熵做路由——熵超过按视频长度校正过的阈值时才触发选择器与第二轮推理,并让同一份熵继续决定帧采样的抑制间隔。

方法详解

整体框架

ReQuest 是一条即插即用的三段式流水线,答题的 MLLM 全程冻结。输入是长视频与一道多选题:(1) 先用 1 fps 均匀采样得到的帧做一次"首轮推理",从选项概率分布算出预测熵;(2) 重想路由按熵与一个随视频长度校正的阈值,判定这道题直接在均匀帧上作答、还是进入重想阶段;(3) 进入重想时,问答感知选择器对全视频逐帧估计视觉贡献分,自适应 NMS 采样再用同一份熵缩放抑制间隔、选出 K 帧送回 MLLM 做第二轮推理。整条流水线里只有选择器(四层 transformer 加一个打分头)需要训练,而它的监督标签也由 MLLM 自己离线生成,路由器与采样器都不含学习参数。

需要说明"重想"到底重想什么:它不迭代修正相关性估计,也不多轮循环,而是在证据层面修一次——首轮推理是在一套可能漏掉关键画面的均匀帧上做的,重想就是用一次全局扫描把"对答对这道题真正有用"的帧重新捞出来,换一套证据集合让 MLLM 重答。判断依据来自模型自己的不确定性,所以"要不要重想"由模型说了算。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["长视频 + 问题<br/>1 fps 均匀采样"] --> B["首轮推理<br/>MLLM 输出选项概率与熵"]
    B --> C["重想路由<br/>熵 vs 长度校正阈值"]
    C -->|置信| D["直接作答"]
    C -->|不确定| E["问答感知选择器<br/>逐帧估计视觉贡献"]
    E --> F["自适应 NMS 采样<br/>按熵缩放抑制间隔"]
    F --> G["二次推理<br/>MLLM 用所选 K 帧作答"]

关键设计

1. 重想路由:只对模型真正不确定的问题付第二轮的算力

并非每道题都值得精挑细选:均匀帧上模型已经答得斩钉截铁的题,再选一次帧只会白花算力;而线索稀疏、需要跨时段聚合的题,模型在几个选项之间会明显摇摆。ReQuest 直接拿首轮推理的选项概率分布算熵当作不确定度:

\[u = -\sum_{k=1}^{M} p_k \log p_k\]

其中 M 为选项数。把这份熵与一个阈值比大小就能做路由,但固定阈值跨长度会失效:视频越长,1 fps 均匀采样能覆盖的比例越小,"没看到证据"导致的熵升高会和"问题本身难"混在一起。论文因此加了长度校正项——把视频帧数 N(截断到 \(N_{\max}\))归一化到 \([0,1]\) 得到 \(r_{\text{len}}(N)\),用它把基准阈值 \(\tau_0\) 调节成有效阈值 \(\tau_{\mathrm{eff}}\),原则是短视频用更严的阈值(模型本来就不容易不确定),长视频用更宽松的阈值。⚠️ 原文式 (3)(4) 在缓存全文中 OCR 不完整,\(\tau_{\mathrm{eff}}=\tau_0\,(1-\gamma_{\text{len}} r_{\text{len}}(N))\) 是按论文描述重构的形式,\(\gamma_{\text{len}}=0.3\)\(\tau_0\) 取 0.55 / 0.45 / 0.3 为原文给出,精确形式以原文为准。

路由决策本身不含任何学习参数:\(u > \tau_{\mathrm{eff}}\) 走选择分支,否则直接用均匀帧作答。这种纯规则设计有很实际的好处——路由器不需要额外训练,换基准只要标定一个阈值。代价是阈值必须按基准手调:Video-MME 上扫描阈值的曲线很干净,全部触发选择(2700/0)得 65.3%,均衡路由(1365 题触发、1335 题不触发)最高 65.6%,完全不触发(0/2700)掉回 62.6%;在 Qwen3-VL-8B 上,路由把"全部触发选择"的 69.9% 提到 71.1%,同时把平均时延从 52.1s 压到 39.3s。也就是说这一个模块同时兜住了准确率的上界和算力的下界。

2. 问答感知选择器:从 MLLM 自己的回答里蒸馏"哪一帧真的有用"

这一设计要解决的核心问题是监督从哪来——若直接拿帧与问题的相似度当标签,学到的选择器只会继承相似度方法的盲点。ReQuest 的做法是让 MLLM 给自己出题:把视频按 FINCH 层次聚类切成片段,逐片段把该片段作为视觉输入喂给 MLLM,读出正确选项上的概率 \(p_{i,g}\);再用同一道题问一次,但把视觉输入换成全零的 dummy 张量,得到基线分布 \(p_{\text{base}}\)。两者相减就是该片段的贡献分:

\[\Delta c_i = p_{i,g} - p_{\text{base},g}\]

这个减法承载了整个监督信号的意义:\(p_{\text{base},g}\) 编码的是"完全不看画面、只凭问题文本就能猜对"的文本先验,扣掉它之后剩下的才是这段画面真正提供的视觉证据量。不减基线的后果很具体——那些靠常识或语言先验就能答对的题会给所有片段都打高分,训练信号的动态范围被整体抬高、区分度被稀释,而这类题在 178K 数据里占比不小。

选择器的结构刻意保持轻量,而且刻意选了非双塔的 BLIP:帧与问题一起送入 BLIP,问题 token 在文本侧融合层对视觉 token 做 cross-attention,得到帧—问题融合 token。训练时把同一片段内各帧的融合 token 做时序池化得到片段级序列,前面拼一个可学习的 score token,送进四层 transformer 编码器,取该 token 的末层隐状态过一个轻量打分头回归 \(\Delta c_i\)。这里有一个训练/推理不对称的关键选择:训练在片段级(标注便宜、长视频上覆盖高效),推理在帧级(每帧单独与问题过 BLIP 打分)。消融证明这个不对称是划算的——同一套训练权重,只把推理粒度从片段级换成帧级,Video-MME 整体从 62.9% 涨到 65.6%、长视频子集从 53.3% 涨到 55.8%;原因是一个片段被池化成单个表示时,片段内部的细粒度线索会被平均掉,而决定性画面往往只占几秒。选择器对问题的理解是显式进入打分的(问题 token 与视觉 token 在同一融合流里交互),这也是它在"问题不含关键物体"的 400 题上能拿到 53.0%、反超均匀采样(51.3%)与两种相似度选择(48.0% / 51.0%)的原因。

3. 自适应 NMS 采样:让不确定度同时决定"选得准"和"选得密"

拿到逐帧贡献分后,还要决定在时间轴上的取帧方式。单纯取 top-K 会让相邻帧被反复选中,K 帧全挤在同一时刻;固定宽度的贪心 NMS(选当前最高分,抑制区间 \([i-\delta, i+\delta]\),重复到选满 K 帧)能去冗余,但抑制宽度写死,无法适配题目难度。ReQuest 让首轮推理的熵来定这个宽度:先定义基准间隔 \(b_s = N/K\)(N 为 1 fps 后的总帧数,K 为最终送入 MLLM 的帧数),再把熵裁剪到 \([u_{\min}, u_{\max}]\) 并归一化成 \(w\),得到缩放系数 \(s(u)\) 与有效抑制间隔 \(\delta\)

\[w = \frac{\mathrm{clip}(u;\,u_{\min},u_{\max}) - u_{\min}}{u_{\max}-u_{\min}}, \qquad s(u) = s_{\min} + (1-w)(1-s_{\min}), \qquad \delta = \mathrm{round}\!\left(s(u)\cdot b_s\right)\]

熵越高(模型越不确定),\(w\) 越接近 1,\(s(u)\) 越接近下限 \(s_{\min}\),抑制窗口越窄,选出的帧在时间轴上越密集,等于把预算集中投向可疑的局部;熵低于 \(u_{\min}\) 时直接取 \(s(u)=1\),退化为近似均匀的全局铺开。因为熵在设计 1 里已经算过,这一步不引入额外计算,也不引入任何学习参数。消融说明"自适应"不是可有可无的修饰:同样用选择器打分,top-K 得 64.0%、固定宽度贪心 NMS 得 64.7%、自适应 NMS 得 65.6%,而差距几乎全部来自长视频子集(53.0 / 53.3 → 55.8%)——视频越长,固定抑制宽度越无法同时满足"局部事件要密"与"全局要铺开"这两种彼此冲突的需求。值得注意的是,这个模块控制的是预算花在哪里,而不是花多少:帧数上限 K 是预先固定的,熵只改变 K 帧在时间轴上的分布密度。

一个完整示例

取一段 Video-MME 长视频为例(该子集平均 17 分钟):1 fps 采样后 N = 1020 帧,预算 K = 32。首轮用均匀帧推理,得到选项概率并算出熵,比如某题 u = 1.02;若 \(\tau_{\mathrm{eff}} \approx 0.55\)(长视频经长度校正后还会更低),路由判定"不确定",进入重想。若换成一道熵只有 0.31 的题,则直接输出首轮答案,一分额外算力都不花。

进入重想后,选择器对 1020 帧逐帧打分,基准间隔 \(b_s = 1020/32 \approx 32\) 帧。假设本题熵 u = 1.0,经 \(u_{\min}=0.45\)\(u_{\max}=1.0\)\(s_{\min}=0.2\) 换算得 w = 1、\(s(u)=0.2\),抑制间隔 \(\delta = \mathrm{round}(0.2 \times 32) = 6\) 帧——贪心 NMS 于是允许在相距 6 帧以上的位置连续取帧,把 32 帧压在那段真正藏着答案的画面附近(约几秒的时间窗内)。反之若熵只有 u = 0.5,则 w ≈ 0.09、\(s(u) \approx 0.93\)、δ ≈ 30,采样几乎退化成每隔约 30 帧取一帧的均匀铺开,覆盖整段视频。选出的 32 帧连同问题再次送进 MLLM,得到第二轮也是最终的回答。

损失函数 / 训练策略

选择器的训练目标是让预测分 \(\hat c_i\) 逼近伪标签 \(\Delta c_i\),损失为 Smooth-\(\ell_1\)\(\beta = 0.5\))加一项成对排序损失,后者把随机采样两个片段之间的大小关系也纳入监督(原文给出权重 \(\alpha = 0.3\)\(\tau = 0.25\)\(\gamma_{\text{loss}} = 2.0\);⚠️ 排序项的精确形式在缓存全文中不完整,以原文为准)。排序项是必要的:选择器最终只被用来挑"相对更值得看"的帧,绝对分数的校准远不如相对次序重要。

监督数据的构造分三步:从 LLaVA-Video-178K 的多选题划分里取 808K 问答对,筛掉缺乏视觉依据的样本留下 169K 个"确有视觉依据"的样本;对每段视频按 1 fps 用 FINCH(第二层层次)切分片段,逐片段生成 \(\Delta c_i\);最后只保留 \(\Delta c\) 分布存在明显峰值的题目(阈值 0.20),剔除"各片段贡献都差不多"的噪声题。最终得到 73,468 道训练题与 803,956 条片段级样本。优化用 AdamW,批大小 256,每批采样 2,048 个随机片段对。

推理侧超参为 K = 32、\(u_{\min} = 0.45\)\(u_{\max} = 1.0\)\(s_{\min} = 0.2\)\(N_{\max} = 3600\)\(\gamma_{\text{len}} = 0.3\),基准阈值 \(\tau_0\) 按基准分别取 0.55(Video-MME)、0.45(MLVU)、0.3(LongVideoBench)。底层 MLLM 全程冻结不微调,选择器只训练一次即可即插即用地挂到别的模型上(论文中在 LLaVA-OneVision 与 Qwen3-VL 上的结果均为用 LLaVA-Video 监督训练的选择器直接零样本迁移)。

实验关键数据

主实验

在 MLVU(2,174 题、平均 12 分钟)、LongVideoBench 验证集(1,337 题、平均 8 分钟)、Video-MME 无字幕版(2,700 题、平均 17 分钟)三个长视频基准上评测,LLaVA-Video 同时用于生成伪标签与主评测。

模型(#Frames) LVB MLVU Video-MME Overall Short Medium Long
LLaVA-Video 7B (32) 58.0 64.7 62.6 76.2 59.3 52.2
+ ReQuest 60.1 71.7 65.6 77.0 64.1 55.8
LLaVA-OneVision 7B (32) 56.6 63.1 58.7 70.3 56.6 49.2
+ ReQuest* 60.2 68.8 60.9 71.7 58.8 52.3
Qwen3-VL 8B (512) 62.7 74.0 70.0 78.6 70.1 61.2
+ ReQuest* (≤512) 66.3 76.2 71.1 80.0 70.8 62.4

* 为用 LLaVA-Video 监督训练的选择器零样本迁移的结果。作为参照,表中原有的帧选择/压缩类方法分别为:Frame-Voyager(7B、8 帧)MLVU 65.6;LongVU(7B)MLVU 65.4、Video-MME 60.9;NVILA(8B、1024 帧)MLVU 70.1、Video-MME 64.0;VideoTree MLVU 60.4;LLoVi MLVU 55.1。

长视频子集最能说明问题:均匀采样下 Qwen3-VL 的准确率随帧预算先升后降,而 ReQuest 只用远少于 512 的帧就反超了所有均匀配置。

Qwen3-VL 输入帧数 Overall Short Medium Long 平均时延 (s)
2048 67.7 78.6 68.9 55.6 53.8
1024 68.7 78.6 69.0 58.6 41.6
768 69.1 78.6 69.0 59.9 36.4
512 70.0 78.6 70.1 61.2 33.2
256 69.0 78.6 67.8 60.6 24.7
ReQuest(短/中/长取 40/208/369 帧) 71.1 80.0 70.8 62.4 39.3

ReQuest 的做法是保留每题分数分布中排在前 50%/40%/15%(短/中/长)的帧;也正因如此,它比 2048 帧的均匀采样还高出 3.4 个点,时延却更低。

消融实验

采样策略与推理粒度(均在 LLaVA-Video + ReQuest、Video-MME 上):

配置 Overall Short Medium Long 说明
Top-k 选择 64.0 76.7 62.3 53.0 不做时序去冗余
固定宽度贪心 NMS 64.7 77.0 63.7 53.3 抑制宽度不随题目变化
自适应 NMS 65.6 77.0 64.1 55.8 完整模型,增益几乎全在长视频
片段级推理 62.9 74.8 60.4 53.3 训练/推理同为片段级
帧级推理 65.6 77.0 64.1 55.8 片段级训练 + 帧级推理

监督信号的来源(同一流水线,仅替换伪标签来源):

方法 选择器骨干 监督信号 Overall Short Medium Long
特征相似度(免训练) SigLIP 61.6 74.8 57.8 52.1
模型相似度(免训练) BLIP ITM 65.0 76.2 64.0 54.9
选择器 SigLIP 特征相似度 61.7 75.6 57.2 52.3
选择器 BLIP 模型相似度 63.6 76.0 61.8 53.0
选择器 SigLIP MLLM 回答(本文) 64.7 76.2 61.7 56.1
选择器 BLIP MLLM 回答(本文) 65.6 77.0 64.1 55.8

路由阈值分析(Video-MME,LLaVA-Video + ReQuest;#Selection/#Uniform 表示触发与不触发选择分支的题数):

#Selection #Uniform 准确率 (%)
2700 0 65.3
1782 918 65.4
1365 1335 65.6
1051 1649 65.0
567 2133 64.0
0 2700 62.6

关键发现

  • 增益随视频变长而放大,方向与动机一致:LLaVA-Video 上短/中/长分别提升 0.8 / 4.8 / 3.6 个点(77.0 / 64.1 / 55.8)。短视频本来均匀采样就能覆盖大部分内容,改进空间天然有限;长视频才是证据定位真正失败的地方。⚠️ 原文 §4.2 正文写"MLVU 从 66.7 提升到 73.9",与 Table 1 的 MLVU 64.7 → 71.7 不一致,此处按表格数字记录,以原文/官方表格为准。
  • 长视频上贡献最大的是采样策略,不是选择器本身:固定宽度贪心 NMS 与自适应 NMS 用同一个选择器打分,整体只差 0.9 个点,但长视频子集差 2.5 个点(53.3 → 55.8)。说明"分数打得准"之外,"预算在时间轴上怎么花"对长视频是同等重要的一环。
  • 监督信号的质量决定选择器上限:把伪标签从特征相似度换成 MLLM 回答,BLIP 骨干从 63.6% 涨到 65.6%、SigLIP 骨干从 61.7% 涨到 64.7%;反过来,用相似度监督去训练学习型选择器(61.7% / 63.6%)甚至不如对应的免训练相似度基线(61.6% / 65.0%),说明不换监督只换模型架构是白做工。骨干方面 BLIP 略优于 SigLIP(65.6 vs 64.7),作者归因于 BLIP 在文本侧融合层内做跨模态交互。
  • 路由是一个可直接调的成本—精度旋钮:全触发(65.3%)和不触发(62.6%)都不如均衡路由(65.6%),且全触发的代价更高;τ_eff = 0 时 2,700 题全部进入重想,τ_eff = 1 时全部走均匀采样。Qwen3-VL-8B 上路由把 69.9% 提到 71.1% 的同时把平均时延从 52.1s 降到 39.3s。
  • 提升来自关键帧而非重复推理的随机性:作者只对均匀采样答错的子集做二次推理并合并统计——换随机种子重跑的均匀采样得 62.8%/62.7%(Router-Ours / Router-Oracle),而路由器引导的重推理得 65.6%/71.4%。用"路由到 Oracle 理想分支"的上限 71.4% 也说明当前路由器仍有可提升的选择空间。
  • 训练粒度与推理粒度解耦是划算的:片段级推理 62.9% → 帧级推理 65.6%,因为一个片段的池化表示会平均掉几秒钟之内的细粒度线索。
  • 成本结构值得注意:在 900 道 Video-MME 长视频题上,ReQuest(LLaVA-Video)总时延 102.3s、428.7 TFLOPs,而均匀采样基线只有 7.5s / 98.8 TFLOPs;代价主要来自 1 fps 全视频解码(89.6s、256.7 TFLOPs),选择器本身只占 0.3s / 4.2 TFLOPs。相较朴素的相似度选择(137.0s / 448.5 TFLOPs,长视频 54.3%),ReQuest 在更低的时延与算力下拿到 55.8%,说明路由确实省掉了不必要的稠密观察(900 题中只有 640 题进入重想;Qwen3-VL-8B 上是 390/900)。
  • 开放题也有效:把不确定度换成生成 token 分布上的最大熵来驱动同一套路由与采样,Video-MME 开放题的事实性得分从 2.77 提到 3.00(整体 +8%,长视频 +11%),说明方法不局限于多选题。
  • 规模可迁移:Qwen3-VL-32B 上从 73.9% 提到 75.7%(短/中/长 81.6→82.8、73.7→76.6、66.5→67.8),底层 MLLM 越强,收益依然存在。

亮点与洞察

  • 让 MLLM 用自己的答案给自己做监督\(\Delta c_i = p_{i,g} - p_{\text{base},g}\) 把"这段画面值多少钱"变成一个不需要任何人工标注、不需要额外模型的可计算量。它的巧妙之处在于零视觉基线的使用——把纯文本先验显式扣掉,剩下的才是视觉贡献,否则常识类题目会让所有片段都变成高分,监督信号失去区分度。这个配方可以原样搬到任何"多选题 + 可切分证据"的场景。
  • 一份不确定度用两次:同一份预测熵既决定"要不要重想"(路由),又决定"选帧该多密"(NMS 抑制间隔)。两个决策本该是不同的问题,这里被统一到一个已经算出来的标量上,几乎零额外开销,也让整条流水线只有一个可解释的调节旋钮。
  • 训练与推理粒度解耦:片段级训练解决了"逐帧向 MLLM 要标签太贵"的问题,帧级推理又避免了池化带来的线索平均化。这个"用粗粒度监督训、用细粒度推理"的套路可以迁移到任何"标注成本随分辨率增长"的稠密预测任务(如长文档中的证据句选择、长音频中的事件定位)。
  • 不追求把 MLLM 改强,只改喂给它的东西:整个方法冻结答题模型,只训练一个四层 transformer 的选择器,且能零样本迁移到别的 MLLM。这种"外围可控、内核不动"的思路在工程上更容易落地——换基座模型不需要重训整条流水线(选择器也只需换监督源重训一次)。
  • 帧预算的反直觉结论:Qwen3-VL 能吞 2048 帧,但准确率在 512 帧见顶;ReQuest 在长视频上只用约 369 帧就超过 2048 帧的配置。这提示"高容量 MLLM 就该多喂帧"是一个错误直觉,瓶颈不在帧数上限而在有效证据密度。

局限与展望

  • 第二轮的算力节省被解码开销吃掉:成本表显示 ReQuest 的总时延里 89.6s(约 88%)来自 1 fps 全视频解码,选择器只占 0.3s。也就是说,方法确实省下了"对不需要的样本做稠密观察"的 MLLM 前向,却仍然要为所有样本先解出 1 fps 的完整帧序列。真正的瓶颈是解码与特征提取,作者没有给出降低这部分成本的方案(例如先低码率粗筛、只对路由到重想的样本解码,或利用关键帧附近的 I 帧做局部解码)。
  • 路由器需要按基准手调阈值\(\tau_0\) 在三个基准上分别是 0.55 / 0.45 / 0.3,论文没有给出自动标定方法,跨域(尤其是视频长度分布不同的新基准)迁移时这个阈值是明确的使用成本。长度校正项 \(\gamma_{\text{len}}\) 也是固定的 0.3。
  • 选择器仍需要一次有监督训练:虽然答题 MLLM 免训练,但选择器的监督依赖 808K→169K→73K 的筛选流程与离线跑遍 MLLM 的伪标签生成,且需要与目标 MLLM 分布匹配(跨模型迁移时论文标注为带 * 的零样本结果,在 LLaVA-OneVision 的 MLVU 上就比 LLaVA-Video 本体上的增益小)。\(\Delta c\) 峰值过滤会丢掉相当比例的题目(169K → 73K),暗示过长的、需要跨片段聚合的问题很难拿到干净标签。
  • 只做一轮重想、不做迭代:路由是二值决策,触发后只重选一次证据,没有"重想后仍不确定就再重想"的机制,也没有对"重想失败"的兜底。表 6 中 Router-Oracle 能到 71.4% 而实际路由器只有 65.6%,说明有相当一部分被判定为"置信"的题其实是错的,路由器的判定质量是明显的提升空间。
  • 主要评测仍是多选题:开放题只用最大熵启发式补齐,且仅在 Video-MME 上报告(2.77 → 3.00),缺少在开放题为主的长视频基准上的验证。
  • 改进思路:把"是否重想"从二值扩展为按熵分档的多档采样预算(熵越高给越多帧),让 K 也随题目自适应;用首轮与重想后的答案一致性做自校验,不一致时再触发一轮或退回答疑;把选择器训练目标从回归 \(\Delta c\) 改为直接在"选出的帧能否让 MLLM 答对"上做排序学习。

相关工作与启发

  • vs 相似度驱动的帧选择(BOLT / MDP3 / Q-Frame / AKS):他们都用 CLIP / SigLIP 余弦相似度或策略式检索挑帧,免训练、极便宜。区别在于相似度只反映"视觉内容与问题文本的字面接近度",当关键物体不在问题里时排序就不可靠——论文的 400 题对照里 SigLIP 相似度只有 48.0%,低于均匀采样的 51.3%。ReQuest 用 MLLM 回答的贡献分做监督,在这类题上拿到 53.0%,代价是需要一次离线训练选择器,但推理时开销相当(0.3s)。
  • vs Frame-Voyager / MLLM-based frame selection:他们用 Video-LLM 的预测损失构造帧组合的相对排序并训练模型选帧,语义更强,但算力迫使其采用"3600 → 128 → 32"的多阶段稀疏采样,全局探索和效率被硬性折中,首阶段漏掉的证据无法挽回。ReQuest 保留 1 fps 的稠密观察(不做稀疏预筛),把"理解问题"的能力压进一个廉价选择器,用 BLIP + 四层 transformer 换回全局扫描的可行性。
  • vs 层级/Agent 式选择(VideoTree / VideoAgent / LLoVi / SeViLA):这些方法让 LLM 或 MLLM agent 逐层提问、递归定位,语义强但需要多次模型调用;ReQuest 把问题理解一次性蒸馏进选择器,推理时只多一次选择器前向与一次 MLLM 前向,成本曲线平缓得多。
  • vs LVNet:LVNet 是免训练的分层关键帧选择器,同样针对长视频 QA 的冗余问题;ReQuest 也保留免训练的部分(路由与自适应 NMS 都不学习),只把"哪一帧有用"这一最难的判断交给有监督的轻量选择器,比纯免训练方案多了一次训练成本但换来了问题条件化的能力。
  • vs 直接扩大帧预算(LongVU / NVILA 等人的高帧数路线):那条路线靠压缩或增加帧容量硬扛,ReQuest 的结果(长视频上 369 帧胜过 2048 帧)说明在固定视觉 token 预算下,证据密度比帧容量更重要,这对所有"堆帧数"的方法都是一个直接的反驳论据。

评分

  • 新颖性: ⭐⭐⭐⭐ 把 MLLM 自身的答案概率差当作帧级视觉贡献的监督信号,并用同一份熵同时驱动路由与采样密度,组合得干净且可复用;单看每个组件(蒸馏选择器、熵路由、NMS 采样)都有先行工作。
  • 实验充分度: ⭐⭐⭐⭐⭐ 三个长视频基准、三种基座(含 32B)、成本—精度对照、随机性控制、粒度与监督来源消融齐全,且给出了帧预算扫描这条关键的实证曲线。
  • 写作质量: ⭐⭐⭐⭐ 动机链条与消融设计对得上,公式节制;但方法式 (3)(4) 的表达不够清晰,§4.2 正文的 MLVU 数字与 Table 1 不一致,是需要修订的瑕疵。
  • 价值: ⭐⭐⭐⭐ 即插即用、不改基座即可提升,且有明确的高帧容量模型适用场景;主要折扣来自 1 fps 全视频解码这一未解决的固有开销。