ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://geppa.github.io/ReQuest
领域: 视频理解
关键词: 关键帧选择 / 长视频问答 / 多模态大模型 / 不确定性路由 / 自适应 NMS
一句话总结¶
ReQuest 用一个从 MLLM 自身回答里蒸馏出来的轻量选择器估计每一帧提供的视觉证据量,再用同一次推理的预测熵同时决定"要不要多想一轮"和"选帧时该多密",在不微调底层 MLLM 的前提下稳定提升长视频问答准确率,并把第二轮推理的算力只花在模型真正不确定的问题上。
研究背景与动机¶
长视频问答的第一道硬约束是视觉 token 预算:把整段视频送进多模态大模型(MLLM)并不现实,帧数一多,每帧能分到的分辨率就被压低,细节丢得更快。于是实践中几乎都退回到均匀采样——按固定间隔取 K 帧。但帧预算怎么分配本身很微妙:取得太少,决定性画面可能整个落在采样点之外;取得太多,冗余帧挤占分辨率、反而稀释了有效信息。论文在 Qwen3-VL 上把输入帧数从 256 一路加到 2048,准确率在 512 帧达到峰值 70.0%,1024/2048 帧反而回落到 68.7%/67.7%——"帧更多"不等于"证据更多",这是长视频"大海捞针"问题最直接的实证。
已有的应对思路是问题条件化的帧选择:用 CLIP / SigLIP 这类视觉语言编码器计算帧与问题的相似度,把看起来相关的帧挑出来,代表方法有 BOLT、MDP3、Q-Frame、AKS。它们便宜,却有一个结构性盲点——依赖的是视觉内容与问题文本的字面相似。当答案所需的关键物体压根没有出现在问题里时,相似度排序会退化:论文在 Video-MME 的 400 道"问题中不含关键物体"的题目上做对照,基于 SigLIP 特征的相似度选择只有 48.0%,甚至低于均匀采样的 51.3%。另一条路线是把选择本身交给 MLLM(Frame-Voyager、MLLM-based frame selection),语义理解更强,但算力太贵,只能接受"多阶段稀疏采样"的折中(例如 3600 → 128 → 32 帧)——第一阶段一旦漏掉证据,后面再精细也无力回天。更根本的是,长视频里问题中的词与答案的关联强度并不均匀,简单的帧—文本余弦相似度并不等于这一帧对正确推理轨迹的真实贡献。
矛盾于是很清楚:要看懂问题意图就得有 MLLM 级别的能力,要全局扫描整段视频又必须便宜到能逐帧跑,现有方案二者不可兼得。本文的切入角度是不拿 MLLM 当选择器,而是把 MLLM 对"这段画面有没有用"的判断力蒸馏进一个 BLIP 级别的轻量选择器,让问题理解从一次昂贵推理变成一次廉价前向;同时承认一个前提——并非所有问题都需要精挑细选,均匀帧上模型已经答得很确定的题,再选一次帧纯属浪费。核心 idea:用 MLLM 在"只给某个视频片段"与"完全不给视觉输入"两种条件下正确选项概率之差,作为每个片段视觉贡献的伪标签来训练轻量选择器;再用首轮推理的预测熵做路由——熵超过按视频长度校正过的阈值时才触发选择器与第二轮推理,并让同一份熵继续决定帧采样的抑制间隔。
方法详解¶
整体框架¶
ReQuest 是一条即插即用的三段式流水线,答题的 MLLM 全程冻结。输入是长视频与一道多选题:(1) 先用 1 fps 均匀采样得到的帧做一次"首轮推理",从选项概率分布算出预测熵;(2) 重想路由按熵与一个随视频长度校正的阈值,判定这道题直接在均匀帧上作答、还是进入重想阶段;(3) 进入重想时,问答感知选择器对全视频逐帧估计视觉贡献分,自适应 NMS 采样再用同一份熵缩放抑制间隔、选出 K 帧送回 MLLM 做第二轮推理。整条流水线里只有选择器(四层 transformer 加一个打分头)需要训练,而它的监督标签也由 MLLM 自己离线生成,路由器与采样器都不含学习参数。
需要说明"重想"到底重想什么:它不迭代修正相关性估计,也不多轮循环,而是在证据层面修一次——首轮推理是在一套可能漏掉关键画面的均匀帧上做的,重想就是用一次全局扫描把"对答对这道题真正有用"的帧重新捞出来,换一套证据集合让 MLLM 重答。判断依据来自模型自己的不确定性,所以"要不要重想"由模型说了算。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["长视频 + 问题<br/>1 fps 均匀采样"] --> B["首轮推理<br/>MLLM 输出选项概率与熵"]
B --> C["重想路由<br/>熵 vs 长度校正阈值"]
C -->|置信| D["直接作答"]
C -->|不确定| E["问答感知选择器<br/>逐帧估计视觉贡献"]
E --> F["自适应 NMS 采样<br/>按熵缩放抑制间隔"]
F --> G["二次推理<br/>MLLM 用所选 K 帧作答"]
关键设计¶
1. 重想路由:只对模型真正不确定的问题付第二轮的算力
并非每道题都值得精挑细选:均匀帧上模型已经答得斩钉截铁的题,再选一次帧只会白花算力;而线索稀疏、需要跨时段聚合的题,模型在几个选项之间会明显摇摆。ReQuest 直接拿首轮推理的选项概率分布算熵当作不确定度:
其中 M 为选项数。把这份熵与一个阈值比大小就能做路由,但固定阈值跨长度会失效:视频越长,1 fps 均匀采样能覆盖的比例越小,"没看到证据"导致的熵升高会和"问题本身难"混在一起。论文因此加了长度校正项——把视频帧数 N(截断到 \(N_{\max}\))归一化到 \([0,1]\) 得到 \(r_{\text{len}}(N)\),用它把基准阈值 \(\tau_0\) 调节成有效阈值 \(\tau_{\mathrm{eff}}\),原则是短视频用更严的阈值(模型本来就不容易不确定),长视频用更宽松的阈值。⚠️ 原文式 (3)(4) 在缓存全文中 OCR 不完整,\(\tau_{\mathrm{eff}}=\tau_0\,(1-\gamma_{\text{len}} r_{\text{len}}(N))\) 是按论文描述重构的形式,\(\gamma_{\text{len}}=0.3\) 与 \(\tau_0\) 取 0.55 / 0.45 / 0.3 为原文给出,精确形式以原文为准。
路由决策本身不含任何学习参数:\(u > \tau_{\mathrm{eff}}\) 走选择分支,否则直接用均匀帧作答。这种纯规则设计有很实际的好处——路由器不需要额外训练,换基准只要标定一个阈值。代价是阈值必须按基准手调:Video-MME 上扫描阈值的曲线很干净,全部触发选择(2700/0)得 65.3%,均衡路由(1365 题触发、1335 题不触发)最高 65.6%,完全不触发(0/2700)掉回 62.6%;在 Qwen3-VL-8B 上,路由把"全部触发选择"的 69.9% 提到 71.1%,同时把平均时延从 52.1s 压到 39.3s。也就是说这一个模块同时兜住了准确率的上界和算力的下界。
2. 问答感知选择器:从 MLLM 自己的回答里蒸馏"哪一帧真的有用"
这一设计要解决的核心问题是监督从哪来——若直接拿帧与问题的相似度当标签,学到的选择器只会继承相似度方法的盲点。ReQuest 的做法是让 MLLM 给自己出题:把视频按 FINCH 层次聚类切成片段,逐片段把该片段作为视觉输入喂给 MLLM,读出正确选项上的概率 \(p_{i,g}\);再用同一道题问一次,但把视觉输入换成全零的 dummy 张量,得到基线分布 \(p_{\text{base}}\)。两者相减就是该片段的贡献分:
这个减法承载了整个监督信号的意义:\(p_{\text{base},g}\) 编码的是"完全不看画面、只凭问题文本就能猜对"的文本先验,扣掉它之后剩下的才是这段画面真正提供的视觉证据量。不减基线的后果很具体——那些靠常识或语言先验就能答对的题会给所有片段都打高分,训练信号的动态范围被整体抬高、区分度被稀释,而这类题在 178K 数据里占比不小。
选择器的结构刻意保持轻量,而且刻意选了非双塔的 BLIP:帧与问题一起送入 BLIP,问题 token 在文本侧融合层对视觉 token 做 cross-attention,得到帧—问题融合 token。训练时把同一片段内各帧的融合 token 做时序池化得到片段级序列,前面拼一个可学习的 score token,送进四层 transformer 编码器,取该 token 的末层隐状态过一个轻量打分头回归 \(\Delta c_i\)。这里有一个训练/推理不对称的关键选择:训练在片段级(标注便宜、长视频上覆盖高效),推理在帧级(每帧单独与问题过 BLIP 打分)。消融证明这个不对称是划算的——同一套训练权重,只把推理粒度从片段级换成帧级,Video-MME 整体从 62.9% 涨到 65.6%、长视频子集从 53.3% 涨到 55.8%;原因是一个片段被池化成单个表示时,片段内部的细粒度线索会被平均掉,而决定性画面往往只占几秒。选择器对问题的理解是显式进入打分的(问题 token 与视觉 token 在同一融合流里交互),这也是它在"问题不含关键物体"的 400 题上能拿到 53.0%、反超均匀采样(51.3%)与两种相似度选择(48.0% / 51.0%)的原因。
3. 自适应 NMS 采样:让不确定度同时决定"选得准"和"选得密"
拿到逐帧贡献分后,还要决定在时间轴上的取帧方式。单纯取 top-K 会让相邻帧被反复选中,K 帧全挤在同一时刻;固定宽度的贪心 NMS(选当前最高分,抑制区间 \([i-\delta, i+\delta]\),重复到选满 K 帧)能去冗余,但抑制宽度写死,无法适配题目难度。ReQuest 让首轮推理的熵来定这个宽度:先定义基准间隔 \(b_s = N/K\)(N 为 1 fps 后的总帧数,K 为最终送入 MLLM 的帧数),再把熵裁剪到 \([u_{\min}, u_{\max}]\) 并归一化成 \(w\),得到缩放系数 \(s(u)\) 与有效抑制间隔 \(\delta\):
熵越高(模型越不确定),\(w\) 越接近 1,\(s(u)\) 越接近下限 \(s_{\min}\),抑制窗口越窄,选出的帧在时间轴上越密集,等于把预算集中投向可疑的局部;熵低于 \(u_{\min}\) 时直接取 \(s(u)=1\),退化为近似均匀的全局铺开。因为熵在设计 1 里已经算过,这一步不引入额外计算,也不引入任何学习参数。消融说明"自适应"不是可有可无的修饰:同样用选择器打分,top-K 得 64.0%、固定宽度贪心 NMS 得 64.7%、自适应 NMS 得 65.6%,而差距几乎全部来自长视频子集(53.0 / 53.3 → 55.8%)——视频越长,固定抑制宽度越无法同时满足"局部事件要密"与"全局要铺开"这两种彼此冲突的需求。值得注意的是,这个模块控制的是预算花在哪里,而不是花多少:帧数上限 K 是预先固定的,熵只改变 K 帧在时间轴上的分布密度。
一个完整示例¶
取一段 Video-MME 长视频为例(该子集平均 17 分钟):1 fps 采样后 N = 1020 帧,预算 K = 32。首轮用均匀帧推理,得到选项概率并算出熵,比如某题 u = 1.02;若 \(\tau_{\mathrm{eff}} \approx 0.55\)(长视频经长度校正后还会更低),路由判定"不确定",进入重想。若换成一道熵只有 0.31 的题,则直接输出首轮答案,一分额外算力都不花。
进入重想后,选择器对 1020 帧逐帧打分,基准间隔 \(b_s = 1020/32 \approx 32\) 帧。假设本题熵 u = 1.0,经 \(u_{\min}=0.45\)、\(u_{\max}=1.0\)、\(s_{\min}=0.2\) 换算得 w = 1、\(s(u)=0.2\),抑制间隔 \(\delta = \mathrm{round}(0.2 \times 32) = 6\) 帧——贪心 NMS 于是允许在相距 6 帧以上的位置连续取帧,把 32 帧压在那段真正藏着答案的画面附近(约几秒的时间窗内)。反之若熵只有 u = 0.5,则 w ≈ 0.09、\(s(u) \approx 0.93\)、δ ≈ 30,采样几乎退化成每隔约 30 帧取一帧的均匀铺开,覆盖整段视频。选出的 32 帧连同问题再次送进 MLLM,得到第二轮也是最终的回答。
损失函数 / 训练策略¶
选择器的训练目标是让预测分 \(\hat c_i\) 逼近伪标签 \(\Delta c_i\),损失为 Smooth-\(\ell_1\)(\(\beta = 0.5\))加一项成对排序损失,后者把随机采样两个片段之间的大小关系也纳入监督(原文给出权重 \(\alpha = 0.3\)、\(\tau = 0.25\)、\(\gamma_{\text{loss}} = 2.0\);⚠️ 排序项的精确形式在缓存全文中不完整,以原文为准)。排序项是必要的:选择器最终只被用来挑"相对更值得看"的帧,绝对分数的校准远不如相对次序重要。
监督数据的构造分三步:从 LLaVA-Video-178K 的多选题划分里取 808K 问答对,筛掉缺乏视觉依据的样本留下 169K 个"确有视觉依据"的样本;对每段视频按 1 fps 用 FINCH(第二层层次)切分片段,逐片段生成 \(\Delta c_i\);最后只保留 \(\Delta c\) 分布存在明显峰值的题目(阈值 0.20),剔除"各片段贡献都差不多"的噪声题。最终得到 73,468 道训练题与 803,956 条片段级样本。优化用 AdamW,批大小 256,每批采样 2,048 个随机片段对。
推理侧超参为 K = 32、\(u_{\min} = 0.45\)、\(u_{\max} = 1.0\)、\(s_{\min} = 0.2\)、\(N_{\max} = 3600\)、\(\gamma_{\text{len}} = 0.3\),基准阈值 \(\tau_0\) 按基准分别取 0.55(Video-MME)、0.45(MLVU)、0.3(LongVideoBench)。底层 MLLM 全程冻结不微调,选择器只训练一次即可即插即用地挂到别的模型上(论文中在 LLaVA-OneVision 与 Qwen3-VL 上的结果均为用 LLaVA-Video 监督训练的选择器直接零样本迁移)。
实验关键数据¶
主实验¶
在 MLVU(2,174 题、平均 12 分钟)、LongVideoBench 验证集(1,337 题、平均 8 分钟)、Video-MME 无字幕版(2,700 题、平均 17 分钟)三个长视频基准上评测,LLaVA-Video 同时用于生成伪标签与主评测。
| 模型(#Frames) | LVB | MLVU | Video-MME Overall | Short | Medium | Long |
|---|---|---|---|---|---|---|
| LLaVA-Video 7B (32) | 58.0 | 64.7 | 62.6 | 76.2 | 59.3 | 52.2 |
| + ReQuest | 60.1 | 71.7 | 65.6 | 77.0 | 64.1 | 55.8 |
| LLaVA-OneVision 7B (32) | 56.6 | 63.1 | 58.7 | 70.3 | 56.6 | 49.2 |
| + ReQuest* | 60.2 | 68.8 | 60.9 | 71.7 | 58.8 | 52.3 |
| Qwen3-VL 8B (512) | 62.7 | 74.0 | 70.0 | 78.6 | 70.1 | 61.2 |
| + ReQuest* (≤512) | 66.3 | 76.2 | 71.1 | 80.0 | 70.8 | 62.4 |
* 为用 LLaVA-Video 监督训练的选择器零样本迁移的结果。作为参照,表中原有的帧选择/压缩类方法分别为:Frame-Voyager(7B、8 帧)MLVU 65.6;LongVU(7B)MLVU 65.4、Video-MME 60.9;NVILA(8B、1024 帧)MLVU 70.1、Video-MME 64.0;VideoTree MLVU 60.4;LLoVi MLVU 55.1。
长视频子集最能说明问题:均匀采样下 Qwen3-VL 的准确率随帧预算先升后降,而 ReQuest 只用远少于 512 的帧就反超了所有均匀配置。
| Qwen3-VL 输入帧数 | Overall | Short | Medium | Long | 平均时延 (s) |
|---|---|---|---|---|---|
| 2048 | 67.7 | 78.6 | 68.9 | 55.6 | 53.8 |
| 1024 | 68.7 | 78.6 | 69.0 | 58.6 | 41.6 |
| 768 | 69.1 | 78.6 | 69.0 | 59.9 | 36.4 |
| 512 | 70.0 | 78.6 | 70.1 | 61.2 | 33.2 |
| 256 | 69.0 | 78.6 | 67.8 | 60.6 | 24.7 |
| ReQuest(短/中/长取 40/208/369 帧) | 71.1 | 80.0 | 70.8 | 62.4 | 39.3 |
ReQuest 的做法是保留每题分数分布中排在前 50%/40%/15%(短/中/长)的帧;也正因如此,它比 2048 帧的均匀采样还高出 3.4 个点,时延却更低。
消融实验¶
采样策略与推理粒度(均在 LLaVA-Video + ReQuest、Video-MME 上):
| 配置 | Overall | Short | Medium | Long | 说明 |
|---|---|---|---|---|---|
| Top-k 选择 | 64.0 | 76.7 | 62.3 | 53.0 | 不做时序去冗余 |
| 固定宽度贪心 NMS | 64.7 | 77.0 | 63.7 | 53.3 | 抑制宽度不随题目变化 |
| 自适应 NMS | 65.6 | 77.0 | 64.1 | 55.8 | 完整模型,增益几乎全在长视频 |
| 片段级推理 | 62.9 | 74.8 | 60.4 | 53.3 | 训练/推理同为片段级 |
| 帧级推理 | 65.6 | 77.0 | 64.1 | 55.8 | 片段级训练 + 帧级推理 |
监督信号的来源(同一流水线,仅替换伪标签来源):
| 方法 | 选择器骨干 | 监督信号 | Overall | Short | Medium | Long |
|---|---|---|---|---|---|---|
| 特征相似度(免训练) | SigLIP | – | 61.6 | 74.8 | 57.8 | 52.1 |
| 模型相似度(免训练) | BLIP ITM | – | 65.0 | 76.2 | 64.0 | 54.9 |
| 选择器 | SigLIP | 特征相似度 | 61.7 | 75.6 | 57.2 | 52.3 |
| 选择器 | BLIP | 模型相似度 | 63.6 | 76.0 | 61.8 | 53.0 |
| 选择器 | SigLIP | MLLM 回答(本文) | 64.7 | 76.2 | 61.7 | 56.1 |
| 选择器 | BLIP | MLLM 回答(本文) | 65.6 | 77.0 | 64.1 | 55.8 |
路由阈值分析(Video-MME,LLaVA-Video + ReQuest;#Selection/#Uniform 表示触发与不触发选择分支的题数):
| #Selection | #Uniform | 准确率 (%) |
|---|---|---|
| 2700 | 0 | 65.3 |
| 1782 | 918 | 65.4 |
| 1365 | 1335 | 65.6 |
| 1051 | 1649 | 65.0 |
| 567 | 2133 | 64.0 |
| 0 | 2700 | 62.6 |
关键发现¶
- 增益随视频变长而放大,方向与动机一致:LLaVA-Video 上短/中/长分别提升 0.8 / 4.8 / 3.6 个点(77.0 / 64.1 / 55.8)。短视频本来均匀采样就能覆盖大部分内容,改进空间天然有限;长视频才是证据定位真正失败的地方。⚠️ 原文 §4.2 正文写"MLVU 从 66.7 提升到 73.9",与 Table 1 的 MLVU 64.7 → 71.7 不一致,此处按表格数字记录,以原文/官方表格为准。
- 长视频上贡献最大的是采样策略,不是选择器本身:固定宽度贪心 NMS 与自适应 NMS 用同一个选择器打分,整体只差 0.9 个点,但长视频子集差 2.5 个点(53.3 → 55.8)。说明"分数打得准"之外,"预算在时间轴上怎么花"对长视频是同等重要的一环。
- 监督信号的质量决定选择器上限:把伪标签从特征相似度换成 MLLM 回答,BLIP 骨干从 63.6% 涨到 65.6%、SigLIP 骨干从 61.7% 涨到 64.7%;反过来,用相似度监督去训练学习型选择器(61.7% / 63.6%)甚至不如对应的免训练相似度基线(61.6% / 65.0%),说明不换监督只换模型架构是白做工。骨干方面 BLIP 略优于 SigLIP(65.6 vs 64.7),作者归因于 BLIP 在文本侧融合层内做跨模态交互。
- 路由是一个可直接调的成本—精度旋钮:全触发(65.3%)和不触发(62.6%)都不如均衡路由(65.6%),且全触发的代价更高;τ_eff = 0 时 2,700 题全部进入重想,τ_eff = 1 时全部走均匀采样。Qwen3-VL-8B 上路由把 69.9% 提到 71.1% 的同时把平均时延从 52.1s 降到 39.3s。
- 提升来自关键帧而非重复推理的随机性:作者只对均匀采样答错的子集做二次推理并合并统计——换随机种子重跑的均匀采样得 62.8%/62.7%(Router-Ours / Router-Oracle),而路由器引导的重推理得 65.6%/71.4%。用"路由到 Oracle 理想分支"的上限 71.4% 也说明当前路由器仍有可提升的选择空间。
- 训练粒度与推理粒度解耦是划算的:片段级推理 62.9% → 帧级推理 65.6%,因为一个片段的池化表示会平均掉几秒钟之内的细粒度线索。
- 成本结构值得注意:在 900 道 Video-MME 长视频题上,ReQuest(LLaVA-Video)总时延 102.3s、428.7 TFLOPs,而均匀采样基线只有 7.5s / 98.8 TFLOPs;代价主要来自 1 fps 全视频解码(89.6s、256.7 TFLOPs),选择器本身只占 0.3s / 4.2 TFLOPs。相较朴素的相似度选择(137.0s / 448.5 TFLOPs,长视频 54.3%),ReQuest 在更低的时延与算力下拿到 55.8%,说明路由确实省掉了不必要的稠密观察(900 题中只有 640 题进入重想;Qwen3-VL-8B 上是 390/900)。
- 开放题也有效:把不确定度换成生成 token 分布上的最大熵来驱动同一套路由与采样,Video-MME 开放题的事实性得分从 2.77 提到 3.00(整体 +8%,长视频 +11%),说明方法不局限于多选题。
- 规模可迁移:Qwen3-VL-32B 上从 73.9% 提到 75.7%(短/中/长 81.6→82.8、73.7→76.6、66.5→67.8),底层 MLLM 越强,收益依然存在。
亮点与洞察¶
- 让 MLLM 用自己的答案给自己做监督:\(\Delta c_i = p_{i,g} - p_{\text{base},g}\) 把"这段画面值多少钱"变成一个不需要任何人工标注、不需要额外模型的可计算量。它的巧妙之处在于零视觉基线的使用——把纯文本先验显式扣掉,剩下的才是视觉贡献,否则常识类题目会让所有片段都变成高分,监督信号失去区分度。这个配方可以原样搬到任何"多选题 + 可切分证据"的场景。
- 一份不确定度用两次:同一份预测熵既决定"要不要重想"(路由),又决定"选帧该多密"(NMS 抑制间隔)。两个决策本该是不同的问题,这里被统一到一个已经算出来的标量上,几乎零额外开销,也让整条流水线只有一个可解释的调节旋钮。
- 训练与推理粒度解耦:片段级训练解决了"逐帧向 MLLM 要标签太贵"的问题,帧级推理又避免了池化带来的线索平均化。这个"用粗粒度监督训、用细粒度推理"的套路可以迁移到任何"标注成本随分辨率增长"的稠密预测任务(如长文档中的证据句选择、长音频中的事件定位)。
- 不追求把 MLLM 改强,只改喂给它的东西:整个方法冻结答题模型,只训练一个四层 transformer 的选择器,且能零样本迁移到别的 MLLM。这种"外围可控、内核不动"的思路在工程上更容易落地——换基座模型不需要重训整条流水线(选择器也只需换监督源重训一次)。
- 帧预算的反直觉结论:Qwen3-VL 能吞 2048 帧,但准确率在 512 帧见顶;ReQuest 在长视频上只用约 369 帧就超过 2048 帧的配置。这提示"高容量 MLLM 就该多喂帧"是一个错误直觉,瓶颈不在帧数上限而在有效证据密度。
局限与展望¶
- 第二轮的算力节省被解码开销吃掉:成本表显示 ReQuest 的总时延里 89.6s(约 88%)来自 1 fps 全视频解码,选择器只占 0.3s。也就是说,方法确实省下了"对不需要的样本做稠密观察"的 MLLM 前向,却仍然要为所有样本先解出 1 fps 的完整帧序列。真正的瓶颈是解码与特征提取,作者没有给出降低这部分成本的方案(例如先低码率粗筛、只对路由到重想的样本解码,或利用关键帧附近的 I 帧做局部解码)。
- 路由器需要按基准手调阈值:\(\tau_0\) 在三个基准上分别是 0.55 / 0.45 / 0.3,论文没有给出自动标定方法,跨域(尤其是视频长度分布不同的新基准)迁移时这个阈值是明确的使用成本。长度校正项 \(\gamma_{\text{len}}\) 也是固定的 0.3。
- 选择器仍需要一次有监督训练:虽然答题 MLLM 免训练,但选择器的监督依赖 808K→169K→73K 的筛选流程与离线跑遍 MLLM 的伪标签生成,且需要与目标 MLLM 分布匹配(跨模型迁移时论文标注为带 * 的零样本结果,在 LLaVA-OneVision 的 MLVU 上就比 LLaVA-Video 本体上的增益小)。\(\Delta c\) 峰值过滤会丢掉相当比例的题目(169K → 73K),暗示过长的、需要跨片段聚合的问题很难拿到干净标签。
- 只做一轮重想、不做迭代:路由是二值决策,触发后只重选一次证据,没有"重想后仍不确定就再重想"的机制,也没有对"重想失败"的兜底。表 6 中 Router-Oracle 能到 71.4% 而实际路由器只有 65.6%,说明有相当一部分被判定为"置信"的题其实是错的,路由器的判定质量是明显的提升空间。
- 主要评测仍是多选题:开放题只用最大熵启发式补齐,且仅在 Video-MME 上报告(2.77 → 3.00),缺少在开放题为主的长视频基准上的验证。
- 改进思路:把"是否重想"从二值扩展为按熵分档的多档采样预算(熵越高给越多帧),让 K 也随题目自适应;用首轮与重想后的答案一致性做自校验,不一致时再触发一轮或退回答疑;把选择器训练目标从回归 \(\Delta c\) 改为直接在"选出的帧能否让 MLLM 答对"上做排序学习。
相关工作与启发¶
- vs 相似度驱动的帧选择(BOLT / MDP3 / Q-Frame / AKS):他们都用 CLIP / SigLIP 余弦相似度或策略式检索挑帧,免训练、极便宜。区别在于相似度只反映"视觉内容与问题文本的字面接近度",当关键物体不在问题里时排序就不可靠——论文的 400 题对照里 SigLIP 相似度只有 48.0%,低于均匀采样的 51.3%。ReQuest 用 MLLM 回答的贡献分做监督,在这类题上拿到 53.0%,代价是需要一次离线训练选择器,但推理时开销相当(0.3s)。
- vs Frame-Voyager / MLLM-based frame selection:他们用 Video-LLM 的预测损失构造帧组合的相对排序并训练模型选帧,语义更强,但算力迫使其采用"3600 → 128 → 32"的多阶段稀疏采样,全局探索和效率被硬性折中,首阶段漏掉的证据无法挽回。ReQuest 保留 1 fps 的稠密观察(不做稀疏预筛),把"理解问题"的能力压进一个廉价选择器,用 BLIP + 四层 transformer 换回全局扫描的可行性。
- vs 层级/Agent 式选择(VideoTree / VideoAgent / LLoVi / SeViLA):这些方法让 LLM 或 MLLM agent 逐层提问、递归定位,语义强但需要多次模型调用;ReQuest 把问题理解一次性蒸馏进选择器,推理时只多一次选择器前向与一次 MLLM 前向,成本曲线平缓得多。
- vs LVNet:LVNet 是免训练的分层关键帧选择器,同样针对长视频 QA 的冗余问题;ReQuest 也保留免训练的部分(路由与自适应 NMS 都不学习),只把"哪一帧有用"这一最难的判断交给有监督的轻量选择器,比纯免训练方案多了一次训练成本但换来了问题条件化的能力。
- vs 直接扩大帧预算(LongVU / NVILA 等人的高帧数路线):那条路线靠压缩或增加帧容量硬扛,ReQuest 的结果(长视频上 369 帧胜过 2048 帧)说明在固定视觉 token 预算下,证据密度比帧容量更重要,这对所有"堆帧数"的方法都是一个直接的反驳论据。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把 MLLM 自身的答案概率差当作帧级视觉贡献的监督信号,并用同一份熵同时驱动路由与采样密度,组合得干净且可复用;单看每个组件(蒸馏选择器、熵路由、NMS 采样)都有先行工作。
- 实验充分度: ⭐⭐⭐⭐⭐ 三个长视频基准、三种基座(含 32B)、成本—精度对照、随机性控制、粒度与监督来源消融齐全,且给出了帧预算扫描这条关键的实证曲线。
- 写作质量: ⭐⭐⭐⭐ 动机链条与消融设计对得上,公式节制;但方法式 (3)(4) 的表达不够清晰,§4.2 正文的 MLVU 数字与 Table 1 不一致,是需要修订的瑕疵。
- 价值: ⭐⭐⭐⭐ 即插即用、不改基座即可提升,且有明确的高帧容量模型适用场景;主要折扣来自 1 fps 全视频解码这一未解决的固有开销。