Dense Video Understanding with Inter-tokenization Acceleration¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/3614
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/2211.pdf
项目: DIVE-Bench
领域: VLM效率
关键词: 高帧率视频理解、门控残差分词、运动补偿、场景合并、DIVE-Bench
一句话总结¶
本文用 DIVE-Bench 把“几乎每帧都有信息”的视频问答单独定义为高帧率视频理解,并提出 Gated Residual Tokenization(GRT):在视觉编码前仅处理发生变化的补丁、编码后再合并语义相近场景,从而在 1 FPS 下减少 53.6% tokenization 延迟,同时改善密集文字与高运动任务的回答质量。
研究背景与动机¶
现有视频大语言模型通常先从视频中均匀抽取少量帧,再把每帧切成视觉 token。这个工程折中在场景变化缓慢、问题只问全局语义时很有效,却默认“被跳过的帧没有不可替代的信息”。教育视频中的短暂字幕、第一视角视频中的快速手部运动恰好违反这一假设:采样率减半就可能漏掉整句字幕或一个短动作,而且视频越长,固定帧预算带来的有效 FPS 越低。
直接提高 FPS 又会同时撞上两个瓶颈。视觉编码器需要对每一帧的所有补丁执行卷积和 Transformer,即使相邻帧的大部分区域完全静止,tokenization 时间与 token 数仍随帧数近似线性增长;视觉 token 进入语言模型后,自注意力成本还会随序列长度平方增长。更麻烦的是,常用视频问答基准多数只要求活动识别或对象存在判断,六帧也可能取得高分,因此无法揭示密集时间信息被丢弃的代价。
论文为此同时补上评测与表示两块缺口:DIVE-Bench 用逐帧变化的字幕和手掌网格轨迹逼迫模型读取密集证据,GRT 则借鉴视频编解码器的关键帧与预测帧思路,把“哪里变化了”提前到 tokenization 过程中处理。核心 idea:不要先完整编码每一帧再删除冗余 token,而要像视频编解码器一样,让关键帧承载静态场景、让后续帧只编码运动残差,再在语义层合并重复场景。
方法详解¶
整体框架¶
输入是一段高 FPS 视频和文本问题,输出仍由标准视频 LLM 生成。GRT 不训练新的视觉骨干,而是在预训练 ViT tokenizer 内部加入运动补偿门控,并在得到视觉 token 后执行语义场景合并;压缩后的视觉序列经过线性投影,与问题 token 拼接后送入 LLaVA-OneVision/Qwen2 架构。
整条链路分为三个贡献环节:DIVE-Bench 定义需要逐帧证据的任务;运动补偿门控分词在昂贵视觉编码前去掉静态补丁;语义场景合并在编码后继续删除重复的关键帧表示,同时保留按时间排列的运动 token。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["高 FPS 视频 + 问题"] --> B["DIVE-Bench 密集监督<br/>字幕序列 / 手掌轨迹"]
B --> C["运动补偿门控分词<br/>关键帧 + 变化补丁"]
C --> D["语义场景合并<br/>合并静态、保留运动"]
D --> E["线性投影 + 问题 token"]
E --> F["视频 LLM 回答"]
关键设计¶
1. DIVE-Bench 密集监督:让跳帧造成可测量的信息损失
DIVE-Bench 不再把高 FPS 当作普通长视频的采样参数,而是要求答案依赖连续帧。教育分区复用长于 30 分钟的讲座视频,把快速变化的嵌入字幕作为真值;模型需要恢复字幕序列,因而用 CER、WER、Token-F1、Exact Match 和 0–5 分 MOS 衡量完整性。该分区包含 317 个视频和 317 个问答,源视频平均 44.26 FPS、每个视频平均 72,068.5 帧。
高运动分区来自第一视角手部视频。作者在每帧叠加 \(3\times3\) 网格,把手掌中心从连续坐标转换成 r1c2 一类网格标签,再用 Grid ADE/FDE 衡量整段轨迹和末帧位置误差。它包含 277 个视频、3,243 个片段,平均 30 FPS、每段 254.8 帧。两种分区分别覆盖密集文字变化和密集运动变化,使“少看几帧”不再能被全局语义掩盖。
2. 运动补偿门控分词:在视觉编码发生前只放行变化补丁
传统 token pruning 已经为整帧支付了卷积与 Transformer 代价,GRT 则先比较相邻帧补丁。每个场景以一张关键帧完整表示,后续 P 帧只保留与前一帧结构相似度低于阈值 \(\tau\) 的补丁;关键帧的门控恒为 1。残差可写为:
为了复用预训练 ViT,作者把步幅等于卷积核大小的非重叠 patch convolution 展平为等价 MLP。被选中的补丁使用原卷积权重生成 embedding;被屏蔽位置先填零,以便添加正确的位置编码,随后再从送入多头注意力的序列中滤除占位符。这样既不额外训练 tokenizer,也避免让静态区域经过完整视觉编码,是 tokenization 复杂度能够随帧数次线性增长的关键。
3. 语义场景合并:删除重复静态语义而不牺牲运动残差
像素差异不足以判断两个场景在语义上是否相同,轻微相机抖动也可能触发大量残差。因此第二阶段使用预训练 tokenizer 已产生的深层语义表示,比较相邻场景关键帧 token 的归一化分布。论文最终以 Jensen–Shannon divergence 选择语义最接近的相邻场景:
合并时,两个关键 token 集的均值表示再取平均,而两个场景的 P-token 序列依时间顺序拼接。也就是说,压缩针对的是占 token 大头、内容重复的静态关键帧,而不是最能反映短时变化的运动残差。实验中这一阶段在 1 FPS 将保留比例从门控后的 90% 进一步压到原始 token 的 14%,但 MOS 只从 1.93 小幅升至 1.94,说明它主要是效率模块而非质量增益来源。
一个完整示例¶
考虑一段讲座视频:首帧完整编码讲师、幻灯片背景和当前字幕;下一帧只有字幕末尾与手势变化。门控分词保留这两处变化补丁,静止背景以零占位保持位置后不再进入 Transformer。切换到下一页时建立新的关键帧;若后续场景仍是同一讲师和相似版式,语义场景合并只保留合并后的关键表示,却按顺序拼接所有字幕和手势 P-token。最终语言模型看到的不是稀疏抽帧,也不是每帧的完整重复背景,而是一份“静态场景 + 连续变化”的压缩时间记录。
损失函数 / 训练策略¶
GRT 是零样本、仅推理方法,不为门控或场景合并引入训练损失。实验使用 LLaVA-OneVision 与 Qwen2 架构的 0.5B/7B 变体,将 \(224\times224\) 帧切成 \(16\times16\) 补丁,以 FP16 在 RTX 4090、RTX A6000 Ada 和 H200 上推理。tokenization 时间覆盖从原始帧提取到 token 序列完成的全过程,并用 LMMS-Eval 在 50 个视频上取平均;教育视频回答由 GPT-3.5 相对真值给出 0–5 MOS。
实验关键数据¶
主实验¶
| 场景 / 数据集 | 方法 | 质量指标 | 效率 / 运动指标 |
|---|---|---|---|
| DIVE-Bench 教育视频 | LLaVA-OneVision 0.5B | MOS 2.01 | — |
| DIVE-Bench 教育视频 | GRT 0.5B | MOS 2.50 | — |
| DIVE-Bench 高运动视频 | LLaVA-OV baseline | — | 4.49 FPS / ADE 1.3618 / FDE 1.6085 |
| DIVE-Bench 高运动视频 | GRT | — | 8.69 FPS / ADE 1.1456 / FDE 1.1828 |
| MLVU | LLaVA-OneVision 0.5B → GRT | 33.002 → 34.066 | +1.064 |
| VideoMME | LLaVA-OneVision 0.5B → GRT | 43.963 → 44.037 | +0.074 |
GRT 的 0.5B 教育视频 MOS 还高于表中 LLaVA-Video 7B 的 1.47 和 LLaVA-OneVision 7B 的 1.70。高运动任务中,有效 FPS 增加 93.5%,同时 ADE 降低约 15.9%、FDE 降低约 26.5%;这组结果比单纯加速更重要,因为它表明保留下来的密集帧确实改善了运动定位。
消融实验¶
| 门控分词 | 场景合并 | MOS | 相对基线变化 | 解释 |
|---|---|---|---|---|
| 否 | 否 | 1.66 | — | 全 FPS、无门控与合并 |
| 是 | 否 | 1.93 | +0.27 | 主要质量增益来自早期静态补丁过滤 |
| 是 | 是 | 1.94 | +0.28 | 场景合并额外提供压缩,MOS 仅再增 0.01 |
| 输入 FPS | LLaVA-OV 时间 | GRT 时间 | 加速 | 门控后 token 保留率 | 场景合并后保留率 |
|---|---|---|---|---|---|
| 0.01 | 0.0170 s | 0.0174 s | -2.4% | 100% | 100% |
| 0.1 | 0.0186 s | 0.0177 s | 4.8% | 96% | 33% |
| 1.0 | 0.0487 s | 0.0226 s | 53.6% | 90% | 14% |
关键发现¶
- 门控分词是质量保持的核心:单独启用便贡献 0.27 MOS,而场景合并只再增加 0.01 MOS,后者的价值主要体现在高 FPS 时的大幅 token 压缩。
- GRT 并非在任何采样率都更快。0.01 FPS 时固定门控开销使其慢 2.4%,到 1 FPS 才显出 53.6% 的优势,符合它为密集视频而设计的定位。
- 在传统低 FPS 基准上,MLVU 提升 1.064,VideoMME 仅提升 0.074;方法的优势集中在密集时间证据,而不是普遍提高长视频语义推理。
- 语义与运动保真度目前只有间接证据:MLVU 的 Ego-centric 从 37.7 提升到 39.6、Anomaly Recognition 从 30.8 提升到 38.5,但论文没有带像素级遗漏运动标注的直接召回率实验。
亮点与洞察¶
- 把剪枝前移到 tokenizer 内部:多数压缩方法先产生视觉 token 再裁剪,GRT 先用廉价补丁差异决定哪些位置值得运行视觉编码,直接省掉最早的一段冗余计算。这一思路也适用于固定摄像头、屏幕录制和机器人连续观测。
- 静态信息与动态信息采用不同压缩策略:关键帧用语义距离去重,P 帧按时间保留运动残差,避免用同一种相似度规则处理两类性质不同的信息。它对应传统视频编码的 I/P 帧分工,但压缩目标从像素重建转为 VLM 推理。
- 基准与方法共同验证问题:DIVE-Bench 特意构造“漏帧即丢答案”的任务,防止方法在低时间敏感基准上靠冗余语义获得虚高结论。尤其是网格化手掌轨迹,把原本不适合语言模型的坐标回归转成可审计的离散问答。
局限与展望¶
- DIVE-Bench 目前只覆盖字幕/OCR 流和网格化手掌轨迹,两者虽密集但不能代表所有高 FPS 语义;实时交互、游戏、手术与细粒度因果事件仍未评测。
- 高运动分区保留 244 个无效或空网格解析,占 7.52%,另有 171 个重复问题模式,占 5.27%。这些被明确标为审计项,但仍可能影响指标稳定性。
- 门控依赖相邻补丁 SSIM 与固定阈值,摄像机抖动、遮挡和细小但关键的变化都可能造成误保留或误删除。论文承认没有逐像素运动真值来直接测 missed-motion recall,现有 MLVU 子任务只能作代理证据。
- 论文声称 tokenization 随帧数次线性增长,但主文只报告 0.01、0.1、1 FPS 三点的短视频延迟,尚缺不同视频长度、分辨率和硬件上的复杂度曲线;低 FPS 下还会因门控开销变慢。
- 当前实现仍先接收采样后的帧。后续可直接利用真实编解码器的关键帧、运动向量和残差流,减少解码后再估计运动的重复工作,并引入内容自适应阈值保护小而关键的变化。
相关工作与启发¶
- vs 稀疏/自适应抽帧:LLaVA-OneVision 等方法限制总帧数,Flexible-FPS 把更多帧分给高运动片段,但仍会完整编码每个被选帧。GRT 保留更密的时间轴,只在空间补丁和场景语义层消除冗余,因此更适合信息几乎逐帧变化的任务。
- vs tokenization 后剪枝或合并:后处理方法能缩短语言模型输入,却无法收回视觉编码器已经花掉的计算。运动补偿门控在 patch embedding 前筛选,场景合并再负责语言模型前的序列长度,两阶段分别击中两个成本来源。
- vs 传统视频编解码:传统 codec 以视觉重建质量为目标,GRT 借用关键帧/残差帧结构但以问答语义为目标。一个自然延伸是直接读取压缩码流,并用任务相关的语义风险而非像素误差决定哪些残差必须送入 VLM。
评分¶
- 新颖性: ⭐⭐⭐⭐ 高 FPS 视频问答任务与 tokenizer 内部的 codec-style 门控结合得很有针对性,但关键帧/残差思想本身来自成熟视频编码。
- 实验充分度: ⭐⭐⭐⭐ 同时覆盖质量、运动误差、延迟、token 保留率、消融和传统基准;缺少直接 missed-motion recall 与更广泛复杂度曲线。
- 写作质量: ⭐⭐⭐⭐ 问题、两阶段方法和效率收益清楚,个别方法公式在余弦距离与 JSD 两种场景距离之间略显重复。
- 价值: ⭐⭐⭐⭐ 把“先完整编码再压缩”的默认顺序翻转,对高帧率 VLM、连续机器人感知和长时视频基础设施都有可迁移价值。