Parallelized Autoregressive Decoding for Omni-Modal Dense Video Captioning¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/showlab/PadCaptioner
领域: 视频理解
关键词: 稠密视频描述、并行自回归解码、隐式全局规划、全模态视频大模型、因果依赖重构
一句话总结¶
针对稠密视频描述中严格逐词自回归生成导致的延迟瓶颈与跨事件干扰,PadCaptioner 提出通过隐式全局规划重构事件间因果依赖图,并配合事件因子化注意力实现保质且大幅加速(3.8× 实际墙钟加速)的并行自回归解码。
研究背景与动机¶
稠密视频描述(Dense Video Captioning, DVC)要求对未剪辑长视频中密集发生的事件进行联合时间定位并生成高质量的细粒度描述。随着多模态大语言模型(MLLMs)在生成与跨模态推理能力的飞跃,自回归视频大模型逐渐成为处理 DVC 的主导范式。然而,传统的自回归框架采用严格从左到右、逐 token 串行解码(token-by-token sequential decoding)的模式。由于 DVC 涉及长视频内多个密集事件的多句叙述,输出序列通常达到数百甚至上千 token,导致推理阶段的解码延迟急剧上升;虽然扩散语言模型(dLLM)尝试引入位置级并行生成,但往往受制于多轮迭代优化与 KV 缓存机制的冲突,不仅难以在视频理解中维持生成质量,实际加速效果也极为有限。
现有串行自回归建模的本质缺陷在于将所有 token 强制绑定在一个刚性的单一因果链条上。然而,长视频中的不同事件在时间维度上高度模块化:细粒度的强因果交互主要集中在单个事件内部(local intra-event coherence),而跨事件之间的关联更多受全局高级时序结构与叙事流驱动,其底层 token 之间的局部依赖极其微弱。强行让后续事件的每一个词都依赖前面事件所有词的局部上下文,不仅造成了大量的串行等待与延迟开销,还会将冗余且无关的跨事件上下文强行注入注意力计算,分散模型在当前事件上的聚焦程度。
本文的切入角度是打破全局平铺的单一因果链,将视频时序结构的先验融入自回归因果图的重构。核心 idea:利用视频事件间的弱局部依赖重构因果依赖图,先通过自回归隐式全局规划提取事件级全局 token 并自适应聚合视听语义,再以此为锚点解耦并行解码各个事件子链,配合事件因子化注意力实现兼顾全局感知与局部聚焦的高效无损生成。
方法详解¶
整体框架¶
PadCaptioner 将输入的全模态前缀(交织的音视频帧特征与文本指令提示词)映射为结构化且并行的稠密描述。模型不再直接自回归生成整篇长描述,而是将生成过程划分为两个阶段:第一阶段为“隐式全局规划(Latent Global Planning)”,模型自回归生成一组数量自适应的紧凑全局事件 token;第二阶段为“依赖重构的并行解码(Dependency-Restructured Parallel Decoding)”,在全局事件 token 的锚定与条件引导下,所有事件的分支描述子链在时间步维度上同步并行展开。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入音视频流与文本提示<br/>交织多模态前缀 P"] --> B["自回归隐式规划<br/>生成全局事件 Token 序列"]
B --> C["自适应语义聚合<br/>加权汇聚视听片段特征"]
C --> D["事件因子化并行解码<br/>多分支事件子链同步展开"]
D --> E["输出全模态事件时间戳与文本描述"]
关键设计¶
1. 自适应隐式全局规划:自回归生成具备显式时序定位的全局事件锚点
为了在并行解码前建立全局时序框架并避免硬性预设事件数量,PadCaptioner 引入特殊符号 <G>,让模型在多模态前缀输入 \(P\) 的条件下首先自回归生成全局事件 token 序列 \(\{G_1, G_2, \dots, G_K\}\) 及终止切换符号 \(S\)。事件数量 \(K\) 由模型根据视频内容自适应停止判定。为了使每个潜变量 \(G_i\) 真正锚定一个合法的视频事件区间,模型在训练时对 \(G_i\) 施加显式事件定位约束(Explicit Event Grounding Constraint)。利用标注的真值事件时间段,计算 \(G_i\) 与视频各时间步多模态特征的归一化点积相似度 \(\text{sim}_t^i\),并通过二元交叉熵损失进行时序对齐:
$\(\mathcal{L}_{\text{gnd}}^{G_i} = - \frac{1}{T} \sum_{t=1}^T \Big( y_t^i \log \text{sim}_t^i + (1 - y_t^i) \log (1 - \text{sim}_t^i) \Big)\)$
该约束不仅使全局事件 token 具备先验时序锚定功能,而且在推理时只需计算 \(G_i\) 与多模态前缀的相似度即可直接推导出事件起止时间戳,无需依赖额外的回归头。
2. 自适应语义聚合:为潜变量注入富集的多模态事件线索
单纯的规划符号不足以承载生成详细描述所需的细粒度信息。为了让并行解码的各个分支在初始时刻就获得充沛的局部线索,PadCaptioner 在 \(G_i\) 生成后,将其定位时间区间内的音视频前缀特征动态汇聚到 \(G_i\) 的表征中。针对时空与跨模态特征的信息异质性,论文对比了均匀池化、基于轻量 MLP 的预测打分头加权以及基于注意力的自适应加权机制。最终采用注意力引导聚合策略:直接复用提示词末尾 token 对音视频前缀特征的交叉注意力权重作为重要性评分,免去额外引入参数的开销,自适应加权汇聚当前事件区间内的关键视觉与声音 token 并残差加回 \(G_i\) 嵌入,使 \(G_i\) 成为语义充盈且局部聚焦的事件锚点。
3. 事件因子化并行解码:解耦跨事件局部干扰与保持全局结构感知
进入文本生成阶段后,所有 \(K\) 个事件分支在各解码步 \(j\) 进行同步并行生成。在因果依赖图上,联合条件分布被因子化分解: $\(\{L_j^i\}_{i=1}^K \sim \mathbb{P}\Big( \{L_j^i\}_{i=1}^K \;\Big|\; P, G^{1:K}, \{G^i, L_{<j}^i\}_{i=1}^K \Big)\)$ 在注意力机制实现中,模型构造了专用的事件因子化掩码矩阵:每个事件分支中的局部 token \(L_j^i\) 可以完整访问全局上下文(前缀 \(P\) 和所有全局事件 token \(G^{1:K}\)),同时因果访问本事件的锚点 \(G^i\) 及本事件已生成的历史 token \(L_{<j}^i\);但不同分支之间的局部 token 彼此完全不可见(相互掩码)。该设计彻底隔绝了跨事件的词级伪相关性,同时借助全局共享的 \(G^{1:K}\) 维持了全文叙事结构的宏观连贯。
4. 结构无关位置编码与对齐截断机制:适配变长事件描述的高效推理
不同事件的文字描述长度各异。为了使多分支在同一张张量中执行并行批处理自回归,PadCaptioner 设计了分支对齐的位置编码方案:不同事件分支在相同解码步 \(j\) 共享完全一致的相对位置索引,彻底消除分支间的序列先后假象。训练阶段,针对最大长度 \(N\) 较短的分支填充 <EOS> 占位并计入自回归损失,以此强化模型在语义表述完结时果断截断的能力;推理阶段,一旦某分支吐出 <EOS>,即可独立停止该分支的 KV 更新,无需等待其它未完成分支,杜绝冗余计算。
实验关键数据¶
主实验¶
在代表性全模态长视频稠密描述基准 LongVALE 与 ChronusAV 上,PadCaptioner(3B)不仅在解码速度上大幅超越 7B 模型,在事件定位(F1)与描述质量(Sim, SODA_c, CIDEr, METEOR)上也全面建立新 SOTA。
| 基准数据集 | 模型 | 参数量 | F1 (定位) ↑ | Sim (相似度) ↑ | SODA_c ↑ | CIDEr ↑ | METEOR ↑ |
|---|---|---|---|---|---|---|---|
| LongVALE | LongVALE-LLM | 7B | 31.2 | 37.2 | 2.8 | 7.9 | 4.7 |
| LongVALE | ChronusOmni | 7B | 49.7 | 52.4 | 3.7 | 5.6 | 5.2 |
| LongVALE | PadCaptioner (本文) | 3B | 56.4 | 58.5 | 6.4 | 13.7 | 8.6 |
| ChronusAV | LongVALE-LLM | 7B | 18.4 | 25.4 | 3.1 | 4.6 | 8.8 |
| ChronusAV | ChronusOmni | 7B | 60.1 | 36.8 | 8.6 | 2.9 | 7.6 |
| ChronusAV | PadCaptioner (本文) | 3B | 63.2 | 40.0 | 12.4 | 9.6 | 12.4 |
在解码推理延迟测试中(单张 NVIDIA A6000 GPU 测算实际墙钟时间),PadCaptioner 展示出显著的端到端吞吐优势:
| 模型 | LongVALE 单视频解码耗时 (ms) ↓ | LongVALE 单 Token 耗时 (ms) ↓ | ChronusAV 单视频解码耗时 (ms) ↓ | ChronusAV 单 Token 耗时 (ms) ↓ |
|---|---|---|---|---|
| ChronusOmni (7B) | 16162.1 | 41.3 | 28093.0 | 41.0 |
| video-SALMONN-2+ (3B) | 2706.8 | 22.5 | 3083.4 | 22.8 |
| PadCaptioner (3B, 本文) | 4283.8 (3.8× 加速) | 13.4 (3.1× 加速) | 7526.7 (3.7× 加速) | 13.7 (3.0× 加速) |
注:video-SALMONN-2+ 单视频总时间看似较低,原因在于其倾向于输出极短且缺乏细节的描述(F1 仅 35.5/21.5,Sim 仅 26.6/17.6),一旦归一化到每 Token 解码耗时(T/token),PadCaptioner 展现出绝对的速度优势。
消融实验¶
基于 ChronusAV 数据集(统一采用 12K 训练集子集),论文对各核心模块的贡献及设计选择进行了详尽验证。
| 模块配置与变体 | F1 (定位) ↑ | Sim (语义) ↑ | 单视频耗时 (ms) ↓ | 单 Token 耗时 (ms) ↓ | 说明 |
|---|---|---|---|---|---|
| 基础串行 Baseline | 32.7 | 17.6 | 7798.7 | 22.9 | 传统单链自回归,易受跨事件干扰 |
| + 文本形式规划 (Textual planning) | 37.4 | 19.4 | - | - | 先输出时间文本再串行写描述 |
| + 隐式规划 (Latent planning) | 61.5 | 38.4 | 12405.1 | 22.9 | 规划带来质量质变,但未并行时总耗时升高 |
| ++ 并行解码 (PadCaptioner 完整版) | 61.8 | 38.8 | 7598.2 | 13.8 | 质量进一步微升,解码提速 1.66× |
| 因子化注意力换为标准因果注意力 | 38.7 | 19.9 | - | - | 跨事件局部 token 产生强干扰导致崩溃 |
| 仅访问自身 \(G^i\)(无全局 \(G^{1:K}\) 视野) | 59.8 | 37.6 | - | - | 缺少宏观事件间结构感知,性能受损 |
| 去除视听语义聚合 (w/o aggregation) | 47.7 | 24.3 | - | - | 潜变量信息匮乏,局部锚定能力变弱 |
| 采用均匀均值池化 (Mean pooling) | 58.5 | 35.7 | - | - | 未区分时空及模态重要度 |
| 采用可学习打分头 (Scoring head) | 61.4 | 38.2 | - | - | 引入额外参数预测重要性标量 |
| 采用注意力引导聚合 (Attention guided) | 61.8 | 38.8 | - | - | 零额外参数,准确捕获任务相关视听线索 |
关键发现¶
- 并行解码不仅无损,反微幅涨点:当从串行隐式规划切换为因子化并行解码时,F1 从 61.5 提升至 61.8,Sim 从 38.4 提升至 38.8。这表明切断不必要的跨事件低级词注意力后,模型对当前事件的注意力更集中,消除了长程无关上下文的混淆。
- 注意力掩码设计决定成败:若在并行解码中粗暴使用标准因果注意力,F1 暴跌至 38.7,Sim 跌至 19.9。这证明在不同事件并行吐字时,未经隔离的半成品相互注意力会带来致命的错误信号传播。
- 注意力引导聚合兼顾高效与轻量:在潜变量语义注入中,复用注意力图(61.8 / 38.8)不仅全面胜过均值池化(58.5 / 35.7),还略优于引入额外参数的 MLP 打分头(61.4 / 38.2)。
亮点与洞察¶
- 将任务时序物理结构映射为计算图因果稀疏性:论文巧妙地发现多事件视频在语义上的“事件独立性”,将其转化为自回归注意力的分块对角掩码结构,在保留自回归局部连贯性的前提下破解了串行延迟困境。
- 隐式全局规划的一石二鸟之策:生成的全局事件 token 既承担了无参数直接时序定位(特征相似度匹配)的几何功能,又扮演了并行子链启动与全局上下文广播的语义锚点角色。
- 可迁移的解耦生成范式:这种“全局紧凑规划 + 局部因子化并行解码”的范式可广泛迁移至多视角摄像机协同描述、长文档分章节并行生成以及具身智能长时程多步动作规划中。
局限与展望¶
- 粒度受限于事件级边界:当前依赖图重构以粗粒度事件为基本单位,若单个事件持续时间极长,该事件子链仍需耗费较长的串行步数,未来可探索子事件或时空实例级的细粒度分级并行。
- 长事件中的描述粗化:自适应语义聚合在超长事件片段下可能丢失瞬态动作信息,导致长事件描述存在泛化粗粒度倾向,需要更精巧的时序金字塔采样与汇聚机制。
- 专用底层 Kernel 适配:自定义的因子化注意力掩码目前主要依托通用注意力算子实现,尚未完全适配 FlashAttention 等硬件级特化切片,开发专用解码内核具有进一步释放硬件吞吐的潜力。
相关工作与启发¶
- vs PDVC (ICCV 2021): PDVC 依赖传统 DETR 架构与查询机制实现并行描述,但无法自然复用现代超大规模多模态大模型的语言先验与世界知识;PadCaptioner 是原生基于 MLLM 架构的因果重构,完整继承了预训练基座的强泛化能力。
- vs 扩散语言模型 (Diffusion LLMs / dLLMs): dLLM 虽具备全序列位置并行能力,但生成需多步去噪且无法利用成熟的自回归 KV-Cache,导致实际吞吐与生成质量双双受挫;PadCaptioner 保持局部的标准自回归特性,完美契合标准 KV-Cache 加速管线。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 成功将因果图解耦引入多模态自回归稠密视频描述,立意深刻且方案高度自洽。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 LongVALE、ChronusAV 与 YouCook2,详细报告了实际墙钟延迟、显存与多种消融对比。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,对动机瓶颈与因果图重构机制的阐述极其透彻清晰。
- 价值: ⭐⭐⭐⭐⭐ 为长视频与多事件理解模型的推理加速提供了兼具高性能与实用落地价值的重要参考。