跳转至

SV-TAD: Native Sparse Convolutions for Efficient Temporal Action Detection

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/pcr-upm/eccv26_tad
领域: 视频理解
关键词: 时序动作检测, 原生稀疏卷积, Token剪枝, 参数高效微调, 辅助任务监督

一句话总结

SV-TAD 首次提出面向 Vision Transformer 动态剪枝序列的原生稀疏 2D 卷积基元与适配器架构,彻底免除了密集网格重构开销,在保持 SOTA 检测精度的同时将 VideoMAEv2-L 的计算量降低 64%、推理速度提升 2.2 倍。

研究背景与动机

在大规模长视频理解与时序动作检测(Temporal Action Detection, TAD)任务中,输入序列动辄包含数百至数千帧,直接对数十亿参数的视频基础模型(如 VideoMAEv2、InternVideoNext)进行全量微调在显存与算力上均不可承受。近期的参数高效微调(PEFT)方法通过冻结主干网络、插入轻量级卷积适配器(如 ST-Adapter、LoSA、AdaTAD)实现了高效训练。然而,这些适配器主要降低了可训练参数量,在推理时依然必须在全量稠密 token 网格上进行前向计算,计算复杂度随视频序列长度线性甚至二次方膨胀,长视频扩展性问题依然严峻。

动态 Token 剪枝技术(如 EViT、DynamicViT、ToMe)虽然能够基于注意力显著性有效剔除长视频中的冗余背景 token,从而缓解自注意力层的计算瓶颈,但它会打乱并破坏规则的 2D 空间拓扑结构。现有的卷积适配器(包括 FPN 等局部邻域算子)天然依赖网格化的空间排列,若要在剪枝后的 token 序列上应用卷积,传统方案必须执行昂贵的“分散-聚集”(Scatter-Gather)密集网格重构——将保留的稀疏 token 重新填入全零的稠密张量中计算卷积后再提取。这种重构操作不仅导致显存占用与全网格无异,而且填充补零计算和重构调度开销彻底抵消了剪枝带来的加速红利。与此同时,点云领域的 3D 稀疏卷积引擎(如 MinkowskiEngine、Submanifold Sparse Conv)依赖复杂的坐标哈希表管理,无法与 ViT 逐层动态变化的规则 2D Patch 拓扑和紧凑张量格式兼容。

针对这一困境,本文的核心切入点是:2D 局部卷积本质上只需要每个输出位置与其 \(K \times K\) 空间邻域的局部拓扑关联,而并不需要物化整个稠密网格。核心 idea:构建基于静态邻域索引表与定制 CUDA 算子的原生稀疏 2D 卷积基元(SparseConv2D),使轻量级瓶颈适配器能直接在动态剪枝后的不规则 token 集合上无损高效执行,彻底消除稠密重构瓶颈并天然支持多任务辅助 token 监督。

方法详解

整体框架

SV-TAD 建立在冻结的预训练视频 Vision Transformer(如 VideoMAEv2、InternVideoNext)基础之上。整个时序动作检测模型由分阶段的 Token 剪枝模块(Token Selection)、原生稀疏瓶颈适配器(SparseConv2D Adapter)以及下游时序动作定位检测头(ActionFormer)组成。输入由长视频采样帧序列与可学习的任务辅助 token 构成,在浅层阶段保留完整稠密网格以建立鲁棒的底层视觉表征,而在中深层逐步执行注意力引导的动态剪枝,并将剪枝后的稀疏 token 序列直接送入包含稀疏空间卷积与跨注意力机制的适配器中,最终将富集后的特征输入检测头输出动作边界与分类预测。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["长视频帧序列 + 辅助Token Xaux"] --> B["浅层 Transformer 块<br/>前3层标准密集处理"]
    B --> C["注意力引导Token剪枝<br/>保留Nkept个有效视觉Patch并记录网格坐标"]
    C --> D["构建邻域索引表<br/>2步O(Nkept)构建M映射与N邻域表"]
    D --> E["原生稀疏2D卷积<br/>SparseConv2D根据索引直接Gather计算"]
    E --> F["非对称跨注意力机制<br/>Xaux查询稀疏视觉特征更新时序与辅助表征"]
    F --> G["ActionFormer 检测头<br/>输出动作时序区间边界与类别概率"]

关键设计

1. 静态邻域索引表:用 \(O(N_{kept})\) 映射解耦空间卷积与稠密网格物化

为了让标准 \(3 \times 3\) 卷积摆脱对完整空间尺寸 \(H \times W\) 的依赖,作者利用 ViT 空间 patch 坐标本就位于已知离散网格上的先验,为保留的 \(N_{kept}\) 个 token 预先构建邻域索引表 \(\mathbf{N} \in \mathbb{Z}^{N_{kept} \times 9}\)。构建过程仅分两步:首先分配一个大小为 \(H \times W\) 的映射数组 \(\mathbf{M}\) 并初始化为 \(-1\),遍历每个保留 token \(k\),将其在稠密网格中的坐标 \((y_k, x_k)\) 映射为自身在紧凑序列中的索引 \(k\),即 \(\mathbf{M}[y_k, x_k] = k\);随后第二步,对于每个保留 token \(k\),通过向 8 个邻域方向偏移偏移量 \((\delta_y, \delta_x)\) 查表获取邻域位置索引:

\[ \mathbf{N}[k, j] = \begin{cases} \mathbf{M}[y_k + \delta_{y,j}, x_k + \delta_{x,j}], & \text{若邻居在保留集合中} \\ -1, & \text{若邻居已被剪枝或越界} \end{cases} \]

两步均在 CPU 上以 \(O(N_{kept})\) 复杂度完成,耗时不足 3ms,且映射表 \(\mathbf{M}\) 可在同一剪枝阶段内的多个适配器层完全复用。

2. 原生稀疏 2D 卷积算子:多策略定制 CUDA 内核消除内存与调度冗余

传统散焦-聚合方式占用显存高达 \(O(THW \cdot C)\),且计算随视频时长剧烈退化。作者编写了原生 SparseConv2D 的前向与反向 CUDA 内核,根据当前保留 token 索引表直接收集特征并执行矩阵乘法:

\[ \mathbf{y}_k = \sum_{j=1}^{9} \mathbf{W}_j \mathbf{x}[\mathbf{N}[k, j]] \]

式中当 \(\mathbf{N}[k, j] = -1\) 时自动作为零填充处理。内核提供了自适应的双分支执行策略:当通道数较大(\(C_{out} \ge 256\))时,走基于 cuBLAS 的隐式 GEMM 路径以极致发挥 Tensor Core 吞吐;当通道较小时,启用定制分块(Tiled)融合内核,将访存 gather 与计算 GEMM 融合在单次调度内完成。此外,通过分块(chunked)计算机制将显存占用与视频总长度彻底解耦,在 6,144 帧超长输入下显存恒定保持在约 800MB,相比稠密方案实现 87% 的显存压降。

3. 非对称跨注意力与时序特征重组:以微小代价补全帧间时序动态

原生稀疏卷积仅在单帧空间邻域内建立连接,而时序动作定位高度依赖跨帧时序建模。直接实现跨帧 3D 稀疏时序卷积会由于帧间跨步导致访存跨距增大 8 倍,严重破坏 GPU Warp 内存合并与 L2 缓存局部性。为此,作者在瓶颈适配器内部引入非对称跨注意力机制(Cross-Attention):将辅助 token(如 CLS token)作为 Query,降维后的稀疏视觉特征作为 Key 和 Value:

\[ \mathbf{X}'_{aux} = \text{CrossAttn}(\mathbf{X}'_{vis}) \]

该模块仅更新低维辅助 token,计算量微乎其微(仅增加 0.11 TFLOPs),随后借助深层 ViT 自注意力层将全局时序信息反哺广播至所有帧的视觉 token,既完美弥补了空间卷积缺失的时序感知,又彻底避免了稀疏 3D 卷积带来的硬件级性能崩塌。

4. 辅助任务 Token 监督:利用显式拓扑索引扩展细粒度动作定位能力

由于 SV-TAD 显式保留了存活 token 的精确空间几何坐标与原始网格编号,系统天然具备结合细粒度辅助监督(例如人体姿态关节点坐标、热图等)的能力。在计算 token 保留权重时,将辅助任务 token 赋予可学习权重纳入重要性评估,引导剪枝模块偏向保留与关键手部/工具交互强相关的局部 Patch。在装配动作基准 ATTACH 上,无需任何额外的稠密重构流水线即可直接无缝注入关键点监督。

损失函数 / 训练策略

SV-TAD 遵循标准的端到端 TAD 训练框架,适配器参数与 ActionFormer 检测头联合优化,而 ViT 主干完全冻结。检测头损失函数包含用于动作分类的 Focal Loss \(\mathcal{L}_{cls}\) 和用于时序边界回归的 DIoU Loss \(\mathcal{L}_{reg}\)

\[ \mathcal{L} = \mathcal{L}_{cls} + \lambda_{reg} \mathcal{L}_{reg} + \lambda_{aux} \mathcal{L}_{aux} \]

当启用辅助任务(如 ATTACH 数据集上的关键点关节点热图预测)时,追加辅助损失项 \(\mathcal{L}_{aux}\)。训练在单一阶段内完成,初始前几层适配器使用标准稠密 2D 卷积,第 4、8、12、16 层执行剪枝(ViT-L,保留率 \(k_r=0.6\)),后续层自适应切换至 SparseConv2D。

实验关键数据

主实验

在 THUMOS-14 与 ActivityNet-1.3 两个经典基准上,SV-TAD 在大幅压缩算力开销的同时达到或超越了全量稠密适配器(如 AdaTAD、LoSA)的检测精度:

数据集 主干网络 方法 计算量 (TFLOPs)↓ [email protected] (%) 平均 mAP (%)
THUMOS-14 VideoMAEv2-B AdaTAD (CVPR'24) 17.90 74.31 70.67
THUMOS-14 VideoMAEv2-B SV-TAD (本文) 10.29 (-43%) 75.28 72.44 (+1.77)
THUMOS-14 VideoMAEv2-L AdaTAD (CVPR'24) 59.40 76.84 73.50
THUMOS-14 VideoMAEv2-L SV-TAD (本文) 21.25 (-64%) 77.22 73.47
THUMOS-14 InternVideoNext-L SV-TAD (本文) 87.05 78.22 74.13
THUMOS-14 VideoMAEv2-G AdaTAD (CVPR'24) 176.87 77.61 73.87
ActivityNet-1.3 VideoMAEv2-B AdaTAD (CVPR'24) 8.05 56.66 38.31
ActivityNet-1.3 VideoMAEv2-B SV-TAD (本文) 4.75 (-41%) 57.09 38.80 (+0.49)
ActivityNet-1.3 InternVideoNext-L SV-TAD (本文) 34.00 (-59%) 58.79 40.06 (+0.86)

注:在 THUMOS-14 上,SV-TAD InternVideoNext-L 仅需 87.05 TFLOPs 便超过了 AdaTAD 使用十亿级参数 VMAEv2-G 的成绩(176.87 TFLOPs),算力仅为其一半;在相同 InternVideoNext-L 骨干下,SV-TAD(34.0 TFLOPs / 40.06%)相比 AdaTAD(95.3 TFLOPs / 39.72%)显著降低计算量且提高精度。

消融实验

下表展示了不同卷积形式与核心组件对 THUMOS-14 性能的影响,以及在 ATTACH 数据集上辅助监督的收益:

实验类型 模型配置 TFLOPs↓ 平均 mAP (%) 核心说明
卷积类型 (THUMOS-14, VMAE-B) DenseConv1D (带重构) 17.90 69.60 沿时序做 1D 卷积,依赖重构开销大
卷积类型 (THUMOS-14, VMAE-B) DenseConv2D (带重构) 17.90 68.83 空间 2D 稠密卷积,补零冗余计算严重
卷积类型 (THUMOS-14, VMAE-B) SparseConv2D (本文) 10.29 69.35 免除重构,算力锐减,精度反超 Dense2D
模块消融 (THUMOS-14, VMAE-B) SV-TAD (w/o CrossAttn) 10.18 71.80 缺少跨注意力时序重组,时序建模弱化
模块消融 (THUMOS-14, VMAE-B) SV-TAD (完整模型) 10.29 72.44 仅 +0.11 TFLOPs 补齐时序能力,提升 +0.64%
剪枝保留率 \(k_r\) (InternVidNext-L) \(k_r = 0.7\) 87.05 74.13 速度 0.42 vid/s,综合精度最高
剪枝保留率 \(k_r\) (InternVidNext-L) \(k_r = 0.6\) 74.09 73.64 速度 0.50 vid/s,折中平衡
剪枝保留率 \(k_r\) (InternVidNext-L) \(k_r = 0.5\) 60.13 73.00 速度 0.60 vid/s,算力降 31% 精度平缓下降 1.13%
辅助任务 (ATTACH 数据集) SV-TAD 基线 10.29 16.28 纯视觉 token 剪枝与时序动作检测
辅助任务 (ATTACH 数据集) SV-TAD + Kp (关节点辅助) 11.17 18.69 辅助 token 注入位姿引导,mAP 大幅提升 +2.41%

关键发现

  • 显存与计算随层深复合收益递增:在 ViT-L(24 层)上经过 4 次递进剪枝后,有效 token 保留率在深层降至 0.13,大部分网络层处于稀疏算子性能占优的区间(<55% keep rate)。实测推理端到端吞吐提升 2.2 倍(1.57 vid/s vs. 0.73 vid/s),训练显存从 13.30GB 降至 9.23GB(-31%),训练耗时缩短 1.7 倍。
  • 跨注意力以极低开销解决空间卷积的时序盲区:空间稀疏 2D 卷积避免了跨帧显存跳跃,而加入单一 CLS 跨注意力仅需 0.11 TFLOPs 便恢复了全局时序关联,性能相比无 CrossAttn 版本提升 0.64% mAP。
  • 平滑的算力-精度权衡:调节保留率 \(k_r\) 从 0.7 降至 0.5 时,吞吐量从 0.42 提升至 0.60 vid/s(+43%),而平均 mAP 仅轻微下降 1.13%,展现出高度平滑的退化曲线,便于针对实际落地边缘算力灵活伸缩。

亮点与洞察

  • 跳出“稀疏必须建哈希”与“卷积必须填零重构”的双重思维定势:作者指出 ViT 剪枝 token 依然处于固定 2D Patch 网格上,不需要复杂的 3D 稀疏哈希引擎,仅需一张预计算且可多层复用的轻量映射表即可用紧凑张量完成邻域 Gather,思路极其精巧。
  • 非对称时序交互设计巧妙规避硬件陷阱:在视频中直接做 3D 稀疏卷积会破坏 GPU Warp 内存合并,作者改用空间稀疏 2D 卷积捕捉画面细节,辅以轻量跨注意力完成时序信息汇总,兼顾算法表达力与硬件访存效率。
  • 通用可复用性极强:该原生稀疏 2D 卷积算子不仅可用于 TAD,还能无缝拓展至任何在 Token Selection 之后需要局部空间卷积的 ViT 视觉下游任务(如 FPN、多尺度特征适配器、密集预测头等)。

局限与展望

  • 平台依赖性与跨硬件优化:当前高性能实现针对 NVIDIA GPU 的 CUDA/Tensor Core 进行了深度微调,在 AMD ROCm、Apple Silicon 或移动端 NPU 上的跨平台迁移需要重构对应的底层底层算子。
  • 剪枝率调度策略偏启发式:目前的剪枝阶段与保留率采用等距固定配置(如 4, 8, 12, 16 层,固定 \(k_r\)),未来若能引入内容自适应、动态可学习的自调节 Token 剪枝机制,有望在简单背景片段实现更高压缩比。
  • 更宽广的局部时空联合建模:当前空间稀疏卷积与跨注意力时序交互在结构上解耦,探索既能保持高缓存命中率又能原生捕捉局部时空 3D 轨迹的稀疏图卷积基元是值得深入的方向。

相关工作与启发

  • vs. AdaTAD (CVPR 2024):AdaTAD 提出参数高效的 1D 时序卷积适配器,但在推理时必须全量计算所有网格与帧;SV-TAD 引入动态 Token 剪枝与原生稀疏卷积,在相同 VideoMAEv2-L 主干下减少了 64% 的 TFLOPs 并实现 2.2 倍实际推理加速。
  • vs. LoSA (WACV 2025):LoSA 虽扩展到 VMAEv2-G,但在超大模型上精度饱和且依然维持稠密计算;SV-TAD 凭借 InternVideoNext-L 搭配稀疏适配器,以不到 LoSA 一半的算力取得了全面领先的检测精度。
  • vs. MinkowskiEngine / Submanifold Sparse Conv:传统 3D 稀疏引擎采用通用的 COO/哈希表机制,坐标检索与内存往返开销巨大,无法适应 ViT 紧凑稠密张量流;SV-TAD 专为 2D Patch 拓扑设计两步 \(O(N_{kept})\) 索引表,实现了真正的轻量无缝嵌合。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出专为 ViT 剪枝 token 打造的原生稀疏 2D 卷积与时空解耦适配器,攻克了长视频理解中适配器无法享受剪枝红利的长期瓶颈。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 THUMOS-14、ActivityNet-1.3 和 ATTACH 三大基准,进行了严格的算力对齐比较、不同卷积形式的细粒度消融以及底层 CUDA 核函数基准测试。
  • 写作质量: ⭐⭐⭐⭐⭐ 痛点刻画极为敏锐准确,方法动机与软硬件协同设计逻辑自洽,图表信息量极其丰富。
  • 价值: ⭐⭐⭐⭐⭐ 为长视频大模型的高效落地提供了崭新的底层算子基础设施,发布的独立 PyTorch 稀疏算子库极具实用价值。