跳转至

DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4843
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7683.pdf
代码: https://github.com/laychou666/DASH
领域: VLM效率 / 全模态大模型
关键词: Token压缩、动态语义分块、音频边界、三信号融合、音视频理解

一句话总结

DASH把音频相邻表征的突变作为语义分块线索,再用边界、表征独特性和注意力共同决定保留哪些Token,使Qwen2.5-Omni-7B在25%目标保留率下达到WorldSense 44.9%准确率,以14.9T FLOPs超过35%保留率的OmniZip的44.7%和21.4T FLOPs。

研究背景与动机

全模态大模型把音频、视频和文本送入同一个语言模型,单段视频可能产生数万个Token。即使不重新训练模型,也可以通过剪枝减少预填充阶段的注意力计算与后续KV缓存负担。然而,压缩并不是简单地挑出最高注意力的若干Token:一次说话人变化、一句解释结束或一个动作开始,可能只占很少的Token,却决定了前后事件如何衔接。

OmniZip已经让音频参与视频压缩,并通过交错的空间与时间压缩利用两类冗余;DASH指出,其固定分组仍可能把一个完整语义单元切开。论文给出的静态分组例子是每组50个音频Token、4帧视频。这种固定粒度不随内容变化,而注意力又高度集中在少量位置,因而“低注意力但连接前后叙事”的Token容易在强压缩下消失。真正需要改进的是分组边界和保留依据,而不只是继续调低压缩率。

音频的停顿、话题变化和说话人切换常表现为相邻嵌入的相似度下降,因此可以低成本提供结构线索。不过,声音变化不必与画面切换同时发生,不能把音频边界直接当作真实视觉切镜。核心idea:让音频定义可变长度的语义单元,以软时间先验组织视频,并把结构重要性、内容表征和模型注意力联合用于Token保留。

方法详解

整体框架

DASH位于模态编码器与LLM之间,不新增可学习参数。输入是编码后的音频序列和视频序列,输出是供LLM推理的压缩音视频Token;文本不是本文的压缩对象。首先由音频检测动态语义边界,再把边界投影到视频时间轴并清理过短分段;音频三信号融合产生保留掩码,其分段保留比例进一步控制视频压缩强度。

这里有两种不同的“音频引导”:边界决定视频在哪里分组,保留比例决定各组压缩多狠。最终哪些视频Token留下,仍由视觉特征的空间密度和跨帧相似度决定,而不是直接照搬音频掩码。每个分段都从原始编码器嵌入独立压缩,不会拿前面已经压缩过的输出递归决定后面的边界。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["音频与视频编码特征"] --> Chunk["动态语义分块"]
    Chunk --> Map["音频引导视频分段"]
    Map --> Score["三信号融合评分"]
    Score --> Video["边界感知视频压缩"]
    Input -->|原始视觉特征| Video
    Score -->|保留的音频Token| Output["压缩音视频Token<br/>送入LLM"]
    Video --> Output

关键设计

1. 动态语义分块:用表征突变找边界,而非按固定长度截断

对于音频Token \(a_t\),DASH计算它与前一个Token的余弦相似度。只有相似度低于阈值 \(\tau_a=0.4\),且距离上一个边界至少 \(C_{\min}=30\) 个Token时,才接受新的边界。下面把原文公式(1)、(3)的条件按可读形式整理;\(t_{\mathrm{last}}\) 表示最近一次已接受的边界位置:

\[ \mathrm{sim}_t=\frac{\langle a_{t-1},a_t\rangle}{\|a_{t-1}\|\,\|a_t\|}, \qquad m_t^{\mathrm{boundary}}= \mathbf{1}[\mathrm{sim}_t<0.4]\, \mathbf{1}[t-t_{\mathrm{last}}\geq 30]. \]

首个Token始终作为边界,其边界概率设为1。30个Token在论文设置下约为1秒音频,这个下限防止轻微噪声把序列切成只有2至3个Token的小块。它同时意味着边界检测不是任意精细的:非常短的事件即使发生明显表征变化,也可能因为间距不足而被并入当前块。动态分块追求的是适合压缩的连贯单元,并非高精度语音或事件分割标签。

除了二值边界掩码,DASH还保留连续的边界概率,表示相邻表征有多不相似。它既用于后续评分,也用于比较两个过近的候选边界哪个更值得保留。缓存的公式(2)存在符号缺失,本笔记不补写其精确裁剪表达式;可确认的是该值位于 \([0,1]\),且相似度越低,边界概率越高。这样可以解释后续机制,但不足以替代复现时对原始公式的核验。

2. 音频引导视频分段:投影的是结构先验,不是真实切镜标签

设音频与视频总Token数分别为 \(N_a,N_v\),音频边界位置为 \(b_i^a\),DASH按两条序列的相对时间位置投影边界。原文公式(4)的核心映射为:

\[ b_i^v=\left\lfloor b_i^a\frac{N_v}{N_a}\right\rfloor. \]

映射后要去重、排序、裁剪到 \([0,N_v]\),并强制加入起点0和终点 \(N_v\)。因为视频每帧有 \(K\) 个Token,后续交错空间时间压缩至少需要两帧,即每段至少 \(2K\) 个Token。直接投影可能产生太短的段,因此DASH把内部候选边界按音频边界概率从高到低排序,从只含首尾边界的集合开始逐个插入;只有插入后左右两段都至少为 \(2K\),该边界才被接受。

这个贪心过程解决的是两个限制之间的冲突:语义线索希望在变化处切分,但压缩器需要足够长的上下文比较冗余。优先保留强边界比随意丢掉一个边界更合理,不过它仍是启发式筛选,没有证明全局最优。音视频时间共注册是映射成立的前提,而对白持续、画面快速切换的场景仍可能缺少合适的音频边界;最终保留掩码需要视觉特征来纠偏。

3. 三信号融合评分:不给稀疏注意力独占保留名额

音频保留分数包含三项。边界项把边界概率按最大值归一化,强调内容转折;注意力项来自音频编码器,同样归一化,表示模型本来关注的位置;作者称为“独特性”的第三项,则试图从表征分布中补充信息。三者的默认权重是0.4、0.3、0.3,融合后按分数选择Top-K,而不是把三个候选集合简单取并集。

\[ s_t=0.4\,s_t^{\mathrm{bnd}}+0.3\,s_t^{\mathrm{uniq}}+0.3\,s_t^{\mathrm{attn}}, \qquad N_{\mathrm{keep}}=\left\lfloor(1-\rho_a)N_a\right\rfloor. \]

这里 \(\rho_a\) 表示音频压缩比例,因此 \(1-\rho_a\) 才是保留率。原文整体叙述强调分段内比较,但公式(10)后的Top-K预算使用总音频Token数 \(N_a\);正文没有完整给出逐段整数预算的分配规则,不能据此补出“每段固定保留25%”的实现。后续视频预算恰恰利用各段音频实际保留率的差异。极短序列无法提供边界信息时,作者规定退回纯注意力选择。

“独特性”计算先统计各特征通道的方差,保留方差最低的一半通道,再做 \(\ell_2\) 归一化并计算全局中心。其多尺度高斯带宽集合为 \(\{0.125,0.25,0.5,1.0,2.0\}\),目的在于避免单一尺度或硬距离阈值过于敏感。低方差筛选对应作者“稳定语义维度比瞬态噪声更可靠”的假设,不是通过额外监督学习得到的通道重要性。

必须保留一个复现疑点:缓存公式(7)使用Token到全局中心的高斯相似度,而公式(8)又出现不完整的变量对应关系;如果只是把中心相似度直接归一化,高分代表更接近中心,并不自然等于更独特。因此这里不擅自添加取反、倒数或距离峰值因子。图1还标出“跨模态上下文合并”,但正文方法没有足够的独立定义,不能凭示意图补造其检索或合并算法。图文能够明确支持的核心仍是三信号评分与音频引导的视频压缩。

4. 边界感知视频压缩:用音频保留率分配预算,用视觉特征做选择

对每个视频段,DASH统计对应音频区间中被三信号评分保留下来的Token比例,把它作为信息密度代理。在基础视频压缩率上,加上 \(\lambda_r=0.1\) 乘以“0.5减去该段音频保留率”的修正:音频保留越多,视频压缩越轻;音频保留越少,视频压缩越重。这里是有限幅度的预算调节,不代表有声片段就完全不能压缩,也不代表静音一定没有视觉信息。

投影边界附近的帧还会得到温和的额外保留,避免恰好删掉过渡上下文。缓存公式(12)有缺失因子,本笔记只保留正文可以确认的方向,不捏造保护系数。随后沿用OmniZip的ISTC:偶数帧依据DPC-KNN进行空间剪枝,减少局部高密度的冗余Token;奇数帧依据与前一帧的相似度进行时间剪枝,减少重复画面信息。也就是说,新增部分主要在于“如何分段、给多少预算”,基础的视觉冗余压缩器并不是DASH重新提出的。

一个完整示例

以一段“人物连续解释操作,停顿后切换到下一步骤”的音视频为概念示例,不把它当作论文实测样本。连续解释期间,相邻音频表征较相似,可以形成一个长块;停顿处若余弦相似度低于0.4且距离上次边界至少30个Token,就产生新边界。该位置再按音视频Token总数比例投影到视频,只有两侧都满足两帧下限时才保留分割。

三信号评分随后允许低注意力的转折Token凭借边界项进入保留集合;如果解释密集的一段保留了更多音频Token,该视频段也会得到较轻的压缩。最后,静态背景通过空间或跨帧相似性被去冗余,过渡附近的视觉上下文获得适度保护。这个例子说明各机制如何协同,不假设每次停顿都发生切镜,也不虚构最终保留Token数。

损失函数 / 训练策略

DASH无需训练,没有新增损失函数、训练数据或可学习参数。实验基座为Qwen2.5-Omni-7B与3B,硬件为NVIDIA H20 96GB,使用FlashAttention、确定性解码和基于规则的多选答案解析。VideoMME最多输入768帧,其他数据集最多128帧;实现描述中每个时间窗口含50个音频Token和288个视频Token,不能把窗口Token数直接当作前述单帧 \(K\)

25%和35%是目标保留率,实际样本会因音视频比例、分段约束及内容复杂度而偏离。论文称边界检测与三信号评分额外开销小于40 ms,但未给出完整的输入长度分布或延迟方差;因此不能把这一数字当作任意长度输入的固定成本。

实验关键数据

主实验

下表选取原文表1、表2中的完整模型、OmniZip和DASH。AVUT、VideoMME和WorldSense列均为准确率百分数;AVUT保留原表的Avg.,不自行对六个子任务重算。VideoMME对应原表的“wo”列。AVUT/VideoMME FLOPs比例与WorldSense绝对FLOPs分列,避免混淆口径;后者只计算音视频多模态Token。

模型 方法 目标保留率 AVUT/VideoMME FLOPs比例 AVUT Avg. VideoMME wo WorldSense Avg. WorldSense FLOPs (T)
7B Full Tokens 100% 100% 64.5 66.0 46.8 73.2
7B OmniZip 35% 29% 60.6 66.0 44.7 21.4
7B DASH 35% 29% 61.5 66.7 未报告 未报告
7B DASH 25% 20% 60.9 66.0 44.9 14.9
3B Full Tokens 100% 100% 62.2 62.6 46.4 37.4
3B OmniZip 35% 26% 58.7 61.9 44.1 9.9
3B DASH 35% 26% 59.9 62.6 未报告 未报告
3B DASH 25% 18% 58.8 61.7 44.6 6.7

“未报告”表示原文表2没有该配置的条目,不从曲线估算。7B的DASH 25%相对OmniZip 35%,在WorldSense提高0.2个百分点,同时FLOPs约减少30.4%;3B提高0.5个百分点,FLOPs约减少32.3%。但相对Full Tokens,DASH的WorldSense仍分别低1.9和1.8个百分点,不能称为全面无损压缩。3B的VideoMME在25%保留率下也低于OmniZip 0.2个百分点。

原文表3的效率结果如下,加速倍数均相对同规模Full Tokens;并非剩余时间比例。DASH使用25%目标保留率,OmniZip使用35%。

模型 方法 显存(原表G) 预填充加速 端到端加速 WorldSense准确率
7B Full Tokens 35 1.0× 1.0× 46.8
7B OmniZip 25 3.4× 1.4× 44.7
7B DASH 26 3.5× 1.7× 44.9
3B Full Tokens 25 1.0× 1.0× 46.4
3B OmniZip 16 3.3× 1.3× 44.1
3B DASH 16 3.8× 1.4× 44.6

最高3.8倍预填充加速来自3B,最高1.7倍端到端加速来自7B,不能拼成同一配置的结果。7B的DASH显存还比OmniZip高1G,说明更少Token并不保证所有资源指标都单调改善。

消融实验

下表合并原文表4、表5,全部在WorldSense、Qwen2.5-Omni-3B上评测。TSF为三信号融合,DSC为动态语义分块,ADVS为音频引导视频分段;除参照OmniZip为35%外,其余均为25%目标保留率。

分析 配置 目标保留率 准确率(%)
参照 OmniZip 35% 44.1
组件 Static + TSF 25% 44.4
组件 DSC + ADVS,纯注意力选择 25% 44.4
组件 Full DASH 25% 44.6
边界算法 Random 25% 43.8
边界算法 Dot Product 25% 43.6
边界算法 Change Rate 25% 44.0
边界算法 Cosine 25% 44.6

完整DASH相对两个部分配置均提高0.2个百分点,支持分块与融合具有互补性,但不能把相对44.1的提升解释为同保留率的单模块净收益,因为该参照是35%。表4也没有提供25%保留率下静态分组加纯注意力的数值,不补造这一缺失基线。

关键发现

  • 边界度量确实影响结果:余弦相似度比点积高1.0个百分点,比随机边界高0.8个百分点;尺度归一化是一个合理解释,但实验没有直接标注边界正确率。
  • 图4报告边界权重 \(w_b\) 在0.3至0.5间较稳定,0.4最佳,超过0.5退化;图中没有完整数值表,因此不插值编写各权重准确率。
  • 图2中,融合与纯注意力共同选中866个Token,另替换631个;\(631/(631+866)\) 约为42.2%。这是该可视化的选择差异,不是所有样本平均改善率,也不是准确率增益。

亮点与洞察

  • 压缩的对象不仅是重复内容,还有时间结构。把边界保护与Token显著性拆开后,模型可以保留“解释前后关系”的位置,而不是只保留最醒目的实体。
  • 同一种模态可以同时提供分组先验与预算先验,但不必决定另一模态的最终选择。这种分工保留了视觉剪枝器对错位音频线索的纠偏空间。
  • 最有价值的证据是低保留率下的准确率与算力折中,而不是绝对超过完整模型。对部署而言,这比只展示一个更高的理论压缩率更有参考价值。

局限与展望

  • 作者明确不假设音视频边界完全一致,且保留率会偏离目标值。静音动作、配乐、画外音或音画错位是否破坏这一先验,正文没有针对性压力测试;这些是需要补充的评估,不是已证实失败案例。
  • 只有同一Qwen2.5-Omni家族的3B和7B实验,不能据此声称跨架构、跨编码器普适。实验采用多选问答,对自由生成、细粒度时间定位和流式推理的收益尚不明确。
  • 部分配置仅有0.2个百分点的增益,未报告重复运行方差或置信区间。论文复现OmniZip与DASH,Random、FastV和DyCoke则引用OmniZip结果,比较并非全部由同一套实验重跑。
  • 全局中心式“独特性”、逐段Top-K预算和图示上下文合并的具体定义仍需核对;缓存中的缺损公式又进一步限制了精确复现。可优先补充同预算的单信号消融、音画错位实验和精确实际保留率统计,而不是仅扩大主结果表。

相关工作与启发

  • 对比OmniZip:DASH沿用音频引导压缩与ISTC,新增重点是动态分块、软时间投影和三信号评分。它是对既有压缩流水线的结构化增强,不是从零提出整个音视频压缩器。
  • 对比H-Net:H-Net学习动态分块路由;DASH借鉴相邻表征余弦变化这一线索,在已有音频编码特征上无需训练地检测边界,并把它投影到视频。
  • 对比FastV与DyCoke:前者主要利用LLM层内注意力,后者强调视频时间压缩;本研究中的全模态适配用于说明跨模态结构的价值,不能代表这些方法在各自原始任务上的总体优劣。
  • 可迁移方向:长视频检索或流式多模态助手可尝试内容驱动的分块和边界保留,但需先处理在线边界确认、全局中心计算与音画延迟,不能直接把当前离线策略称作流式方案。

评分

  • 新颖性:4/5。把语义分块、跨模态软先验和多信号评分联成实用方案,但基础压缩器与动态路由线索来自既有工作。
  • 实验充分度:3/5。覆盖三个基准、两种模型规模和组件消融,但缺少跨家族验证、同预算完整基线与统计不确定性。
  • 写作质量:3/5。主线易理解,部分图示模块和评分定义不够闭合;本地公式抽取损坏另行限制了核验精度。
  • 价值:4/5。无需训练且给出真实延迟收益,对音视频推理部署有价值,但不是所有任务都无损,也不是所有资源指标都优于OmniZip。