DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression¶
会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/4843
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/7683.pdf
代码: https://github.com/laychou666/DASH
领域: VLM效率 / 全模态大模型
关键词: Token压缩、动态语义分块、音频边界、三信号融合、音视频理解
一句话总结¶
DASH把音频相邻表征的突变作为语义分块线索,再用边界、表征独特性和注意力共同决定保留哪些Token,使Qwen2.5-Omni-7B在25%目标保留率下达到WorldSense 44.9%准确率,以14.9T FLOPs超过35%保留率的OmniZip的44.7%和21.4T FLOPs。
研究背景与动机¶
全模态大模型把音频、视频和文本送入同一个语言模型,单段视频可能产生数万个Token。即使不重新训练模型,也可以通过剪枝减少预填充阶段的注意力计算与后续KV缓存负担。然而,压缩并不是简单地挑出最高注意力的若干Token:一次说话人变化、一句解释结束或一个动作开始,可能只占很少的Token,却决定了前后事件如何衔接。
OmniZip已经让音频参与视频压缩,并通过交错的空间与时间压缩利用两类冗余;DASH指出,其固定分组仍可能把一个完整语义单元切开。论文给出的静态分组例子是每组50个音频Token、4帧视频。这种固定粒度不随内容变化,而注意力又高度集中在少量位置,因而“低注意力但连接前后叙事”的Token容易在强压缩下消失。真正需要改进的是分组边界和保留依据,而不只是继续调低压缩率。
音频的停顿、话题变化和说话人切换常表现为相邻嵌入的相似度下降,因此可以低成本提供结构线索。不过,声音变化不必与画面切换同时发生,不能把音频边界直接当作真实视觉切镜。核心idea:让音频定义可变长度的语义单元,以软时间先验组织视频,并把结构重要性、内容表征和模型注意力联合用于Token保留。
方法详解¶
整体框架¶
DASH位于模态编码器与LLM之间,不新增可学习参数。输入是编码后的音频序列和视频序列,输出是供LLM推理的压缩音视频Token;文本不是本文的压缩对象。首先由音频检测动态语义边界,再把边界投影到视频时间轴并清理过短分段;音频三信号融合产生保留掩码,其分段保留比例进一步控制视频压缩强度。
这里有两种不同的“音频引导”:边界决定视频在哪里分组,保留比例决定各组压缩多狠。最终哪些视频Token留下,仍由视觉特征的空间密度和跨帧相似度决定,而不是直接照搬音频掩码。每个分段都从原始编码器嵌入独立压缩,不会拿前面已经压缩过的输出递归决定后面的边界。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["音频与视频编码特征"] --> Chunk["动态语义分块"]
Chunk --> Map["音频引导视频分段"]
Map --> Score["三信号融合评分"]
Score --> Video["边界感知视频压缩"]
Input -->|原始视觉特征| Video
Score -->|保留的音频Token| Output["压缩音视频Token<br/>送入LLM"]
Video --> Output
关键设计¶
1. 动态语义分块:用表征突变找边界,而非按固定长度截断
对于音频Token \(a_t\),DASH计算它与前一个Token的余弦相似度。只有相似度低于阈值 \(\tau_a=0.4\),且距离上一个边界至少 \(C_{\min}=30\) 个Token时,才接受新的边界。下面把原文公式(1)、(3)的条件按可读形式整理;\(t_{\mathrm{last}}\) 表示最近一次已接受的边界位置:
首个Token始终作为边界,其边界概率设为1。30个Token在论文设置下约为1秒音频,这个下限防止轻微噪声把序列切成只有2至3个Token的小块。它同时意味着边界检测不是任意精细的:非常短的事件即使发生明显表征变化,也可能因为间距不足而被并入当前块。动态分块追求的是适合压缩的连贯单元,并非高精度语音或事件分割标签。
除了二值边界掩码,DASH还保留连续的边界概率,表示相邻表征有多不相似。它既用于后续评分,也用于比较两个过近的候选边界哪个更值得保留。缓存的公式(2)存在符号缺失,本笔记不补写其精确裁剪表达式;可确认的是该值位于 \([0,1]\),且相似度越低,边界概率越高。这样可以解释后续机制,但不足以替代复现时对原始公式的核验。
2. 音频引导视频分段:投影的是结构先验,不是真实切镜标签
设音频与视频总Token数分别为 \(N_a,N_v\),音频边界位置为 \(b_i^a\),DASH按两条序列的相对时间位置投影边界。原文公式(4)的核心映射为:
映射后要去重、排序、裁剪到 \([0,N_v]\),并强制加入起点0和终点 \(N_v\)。因为视频每帧有 \(K\) 个Token,后续交错空间时间压缩至少需要两帧,即每段至少 \(2K\) 个Token。直接投影可能产生太短的段,因此DASH把内部候选边界按音频边界概率从高到低排序,从只含首尾边界的集合开始逐个插入;只有插入后左右两段都至少为 \(2K\),该边界才被接受。
这个贪心过程解决的是两个限制之间的冲突:语义线索希望在变化处切分,但压缩器需要足够长的上下文比较冗余。优先保留强边界比随意丢掉一个边界更合理,不过它仍是启发式筛选,没有证明全局最优。音视频时间共注册是映射成立的前提,而对白持续、画面快速切换的场景仍可能缺少合适的音频边界;最终保留掩码需要视觉特征来纠偏。
3. 三信号融合评分:不给稀疏注意力独占保留名额
音频保留分数包含三项。边界项把边界概率按最大值归一化,强调内容转折;注意力项来自音频编码器,同样归一化,表示模型本来关注的位置;作者称为“独特性”的第三项,则试图从表征分布中补充信息。三者的默认权重是0.4、0.3、0.3,融合后按分数选择Top-K,而不是把三个候选集合简单取并集。
这里 \(\rho_a\) 表示音频压缩比例,因此 \(1-\rho_a\) 才是保留率。原文整体叙述强调分段内比较,但公式(10)后的Top-K预算使用总音频Token数 \(N_a\);正文没有完整给出逐段整数预算的分配规则,不能据此补出“每段固定保留25%”的实现。后续视频预算恰恰利用各段音频实际保留率的差异。极短序列无法提供边界信息时,作者规定退回纯注意力选择。
“独特性”计算先统计各特征通道的方差,保留方差最低的一半通道,再做 \(\ell_2\) 归一化并计算全局中心。其多尺度高斯带宽集合为 \(\{0.125,0.25,0.5,1.0,2.0\}\),目的在于避免单一尺度或硬距离阈值过于敏感。低方差筛选对应作者“稳定语义维度比瞬态噪声更可靠”的假设,不是通过额外监督学习得到的通道重要性。
必须保留一个复现疑点:缓存公式(7)使用Token到全局中心的高斯相似度,而公式(8)又出现不完整的变量对应关系;如果只是把中心相似度直接归一化,高分代表更接近中心,并不自然等于更独特。因此这里不擅自添加取反、倒数或距离峰值因子。图1还标出“跨模态上下文合并”,但正文方法没有足够的独立定义,不能凭示意图补造其检索或合并算法。图文能够明确支持的核心仍是三信号评分与音频引导的视频压缩。
4. 边界感知视频压缩:用音频保留率分配预算,用视觉特征做选择
对每个视频段,DASH统计对应音频区间中被三信号评分保留下来的Token比例,把它作为信息密度代理。在基础视频压缩率上,加上 \(\lambda_r=0.1\) 乘以“0.5减去该段音频保留率”的修正:音频保留越多,视频压缩越轻;音频保留越少,视频压缩越重。这里是有限幅度的预算调节,不代表有声片段就完全不能压缩,也不代表静音一定没有视觉信息。
投影边界附近的帧还会得到温和的额外保留,避免恰好删掉过渡上下文。缓存公式(12)有缺失因子,本笔记只保留正文可以确认的方向,不捏造保护系数。随后沿用OmniZip的ISTC:偶数帧依据DPC-KNN进行空间剪枝,减少局部高密度的冗余Token;奇数帧依据与前一帧的相似度进行时间剪枝,减少重复画面信息。也就是说,新增部分主要在于“如何分段、给多少预算”,基础的视觉冗余压缩器并不是DASH重新提出的。
一个完整示例¶
以一段“人物连续解释操作,停顿后切换到下一步骤”的音视频为概念示例,不把它当作论文实测样本。连续解释期间,相邻音频表征较相似,可以形成一个长块;停顿处若余弦相似度低于0.4且距离上次边界至少30个Token,就产生新边界。该位置再按音视频Token总数比例投影到视频,只有两侧都满足两帧下限时才保留分割。
三信号评分随后允许低注意力的转折Token凭借边界项进入保留集合;如果解释密集的一段保留了更多音频Token,该视频段也会得到较轻的压缩。最后,静态背景通过空间或跨帧相似性被去冗余,过渡附近的视觉上下文获得适度保护。这个例子说明各机制如何协同,不假设每次停顿都发生切镜,也不虚构最终保留Token数。
损失函数 / 训练策略¶
DASH无需训练,没有新增损失函数、训练数据或可学习参数。实验基座为Qwen2.5-Omni-7B与3B,硬件为NVIDIA H20 96GB,使用FlashAttention、确定性解码和基于规则的多选答案解析。VideoMME最多输入768帧,其他数据集最多128帧;实现描述中每个时间窗口含50个音频Token和288个视频Token,不能把窗口Token数直接当作前述单帧 \(K\)。
25%和35%是目标保留率,实际样本会因音视频比例、分段约束及内容复杂度而偏离。论文称边界检测与三信号评分额外开销小于40 ms,但未给出完整的输入长度分布或延迟方差;因此不能把这一数字当作任意长度输入的固定成本。
实验关键数据¶
主实验¶
下表选取原文表1、表2中的完整模型、OmniZip和DASH。AVUT、VideoMME和WorldSense列均为准确率百分数;AVUT保留原表的Avg.,不自行对六个子任务重算。VideoMME对应原表的“wo”列。AVUT/VideoMME FLOPs比例与WorldSense绝对FLOPs分列,避免混淆口径;后者只计算音视频多模态Token。
| 模型 | 方法 | 目标保留率 | AVUT/VideoMME FLOPs比例 | AVUT Avg. | VideoMME wo | WorldSense Avg. | WorldSense FLOPs (T) |
|---|---|---|---|---|---|---|---|
| 7B | Full Tokens | 100% | 100% | 64.5 | 66.0 | 46.8 | 73.2 |
| 7B | OmniZip | 35% | 29% | 60.6 | 66.0 | 44.7 | 21.4 |
| 7B | DASH | 35% | 29% | 61.5 | 66.7 | 未报告 | 未报告 |
| 7B | DASH | 25% | 20% | 60.9 | 66.0 | 44.9 | 14.9 |
| 3B | Full Tokens | 100% | 100% | 62.2 | 62.6 | 46.4 | 37.4 |
| 3B | OmniZip | 35% | 26% | 58.7 | 61.9 | 44.1 | 9.9 |
| 3B | DASH | 35% | 26% | 59.9 | 62.6 | 未报告 | 未报告 |
| 3B | DASH | 25% | 18% | 58.8 | 61.7 | 44.6 | 6.7 |
“未报告”表示原文表2没有该配置的条目,不从曲线估算。7B的DASH 25%相对OmniZip 35%,在WorldSense提高0.2个百分点,同时FLOPs约减少30.4%;3B提高0.5个百分点,FLOPs约减少32.3%。但相对Full Tokens,DASH的WorldSense仍分别低1.9和1.8个百分点,不能称为全面无损压缩。3B的VideoMME在25%保留率下也低于OmniZip 0.2个百分点。
原文表3的效率结果如下,加速倍数均相对同规模Full Tokens;并非剩余时间比例。DASH使用25%目标保留率,OmniZip使用35%。
| 模型 | 方法 | 显存(原表G) | 预填充加速 | 端到端加速 | WorldSense准确率 |
|---|---|---|---|---|---|
| 7B | Full Tokens | 35 | 1.0× | 1.0× | 46.8 |
| 7B | OmniZip | 25 | 3.4× | 1.4× | 44.7 |
| 7B | DASH | 26 | 3.5× | 1.7× | 44.9 |
| 3B | Full Tokens | 25 | 1.0× | 1.0× | 46.4 |
| 3B | OmniZip | 16 | 3.3× | 1.3× | 44.1 |
| 3B | DASH | 16 | 3.8× | 1.4× | 44.6 |
最高3.8倍预填充加速来自3B,最高1.7倍端到端加速来自7B,不能拼成同一配置的结果。7B的DASH显存还比OmniZip高1G,说明更少Token并不保证所有资源指标都单调改善。
消融实验¶
下表合并原文表4、表5,全部在WorldSense、Qwen2.5-Omni-3B上评测。TSF为三信号融合,DSC为动态语义分块,ADVS为音频引导视频分段;除参照OmniZip为35%外,其余均为25%目标保留率。
| 分析 | 配置 | 目标保留率 | 准确率(%) |
|---|---|---|---|
| 参照 | OmniZip | 35% | 44.1 |
| 组件 | Static + TSF | 25% | 44.4 |
| 组件 | DSC + ADVS,纯注意力选择 | 25% | 44.4 |
| 组件 | Full DASH | 25% | 44.6 |
| 边界算法 | Random | 25% | 43.8 |
| 边界算法 | Dot Product | 25% | 43.6 |
| 边界算法 | Change Rate | 25% | 44.0 |
| 边界算法 | Cosine | 25% | 44.6 |
完整DASH相对两个部分配置均提高0.2个百分点,支持分块与融合具有互补性,但不能把相对44.1的提升解释为同保留率的单模块净收益,因为该参照是35%。表4也没有提供25%保留率下静态分组加纯注意力的数值,不补造这一缺失基线。
关键发现¶
- 边界度量确实影响结果:余弦相似度比点积高1.0个百分点,比随机边界高0.8个百分点;尺度归一化是一个合理解释,但实验没有直接标注边界正确率。
- 图4报告边界权重 \(w_b\) 在0.3至0.5间较稳定,0.4最佳,超过0.5退化;图中没有完整数值表,因此不插值编写各权重准确率。
- 图2中,融合与纯注意力共同选中866个Token,另替换631个;\(631/(631+866)\) 约为42.2%。这是该可视化的选择差异,不是所有样本平均改善率,也不是准确率增益。
亮点与洞察¶
- 压缩的对象不仅是重复内容,还有时间结构。把边界保护与Token显著性拆开后,模型可以保留“解释前后关系”的位置,而不是只保留最醒目的实体。
- 同一种模态可以同时提供分组先验与预算先验,但不必决定另一模态的最终选择。这种分工保留了视觉剪枝器对错位音频线索的纠偏空间。
- 最有价值的证据是低保留率下的准确率与算力折中,而不是绝对超过完整模型。对部署而言,这比只展示一个更高的理论压缩率更有参考价值。
局限与展望¶
- 作者明确不假设音视频边界完全一致,且保留率会偏离目标值。静音动作、配乐、画外音或音画错位是否破坏这一先验,正文没有针对性压力测试;这些是需要补充的评估,不是已证实失败案例。
- 只有同一Qwen2.5-Omni家族的3B和7B实验,不能据此声称跨架构、跨编码器普适。实验采用多选问答,对自由生成、细粒度时间定位和流式推理的收益尚不明确。
- 部分配置仅有0.2个百分点的增益,未报告重复运行方差或置信区间。论文复现OmniZip与DASH,Random、FastV和DyCoke则引用OmniZip结果,比较并非全部由同一套实验重跑。
- 全局中心式“独特性”、逐段Top-K预算和图示上下文合并的具体定义仍需核对;缓存中的缺损公式又进一步限制了精确复现。可优先补充同预算的单信号消融、音画错位实验和精确实际保留率统计,而不是仅扩大主结果表。
相关工作与启发¶
- 对比OmniZip:DASH沿用音频引导压缩与ISTC,新增重点是动态分块、软时间投影和三信号评分。它是对既有压缩流水线的结构化增强,不是从零提出整个音视频压缩器。
- 对比H-Net:H-Net学习动态分块路由;DASH借鉴相邻表征余弦变化这一线索,在已有音频编码特征上无需训练地检测边界,并把它投影到视频。
- 对比FastV与DyCoke:前者主要利用LLM层内注意力,后者强调视频时间压缩;本研究中的全模态适配用于说明跨模态结构的价值,不能代表这些方法在各自原始任务上的总体优劣。
- 可迁移方向:长视频检索或流式多模态助手可尝试内容驱动的分块和边界保留,但需先处理在线边界确认、全局中心计算与音画延迟,不能直接把当前离线策略称作流式方案。
评分¶
- 新颖性:4/5。把语义分块、跨模态软先验和多信号评分联成实用方案,但基础压缩器与动态路由线索来自既有工作。
- 实验充分度:3/5。覆盖三个基准、两种模型规模和组件消融,但缺少跨家族验证、同预算完整基线与统计不确定性。
- 写作质量:3/5。主线易理解,部分图示模块和评分定义不够闭合;本地公式抽取损坏另行限制了核验精度。
- 价值:4/5。无需训练且给出真实延迟收益,对音视频推理部署有价值,但不是所有任务都无损,也不是所有资源指标都优于OmniZip。