跳转至

Distribution-Alignment Bridge for Uncertainty-Aware Text-to-Video Retrieval

会议: ECCV 2026
论文: ECCV 原文
领域: 视频理解
关键词: 文本到视频检索, 概率嵌入, 分布桥接, 不确定性建模, 对比学习

一句话总结

针对确定性点匹配忽略多模态语义歧义与一对多对应关系的问题,本文提出分布对齐桥接框架(DAB),将文本与视频建模为高斯分布,并借助无随机采样的确定性截断扩散桥将文本分布平滑迭代对齐至视频分布,配合方向性 KL 散度对比学习实现了显著的召回率提升与不确定性感知检索。

研究背景与动机

文本到视频检索(TVR)的核心痛点在于多模态鸿沟,即高度浓缩、结构化的离散文本与高维连续、时空密集的视频内容之间存在巨大的表征差异。尽管近年来基于预训练视觉语言模型(如 CLIP)的双塔与交叉注意力机制取得了显著进展,但主流方法普遍将图文对表征为潜在空间中的确定性单一向量。这种确定性点匹配假设模态之间存在确定的一对一映射,完全忽视了多模态数据固有一对多或多对多语义对应的事实——一段简洁的文本查询往往能够合理描述多种完全不同的视觉场景,而一段长视频也可对应多重不同侧重点的描述。

近期以 DITS 为代表的工作尝试借鉴扩散模型的思想,将一次性跨模态映射重构为多步截断迭代细化,虽然避免了生成式扩散模型因纯高斯随机噪声初始化和 \(L_2\) 重建目标导致的检索排序不稳定,但其优化对象依然停留在确定性特征向量的点空间中,未从根本上建模语义的不确定度与语境多样性。此外,早期的概率嵌入方法(如 UATVR)虽然为模态引入了高斯分布建模,但在计算相似度时往往依赖随机采样原型,重新退化为了随机点比较,导致推理方差大、训练难收敛。

面对点特征表示能力受限与随机采样不稳定的双重矛盾,本文的切入角度是直接在概率分布参数空间中构建无采样的确定性传输轨迹。文本与视频被显式表示为包含语义均值与不确定性方差的高斯分布,由一个受截断扩散启发的轻量漂移网络引导文本分布向视频分布演进。核心 idea:将文本到视频检索从确定性点匹配重构为无采样的分布对齐任务,通过确定性分布桥接网络联合传输均值与方差,并以方向性 KL 散度构建对比损失,在保留模态非对称不确定性的同时实现全局紧致的排序空间。

方法详解

整体框架

DAB 的整体流程由三大模块紧密协同构成:基于跨模态注意力的特征提取底座、解耦均值与方差的高斯概率编码器,以及无随机采样的分布桥接网络(Distribution Bridge)。模型首先使用预训练 CLIP 分别提取文本向量与视频各帧特征,并通过以文本为 Query 的跨注意力汇聚得到文本条件化的视频表征。随后,概率编码器将两模态特征分别映射为高斯分布参数 \((\mu, \log \sigma^2)\),其中视频分支引入帧级自注意力捕捉帧间时序方差。最后,分布桥接网络以离散时间步为条件,通过轻量级 MLP 预测多步均值与方差漂移项,将文本分布平滑推移至目标视频分布,并采用基于方向性 KL 散度的概率对齐对比损失(PAC Loss)进行端到端优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态输入<br/>文本查询与视频连续采样帧"] --> B["CLIP 基础表征与时序交叉注意力汇聚"]
    B --> C["概率嵌入模块:均值与方差解耦建模"]
    C --> D["分布桥接网络:时间条件化确定性迭代漂移"]
    D --> E["概率对齐对比学习:方向性 KL 散度排序优化"]
    E --> F["检索排序与置信度边际校准输出"]

关键设计

1. 概率嵌入模块:语义中心与模态不确定性的显式解耦 针对确定性点向量无法刻画多义性与一对多关系的问题,本模块将各模态映射为对角高斯分布 \(\mathcal{N}(\mu, \operatorname{diag}(\sigma^2))\)。输入表征先经过 \(L_2\) 归一化,再由两个独立的单层线性投影头(带 LayerNorm)分别输出语义均值 \(\mu \in \mathbb{R}^{B \times D}\) 与对数方差 \(\log \sigma^2 \in \mathbb{R}^{B \times D}\)。对数方差偏置初始化为 -2.0 以促成低初始不确定度,并进行数值截断保底。针对视频模态特有的时间动态,设计了额外的基于 Token 的不确定度分支:通过单头自注意力汇聚帧级 Token,平均池化后与全局视频特征加权融合,计算最终视频方差 \(\log \sigma_v^2 = \frac{1}{2}(\log \sigma_{v,\text{base}}^2 + \log \sigma_{v,\text{tok}}^2)\)。此举使语义内容(均值)与时空变化的不确定度(方差)彻底解耦,视频模态得以保留比文本更丰富的高熵多义性。

2. 分布桥接网络:时间条件化确定性迭代漂移 针对传统生成扩散模型在检索任务中因随机高斯采样而方差过大、排名不稳定的缺陷,DAB 设计了一个无随机噪声注入的确定性分布桥接机制。给定文本分布 \(P_t = \mathcal{N}(\mu_t, \sigma_t^2)\) 与目标视频分布 \(Q_v = \mathcal{N}(\mu_v, \sigma_v^2)\),系统在离散时间步 \(t \in [1, T']\) 内执行截断细化。每个时间步经过轻量正弦时间编码后输入漂移网络 DriftDistMLP,联合当前分布参数预测均值与方差的残差漂移项 \([\Delta \mu_t, \Delta(\log \sigma_t^2)]\)。每一步的更新由线性调度步长 \(\chi_t \in [0.2, 0.6]\) 调节: $$ \mu_{t-1} = \mu_t - \chi_t \cdot \Delta \mu_t, \quad \log \sigma_{t-1}^2 = \log \sigma_t^2 - \chi_t \cdot \Delta(\log \sigma_t^2) $$ 漂移输出层进行零初始化,保证训练初期无剧烈扰动;对数方差在每一步被限制在 \([-6, 2]\) 区间。在步长压缩因子(收缩率至多 0.8)与残差更新的作用下,文本分布在无需任何随机采样的前提下,沿着平滑轨迹稳健收敛至目标视频分布 \(\hat{P}_t\)。

3. 概率对齐对比学习:基于方向性 KL 散度的排序优化 分布间相似度的衡量通常受尺度和度量形式影响显著。若采用对称的 Wasserstein-2(\(W_2\))距离,其对极端离群分量的惩罚较钝,且无法反映从精简文本到复杂视频的定向适应过程。DAB 采用闭式解对角高斯分布的方向性 Kullback-Leibler(KL)散度作为代价矩阵 \(C_{ij} = D_{\mathrm{KL}}(Q_{v_j} \parallel \hat{P}_{t_i})\): $$ D_{\mathrm{KL}}(Q \parallel P) = \frac{1}{2} \sum_{d=1}^D \left[ \frac{(\mu_{Q,d} - \mu_{P,d})^2}{\sigma_{P,d}^2} + \frac{\sigma_{Q,d}^2}{\sigma_{P,d}^2} - \log \frac{\sigma_{Q,d}^2}{\sigma_{P,d}^2} - 1 \right] $$ 随后构建双向概率对齐对比损失(PAC Loss): $$ \mathcal{L}{\mathrm{PAC}} = - \frac{1}{B} \sum \right] $$ 该损失强制要求正匹配对的定向 KL 代价低于批次内负样本。由于 KL 散度关于方差的梯度具有强烈的比值缩放效应,它不仅精准对齐跨模态语义均值,还主动约束文本桥接后的方差去包容视频方差,且不强求两模态方差同质化,保留了各模态固有不确定性。}^B \left[ \log \frac{\exp(-C_{ii}/\tau)}{\sum_{j=1}^B \exp(-C_{ij}/\tau)} + \log \frac{\exp(-C_{ii}/\tau)}{\sum_{j=1}^B \exp(-C_{ji}/\tau)

损失函数 / 训练策略

模型端到端同时优化 CLIP 视觉/文本投影层、跨注意力池化、概率编码头及桥接网络参数。优化器采用 AdamW(权重衰减 0.02),CLIP 骨干学习率设为 \(1\times 10^{-6}\),概率与桥接模块学习率设为 \(1\times 10^{-4}\),并采用 0.1 比例的线性预热。截断扩散步数 \(T'\) 设为 32(全序列步长 1000),温度系数 \(\tau\) 调节对比敏锐度。批大小固定为 32,在 MSR-VTT、MSVD 和 VATEX 上统一训练 10 个 epoch,整个训练及推理过程均在单张 NVIDIA A6000 GPU 上即可高效完成。

实验关键数据

主实验

在 MSR-VTT、MSVD 和 VATEX 三大经典文本-视频检索基准上,DAB 与当前最具代表性的确定性方法(CLIP4Clip、X-Pool)、随机概率嵌入方法(UATVR、T-MASS)以及扩散检索方法(DiffusionRet、DITS)进行了全面对比。

数据集 骨干网络 方法 R@1 (%) R@5 (%) R@10 (%) MdR MnR
MSR-VTT (1K-A) ViT-B/32 CLIP4Clip (Neurocomputing'22) 44.5 71.4 81.6 2 15.3
MSR-VTT (1K-A) ViT-B/32 UATVR (ICCV'23) 47.5 73.9 83.5 2 12.9
MSR-VTT (1K-A) ViT-B/32 DITS (NeurIPS'24) 51.9 75.7 84.6 1 11.6
MSR-VTT (1K-A) ViT-B/32 DAB (本文) 56.2 85.4 92.4 1 4.1
MSR-VTT (1K-A) ViT-B/16 DITS (NeurIPS'24) 55.0 79.8 87.1 1 10.0
MSR-VTT (1K-A) ViT-B/16 DAB (本文) 57.6 86.2 92.4 1 4.2
MSVD ViT-B/32 CLIP4Clip (Neurocomputing'22) 45.2 75.5 84.3 2 10.0
MSVD ViT-B/32 Cap4Video (CVPR'23) 51.8 80.8 88.3 1 -
MSVD ViT-B/32 DAB (本文) 54.5 87.8 93.9 1 3.4
VATEX ViT-B/32 DITS (NeurIPS'24) 64.1 92.7 97.0 1 2.9
VATEX ViT-B/32 DAB (本文) 65.4 93.1 97.2 1 2.4
VATEX ViT-B/16 NarVid (CVPR'25) 68.4 94.0 97.1 1 -
VATEX ViT-B/16 DAB (本文) 70.7 95.7 98.3 1 1.9

消融实验

在 MSR-VTT 数据集上(CLIP ViT-B/32,训练 5 个 epoch),对核心组件、损失度量函数以及截断细化步数 \(T'\) 进行了系统消融。

消融维度 / 配置 R@1 (%) R@5 (%) R@10 (%) MnR 延迟 (s) FLOPs (T)
组件分析:Baseline (X-Pool) 46.9 72.8 82.2 14.3 - -
组件分析:+ 概率嵌入 (w/ Prob.) 44.3 76.6 87.2 7.4 - -
组件分析:+ 确定性桥接 (w/ Bridge) 43.2 76.6 86.3 8.5 - -
组件分析:Full DAB (Prob + Bridge) 52.6 82.7 90.8 5.3 51.8 278.93
度量对比:Wasserstein-2 距离 (\(W_2\)) 46.8 79.7 88.4 6.6 - -
度量对比:方向性 KL 散度 (\(D_{\mathrm{KL}}\)) 52.6 82.7 90.8 5.3 - -
步数敏感性:\(T'=8\) 49.0 82.0 89.0 5.8 39.5 69.73
步数敏感性:\(T'=16\) 50.6 80.7 89.4 5.6 43.9 139.47
步数敏感性:\(T'=32\) (默认) 52.6 82.7 90.8 5.3 51.8 278.93
步数敏感性:\(T'=64\) 51.9 84.2 91.1 5.6 68.9 557.85

关键发现

  • 平均排名(MnR)出现雪崩式优化:在 MSR-VTT 上,DAB 将 MnR 从此前顶尖模型 DITS 的 11.6 直接压低至 4.14(降幅达 64%),这证明 DAB 的提升绝非仅仅来自于少数容易样本的 R@1 侥幸匹配,而是彻底重塑了整个跨模态特征空间的几何分布,消除了大量被挤到几十名开外的长尾错误负样本。
  • 概率与桥接不可分割:单纯加入高斯概率嵌入或单纯使用点积桥接时,R@1 均出现回退(从 46.9% 跌至 44.3% 和 43.2%),只有两者深度协同(以高斯分布承载不确定度,以桥接网络迭代优化均值与方差),模型才能发挥出爆发式效果(跳升至 52.6%)。
  • 模态方差非对称性被有效保留:训练收敛后,视频模态的平均方差 \(\sigma_v^2=2.979\),约为文本方差 \(\sigma_t^2=0.507\) 的 5.87 倍;桥接中间态方差为 0.935,居于两者之间。这强有力地证实模型并没有将双模态方差强行同质化,而是忠实反映了视频信息熵远大于文本的现实。
  • Top-1 与 Top-2 的 KL 边际是高度可靠的置信度指标:基于桥接后的 KL 间隙进行选择性预测(Selective Prediction),在覆盖率 25% 时 R@1 飙升至 85.6%,在覆盖率 10% 时高达 94.0%,且风险覆盖曲线下面积(AURC)较随机排序降低近半(0.429 降至 0.256)。

亮点与洞察

  • 采样自由的确定性扩散桥接:规避了生成式扩散模型的高计算开销与随机噪声波动,将扩散过程提炼为在紧凑高斯参数空间 \((\mu, \log \sigma^2)\) 上的确定性残差漂移,兼具生成模型的迭代表征能力与判别模型的检索效率。
  • 方向性 KL 对比损失的几何自适应性:与常用的对称几何距离不同,非对称 KL 散度天然契合跨模态映射的单向适配规律,其梯度对相对方差极度敏感,自动充当了难负例挖掘与自适应缩放器的角色。
  • 局部语义邻域聚合能力:对于语义模糊的查询,DAB 检索出的 Top-10 候选集中包含了大量与真实目标在视觉语义上高度相似的近邻视频(如表 7 中高阈值下的显著检出率),使检索系统具备了出色的语义泛化与容错能力。

局限与展望

  • 截断步数的推理延迟折损:虽然免除了百步采样,但 \(T'=32\) 步迭代依然为推理带来了约 30% 的额外延迟(从 \(T'=8\) 的 39.5 秒增至 51.8 秒)。未来可探索一步快速自蒸馏(Bridge Distillation)将多步漂移压缩至单步前向传播。
  • 简化的独立对角高斯假设:当前实现假设特征各维度间互相独立,采用了对角协方差矩阵。然而视频的时空特征维度之间通常存在强协方差结构,未来可考虑低秩协方差或混合高斯模型(GMM)以刻画更复杂的模态流形。

相关工作与启发

  • vs DITS (Wang et al., NeurIPS 2024):DITS 是启发本文的重要先驱,但其停留在确定性特征向量的点匹配空间;DAB 将其拓展到了高斯参数空间,将迭代更新拓展为语义中心和方差尺度的联合优化,从而彻底解决了多模态不确定度表达不足的问题。
  • vs UATVR (Fang et al., ICCV 2023):UATVR 虽引入了方差建模,但在计算对比分数时仍依赖从高斯分布中采样原型向量,引入了不可控的随机扰动;DAB 则完全摆脱了蒙特卡洛采样,以解析的闭式 KL 散度进行确定性对齐。
  • vs DiffusionRet (Jin et al., ICCV 2023):DiffusionRet 试图以完整的生成式逆扩散过程生成检索候选,训练极其笨重且易模式崩塌;DAB 明确了判别检索无需生成像素或随机潜码,只需利用漂移场实现精准对齐。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将确定性截断桥接机制拓展至高斯分布参数空间,摆脱了生成采样的局限。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖三大经典基准、细致的消融实验、方差非对称性度量及置信度校准评估。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,公式推导严谨,方法与图表对应高度清晰。
  • 价值: ⭐⭐⭐⭐☆ 为视频检索、图文对齐及跨模态不确定性建模提供了极具说服力的新范式。