跳转至

Bridging Vision and Language Concepts through Optimal Transport Semantic Flow

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/ChenyangZhang00/OTF-CBM
领域: 多模态 VLM / 可解释性
关键词: 概念瓶颈模型, 最优传输, 逆最优传输, 流匹配, 跨模态语义对齐

一句话总结

针对传统视觉语言概念瓶颈模型依赖全局静态特征与余弦相似度导致的细粒度定位缺失和跨模态几何畸变,OTF-CBM 引入逆最优传输自适应学习跨模态代价函数,结合非平衡最优传输刻画多对一语义匹配与背景抑制,并构建流匹配速度场在无需 ODE 积分的中点处实现瞬时速度概念激活,在分类精度、概念保真度与抗背景分布偏移上均取得 SOTA。

研究背景与动机

概念瓶颈模型(Concept Bottleneck Models, CBMs)通过在模型最终决策前引入一层人类可理解的中间概念变量,使得原本不可解释的黑盒神经网络推理过程具备了事后诊断、可解释审计和定向干预的能力。随着视觉语言基础模型(如 CLIP)与大语言模型的崛起,现代 CBM 逐步摆脱了昂贵的专家人工属性标注,转而通过在大规模共享多模态嵌入空间中计算图像特征与文本概念库的余弦相似度来自动生成概念激活值。然而,现有视觉语言 CBM 长期面临三重关键表征瓶颈:其一,重用共享 CLIP 空间强制将视觉表征束缚在语言粗粒度几何结构中;其二,依赖图像全局池化向量进行概念推断,使得空间局部证据被抹平,丧失了细粒度概念的精确定位能力;其三,预训练对比学习优化的余弦相似度旨在区分全局类别语义,无法准确反映异构特征空间中局部图像块与精细概念之间的内在传输代价。

这种失败的核心矛盾在于:建立高保真度的概念瓶颈需要图像局部区域与文本概念之间具备既符合语义真实关系、又满足空间几何一致性的细粒度对应,但在实际多模态场景中,这种对应缺乏精细的组件级标注,且图像与文本天然存在信息量不守恒——多个图像补丁对应同一概念(多对一)、大量背景区域在概念库中毫无对应,而部分文本概念在当前图像中完全缺席。若直接套用标准平衡最优传输或固定欧氏/余弦度量,会强制不相关的背景块吸收文本概念质量,造成严重的虚假语义对齐。

本文的切入角度是打破静态几何投影与平衡质量守恒的传统思维,将跨模态概念对齐重塑为一个动态的非平衡语义传输过程:先由数据驱动自适应学习异构特征间的真实度量曲面,再以流匹配刻画视觉原型流向概念表征的连续速度场。核心 idea:通过逆最优传输学习跨模态语义代价度量并结合非平衡最优传输建立局部与概念的柔性耦合,进一步训练连续流匹配速度场,通过中点瞬时速度一致性直接完成高精度概念激活而无需数值 ODE 积分。

方法详解

整体框架

OTF-CBM 的整体流水线包含特征局部原型聚合、逆最优传输跨模态代价自适应学习、非平衡最优传输几何耦合,以及基于流匹配的连续语义速度场激活推断四个核心阶段。对于输入图像,视觉主干提取细粒度局部块特征并聚类为区域原型;随后,由多基核函数参数化且经逆最优传输预训练好的代价函数构建原型与概念间的真实传输代价矩阵,并在 CLS 注意力引导的背景惩罚下求解非平衡 Sinkhorn 传输方案;最后,该离散耦合方案作为端点监督条件流匹配模型,在推断时模型无需任何数值微调或 ODE 时间积分,直接评估时间中点 \(t=0.5\) 处的瞬时预测速度与概念位移的一致性作为概念激活得分,送入线性分类器输出预测类别。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像块聚类原型<br/>与文本概念集合"] --> B["逆最优传输跨模态代价度量<br/>多基核自适应拟合真实几何"]
    B --> C["非平衡最优传输几何耦合<br/>KL松弛多对一匹配与背景抑制"]
    C --> D["流匹配与中点速度概念激活<br/>连续速度场建模与t=0.5瞬时对齐"]
    D --> E["概念激活向量聚合<br/>线性分类器预测类别"]

关键设计

1. 逆最优传输跨模态代价度量:突破固定预设度量局限

视觉编码器(如 DINOv2)与文本编码器(如 CLIP 文本分支)提取的特征位于不同几何特性的异构嵌入空间中,直接采用欧氏距离或余弦相似度作为最优传输的基础代价(ground cost)会产生严重的拓扑畸变与错误对齐。为了构建能真实反映跨模态语义亲和力的距离曲面,OTF-CBM 采用逆最优传输(Inverse Optimal Transport, IoT)从少量带监督的组件级先验配对数据中自适应反推代价函数。具体而言,模型引入一个轻量视觉适配器 \(f_\psi\),将视觉原型与文本概念映射至统一维度 \(d_p\),代价函数被参数化为 \(K=18\) 个基核函数 \(\Phi = \{\phi_k\}_{k=1}^K\) 的线性组合:

\[c_\theta(x, c) = \langle \theta, \Phi(f_\psi(x), c) \rangle\]

基核集涵盖了平方角距离、点积相似度、Dot-RBF 混合核、反二次核和根指数核等多种初等度量形式,既赋予模型表达复杂局部相关与全局语义分离的能力,又保持了线性组合的可解释性。为解决稀疏先验耦合下经典 Fenchel-Young 目标的不稳定性,模型最小化预测传输方案与经验标注之间的绝对加权偏差:

\[\mathcal{L}_{\mathrm{IoT}} = \| (\pi_\theta - \hat{\pi}) \odot c_\theta \|_{1,1} + \lambda_1 \|\theta\|_1\]

优化初期切断传输方案梯度以稳定求解,收敛后固化学得的跨模态度量参数 \(c_{\theta^*}\) 与适配器 \(f_{\psi^*}\),为后续跨模态几何建模提供真实可靠的物理度量基准。

2. 非平衡最优传输几何耦合:解耦局部多对一与背景质量收缩

输入图像的高维 patch 特征往往在相邻空间内高度冗余,直接在 patch 尺度求解开销巨大且易受微观噪声扰动。因此,模型首先在图像内部执行 K-means 聚类获得 \(K\) 个区域代表原型 \(\tilde{x}_{1:K}\)。在跨模态对齐中,标准平衡最优传输强求边缘分布完全守恒,即 \(\pi \mathbf{1} = \mu\) 且 \(\mathbf{1}^\top \pi = \nu\),这必然导致模型在处理无对应概念的背景区域或图像中未出现的缺席概念时发生虚假质量分配。OTF-CBM 采用非平衡最优传输(Unbalanced Optimal Transport, UOT)公式,通过引入广义 Kullback-Leibler(KL)散度放宽严格的质量守恒约束:

\[\pi_{\mathrm{VLOT}} = \arg\min_{\pi \ge 0} \langle c'_\theta, \pi \rangle + \varepsilon \, \mathrm{KL}(\pi \| \mu \otimes \nu) + \tau_1 \, \mathrm{KL}(\pi \mathbf{1} \| \mu) + \tau_2 \, \mathrm{KL}(\mathbf{1}^\top \pi \| \nu)\]

列边缘松弛自然支持多个视觉原型映射到同一核心概念(多对一建模),而行边缘松弛允许图像总质量以有限惩罚自由缩减。为了杜绝背景原型对细粒度概念的弱关联干扰,模型进一步提取视觉主干 CLS Token 的自注意力分布作为前景显著性先验,对判定为背景的索引子集 \(B\) 施加显式几何惩罚:

\[c'_{kj} = c_{kj} + \lambda_{\mathrm{bg}} \mathbf{1}(k \in B)\]

由于传输背景质量的单位代价被人为抬高,UOT 求解器倾向于直接销毁背景块的质量而非强行指派给概念,从而在数学机制上实现了背景噪声的主动剥离与前景细粒度语义的精确定位。

3. 流匹配与中点速度概念激活:跳过ODE积分的高效动态推理

离散最优传输方案 \(\pi_{\mathrm{VLOT}}\) 仅是一张静态的二分匹配分配表,它指明了质量流动终点,却无法描述特征从感知原型演化到抽象语义概念的动态表征流,也难以直接泛化到连续特征评估。OTF-CBM 将最优传输位移解释为连续向量场在离散时刻的采样,利用条件流匹配(Flow Matching, FM)在连续时间域建模语义流。定义起点 \(x_0 = f_{\psi^*}(\tilde{x}_k)\)、终点 \(x_1 = c_j\) 和线性插值轨迹 \(x_t = (1-t)x_0 + t x_1\),目标瞬时速度为 \(u_t = x_1 - x_0\)。参数化条件速度场 \(v_\phi(x, t, \mathrm{cond})\) 通过回归目标进行端到端监督:

\[\mathcal{L}_{\mathrm{FM}} = \mathbb{E}_{(x_0, x_1) \sim \pi_{\mathrm{VLOT}}, \, t \sim \mathcal{U}[0, 1]} \big[ \| v_\phi(x_t, t, \mathrm{cond}) - u_t \|_2^2 \big]\]

在推断阶段,常规生成流匹配需要利用数值 ODE 求解器沿时间步逐次积分,产生高昂的计算延迟。OTF-CBM 做出关键性理论突破:根据端点固定的布朗桥与薛定谔桥理论(Schrödinger Bridge),插值随机过程 \(X_t = (1-t)x_0 + tx_1 + B_t\) 的条件方差为 \(\sigma_t^2 = t(1-t)\),该方差在时间中点 \(t = \frac{1}{2}\) 处严格取到极大值。这意味着时间中点处包含着轨迹演化中最丰富的不确定性与语义判别信息,且局部速度一致性在 Lipschitz 正则下完全决定了连续轨线方向。因此,模型在推断时完全无需 ODE 积分,直接在中点 \(x_{1/2}^{(k,j)} = \frac{1}{2}(x_0 + x_{1,j})\) 评估速度场的瞬时预测能力:

\[v_{\mathrm{pred}}^{(k,j)} = v_\phi\big(x_{1/2}^{(k,j)}, 0.5, \mathrm{cond}\big), \quad S_{k,j} = - \big\| v_{\mathrm{pred}}^{(k,j)} - u^{(k,j)} \big\|_2^2\]

通过对所有原型在该概念上的最高对齐响应进行均值池化 \(a_j = \frac{1}{|TopK|} \sum_{k \in \mathrm{TopK}(S_{\cdot, j})} S_{k,j}\),获得连续几何感知的概念激活值,经 LayerNorm 后传入线性层直接得到最终类别分布 \(\hat{y} = f_{\mathrm{cls}}(\mathrm{LayerNorm}(a))\)。

实验关键数据

主实验

论文在五大通用与细粒度基准数据集(ImageNet-1K, CUB-200-2011, CIFAR-100, Animals with Attributes 2 / AwA2, Places365)上进行了全面评测。所有基线方法均在相同预训练 ViT 骨干和统一 Label-Free CBM 概念库下重新实现,以排除特征提取器带来的非公平增益。

数据集 指标 本文 (OURS) 之前SOTA (DOT-CBM) 提升幅度
ImageNet-1K Top-1 Accuracy (%) 85.62 83.84 +1.78%
CUB-200-2011 Top-1 Accuracy (%) 89.92 85.39 +4.53%
CIFAR-100 Top-1 Accuracy (%) 90.21 85.83 +4.38%
AwA2 Top-1 Accuracy (%) 98.88 96.83 +2.05%
Places365 Top-1 Accuracy (%) 55.13 50.65 +4.48%

在五个具有不同粒度和领域复杂度的基准上,OTF-CBM 均显著超越了包括 Vanilla-CBM、CEM、LaBo、SparseCBM、CoopCBM 和前代基于解耦最优传输的 DOT-CBM 在内的全部先进模型。

此外,为了定量评估跨模态连续语义流的动力学建模质量,作者提出了四项动力学指标:传输重建误差(TRE)、速度均方误差(VMSE)、平均余弦比率(MCR)以及负配对误差(NPE)。

动力学建模方法 建模机制 VMSE (↓) MCR (↑) NPE (↓)
Static OT Alignment 静态匹配基线 (无流学习) 2.467 0.739 0.434
OT Flow Matching 平衡传输引导的线性流 2.001 0.803 0.299
IoT + OT Flow Matching 学习代价 + 平衡传输流 1.782 0.884 0.197
IoT + UOT Flow Matching (本文) 学习代价 + 非平衡多对一流 1.000 0.999 0.021

消融实验

消融实验逐模块验证了视觉语言最优传输(VLOT)、逆最优传输代价学习(IoT Cost)以及连续语义流激活机制对最终分类性能的累加贡献。

配置 ImageNet CUB CIFAR-100 AwA2 Places365 说明
Vanilla-CBM 79.17 78.32 80.04 93.15 44.80 基础余弦瓶颈
+ 经典平衡 OT 80.42 80.31 85.23 94.38 47.70 引入显式离散分配
+ 视觉语言 UOT (VLOT) 82.68 84.31 87.44 95.61 50.59 放宽守恒并抑制背景
+ 逆最优传输代价 (IoT) 84.87 87.44 89.09 96.56 52.99 自适应非欧度量曲面
+ 连续语义流 (完整模型) 85.62 89.92 90.21 98.88 55.13 中点速度流匹配激活

同时,在代价函数拟合能力消融中,传统二次 Wasserstein 距离(\(W_2^2\))的 TRE 误差高达 2.371,余弦距离为 1.826,而本文由 IoT 学习的多基核代价将 TRE 大幅降至 0.824,证明了异构多模态空间度量学习的必要性。

在基于 SAM 前景分割与背景随机噪声替换的分布外(OOD)鲁棒性实验中,OTF-CBM 在 CUB 上的 OOD 精度达到 82.0%(相比 DOT-CBM 的 67.5% 提升 +14.5%),在 Places365 上达到 50.5%(相比 DOT-CBM 的 42.1% 提升 +8.4%),ID 与 OOD 的精度断崖显著收窄。

关键发现

  • 逆最优传输(IoT)代价学习是消除模态几何错位的关键支柱:在五大主要贡献核基中,平方角距离与点积主导局部相关,而 Dot-RBF 等混合核提供全局语义区分能力,使传输重建误差 TRE 下降超过 54.8%。
  • 非平衡输运(UOT)结合背景自注意力惩罚有效阻断了非目标区域的质量污染,将流匹配负对错误率(NPE)由 0.434 骤降至 0.021,彻底解决了传统 CBM 依赖背景快捷方式分类的痼疾。
  • 流匹配速度场打破了经典连续动力学高推理开销的限制:利用布朗桥中点方差极大化的统计学性质,单步中点瞬时速度对比不仅保留了连续向量场的几何保真度,而且比数值 ODE 迭代求解提速数百倍,实现了精度与效率的双赢。

亮点与洞察

  • 将离散配对提升为连续动力学流场:传统 CBM 仅把概念激活看作静态特征投射,OTF-CBM 敏锐地将图文匹配重述为流匹配速度场的传输过程,用速度方向的一致性取代脆弱的距离近邻判定,思路极具启发性。
  • 布朗桥中点评估规避 ODE 积分:利用薛定谔桥最大不确定性集中于 \(t=0.5\) 的数学性质,巧妙以单步瞬时速度对齐代替高开销的多步 ODE 轨迹积分,兼具严谨数学美感与工程落地可行性。
  • 跨模态表征解耦学习新范式:论文揭示了多模态对齐的核心瓶颈往往在于过早在异构几何空间中联合强行收敛;先在各自单模态建立强结构表示,再由自适应最优传输几何进行桥接,为多模态表征学习提供了新理论视阈。

局限与展望

  • 组件级监督数据的先验依赖:IoT 代价函数的拟合依赖于少量具有物体-组件关联的弱标注数据集,在全无细粒度配对监督的极端长尾开放世界场景中可能面临冷启动问题。
  • K-means 区域原型数超参数选择:图像块的聚类簇数 \(K\) 属于固定超参数,对于包含极度密集微小物体或极度空旷场景的图像,固定数量的原型可能无法自适应捕捉最佳语义粒度。
  • 未来改进方向:可进一步探索无需任何显式组件先验的完全自监督逆最优传输算法,并将中点速度流机制拓展到高分辨率密集预测(如开集语义分割、具身导航概念定位)中。

相关工作与启发

  • vs Vanilla-CBM / Post-hoc CBM (P-CBM):传统方法使用全图全局池化表征直接投影至概念空间,丢失了区域细粒度定位;OTF-CBM 在局部原型级别建模非平衡最优传输,保持了概念的空间溯源能力。
  • vs DOT-CBM:DOT-CBM 虽然尝试了将图像块与概念做解耦最优传输,但其假定固定的欧氏/余弦基础代价且停留在离散匹配;OTF-CBM 创新性地引入 IoT 学习自适应代价函数,并将离散匹配提升为连续流匹配动力学,全面超越其精度与鲁棒性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将逆最优传输与流匹配速度场引入概念瓶颈模型,提出中点瞬时速度无积分概念推断,理论优雅且创新性极强。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖5个经典基准数据集,提供分类精度、流动力学定量指标、详细消融以及 SAM 扰动的 OOD 鲁棒性验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学推导严密清晰,动机分析一针见血,问题层层递进。
  • 价值: ⭐⭐⭐⭐⭐ 极大地推动了多模态可解释性与跨模态概念对齐研究,对视觉语言几何表征学习具备通用借鉴意义。