跳转至

DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/yoon307/DINOde
领域: 语义分割 (segmentation)
关键词: 开放词汇语义分割、神经常微分方程 (Neural ODE)、DINOv3、跨模态流形对齐、切空间投影

一句话总结

DINOde 提出了一种基于常微分方程(ODE)的连续跨模态对齐框架,通过语义文本流、全局上下文流以及超球面切空间投影,将冻结的 CLIP 文本嵌入平滑且保拓扑地映射到自监督 DINOv3 视觉流形上,仅需 COCO 标题弱监督训练 4 小时即可在八大开放词汇分割基准上刷新 SOTA。

研究背景与动机

开放词汇语义分割(OVSS)旨在超越传统预定义闭集限制,借助自然语言语义分割图像中的任意新类别。目前主流方案多依托以 CLIP 为代表的视觉语言预训练模型,但 CLIP 的图像编码器核心优化目标是全图级别的对比对齐,提取出的特征在局部空间上高度纠缠且边缘粗糙,难以直接满足像素级密集预测的高精度定位需求。与之相对,以 DINOv2、DINOv3 为代表的自监督视觉模型(SSVM)纯粹从无标签图像中学习,具备出色的目标中心性(object-centricity)与清晰的局部边界结构,但其纯视觉表征缺乏与文本概念的内生对齐,无法直接用于零样本或开放词汇推理。

为了弥合这一模态鸿沟,先前方法要么付出高昂代价从头训练全新文本编码器(如 dino.txt 依赖海量图文对联合训练),要么采用多层感知机(MLP)将文本嵌入离散投影到自监督特征空间中。然而,这种单步、瞬时的离散欧氏映射完全忽视了归一化超球面特征空间的内生几何曲率。在将异构模态强行拉齐的过程中,离散投影容易引起严重的流形纠缠(manifold entanglement),破坏原文本空间中近邻类别之间的拓扑结构与测地线距离关系,导致密集分类混淆。

本文的切入角度是打破传统的静态离散映射范式,将跨模态对齐建模为动态连续流系统。核心 idea:将跨模态特征对齐建模为受超球面几何约束的常微分方程(ODE)连续演化轨迹,通过语义文本流与全局上下文流协同引导文本与全局图像表征渐进融合,在严格保拓扑的前提下使文本锚点收敛至 DINO 视觉流形。

方法详解

整体框架

DINOde 保持视觉骨干网络 DINOv3(ViT-L/16)与文本编码器 CLIP(ViT-L/14)完全冻结,核心在于学习由常微分方程速度网络所驱动的连续流场。输入图像经 DINOv3 编码输出密集的局部 Patch Token 和一个汇总全图语义的 [CLS] Token;文本提示(类别名称或图像标题)经 CLIP 文本编码器得到原始文本向量。整个流水线包含两大流场与一个几何约束:语义文本流(STF)将文本嵌入逐步推向视觉流形;全局上下文流(GCF)演化全图 [CLS] Token 以提供全局上下文正则;速度切空间投影(VTP)则强制速度场处在超球面切空间上以严格保模长与流形几何。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与文本提示"] --> B["冻结骨干提取:DINOv3 Patch/CLS + CLIP Text"]
    B --> C["语义文本流 (STF)<br/>连续 ODE 沿超球面轨迹演化文本嵌入"]
    B --> D["全局上下文流 (GCF)<br/>连续 ODE 细化 [CLS] Token 汇聚全局语义"]
    C --> E["速度切空间投影 (VTP)<br/>去除径向分量,速度约束于切平面"]
    D --> E
    E --> F["双分支融合表征构建<br/>Top-K 池化 Patch 特征拼合 GCF 增强 CLS 特征"]
    F --> G["对称 InfoNCE 对比损失监督 (仅在 118k COCO Caption 上微调)"]
    G --> H["测试推理:ODE 演化生成对齐文本锚点,与 Patch 计算余弦相似度"]

关键设计

1. 语义文本流:基于连续 ODE 的渐进流形迁移 针对单步 MLP 映射引发的流形折叠与拓扑扭曲问题,语义文本流(STF)将对齐过程建模为初值问题,使文本嵌入 \(z_t\) 在虚拟时间 \(t \in [0, 1]\) 内受速度场 \(v_\theta(z_t, t)\) 控制平滑演进。初值 \(z_0 = \mathrm{Norm}(W z^{\text{text}})\) 通过轻量线性投影将 CLIP 文本特征调整至与 DINO 相同的维度并进行 \(\ell_2\) 归一化。在演化过程中,时间参数 \(t\) 通过正弦时间编码 \(\gamma(t)\) 经由特征调制注入速度网络 \(F_\theta\)。利用显式欧拉积分器以固定步长 \(\Delta t = 1/N_{\text{step}}\)(默认 \(N_{\text{step}} = 10\))向前求解: $\(z_{t_{k+1}} = \mathrm{Norm}\big(z_{t_k} + \Delta t \cdot \tilde{v}_\theta(z_{t_k}, t_k)\big)\)$ 最终状态 \(\hat{z}^{\text{text}} = z_1\) 作为与 DINO 视觉特征紧密对其的语义锚点。这种连续小步迭代的残差更新机制有效避免了突兀的欧氏几何捷径,保证了语义近邻关系的平滑平移。

2. 速度切空间投影:保留超球面内生曲率的几何约束 在深度特征对比学习中,表征向量通常经过 \(\ell_2\) 归一化约束在单位超球面 \(\mathbb{S}^{D-1}\) 上,相似度由角度或测地线距离决定。若未受约束的速度向量指向球体外部或内部,积分轨迹将频繁脱离流形,单纯依靠每步归一化会引起流形尺度的剧烈形变与非线性失真。为此,本文设计了速度切空间投影(VTP),在每一步积分前将神经网络预测的原始速度向量正交投影到当前状态点 \(z_t\) 的切空间上: $\(\tilde{v}_\theta(z_t, t) = v_\theta(z_t, t) - \langle v_\theta(z_t, t), z_t \rangle z_t\)$ 该设计消除了速度场沿法向量(径向)的分量,确保积分运动纯粹沿着超球面表面的测地线切线方向推进,在保持特征模长严格守恒的同时,精确维持了表征流形的本征黎曼曲率。

3. 全局上下文流:结合全局与局部的多粒度表征协同 为了防止文本流在优化过程中过度偏向图像中某些显著的局部 patch,从而丢失对全图宏观语境的把握,DINOde 设计了全局上下文流(GCF)。DINOv3 原生输出的 [CLS] Token 聚合了整幅图像的全局信息,但未经文本语义雕琢。GCF 以线性变换后的归一化特征 \(c_0 = \mathrm{Norm}(W_{\text{cls}} z^{\text{img}}_{\text{cls}})\) 为起点,通过专用的速度网络 \(u_\phi(c_t, t)\) 与对应的切空间投影进行 ODE 积分: $\(c_{t_{k+1}} = \mathrm{Norm}\big(c_{t_k} + \Delta t \cdot \tilde{u}_\phi(c_{t_k}, t_k)\big)\)$ 在损失计算阶段,全图视觉表征由 Patch Token 经过 Top-K 池化得到的局部汇聚向量 \(z^{\text{img}}\) 与 GCF 演化所得的全局特征 \(\hat{z}^{\text{img}}_{\text{cls}} = c_1\) 拼接而成: $\(z^{\text{img}}_{||} = \big[ z^{\text{img}} \;;\; \hat{z}^{\text{img}}_{\text{cls}} \big] \in \mathbb{R}^{2D}\)$ 同时文本特征进行双倍复制构成 \(z^{\text{text}}_{||}\)。通过将局部细节与宏观全局语境同时置于对比学习目标下,STF 与 GCF 形成了互补的协同机制,既保证了细粒度定位的敏锐度,又避免了误判全局上下文。

损失函数 / 训练策略

模型采用对称 InfoNCE 对比损失进行端到端优化。在一个包含 \(B\) 个图文对的批次中,首先计算视觉与文本拼接表征之间的余弦相似度矩阵: $\(S_{ij} = \frac{1}{\tau} (z^{\text{img}}_{||, i})^\top z^{\text{text}}_{||, j}\)$ 损失函数由双向交叉熵求均值定义: $\(\mathcal{L}_{\text{NCE}} = \frac{1}{2} \Big( \mathrm{CE}(S, y) + \mathrm{CE}(S^\top, y) \Big)\)$ 其中温度超参数设定为 \(\tau = 0.07\)\(y = [1, 2, \dots, B]\) 为对角匹配索引。在优化策略方面,仅利用约 11.8 万张图的 COCO 2017 Caption 训练集进行训练,采用 AdamW 优化器(学习率 \(1 \times 10^{-4}\),权重衰减 0.01),Batch Size 为 256,在单张 RTX 3090 GPU 上训练 20 个 Epoch 仅需约 4 小时即可完成。在推理时,各类别的文本锚点经 STF 演化后一次性离线缓存,直接与图像 Patch 计算点积相似度,无需运行时重复积分。

实验关键数据

主实验

在涵盖含背景类(Pascal VOC 21、Pascal Context 60、COCO Object)与不含背景类(Pascal VOC 20、Pascal Context 59、COCO Stuff、Cityscapes、ADE20K)的 8 个常用开放词汇语义分割基准上,DINOde 均展现出卓越性能。下表列出无后处理掩码细化(w/o Mask Refinement)下的主对比实验数据(对应原论文 Table 5 上半部分):

方法 视觉骨干 V20 C59 Stuff City ADE V21 C60 Object 平均 mIoU
MaskCLIP (ECCV22) CLIP ViT-L 29.4 12.4 8.8 11.5 7.2 23.3 11.7 7.2 13.9
FreeDA (CVPR24) CLIP+DINOv2 85.7 39.7 26.3 33.6 21.4 44.1 34.8 33.9 39.9
ProxyCLIP (ECCV24) CLIP+DINO 83.2 37.7 25.6 40.1 22.6 60.6 34.5 39.2 43.0
Talk2DINO (ICCV25) DINOv2(reg) 87.1 39.1 27.0 35.8 21.1 60.1 34.2 37.6 42.8
Talk2DINO* (ICCV25) DINOv3 ViT-L 87.7 43.0 32.6 40.8 24.2 65.9 37.9 48.6 47.6
DINOde (本文) DINOv3 ViT-L 91.1 44.5 31.6 45.4 25.4 69.2 40.7 48.0 49.5

在进一步引入像素自适应掩码细化(PAMR)后,DINOde 平均 mIoU 进一步攀升至 50.1%,在 8 个基准中的 6 个上均刷新 SOTA。

消融实验

原论文 Table 1 详细拆解了语义文本流(STF)、切空间投影(VTP)与全局上下文流(GCF)各模块的独立与协同增益(基线 (a) 为等量参数的常规 MLP 投影层):

配置 STF VTP GCF V20 C59 Stuff City ADE V21 C60 Object 平均 mIoU
(a) MLP Baseline - - - 88.4 43.2 29.7 42.5 23.2 68.0 39.6 46.7 47.7
(b) 仅加 STF - - 88.4 43.0 31.2 44.7 25.2 66.6 39.5 47.1 48.2
(c) STF + VTP - 88.5 43.4 31.4 45.4 25.5 67.3 39.6 47.2 48.5
(d) STF + GCF - 90.2 44.3 31.3 45.6 24.8 69.5 40.3 47.2 49.2
(e) Full DINOde 91.1 44.5 31.6 45.4 25.4 69.2 40.7 48.0 49.5

原论文 Table 2 同时探索了积分步数 \(N_{\text{step}}\) 的敏感性:\(N=5\) 时为 48.7%,\(N=10\) 时达到最优 49.5%,\(N=50\) 时为 49.6%(平均 mIoU 趋于平缓,且部分基准因数值微小漂移略微震荡),因此选择 \(N=10\) 兼顾最佳效率与性能。

关键发现

  • 连续 ODE 流显著击败离散 MLP:对比配置 (a) 与 (e),平均 mIoU 从 47.7% 大幅提升至 49.5%(+1.8%p),充分证明简单的单步欧氏映射确实存在严重的流形扭曲,连续积分能平稳跨越模态隔阂。
  • 流形保持几何诊断全面占优:在原论文 Table 4 中,STF 在四大几何指标上均领先 MLP:近邻保持率从 0.575 提升至 0.601;测地线一致性从 0.693 提升至 0.712;类别结构保持率(CKA)从 0.843 提升至 0.871;表征紧凑度从 0.412 提升至 0.423。
  • 骨干通用泛化能力出众:无论视觉模型切换为 DINOv3 ViT-B(46.1% vs MLP 44.2%)还是轻量 ViT-S(38.8% vs MLP 36.9%),乃至文本端切换为 CLIP ViT-B(48.7% vs MLP 47.8%),DINOde 均稳定超越 MLP 投影 baseline。

亮点与洞察

  • 切空间投影(VTP)约束优雅而必要:通过严密的线性代数投影操作将速度场限制在超球面的切平面上,从数学机理上根除了积分脱离流形导致的尺度失真,为流形学习中的几何保真度提供了简洁即插即用的手段。
  • 低成本强监督对齐示范:不同于以往弱监督方法动辄依赖 CC3M 或 CC12M 等数百万海量图文对,DINOde 仅在约 11.8 万条 COCO 标注上微调 4 小时即可达到顶尖性能,极大降低了密集预测跨模态对齐的算力门槛。
  • 对 MLLM 模态投影范式的启示:当前现代多模态大模型(如 LLaVA 等)普遍使用单层或两层 MLP 将图像 Token 投射至大语言模型词表空间。DINOde 证明了单步 MLP 会导致细粒度流形失真,为未来在多模态大模型中引入连续动力系统投影提供了强有力的演进方向。

局限与展望

  • 推理时的积分计算开销:尽管测试时文本类别锚点可离线完成演化并缓存,但在遇到动态未知长尾文本提示时,仍需运行 10 步欧拉更新,相比一步式静态投影增加了常数级的延迟。
  • 欧拉解算器的精度极限:在更长步数(如 \(N=50\))时观察到个别基准略有掉点,表明高阶龙格-库塔方法(RK4)或自适应步长积分器在跨模态流中可能更具数值稳定性,但会带来额外计算成本。
  • 未来方向:探索将该连续流对齐理念扩展到开放词汇实例分割/全景分割,或将其适配为 MLLM 中视觉编码器与大语言模型解码器之间的高保真流形连接桥梁。

相关工作与启发

  • vs Talk2DINO:Talk2DINO 利用 DINOv2 内部注意力机制通过静态非线性变换去对齐 CLIP 文本,而 DINOde 指出此类静态映射缺乏几何流形约束,改用动态连续 ODE 轨迹与超球面切空间投影,在同等 DINOv3 骨干下性能高出 1.9%p。
  • vs dino.txt:dino.txt 必须在大规模图文配对数据上从头训练定制的文本编码器以匹配 DINO 视觉特征,计算成本极高;DINOde 保持成熟的预训练 CLIP 编码器不变,仅训练轻量速度场即可在轻量算力下达成更高对齐质量。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 将连续常微分方程动态系统与单位超球面流形几何约束引入跨模态文本-密集视觉对齐,思路巧妙且数学动机清晰。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖八大 OVSS 基准,包含详尽的模块消融、步数分析、跨骨干泛化性验证以及量化的几何拓扑保持诊断。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严谨流畅,问题痛点剖析精准,公式表述精炼且图示表达明确。
  • 价值: ⭐⭐⭐⭐⭐ 开创了无痛高保真连接纯自监督视觉模型与语言模型的新范式,兼具卓越的性能与极高的工程实用价值。