跳转至

CLIMP: Contrastive Language-Image Mamba Pretraining

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/NimrodShabtay/CLIMP
领域: 多模态VLM
关键词: 对比语言图像预训练, Mamba/状态空间模型, 视觉语言模型, 原生可变分辨率, 分布外鲁棒性

一句话总结

CLIMP 把 CLIP 的两个塔整体换成状态空间模型——视觉侧用 VMamba 的 SS2D 四向交叉扫描、文本侧用 Mamba-1/Mamba-2 语言模型做末位 token 池化——在 CC12M 上沿用 CLIP 原有的对称对比目标训练,以线性复杂度换来更好的零样本检索、更强的分布外鲁棒性(ImageNet-O 上超过在 167× 数据上训练的 CLIP-ViT-B/16),并天然支持任意分辨率与任意长度文本。

研究背景与动机

CLIP 用自然语言监督把图像和文本映射进同一个嵌入空间,从而获得零样本迁移能力,此后 OpenCLIP、SigLIP、EVA-CLIP、MetaCLIP、SigLIP 2 等改进几乎都落在同一套骨架里迭代:视觉侧始终是 Vision Transformer(ViT)。ViT 的全局自注意力让任意两个 patch 直接交互,代价是计算量随序列长度平方增长,高分辨率输入的开销迅速变得不可承受;要让同一个 ViT 处理不同分辨率,还得额外引入位置编码插值(RoPE-ViT)或专门的可变分辨率训练流程(FlexViT、NaFlex)。更麻烦的是,逐对 token 交互容易咬住训练数据里的伪相关线索,已有研究指出 CLIP 的鲁棒性在被专门设计来探测伪相关的数据集上会被明显高估。

另一条线上的进展是状态空间模型。Mamba 用输入相关的选择机制让 SSM 参数随内容变化,从而在序列长度上保持线性复杂度;Vision Mamba、SiMBA、VMamba 这类视觉适配已在分类任务上证明可行,而且 SSM 的归纳偏置与注意力不同——它天然偏向平滑和局部,这对样本效率与分布外泛化是加分项。但既有工作 CLIP-Mamba 只在单个塔内部把 Mamba 与 Transformer 混合,从未验证「两个塔全用 SSM」会怎样;文本侧 CLIP 又长期受困于 77 token 的固定上下文,稠密描述检索场景下这个上限直接卡死了长 caption。于是形成一个明确的空缺:如果视觉塔和文本塔都换成 SSM,能不能一次拿到线性复杂度、由空间归纳偏置带来的鲁棒性、以及任意长度文本的处理能力?

本文的做法是把 CLIP 的两个编码器整体替换掉,其余部分一律不动:视觉侧用 VMamba,靠 SS2D 的四方向交叉扫描把二维图像摊成序列;文本侧直接接一个预训练的 Mamba 语言模型,取最后一个非 padding token 的隐状态作为句子表示;对齐目标仍是 CLIP 原本的对称对比损失。关键收益不只是省算力——扫描式感受野把分散的伪相关线索稀释掉,同时模型不再依赖显式位置编码,于是得到了更紧的跨模态对齐和更低的 hubness(嵌入空间里少数向量霸占近邻列表的现象),检索和分布外鲁棒性随之改善。核心 idea:把 CLIP 的视觉塔换成 VMamba 的 SS2D 交叉扫描、文本塔换成自回归 Mamba LLM 并做末位 token 池化,用「全 SSM 双塔」一次性换来线性复杂度、原生可变分辨率、任意长文本与更强的分布外鲁棒性。

方法详解

整体框架

CLIMP 沿用 CLIP 的双塔结构:图像和文本各过一个编码器进入同一个共享嵌入空间,再在批内做对比对齐,区别在于两个塔都是状态空间模型,因此两个模态的显存与计算量都随序列长度线性增长,而不是平方。视觉侧输入一张 \(H\times W\) 的图像,切成 \(P\times P\) 的不重叠 patch 后送入 VMamba 的 VSS 块序列,经层次化下采样逐步降低特征图分辨率,最后由可学习投影 \(W_v\) 映射进共享空间;文本侧输入 token 序列,由预训练的 Mamba 语言模型(Mamba-1 或 Mamba-2)自回归地算出隐状态,取最后一个非 padding token 的隐状态经 \(W_t\) 投影到同一空间。整条流程没有任何位置编码插值,也没有为分辨率或文本长度做过专门训练——这是本文与 FlexViT / NaFlex / RoPE-ViT 最直观的区别。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["图像 I:训练 224×224"] --> B["VMamba 视觉塔<br/>SS2D 四向交叉扫描"]
    B --> C["原生分辨率推理<br/>免位置编码插值"]
    C --> D["视觉嵌入(Wv 投影)"]
    E["文本 T:任意长度"] --> F["Mamba 文本塔<br/>末位非 padding token 池化"]
    F --> G["文本嵌入(Wt 投影)"]
    D --> H["共享嵌入空间"]
    G --> H
    H --> I["批内对称对比损失"]

关键设计

1. VMamba 视觉塔:用 SS2D 四向交叉扫描取代逐对 token 注意力

ViT 的痛点有两个:全局注意力在高分辨率下平方爆炸,且逐对交互容易在局部锁死一个伪相关 token。VMamba 给出的替代方案是把图像当成序列来扫,但必须解决「图像本身是二维的、没有天然顺序」这个矛盾。做法是 SS2D(2D 选择性扫描):把 patch 序列沿四条遍历路径(左上→右下、右下→左上、右上→左下、左下→右上)各扫一遍,每条路径内部跑 Mamba 的选择性递推,再把四路输出融合。这样每个 patch 都能从四个空间方向收集上下文,等效于建立了全局感受野,而每条路径的代价仍是关于 patch 数的线性量。SSM 本身的离散递推是

\[h_t = \bar{A}h_{t-1} + \bar{B}x_t,\qquad y_t = Ch_t + Dx_t\]

其中隐状态 \(h_t\) 充当对整个输入历史的记忆,\(\bar{A}\) 决定遗忘速率、\(\bar{B}\)\(C\) 决定往记忆里写什么、从记忆里读什么;Mamba-1 进一步把 \(B\)\(C\)、步长 \(\Delta\) 都做成输入 \(x_t\) 的函数,实现内容感知的过滤。(⚠️ 缓存文本中该式 OCR 有损,此处按标准 SSM 离散化形式给出,以原文为准。)

为什么这种偏置对对比学习有利:Mamba-2 把转移矩阵约束成 \(\bar{A}=\lambda I\),于是 \(k\) 步之前的状态影响按 \(\lambda^k\) 衰减,模型天然鼓励局部性与平滑性;Mamba-1 的选择性机制虽没有闭式刻画,但作者用合成实验确认两种变体都表现出很强的空间归纳偏置(见实验部分的 CIFAR-10 打乱实验)。放到 CLIP 的语境里,注意力的失败模式是「在局部精确地咬住一个伪相关 token」,而扫描是把整条空间序列累积进隐状态,分散的伪相关线索在累积中被稀释——这正是后面 ImageNet-O 大幅领先、以及 hubness 下降的机制来源。另一个差别是位置信息的载体:ViT 靠显式位置编码,VMamba 靠扫描顺序隐式携带,这个差别直接引出第三个设计点。

2. Mamba 文本塔:末位非 padding token 池化打开任意长文本

CLIP 的文本塔是固定 77 token 的 Transformer,长 caption 会被直接截断;而 Mamba 语言模型是因果(自回归)的,没有现成的双向编码器可用。作者没有去改造它,而是把这个「缺点」当成结构优势来用:因为因果递推,第 \(t\) 步的隐状态只见过前 \(t\) 个 token,所以最后一个非 padding token 的隐状态是唯一完整看过整句的位置,直接把它当作文本表示再经 \(W_t\) 投影即可,这也和 CLIP 取 [EOS] 位置的做法天然对应。又因为序列位置由递推本身携带而非固定位置编码给定,序列长度不受任何预设上限约束。

这个选择是否真的有用,作者用消融做了交叉验证:把视觉塔固定住、只换文本塔时,VMamba 配 Mamba-1 比配 LLaMA 高 +3.5% Acc@1 和 +3.9% TR@5,而 RoPE-ViT 换文本塔几乎不动(±1%)——说明同族 SSM 的双塔能学到更兼容的跨模态表示。他们还试了双向 SSM 变体 Hydra 以及 RoBERTa-L / BERT-L 这类成熟双向编码器,双向 SSM 反而更差,说明「双向」本身不是关键,成熟预训练 LLM 带来的文本表示质量才是。需要强调的是,稠密描述实验里没有任何模型被 77 token 限制(LLaMA-3.2-1B 本身有 8K 上下文),所以 CLIMP 在该项上的优势来自表示质量而非「别人被截断」,这一点论文交代得很清楚。

3. 原生分辨率推理:扫描隐式携带位置,免插值免专项训练

要让训练于 224×224 的模型直接跑 896×896,ViT 系方案要么插值位置编码(RoPE-ViT),要么设计专门的可变分辨率架构并配套训练(FlexViT、NaFlex)。VMamba 的空间位置由扫描路径隐式给出,与 patch 网格尺寸无关,因此同一个权重可以在 224 训练、在 896 直接前向,既不改结构也不再训练。代价侧的好处同样直接:patch 数随像素线性增长,而注意力对 patch 数是平方、SSM 是线性,分辨率越高差距越大。实测在 896×896 下 CLIMP 只要 10.0 MB 的分辨率相关显存(ViT 系为 50.4 MB,约 1/5)和 259.7 GFLOPs(ViT 系 457.9 GFLOPs,约 1/1.8),图 3 给出的跨分辨率显存优势区间是 4–57×。值得注意的是,CLIMP 在高分辨率上不仅超过需要插值的 RoPE-ViT,也超过了专为可变分辨率设计的 FlexViT 和 NaFlex,说明「用扫描顺序替代位置编码」是一条比补丁式训练方案更省事的路径。

损失函数 / 训练策略

训练目标刻意保持原样:CLIP 的批内对称 InfoNCE,图像与文本嵌入各自 L2 归一化后可学习温度缩放,一个 batch 内所有非配对样本互为负样本。CLIMP 只换骨干、不动损失,这样任何收益都只能归因于架构而非训练配方。

\[\mathcal{L}=-\frac{1}{2N}\sum_{i=1}^{N}\left[\log\frac{\exp(\mathrm{sim}(v_i,t_i)/\tau)}{\sum_{j}\exp(\mathrm{sim}(v_i,t_j)/\tau)}+\log\frac{\exp(\mathrm{sim}(t_i,v_i)/\tau)}{\sum_{j}\exp(\mathrm{sim}(t_i,v_j)/\tau)}\right]\]

(⚠️ 原文未列出该式,此处按 CLIP 原论文的对称 InfoNCE 形式给出,以原文为准。)

超参与协议:全部模型在 CC12M(约 12M 图文对)上训练 10 个 epoch,分辨率 224×224,AdamW + cosine 学习率调度,峰值学习率 \(5\times10^{-5}\),batch size 2048,投影维度 768。视觉塔统一为 base 规模(约 86M 参数)并用 ImageNet-1K 初始化;CLIMP 的文本塔分别是 Mamba-1(1.4B)和 Mamba-2(1.3B),Transformer 基线统一用 LLaMA-3.2-1B。为了把「架构差异」和「数据规模差异」分开,所有模型同数据同协议;另外加了一个视觉塔在 MetaCLIP-400M(比 ImageNet-1K 大 400 倍)上预训练过的 MetaCLIP-ViT-B/16 作为「数据量远超本文」的对照。

实验关键数据

主实验

CLIP-Benchmark 的平均结果(28 个分类数据集 + 3 个检索数据集,共 31 个):

视觉塔 文本塔 Acc@1 Acc@5 IR@5 TR@5
FlexViT-B/16 LLaMA-3.2 26.3 57.4 62.4 72.3
NaFlex-B/16 LLaMA-3.2 26.1 56.6 61.5 73.3
ViT-B/16 LLaMA-3.2 27.3 56.4 62.8 72.9
RoPE-ViT-B/16 LLaMA-3.2 27.3 59.0 63.4 72.9
MetaCLIP-ViT-B/16† LLaMA-3.2 25.7 56.9 66.4 76.2
CLIMP (VMamba-B) Mamba-2 26.9 59.0 65.2 75.3
CLIMP (VMamba-B) Mamba-1 29.6 58.5 65.5 77.0

†MetaCLIP-ViT 的视觉塔在 MetaCLIP-400M(比 ImageNet-1K 大 400 倍)上预训练过,即使带着这个数据优势,它的分类精度仍低于 CLIMP。

分布外鲁棒性(5 个 ImageNet 变体,top-1/top-5):

视觉塔 文本塔 IN-V2 IN-R IN-A IN-O Sketch 平均
FlexViT-B/16 LLaMA-3.2 32.8/62.5 45.4/74.3 13.2/41.2 38.1/68.2 24.6/50.0 30.8/59.2
NaFlex-B/16 LLaMA-3.2 31.4/60.5 44.8/72.5 12.0/36.0 38.5/67.6 23.5/49.1 30.0/57.1
ViT-B/16 LLaMA-3.2 30.0/57.5 42.9/69.7 13.9/37.6 27.7/55.8 21.7/46.1 27.2/53.3
RoPE-ViT-B/16 LLaMA-3.2 34.4/65.4 47.8/76.0 16.3/46.3 40.1/69.9 27.4/53.1 33.2/62.1
CLIMP (VMamba-B) Mamba-2 37.0/67.6 46.6/74.5 15.6/45.5 49.8/77.0 27.0/54.2 34.8/63.7
CLIMP (VMamba-B) Mamba-1 37.5/68.4 46.2/74.5 15.5/45.3 48.1/78.8 27.5/54.4 35.2/64.3

分辨率外推与稠密描述检索(全部模型只在 224×224 训练,测试时不做任何微调):

设置 指标 CLIMP-Mamba-1 CLIMP-Mamba-2 最强 Transformer 基线
CLIP-Bench @224 Acc@1 / IR@5 / TR@5 29.6/65.5/77.0 26.9/65.2/75.3 27.3/63.4/72.9(RoPE-ViT)
CLIP-Bench @384 Acc@1 / IR@5 / TR@5 27.3/65.0/75.2 24.9/65.2/74.6 25.9/63.6/75.0(FlexViT)
NoCaps @896 IR@5 / TR@5 57.1/53.5 57.1/53.8 51.6/50.8(NaFlex)
Crossmodal-3600 @896 IR@5 / TR@5 55.9/45.4 54.7/46.0 48.2/42.0(NaFlex)
Flickr8k-Rephrased(均 134 token,98.3% 超 77) 图像 R@1 / 文本 R@1 67.0/81.3 63.3/75.7 60.7/77.6(RoPE-ViT)
DOCCI(均 142 token,94.4% 超 77,图 896) 图像 R@1 / 文本 R@1 37.3/23.8 33.4/24.6 29.1/26.1(NaFlex)

消融实验

只换文本塔、固定视觉塔,考察双塔的架构搭配(CLIP-Benchmark 平均):

视觉塔 文本塔 Acc@1/Acc@5 IR@5/TR@5
RoPE-ViT LLaMA-3.2 27.27/58.95 63.35/72.93
RoPE-ViT Qwen2-1.5B 27.30/58.80 60.40/70.90
RoPE-ViT Mamba-2 27.42/58.69 62.59/72.99
RoPE-ViT Mamba-1 28.10/58.54 63.17/74.28
RoPE-ViT RoBERTa-L 27.47/58.64 64.82/74.72
RoPE-ViT BERT-L 27.80/58.84 63.93/74.15
VMamba LLaMA-3.2 26.13/57.30 63.21/73.16
VMamba Hydra(双向 SSM) 28.63/56.98 61.24/71.35
VMamba Mamba-2 26.94/59.04 65.17/75.25
VMamba Mamba-1 29.59/58.53 65.54/77.03

嵌入几何分析(NoCaps 上测量,对齐越高越好、hubness 越低越好):

视觉塔 文本塔 对齐 文本 hubness 图像 hubness
FlexViT LLaMA 1.111 1.23 1.19
NaFlex LLaMA 1.039 1.24 0.93
RoPE-ViT LLaMA 1.052 1.25 1.04
CLIMP (VMamba) Mamba-1 0.982 1.15 1.01
CLIMP (VMamba) Mamba-2 1.000 1.13 1.01

(⚠️ 原文表 8 表头的箭头标注在缓存文本中不易区分,此处以作者正文陈述为准:CLIMP 取得最好的 alignment 0.982 与最低的文本 hubness 1.13。)

关键发现

  • Mamba-1 稳定优于 Mamba-2,快是有代价的。 Mamba-2 通过把转移矩阵从结构化对角(HiPPO 初始化)简化成标量单位阵、并采用多头权重共享,换来 2–8× 的加速,但每 token 的表达力随之下降;Mamba-1 的逐通道选择扫描(\(\Delta\)\(B\)\(C\) 全部输入相关)过滤更细,得到的表示在对比对齐下更可判别。这也是 Table 10 里 VMamba+Mamba-1 全面最好的原因。
  • 架构归纳偏置可以压过数据规模。 ImageNet-O 上 Mamba-2 取 49.8、Mamba-1 取 48.1,比最强 Transformer 基线(RoPE-ViT 40.1)高 9.7 / 8.0 个点,也超过了在 LAION-2B(比 CC12M 大 167 倍)上训练的 CLIP-ViT-B/16(42.3)。同一逻辑在 CLIP-Benchmark 上重演:MetaCLIP-ViT 的视觉塔在 400× 数据上预训练,分类精度反而是最低的 25.7。
  • 失败模式是互补的,不是单方面碾压。 ImageNet-R(47.8 vs 46.2)和 ImageNet-A(16.3 vs 15.5)上 RoPE-ViT 更好,CLIMP 落后 1–2 个点,作者也承认 VMamba 的空间特征在强风格迁移下不如 ViT 的抽象注意力特征;CLIMP 的收益集中在分布漂移(IN-V2 +3.1/+2.6)与天然分布外(IN-O)以及 Sketch。
  • 分辨率越高,优势越大。 896×896 时 CLIMP 相对 RoPE-ViT 的图像与文本检索都高出 18–19 个点(NoCaps 57.1 vs 38.6、53.5 vs 34.9;Crossmodal-3600 55.9 vs 36.8、45.4 vs 26.9),并且超过专为可变分辨率设计的 FlexViT 与 NaFlex。摘要口径的「16× 训练分辨率下检索最高提升 6.6%」对应的是与 NaFlex 这类最强可变分辨率基线的比较,与 RoPE-ViT 的差距则大得多——基线选谁,结论的量级差别很大。
  • 稠密描述:图像检索领先,文本检索未必。 Flickr8k 改写版(98.3% 的 caption 超过 77 token)上 CLIMP-Mamba-1 图像 R@1 比最强基线高 6.3;DOCCI 上高 8.2。但 DOCCI 的文本检索 NaFlex 最好(26.1 vs CLIMP 的 24.6/23.8),作者归因于其 sequence packing 设计——所以「去掉 77 token 上限」并不自动等于长文本侧全面获胜,这一条论文写得很诚实。
  • 空间归纳偏置有直接的受控证据。 在 CIFAR-10 上用 3 层 VMamba(0.33M)与 3 层 ViT(0.35M)对比:正常 patch 顺序下 VMamba 训练损失更低(1.028 vs 1.121)、精度更高(69.33 vs 67.50);把 patch 顺序打乱后 VMamba 大幅退化(损失 1.612、精度 46.44),ViT 反而相对稳健(1.328 / 59.72)。这说明 SSM 编码器确实把顺序空间结构当作强先验在用,而不是靠参数量取胜。
  • 规模曲线未饱和。 模型规模 22–30M 时 CLIMP 38.8 对 FlexViT 32.5、RoPE-ViT 33.2;87M 时 43.5 对 38.3、40.7,每个规模档都领先。数据从 1M 扩到 12M(Conceptual Captions)曲线持续上升未见拐点,支持「优势来自架构、可以继续放大」的判断。
  • 与卷积骨干的比较。 在 OpenCLIP 的 38 个基准上,CLIMP 平均比所有基于 ResNet 的 CLIP 变体高出 4 个点以上(细节在补充材料),说明收益并非只是「比 ViT 好一点点」。

亮点与洞察

  • 把「池化位置」和「因果性」对齐:自回归模型里最后一个 token 是唯一拥有完整上下文的位置,所以末位池化不是将就,而是与因果结构最匹配的选择——同时它顺带消掉了 77 token 上限。这个「把架构约束翻译成设计优势」的推理方式很值得学。
  • 同族架构的匹配效应:RoPE-ViT 换文本塔几乎不动(±1%),VMamba 换成 Mamba 文本塔却稳定 +3.5% Acc@1 / +3.9% TR@5。这条经验对做跨模态架构搜索的人有直接价值——视觉塔与文本塔的「族别匹配」可能比单独强化某一塔更划算,而且这个结论只有在做了交叉消融(Table 10 那种二维网格)之后才看得出来。
  • 用扫描顺序替代位置编码:把「位置」从可插值的显式参数变成结构性的先验,模型于是天然支持分辨率外推。这个思路可以迁移到任何需要变分辨率的视觉任务(高分辨率检测、遥感、病理切片),只要把「位置靠结构而非编码」这一点落实。
  • hubness 作为检索诊断指标:检索质量不只取决于对齐,还取决于少数「hub」向量是否垄断近邻列表。本文用 alignment / uniformity / hubness 三件套把「为什么检索变好」拆开解释,并且把低文本 hubness 与「更少依赖伪相关特征」联系起来——这套诊断可以搬到任意检索系统的分析里。
  • 控制变量的实验设计本身是亮点:全部模型同数据同协议,再额外放一个数据量大 400× 的 MetaCLIP-ViT 作为对照,把「架构还是数据」这个常吵架的问题变成了可测量的量。同时作者花了一整段篇幅写「Transformer 在哪些地方仍然更好」,这在一篇立场鲜明的论文里不多见。

局限与展望

  • 规模偏小,外推结论缺乏大规模实证。 训练数据只有 CC12M(约 12M 对),视觉塔是约 86M 的 base 规模且用 ImageNet-1K 初始化,文本塔直接沿用现成 LLM 而未做大规模联合预训练。作者用未饱和的缩放曲线论证「放大后仍然成立」,但这终究是曲线外推而非实证。
  • 平均口径会掩盖逐数据集差异。 CLIP-Benchmark 的平均值让 ImageNet-R / ImageNet-A 上的落后被盖住了;摘要的「最高提升 6.6%」与正文表 4 中相对 RoPE-ViT 的 +18~19% 口径不同,读者需要看清对比对象是谁。
  • 扫描路径本身是未做消融的超参。 SS2D 用四条遍历路径,路径数量与方向组合的选择在论文里没有展开,而这恰恰是「隐式位置信息」最敏感的部件。
  • 鲁棒性提升的因果链只有相关性证据。 论文把 OOD 改善归因于低 hubness → 更少依赖伪相关特征,但目前只有几何指标与精度之间的相关性,没有直接操纵伪相关的因果实验。
  • 效率只报了 FLOPs 与显存,没报实际延迟。 线性复杂度在 GPU 上的真实速度取决于 scan kernel 的实现质量(Mamba-2 的 2–8× 加速主要来自训练期),部署侧的实际吞吐仍需实测,论文没有给出。
  • 改进方向:把视觉塔换到更大规模并从零训练、验证跨模态「同族匹配」是否在视觉塔冻结/解冻组合下仍成立、补上扫描方向与路径数的消融、以及扩展到生成式视觉语言任务与混合架构(这也是作者列出的未来工作)。

相关工作与启发

  • vs CLIP / OpenCLIP:本文沿用完全相同的双塔对比框架与损失,只替换骨干。区别在于它证明了「换骨干」本身就能同时改善检索、鲁棒性、分辨率与长文本四个维度,而不需要改损失或造数据;劣势是规模远小于 CLIP 系,绝对精度不能与之直接比较。
  • vs SigLIP / EVA-CLIP / MetaCLIP:这些工作在数据策展、损失形式(sigmoid 成对损失)、训练配方与更强的编码器上做改进,但视觉塔仍是 ViT。MetaCLIP 在本文中恰好被用作「数据红利」的对照,两者结论是互补的而非对立——数据红利和架构归纳偏置可以叠加。
  • vs CLIP-Mamba:它只在单个塔内部混合 Mamba 与 Transformer,也没有覆盖检索、鲁棒性、分辨率、稠密描述这四类评估;CLIMP 是全 SSM 双塔并给出了完整评估,这是本文宣称「首个」的依据。
  • vs LLM2CLIP / UniViTAR:它们用 Transformer LLM 替换 CLIP 的文本塔(外加轻量适配器),视觉塔仍是 ViT;CLIMP 让两个模态都保持线性复杂度,代价是文本塔没有专门的双向预训练适配。
  • vs ViM / SiMBA / VMamba:前两者在分类任务上验证视觉 SSM 的可行性,VMamba 提出 SS2D;CLIMP 是第一次系统性地把 VMamba 放进 CLIP 框架,并额外发现视觉与文本同族匹配的增益。
  • vs FlexViT / NaFlex / RoPE-ViT:它们用位置编码插值或专门的可变分辨率训练来适配高分辨率;CLIMP 靠扫描顺序隐式携带位置,不插值也不额外训练,在高分辨率上反而超过了这些「专业方案」。

评分

  • 新颖性: ⭐⭐⭐⭐ 首个全 SSM 双塔的 CLIP 模型,但主要是把已有组件(VMamba + Mamba LLM + 对比损失)做正确的组合,方法层面没有新的损失或训练机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 检索、鲁棒性、分辨率、稠密描述、几何分析、效率、模型/数据缩放、空间偏置受控实验八个角度全覆盖,且做了同数据同协议的交叉消融与数据量对照。
  • 写作质量: ⭐⭐⭐⭐ 主张与证据对应清晰,专门用一节写「Transformer 在哪些方面仍更好」,少见地克制;缺点是主文未列出对比损失与池化公式。
  • 价值: ⭐⭐⭐⭐ 为「SSM 能否替代 Transformer 做视觉语言预训练」给出了正面答案,并提供了可变分辨率与长文本两条实用路径;实际部署收益仍需延迟实测来确认。