Spherical Interpolation for Backward-Compatible Multimodal Representations¶
会议: NeurIPS2026(按任务清单归档;阅读版本为 arXiv v1,2026-09-30)
arXiv: 2609.39836
代码: https://github.com/miccunifi/SLERP_backward_compatibility
领域: 多模态 VLM
关键词: 向后兼容、跨模态检索、正交 Procrustes、球面插值、模型升级
一句话总结¶
在不重建旧图库索引的条件下,先用 Procrustes 将新模型查询对齐到旧空间,再与同一输入的旧模型查询做球面插值;多数平均检索增益来自两端表示的互补,而支持集选权重进一步提高兼容成功率。
研究背景与动机¶
CLIP、SigLIP 等视觉语言模型把图像和文本编码为归一化向量,检索依靠余弦相似度。升级编码器并不像替换一个分类头那么简单:图库中可能已有数百万乃至数十亿条旧向量,而独立训练的新模型使用了不同的表示坐标。新查询直接搜索旧索引,未必能利用新模型更强的语义能力,反而可能破坏原来的匹配关系;原始图库数据被删除或受隐私约束时,重新编码甚至不可行。
向后兼容训练把旧空间约束加入新模型的训练过程,但需要专门训练,而且可能限制新模型的发展。事后正交对齐提供了轻量替代:用一组共同输入,在不改编码器的情况下估计新到旧的坐标变换。不过,全局对齐不能消除模型之间所有细粒度差异。论文在 CC3M 和零样本迁移的 Flickr30k 上都观察到对齐后仍有角度残差,因此“已在同一坐标系”不等于“同一输入的两种表示完全一致”。
旧查询保持了与既有图库的匹配习惯,对齐后的新查询则可能携带旧查询遗漏的辨别信息。残差不必全部当作噪声,但也不能假设沿残差走到新端点一定更好。核心 idea:把旧查询与对齐后的新查询视为同一球面上的两个端点,在二者之间选择一个可迁移的插值位置,用查询侧的表示互补换取兼容升级,而不改动旧图库。
方法详解¶
整体框架¶
方法的输入是冻结的新旧 VLM、一组支持样本和已部署的旧模型图库,输出是仍能搜索旧索引的单个单位查询向量。离线执行“Procrustes 对齐”和“支持集选权重”;在线执行“球面查询融合”,必须获得同一查询的新旧两个编码结果。离线拟合不是编码器训练,图中的虚线只传递拟合结果,不表示反向传播。
图库侧始终保留旧向量:I2T 用图像查询搜索旧文本图库,T2I 用文本查询搜索旧图像图库。两种方向的权重分别选择;给定模型对、支持模态和检索方向后,权重对所有目标数据集和所有查询固定,并不是逐查询 oracle。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["离线支持集<br/>冻结新旧编码器"] --> B["Procrustes 对齐"]
B --> C["支持集选权重"]
Q["在线查询"] --> O["旧查询编码"]
Q --> N["新查询编码<br/>对齐并归一化"]
B -.->|固定映射| N
O --> D["球面查询融合"]
N --> D
C -.->|固定权重| D
D --> S["余弦检索"]
G["旧图库与旧索引<br/>不重新编码"] --> S
关键设计¶
1. Procrustes 对齐:先建立共同坐标系,再处理剩余差异
支持集中的每个输入都由新旧模型编码,将旧向量和新向量分别按行堆成 \(U\) 与 \(\bar V\)。等维时求解 \(R^\star=\arg\min_{R^\top R=I}\|\bar V R-U\|_F^2\);若 \(\bar V^\top U=P\Sigma Q^\top\),闭式解就是 \(R^\star=PQ^\top\)。论文实验将这个对齐基线简称为 SVD,因为只需要一次奇异值分解,没有梯度优化。
等维正交映射保留新模型内部的内积和角度,避免为了靠近支持集中的旧向量而任意缩放、剪切表示空间。支持数据可以只用文本、只用图像,或将两种模态的向量一起堆叠;共享跨模态结构使单模态估计有机会迁移到另一模态,但这不是独立训练模型之间必然精确成立的对应关系。本文正是利用对齐后的剩余差异,而不是宣称 SVD 已完成全部兼容工作。
实际模型维度不同:CLIP ViT-B/32、L/14、H/14 分别为 512、768、1024 维,SigLIP1/2 为 1152 维。附录 B 的矩形映射要区分方向:新维度较小时可等距嵌入旧空间;新维度较大时只能保留与旧空间对齐的子空间,不能保持所有新向量内积。因此将投影后的新查询归一化为 \(v=\phi_{\mathrm{new}}(x)R^\star/\|\phi_{\mathrm{new}}(x)R^\star\|_2\),要求分母非零。不能把所有跨维升级一概描述为全空间等距变换。
2. 支持集选权重:用共同校准集确定部署位置,而非利用测试标签
作者使用 CC3M 验证集中可用的 12,637 个图文对,既估计对齐映射,也选择插值权重。对每个模型对及支持模态,I2T、T2I 分别在 \(\alpha\in\{0,0.1,\ldots,1.0\}\) 上最大化支持集 Recall@1,选出的 \(\hat\alpha\) 随后冻结,在 Flickr30k、COCO2014、NoCaps 上直接使用。支持集与目标查询、图库分离,但拟合映射和选权重使用的是同一支持集,并非另设一套独立校准集。
固定权重解决的是部署时不可观测“最佳位置”的问题,不会读取当前查询的相关项标签,也不动态搜索目标测试集。论文另外报告目标数据集 oracle \(\alpha^\star\) 和逐查询 oracle,两者都仅用于上界分析。附录 K 从目标分布采样少量有标签数据选择权重属于另一种设定,不能混入主实验的无目标测试调参协议。
端点都包含在支持集网格中,因此当新端点不可靠时可以选回旧查询。注意这只提供支持集上的回退选择,不保证目标分布也超过旧模型;如果最终 \(\hat\alpha=0\),系统等于旧系统,在论文要求“严格超过”的经验兼容标准下不计兼容成功。
3. 球面查询融合:保留旧查询的匹配能力,同时引入对齐新查询的信息
在线先计算旧查询 \(u=\phi_{\mathrm{old}}(x)\) 和归一化对齐新查询 \(v\),二者都位于旧空间单位球面。令 \(\theta=\arccos\langle u,v\rangle\),则 \(q_\alpha=\frac{\sin((1-\alpha)\theta)}{\sin\theta}u+\frac{\sin(\alpha\theta)}{\sin\theta}v\)。这是 SLERP:\(\alpha=0\) 为旧查询,\(\alpha=1\) 为 SVD 新查询,且 \(\angle(u,q_\alpha)=\alpha\theta\),使权重具有“走过端点总角度的多少比例”的统一解释。
公式和理论要求 \(0<\theta<\pi\)。端点重合时没有可利用的路径;端点对跖时最短球面弧不唯一,不能直接使用分母为零的公式。近重合、近对跖也需要数值保护,但本文的非退化定理不自动覆盖所有工程回退规则。输出仍是一个旧维度单位向量,只需搜索一次旧索引;不重新编码图库不等于可以停止计算旧查询。
为什么中间可能优于两端?以仅供分析的理想检索方向 \(q^\ast\) 为参照,将其投影到 \(u,v\) 张成的平面,投影长度为 \(\rho\),相对旧端点的角位置为 \(\psi\)。定理 1 给出角度差 \(G(\alpha)=\arccos(\rho\cos(\alpha\theta-\psi))\):严格优于两个端点的内部方向存在,当且仅当非零投影归一化后落在短弧的相对内部。投影为零时整条弧与参照方向的夹角都是 \(\pi/2\);投影方向在弧外时最佳位置在端点。端点相隔较大本身不能推出插值有效,插值也无法补回平面外的全部信息。
从角度到 Recall 还需要检索间隔。附录 F 定义 \(m_{K,x}(q)=\max_{j\in P(x)}\langle q,g_j\rangle-\tau^-_{K,x}(q)\),其中 \(P(x)\) 是相关项集合,\(\tau^-_{K,x}\) 是负项分数的第 \(K\) 大值;正间隔保证至少一个相关项进入 top-\(K\),零间隔取决于平分规则。取最大化该间隔的方向 \(q_K^\star(x)\),若其最优间隔 \(m^\star_{K,x}>0\) 且 \(G_{K,x}(\alpha)<2\arcsin(m^\star_{K,x}/4)\),才获得单查询成功的局部充分条件。其依据是间隔扰动界 \(|m_{K,x}(q)-m_{K,x}(q')|\leq2\|q-q'\|_2=4\sin(\angle(q,q')/2)\)。这不是所有查询或所有数据集的兼容保证,也不是部署时求解理想方向的算法。
SLERP 的优势需要克制理解。归一化线性插值 NLERP 走过同一条短弧,只是角速度不同;对单查询连续搜索,两者可以达到相同最优方向。对于统一权重和有限网格,参数化会影响不同查询实际采样的位置,但附录 N 中二者平均表现几乎一样。固定系数下,NLERP 与新旧分数线性融合还具有相同排名,因为归一化只给该查询的全部分数乘以同一个正常数。实验证据支持的是端点互补,而非球面算子独有的性能提升。
一个完整示例¶
以 CLIP ViT-L/14 升级 ViT-B/32、文本支持对齐的 I2T 为例,图库仍保存 ViT-B/32 编码的文本向量。离线在 CC3M 上拟合 768 到 512 维映射,并选出图像查询权重 0.7;在线一张新图像分别经过旧、新图像编码器,将新向量投影并归一化,再沿二者短弧走 70% 的角距离。最后只用融合后的 512 维向量搜索原文本图库。
在完整 Flickr30k 协议下,这个固定方案的 Recall@1 为 48.00%,旧查询为 40.62%,单用对齐新查询为 42.89%。这里的 0.7 对所有图像固定,不是事先知道哪条 caption 正确后选择;逐数据集 oracle 的 0.5 和 48.61% 只是另列上界。该例同时说明了查询侧双编码与图库侧零重编码的区别。
损失函数 / 训练策略¶
本文不新增编码器损失,不微调 CLIP/SigLIP,也不学习一个梯度训练的兼容层。可拟合量只有闭式 Procrustes 映射和支持集网格选出的权重;“无需训练”应理解为无需模型重训练或梯度优化,而不是无需支持数据与离线计算。
主检索基准使用 Flickr30k 全部 Karpathy 划分的并集,以及 COCO2014、NoCaps 验证集,不能与常见 Flickr30k 1K 或 COCO 5K 协议直接横比。报告 I2T/T2I 的 Recall@1/5/10,Recall 是“至少命中一个相关项”的查询命中率。
实验关键数据¶
主实验¶
下表摘取原文表 1–2 的文本支持 T 设置,所有数字均为 Recall@1 百分数,权重顺序均为 I2T/T2I。新到旧的箭头表示升级来源到旧图库模型;SLERP 使用 CC3M 固定权重,没有测试集调参。
| 模型升级与数据集 | 旧模型 I2T/T2I | SVD I2T/T2I | SLERP I2T/T2I | 固定权重 |
|---|---|---|---|---|
| CLIP L/14 → B/32,Flickr30k | 40.62 / 21.73 | 42.89 / 21.49 | 48.00 / 23.33 | 0.7 / 0.5 |
| CLIP L/14 → B/32,COCO | 28.76 / 14.47 | 30.27 / 14.03 | 33.40 / 15.26 | 0.7 / 0.5 |
| SigLIP2 → B/32,Flickr30k | 40.62 / 21.73 | 42.80 / 23.56 | 51.01 / 25.79 | 0.6 / 0.5 |
| SigLIP2 → B/32,NoCaps | 71.29 / 45.24 | 72.16 / 46.41 | 78.56 / 50.59 | 0.6 / 0.5 |
| SigLIP2 → SigLIP1,COCO | 46.99 / 30.88 | 36.30 / 30.53 | 46.76 / 32.50 | 0.3 / 0.4 |
| SigLIP1 → H/14,Flickr30k | 59.38 / 43.07 | 60.50 / 29.91 | 64.81 / 43.38 | 0.5 / 0.1 |
同家族 L/14 → B/32 的 Flickr30k I2T 从 SVD 的 42.89% 升到 48.00%,增加 5.11 个百分点;但对应 COCO T2I 的 15.26% 低于 XBT 的 15.55%,不应概括成全面超越训练基线。SigLIP2 → SigLIP1 的 COCO I2T 仍低于旧模型 0.23 个百分点,说明“大幅修复对齐损失”和“严格兼容”不是一回事。
经验兼容定义是 \(M_{\mathrm{new}\to\mathrm{old}}>M_{\mathrm{old}\to\mathrm{old}}\),只比较同一旧图库上的平均指标,不要求每条查询都不退化。正翻转率 PFR 是旧失败、新成功的查询数占全部查询数的比例,负翻转率 NFR 是旧成功、新失败的对应比例,因此 \(\Delta\mathrm{R@}K=\mathrm{PFR}-\mathrm{NFR}\)。平均 Recall 增加时仍可能有负翻转。
消融实验¶
原文表 10 汇总五个模型对、三种支持模态、三个数据集,共 45 个配置、90 个方向级兼容判断。下表保留对齐与融合的关键比较;平均增益相对 SVD、兼容次数均按原表记录。
| 配置 | 平均 I2T R@1 | 平均 T2I R@1 | 相对 SVD 平均增益(百分点) | 兼容次数 |
|---|---|---|---|---|
| SVD / Procrustes | 51.72 | 33.77 | 0.00 | 45/90 |
| Affine 对齐 | 31.69 | 23.10 | -15.35 | 11/90 |
| Ridge 对齐 | 33.96 | 28.89 | -11.32 | 14/90 |
| Whitened Procrustes | 49.06 | 32.78 | -1.83 | 37/90 |
| SVD + 固定归一化中点 | 57.76 | 37.23 | +4.75 | 72/90 |
| SVD + 支持集 NLERP | 57.73 | 37.38 | +4.81 | 84/90 |
| SVD + 支持集 SLERP | 57.72 | 37.38 | +4.80 | 85/90 |
| SVD + 自适应 NLERP | 57.86 | 37.42 | +4.89 | 88/90 |
固定中点已经获得 +4.75 个百分点,SLERP 的 +4.80 只再增加 0.05;选权重的主要收益在兼容稳健性,而非巨大的平均额外增益。自适应 NLERP 根据两端余弦一致性选择位置,参数也只在 CC3M 上校准;它相对 SLERP 多 0.09 个百分点,属于附录扩展,不是主方法的逐查询 oracle。
原文存在计数冲突:第 4.3 节及表 10 写 SLERP 为 85/90,附录 N.3 正文写 84/90,并以脚注讨论某个旧端点配置中浮点平分导致单查询差异。笔记保留表中 85/90,不将两种计数自行修成一致;精确兼容次数需以作者代码和统一平分规则复核。
关键发现¶
附录 M 的逐查询 oracle 使用 Flickr30k I2T、L/14 → B/32、文本支持以及 11 个权重点,允许读取每条测试查询的标签,因此不能部署。下面的数据用来区分“内部方向确实有用”与“内部权重可以在线获得”。
| 查询权重规则 | Recall@1(%) | 可部署性与解释 |
|---|---|---|
| CC3M 固定权重 0.7 | 48.00 | 主方法,不读目标测试标签 |
| Flickr30k 数据集 oracle 0.5 | 48.61 | 测试数据集级上界 |
| 每查询仅选两个端点 | 54.61 | 非部署 oracle,16,936 条查询命中 |
| 每查询搜索整条离散弧 | 59.15 | 非部署 oracle,18,344 条查询命中 |
- 1,408 条查询只在内部权重命中,贡献端点 oracle 无法获得的 4.54 个百分点;这比“97.65% 的可命中查询被分配内部权重”更直接证明内部方向的贡献。后者受相关项相似度和平分规则影响,不是必须插值才能成功的比例。
- 99.87% 查询对至少一个相关 caption 的相似度在内部权重点严格优于两端,但只有部分转化为排名改善。负项也随查询变化,单看相关项相似度不等于 Recall 成功。
- 辅助零样本分类使用旧文本原型,另在 ImageNet 验证集拟合与选权重。表 3 中 L/14 → B/32 的十数据集平均准确率从 SVD 的 51.89% 升到 63.57%,超过旧模型 61.99%;SigLIP2 → SigLIP1 的 79.95% 仍低于旧模型 80.71%,并非总能恢复兼容。
- 附录 P 的 A100、\(10^7\) 合成图库 IVF-PQ 测试中,L/14 → B/32 单 GPU 的 SLERP I2T 查询延迟为 31.04 ms,全重建后为 25.59 ms;双 GPU 并行降至 25.87 ms。它节省图库重编码成本,但没有消除查询侧双编码开销,延迟是分别测量组件的 p50 相加,不是完整服务端到端 p50。
亮点与洞察¶
- 将对齐误差从“必须消掉的偏差”改看成“可利用的互补方向”。共同坐标系允许保留旧模型的匹配稳定性,又让新模型在不重建图库时贡献语义信息。
- 用归一化中点隔离融合本身,用支持集权重隔离位置校准。这个消融使结论落在端点互补上,避免把几乎相同的 NLERP、分数融合效果包装成 SLERP 独有优势。
- 几何定理与离散排名之间保留了间隔这道桥梁。内部方向更接近参照不自动带来成功;只有跨过足够的检索间隔才有局部认证,有助于分析平均增益与负翻转同时存在的原因。
局限与展望¶
- 旧编码器仍需在线运行,除非已有可用的旧查询缓存;原图库不可重建时,这可能成为长期而非短期成本。需同时评估查询吞吐、双模型显存和缓存命中率,不能只报告“不重建索引”。
- 结果依赖支持集覆盖程度和两端互补性。两端都缺乏领域信息时,插值不能创造新信息;支持集允许回退旧端点也不保证目标域表现不降。
- 理论分析使用不可直接观测的理想方向,认证是有正间隔条件的单查询局部充分条件。固定权重并不提供逐查询无退化或全分布兼容保证。
- v1 的兼容计数存在上述 85/90 与 84/90 冲突。附录 J 还将同时变换查询和图库后的 SVD 端点解释为与原新模型等价,但其“保持全部内积”的论证只直接适用于等距情形,不能无条件套用到附录 B 的高维到低维投影;应单独复核跨维重建协议。
- 主要结果为点估计,缺少主检索增益的置信区间;目标子集敏感性只报告三个随机种子。Checklist 也承认当前代码仅有最小实现,完整运行命令与基线复现脚本尚未补齐。
- 可以探索由端点一致性、查询难度和局部负项间隔预测位置,但必须用独立校准数据验证,不能把标签 oracle 当成上线策略。部分回填时如何同时服务旧、新图库也是值得进一步研究的迁移问题。
相关工作与启发¶
- vs BCT / XBT:兼容训练限制新表示与旧表示的差异,XBT 还涉及投影模块与 LoRA 等训练流程;本文冻结模型,付出双查询编码成本换取无需兼容重训练。更适合已有独立预训练模型、暂不能重建图库的升级场景。
- vs Canonicalizing Multimodal Contrastive Representation Learning:共享正交变换解释了跨模态对齐为何可能迁移;本文继续研究全局变换之后的角度残差。对齐提供坐标系,融合处理剩余差异,二者解决不同层次的问题。
- vs 模型 soups / 参数 SLERP:参数融合通常要求可匹配的架构和权重;本文融合的是同一输入的查询表示,不合并模型参数,因此可跨模型家族,但仍需保留两个编码器。
- vs NLERP / 分数融合:对于同一查询,两者与 SLERP 共享可达短弧,且 NLERP 与分数融合在相同系数下排名等价。可迁移的启发是先验证端点组合是否有效,再判断是否需要更复杂的权重规则。
评分¶
- 新颖性: 4/5。把事后对齐残差、球面路径与检索间隔连接起来,但融合算子本身不是新发明。
- 实验充分度: 4/5。覆盖模型家族、支持模态、检索方向、替代算子与成本分析,计数冲突及复现细节仍需补全。
- 写作质量: 4/5。主方法与 oracle 边界清楚,跨维重建的几何解释和兼容计数尚有不一致。
- 价值: 4/5。对无法立即重建图库的 VLM 检索系统实用,但收益须与持续双查询编码成本共同衡量。