跳转至

SyncVL: Synchronizing Vision ⟷ Language Using Unsupervised Adaptation

会议: ECCV 2026
论文: ECCV 2026 Official
PDF: ECCV Paper PDF
领域: 多模态 VLM / 语义分割
关键词: 视觉语言模型、无监督自适应、模态同步、群体相对策略优化 (GRPO)、双向蒸馏

一句话总结

针对双模态对比视觉语言模型在无标签下游目标域中存在的模态差距与域偏移问题,SyncVL 在完全冻结预训练主干的前提下引入双向轻量 Transformer 同步器,通过借鉴群体相对策略优化 (GRPO) 形式化一致性与对齐奖励,配合潜在空间互蒸馏实现全无监督双向模态同步。

研究背景与动机

大规模对比视觉语言模型(如 CLIP、EVA-CLIP、ImageBind 和 SigLIP)通过双编码器架构在海量图像-文本对上进行联合对比预训练,展现出强大的零样本迁移与开放词表泛化能力。然而,由于视觉与文本之间固有的模态异质性,预训练模型表征空间中始终存在不可忽略的模态差距(Modality Gap)。更关键的是,当模型迁移到专业细分领域、分布偏移或退化场景时,这种静态对齐关系往往显著受损,严重制约了模型在无标注下游任务中的判别能力与鲁棒性。

现有提升跨模态对齐的研究主要可分为监督微调与无监督自适应两大路线。前者依赖目标域的有标注样本进行提示微调(Prompt Tuning)或适配器调整(Adapter Tuning),不仅在许多数据敏感场景下面临极高的标注成本,而且极易在小样本上发生过拟合,造成对未见域特征的灾难性遗忘;后者则多采用单向自监督伪标签微调,但直接微调数十亿参数的双编码器不仅破坏预训练多模态先验,伪标签的确认偏差(Confirmation Bias)还会随训练迭代迅速累积与恶化。此外,传统的绝对损失函数往往在样本内一致性约束与跨模态对比对齐约束之间产生剧烈的梯度冲突,导致优化轨迹严重震荡。

针对这一矛盾,本文提出一种双向对称的无监督表征同步范式,完全放弃对主干网络的微调,转而在冻结特征之上构建轻量双向映射,并借助群体优势归一化来化解多目标优化的梯度干扰。核心 idea:在冻结 VLM 编码器的基础上引入视觉到文本 (V2T) 与文本到视觉 (T2V) 双向 Transformer 同步器,将无监督模态同步表述为基于群体相对策略优化 (GRPO) 的强化学习对齐过程,利用增广组内一致性、跨模态伪类中心对齐与潜在空间互蒸馏,在无标注目标域上渐进构建统一对称的公共隐空间。

方法详解

整体框架

SyncVL 的处理流水线如图所示。首先,给定下游无标签图像,利用数据增广构建图像视图组,通过冻结的图像编码器提取初始视觉嵌入;同时对目标任务类别名称采样多个提示模板,通过冻结的文本编码器提取初始文本嵌入并求类中心。随后,两个轻量化编码器-解码器同步器协同运作:视觉到文本同步器(\(f_{v2t}\))将视觉增广组映射到文本语义空间,接受视图一致性奖励和伪类别对齐奖励的监督;文本到视觉同步器(\(f_{t2v}\))则在 \(f_{v2t}\) 生成的伪类别锚点指导下,将多文本模板组映射到视觉空间,同时接收一致性、对齐与潜在互蒸馏奖励。两个同步器交替优化并动态重构样本分组,最终在推理阶段仅抽取同步器的轻量编码器,将视觉与文本嵌入映射至共同的对齐子空间完成相似度匹配。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:无标签图像与类别提示模板"] --> B["冻结主干特征提取<br/>多增广视图与多文本模板编码"]
    B --> C["双向轻量同步器架构<br/>V2T 与 T2V Transformer 映射"]
    C --> D["群体相对策略优化驱动的无监督奖励机制<br/>组内分布一致性 + 伪类中心对齐奖励"]
    D --> E["潜在子空间互蒸馏与迭代对齐<br/>V2T 教师指导 T2V 潜在空间表征对称"]
    E --> F["输出:对齐公共隐空间<br/>保留双编码器零样本判别与结构"]

关键设计

1. 双向轻量同步器架构:解耦主干参数冻结与双向跨模态语义映射 传统跨模态微调方法往往直接解冻主干编码器(\(f_\theta\) 与 \(g_\phi\)),但无监督场景下极易破坏海量预训练赋予的泛化结构。SyncVL 坚持将双模态编码器完全冻结,在特征提取之后接入两个对称轻量级的 Transformer 编码器-解码器结构(包含 2 个 Transformer Block),分别定义为视觉到文本同步器 \(f_{v2t}: \mathbb{R}^d \to \mathbb{R}^d\) 与文本到视觉同步器 \(f_{t2v}: \mathbb{R}^d \to \mathbb{R}^d\)。\(f_{v2t}\) 负责将视觉表征逐步投影至以文本嵌入为骨架的目标空间,而 \(f_{t2v}\) 负责反向对齐。这种双向设计彻底改变了以往仅从视觉单向拉伸到文本的非对称结构,使得两模态在低维子空间中能够互为参照、共同矫正。

2. 群体相对策略优化驱动的无监督奖励机制:利用一致性与对齐协同消除梯度冲突 若直接将样本的一致性损失与对比对齐损失相加做梯度下降,两者方向往往互斥(余弦相似度呈现负值),产生严重的破坏性梯度干扰。SyncVL 借鉴大模型强化学习中的群体相对策略优化(GRPO),将同步器视为生成潜在嵌入的隐式策略 \(\pi_\theta\)。对于输入图像 \(x_j\) 的 \(k\) 个不同增广视图嵌入 \(\{v_{j,i}\}_{i=1}^k\),经同步器映射得 \(v_{j,i}^{t} = f_{v2t}(v_{j,i})\) 构成一组。模型为该组计算两个互补奖励: - 分布一致性奖励(\(L_{v2t}^{con}\)):计算每个实例映射与文本类中心 \(\bar{t}_c\) 的 Softmax 类别分布 \(p_{j,i}\),最小化各实例分布与组均值分布 \(\bar{p}_j = \frac{1}{k}\sum_{i=1}^k p_{j,i}\) 之间的 KL 散度: $\(L_{v2t}^{con}(j, i) = D_{\text{KL}}(\bar{\mathbf{p}}_j \,\|\, \mathbf{p}_{j,i})\)$ - 对比对齐奖励(\(L_{v2t}^{aln}\)):通过组内投票确立正向伪类 \(c^+\),并选取匹配度次高的类别作为难负类 \(c^-\),通过对数似然最大化拉近正类、推开负类: $\(L_{v2t}^{aln}(j, i) = -\log \frac{\exp(s_{(j,i,c^+)} / \tau)}{\exp(s_{(j,i,c^+)} / \tau) + \exp(s_{(j,i,c^-)} / \tau)}\)$ 随后,GRPO 在每个增广组内对奖励计算相对优势值 \(A_{j,i} = (r_{j,i} - \bar{r}_j) / (\sigma_j + \epsilon)\),并执行 PPO 风格的截断目标优化。这使得模型优化摆脱了对绝对损失值的脆弱依赖,将一致性与对齐梯度的余弦相似度从负值逆转为协同的正值(例如在 CIFAR-100 上从 -0.24 跃升至 +0.65)。

3. 潜在子空间互蒸馏与迭代对齐:教师-学生渐进对齐构建统一推断空间 在完成 \(f_{v2t}\) 的训练后,已训练的 \(f_{v2t}\) 被赋予教师角色,对 \(f_{t2v}\) 提供两层强监督。首先,利用 \(f_{v2t}\) 推断的图像伪标签,在目标域上聚合出各伪类别的视觉平均中心 \(\bar{v}_c = \frac{1}{n_c}\sum_{j=1}^{n_c} v_{j}^t\);其次,将 \(f_{v2t}\) 编码器作为潜在空间教师,在 \(f_{t2v}\) 的潜在层引入知识蒸馏奖励: $\(L_{t2v}^{KD}(c, i) = f_{v2t}^e(\bar{\mathbf{v}}_c) \cdot f_{t2v}^e(\mathbf{t}_{c,i})\)$ 其中 \(f_{v2t}^e\) 与 \(f_{t2v}^e\) 分别为两同步器的编码器阶段。在后续交替迭代阶段中,图像组的构建由单纯的增广视图转为基于伪标签的同类聚合(Pseudo-Label Re-grouping),两同步器循环往复提供更纯净的锚点。在推理时,完全剥离解码器,仅保留两个轻量编码器将未见测试样本投影进共享子空间计算余弦相似度,兼顾了高效计算与严格的跨模态对称性。

损失函数 / 训练策略

整个训练过程分为阶段性交替优化: 1. 初试阶段:固定 VLM 主干,对每张图像进行 \(k=7\) 种数据增广,输入 \(f_{v2t}\),使用 AdamW 优化器(学习率 \(1\times 10^{-4}\),权重衰减 0.01)以 GRPO 优化 \(L_{v2t} = L_{v2t}^{con} + L_{v2t}^{aln}\) 共 100 个 epoch。 2. 反向蒸馏阶段:利用训练好的 \(f_{v2t}\) 提取图像伪标签,计算视觉伪类中心 \(\bar{v}_c\)。随后对每个类别的 \(m\) 个文本模板构建组,以 \(f_{v2t}\) 为教师,通过组合一致性、对齐与潜在蒸馏奖励 \(L_{t2v} = L_{t2v}^{con} + L_{t2v}^{aln} + L_{t2v}^{KD}\) 训练 \(f_{t2v}\) 100 个 epoch。 3. 循环重聚与推断:更新伪标签重新对全集图像分组,交替迭代微调。推断时仅调用 \(f_{v2t}^e\) 与 \(f_{t2v}^e\) 提取特征向量,零额外通信开销。

实验关键数据

主实验

在无监督自适应(Unsupervised Adaptation, UA)评测基准中,SyncVL 与当前 SOTA 方法在 CLIP ViT-B/32 骨干上的 14 个常用数据集对比结果如下(涵盖通用分类、细粒度分类、纹理识别、动作识别及遥感图像):

方法 平均分 (Avg.) CIFAR-10 CIFAR-100 DTD Cars UCF101 EuroSAT Food101 Flowers Aircraft ImageNet
CLIP (B/32) 原始基线 65.04 91.30 65.10 44.50 64.50 49.40 82.40 87.00 66.46 21.20 63.20
UPL (ICLR 22) 64.05 91.26 67.41 45.37 62.04 51.88 84.25 83.84 67.40 17.07 62.12
POUF (ICML 23) 64.82 90.50 62.00 46.10 61.20 62.90 82.10 87.80 67.80 18.20 60.00
CPL (ICML 24) 68.54 94.68 77.30 56.30 71.00 82.20 83.18 87.62 76.70 19.76 -
TransCLIP (NeurIPS 24) 68.42 91.18 67.38 50.40 59.00 81.50 89.00 74.40 68.70 20.30 67.44
LafTer (NeurIPS 23) 69.90 95.80 74.60 46.10 73.90 82.45 84.93 71.00 68.20 19.86 64.50
ReCLIP (WACV 24) 70.08 94.84 72.26 53.88 67.01 70.80 84.19 87.49 72.63 18.87 73.89
DPA (WACV 25) 72.29 95.97 76.47 55.69 68.49 80.04 84.76 90.71 75.56 20.67 68.13
SyncVL (本文) 76.48 98.65 81.14 63.28 74.50 84.14 86.98 93.96 79.84 25.06 74.84

此外,在密集预测(目标检测与语义分割)评测中,SyncVL 显著赋能冻结 VLM 的空间定位能力:

骨干网络 评估任务 / 数据集 PASCAL VOC (AP50) PASCAL VOC (mIoU) MS COCO (AP50) MS COCO (mIoU)
CLIP (B/16) Baseline 原始基线 30.48 16.20 27.80 4.40
CLIP (B/16) + SyncVL (本文) 35.09 (+4.61) 27.65 (+11.45) 31.40 (+3.60) 6.01 (+1.61)
TULIP (B/16) Baseline 原始基线 28.70 15.84 21.32 3.72
TULIP (B/16) + SyncVL (本文) 32.14 (+3.44) 17.95 (+2.11) 25.04 (+3.72) 5.69 (+1.97)

消融实验

消融实验系统验证了各个组件、优化目标以及奖励项对模型性能的具体增益贡献:

实验配置类别 变体配置详情 CIFAR-10 CIFAR-100 DTD 核心结论与影响分析
模块递进消融 Baseline (无同步器) 91.30 65.10 44.50 冻结预训练主干的原始零样本性能
单向 V2T (无 GRPO 优化) 86.37 68.54 50.18 缺乏组相对奖励时梯度冲突导致 CIFAR-10 负迁移
单向 V2T (+ GRPO 优化) 93.06 71.86 53.24 相对优化有效规避过拟合,性能显著回升
双向 V2T + T2V (无 GRPO 优化) 95.86 74.18 56.72 双向结构引入双模态对称约束,大幅增强基线
完整 SyncVL (双向 + GRPO) 98.65 81.14 63.28 全要素协同取得最高分类准确率
奖励目标消融 仅使用一致性奖励 \(L_{con}\) 94.18 73.69 55.24 保证组内视图稳定性,但跨模态距离拉伸有限
仅使用对齐奖励 \(L_{aln}\) 94.64 73.24 55.40 增强模态匹配,但缺乏扰动一致性保证
组合 \(L_{con} + L_{aln}\) 96.32 77.16 57.06 组内鲁棒性与跨模态判别互补
全奖励 (\(L_{con} + L_{aln} + L_{KD}\)) 98.65 81.14 63.28 潜在蒸馏有效强化两编码器潜在空间的对称表征

关键发现

  • GRPO 彻底逆转梯度冲突:对一致性奖励与对齐奖励梯度的余弦相似度分析表明,未采用 GRPO 时,两损失梯度在 CIFAR-10、CIFAR-100、DTD 上的夹角余弦为负(分别为 -0.10、-0.24、-0.09),说明优化方向彼此掣肘;引入组相对优势归一化后,余弦值跃变为正协同状态(最终分别达到 +0.63、+0.65、+0.56),从根本上稳定了多任务自监督优化。
  • 双向架构远胜单向拉伸:从单向 V2T 到双向 V2T+T2V 带来了 5-10% 的持续提升,证明文本到视觉的逆向投影与潜在互蒸馏能为伪类别中心提供极具信息量的正则化,遏制了单纯单向聚类导致的类别塌缩。
  • 跨骨干通用性强:在 CLIP、SigLIP、ImageBind、EVA-CLIP、SigLIP-2、TULIP 等 6 种主流不同量级骨干上接入 SyncVL,平均准确率全面增长 2.5% 至 13.5%,验证了框架与具体主干无关的泛化潜力。

亮点与洞察

  • 将策略优化范式平移至对比表征空间:巧妙摆脱了传统 RLHF 依赖自回归解码 token 序列的局限,将连续潜在表征生成视为隐式策略,通过增广组内相对优势归一化实现了对连续嵌入的策略梯度更新。
  • 完全免于主干微调的知识保全哲学:严格冻结大模型编码器全部参数,仅依靠微型双向 Transformer 模块调整流形拓扑,既完全规避了灾难性遗忘,又将可训练参数量压缩至主干的极小比例。
  • 高噪声条件下的异常鲁棒自愈能力:即便在初始零样本准确率低于 25% 的高难度数据集(如 Aircraft、GTSRB、Cars)上,通过组内投票与迭代伪标签重分组机制,SyncVL 依然能够实现 +15% 以上的逆风翻盘。

局限与展望

  • 作者承认的局限:在极端细粒度类别场景下,若初始零样本预测的多数投票完全指向错误类别,伪标签重分组机制可能在初期强化错误的监督信号,延缓收敛速度。
  • 潜在不足与适用边界:训练包含多个顺序阶段(增广训练、伪标签生成、文本蒸馏、多轮迭代重聚),整体流水线相较于单阶段适配器微调稍显繁琐;此外,文本端严重依赖人工设计的丰富提示词模板(Templates),模板多样性不足时可能降低 T2V 同步器的表现。
  • 后续改进方向:可探索利用自回归大语言模型(LLM)动态扩充更具判别性的多维度类别描述文本,替代固定离线模板,进一步自动化跨模态交互质量。

相关工作与启发

  • vs DPA (WACV 2025):DPA 采用双重原型对齐策略,但依赖于直接微调特征主干并采用单向伪标签拉近;SyncVL 坚持冻结主干并构建双向 Transformer,利用 GRPO 解决一致性与对齐目标的梯度干扰,在 14 个数据集上均分领先 4.19%。
  • vs LafTer (NeurIPS 2023):LafTer 使用文本生成与未标注图像进行无标签分类器调优;SyncVL 克服了 LafTer 单向映射易受确认偏差影响的缺陷,引入对称的 T2V 蒸馏和连续潜空间约束,判别边界更清晰。
  • vs CoOp / MaPLe (CVPR / IJCV):有监督与多模态小样本提示学习需要 8-shot 或 16-shot 标注,而 SyncVL 完全无需任何人工标注,但在多数数据集上取得了超越 16-shot MaPLe 的零样本泛化精度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将 GRPO 相对奖励思想引入双编码器 VLM 的连续特征空间,设计了兼顾一致性与对齐的双向同步器。
  • 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 24 个数据集,横跨无监督分类、OOD 泛化、跨模态检索、密集检测分割以及安全鲁棒性,评测极度扎实。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰,梯度冲突与策略优化动机论证深入,图表逻辑自洽。
  • 价值: ⭐⭐⭐⭐⭐ 为预训练大模型在无标签下游场景的高效对齐与鲁棒迁移提供了极具参考价值的工程与理论范式。