Domain Generalization via Text-Anchored Information Bottleneck¶
会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM
关键词: 域泛化, 视觉语言模型, 信息瓶颈, 条件熵瓶颈, 跨模态对齐
一句话总结¶
论文揭示了高表达力视觉编码器在跨域蒸馏中会传递虚假域风格偏差,提出完全摒弃视觉引导、以冻结文本嵌入作为语义锚点的条件熵信息瓶颈(CEB)框架,通过最大化类别互信息并压缩类内与文本不一致的域风格,在各类骨干网络和基准数据集上均取得显著 SOTA。
研究背景与动机¶
计算机视觉识别模型在实际部署时经常遭遇环境与分布漂移。与能够访问目标域无标签数据的域自适应(Domain Adaptation)不同,域泛化(Domain Generalization, DG)要求模型在完全未接触目标域的前提下,学到仅保留核心语义的域不变表征。近年来,学术界广泛采用大规模预训练视觉语言模型(如 CLIP)来提升泛化能力,主流做法往往假设保留预训练视觉特征的高表达力有助于下游分布鲁棒性,普遍通过知识蒸馏(如 RISE、VL2V)、提示调优或权重集成来保留或重用其视觉表征。
然而,保留视觉特征真的能带来纯净的域不变性吗?深入实证分析表明,高表达力的视觉编码器不可避免地将核心语义与视觉风格(如素描笔触、真实照片纹理或抽象艺术线条)纠缠在一起。由于模型容量有限,视觉引导会把与特定训练环境强相关的虚假线索(spurious cues)引入监督信号中,导致模型扩大了类别的表征边界并在分布漂移下产生模糊与混淆。与之形成鲜明对比的是,语言模型的文本嵌入空间天然具有极高的跨域稳定性与语义纯度,互信息诊断显示其几乎不含任何域标识信息。
如果视觉引导必然传递域偏差,那么最直接且彻底的解决路径就是完全摒弃视觉引导,转而让语言空间扮演域不变性的首要来源。核心 idea:将域泛化监督完全锚定在冻结的文本嵌入空间,基于条件熵信息瓶颈(CEB)推导出可分离的变分代理目标,在最大化核心类别语义预测的同时,主动压缩掉与文本锚点不一致的视觉域特异性扰动。
方法详解¶
整体框架¶
本文提出了文本锚定信息瓶颈(Text-Anchored Information Bottleneck)框架。模型输入来自多个源域的图像,利用待微调的视觉骨干网络提取图像特征向量。对于给定的分类任务,系统使用冻结的 CLIP 文本编码器,将标准文本提示(如 "a photo of a [class]")编码为固定的类别语义文本锚点 \(T = [\mathbf{t}_1, \dots, \mathbf{t}_K]^\top \in \mathbb{R}^{K \times d}\)。整个优化过程完全由文本锚点驱动,不再依赖任何预训练视觉模型的特征回归或相似度保持。
为了在有限模型容量下实现语义提纯与虚假特征剔除,方法基于条件熵信息瓶颈(Conditional Entropy Bottleneck, CEB)设计了两个协同机制:其一是单样本级的语义蒸馏(Semantic Distillation),通过对比形式拉近图像表征与其对应类别的文本锚点;其二是批次级的瓶颈压缩与对齐(Bottleneck Compression & Alignment),通过显式增大类内表征合向量模长以促使同类特征高密度聚集,并拉齐类均值表征与文本锚点的方向,从而有效消除跨域的风格分散。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多源域输入图像 X"] --> B["可训练视觉编码器 f_theta"]
B --> C["单位超球面图像特征 Z"]
D["冻结文本提示与编码器"] --> E["固定类别文本锚点 T"]
C --> F["语义蒸馏<br/>单样本拉近目标文本锚点并推开其他类"]
E --> F
C --> G["类内特征聚集压缩<br/>最大化同类合成向量模长"]
C --> H["类中心方向对齐<br/>对齐类均值特征与对应文本锚点"]
E --> H
F --> I["联合目标反向传播优化<br/>滤除域特异虚假信息"]
G --> I
H --> I
关键设计¶
1. 语义蒸馏:最大化类别语义预测充分性
传统方法多采用交叉熵或均方误差强行匹配视觉教师网络,因而不可避免地引入了视觉空间残留的域风格噪声。为了最大化表征 \(Z\) 与任务标签 \(Y\) 之间的互信息 \(I(Z; Y)\),本文将冻结的单位化文本嵌入 \(\mathbf{t}_k\) 直接作为固定的类别原型,构建类条件预测概率。对于属于类别 \(k\) 的样本,定义语义蒸馏损失为:
该目标在单位超球面上直接拉近图像特征 \(\mathbf{z}\) 与所属类别的文本锚点 \(\mathbf{t}_k\),同时推开其他无关类别的文本锚点。由于文本锚点完全由类别名称决定,排除了特定图像的背景与风格细节,从而迫使视觉编码器将精力集中在与语言描述共享的任务核心语义上。
2. 瓶颈压缩与对齐:抑制与文本锚点不一致的域风格扰动
仅仅通过单样本损失拉近文本锚点并不足以完全阻止高容量网络为不同域学习各自独立、混有域线索的特征通路。CEB 要求最小化以标签为条件的输入互信息 \(I(Z; X|Y)\)。论文在单位超球面上将变分先验 \(q(Z|Y=k)\) 和后验分布 \(p(Z|X)\) 建模为 von Mises-Fisher (vMF) 分布。推导出的变分上界等价于在每个小批次中最小化 \(-\mathbf{t}_k^\top \bar{\mathbf{z}}_k = -\|\bar{\mathbf{z}}_k\|\cos(\mathbf{t}_k, \bar{\mathbf{z}}_k)\),其中 \(\bar{\mathbf{z}}_k = \frac{1}{|\mathcal{B}_k|}\sum_{i \in \mathcal{B}_k}\mathbf{z}_i\) 是类别 \(k\) 的批内平均特征。
直接联合优化该式容易发生模长与余弦项的梯度耦合与过早饱和,因此论文将其解耦为两项正交的代理优化目标: - 类内聚集压缩损失(\(\mathcal{L}_{\text{comp}}\)):由于各单样本特征满足 \(\|\mathbf{z}_i\|=1\),当且仅当该类别在当前批次中所有域的样本特征高度平行重合时,其平均向量模长 \(\|\bar{\mathbf{z}}_k\|\) 才达到最大值 1。因此通过最小化负模长直接强制来自不同域的同类样本紧致收敛到同一方向,消除域风格引起的分散:
- 类中心方向对齐损失(\(\mathcal{L}_{\text{align}}\)):直接最大化类均值向量 \(\bar{\mathbf{z}}_k\) 与对应文本锚点 \(\mathbf{t}_k\) 之间的余弦相似度,避免单纯模长压缩导致表征向无语义任意方向坍缩:
损失函数 / 训练策略¶
模型的总体训练损失为三个子项的加权求和:
根据在 PACS 数据集上基于 ResNet-50 的验证集表现,超参数在所有数据集与所有骨干网络中统一固定为 \(\beta_1 = 0.1\) 和 \(\beta_2 = 1.0\)。温度系数 \(\tau\) 沿用标准设定。训练全程不需要对文本编码器做任何梯度更新,具有极佳的计算与显存效率。
实验关键数据¶
主实验¶
在标准 DomainBed 评测协议(留一域交叉验证,重复 3 次取均值)下,覆盖了 ResNet-50、ViT-B/16 以及预训练 CLIP-ViT-B/16 三类代表性骨干网络,在 5 大通用域泛化基准(VLCS、PACS、OfficeHome、TerraIncognita、DomainNet)上进行了全面评测(原论文 Table 1):
| 骨干网络 | 方法 | 引导源 | VLCS | PACS | OfficeHome | TerraInc | DomainNet | 平均精度 |
|---|---|---|---|---|---|---|---|---|
| ResNet-50 (ImageNet-1k) | LP (Linear Probing) | - | 78.1 | 86.2 | 68.4 | 46.3 | 41.2 | 64.0 |
| ResNet-50 | MIRO (ECCV'22) | - | 79.0 | 85.4 | 70.5 | 50.4 | 44.3 | 65.9 |
| ResNet-50 | RISE (ICCV'23) | 视觉+文本 | 81.7 | 89.4 | 71.6 | 52.3 | 46.5 | 68.3 |
| ResNet-50 | VL2V (CVPR'24) | 视觉+文本 | 79.2 | 86.7 | 74.4 | 53.5 | 47.7 | 68.3 |
| ResNet-50 | 本文 (Ours) | 仅文本 | 81.7 | 96.9 | 79.0 | 59.9 | 58.3 | 75.4 (+7.1) |
| ViT-B/16 (ImageNet-1k) | LP | - | 79.5 | 81.5 | 82.8 | 42.2 | 50.5 | 67.3 |
| ViT-B/16 | RISE | 视觉+文本 | 84.2 | 91.0 | 80.3 | 44.6 | 56.6 | 71.3 |
| ViT-B/16 | VL2V | 视觉+文本 | 81.9 | 94.9 | 85.7 | 55.4 | 59.4 | 75.5 |
| ViT-B/16 | 本文 (Ours) | 仅文本 | 86.2 | 94.1 | 86.4 | 62.2 | 68.8 | 79.5 (+4.0) |
| CLIP-ViT-B/16 (400M) | CLIP-ZeroShot | - | 82.4 | 96.1 | 82.3 | 34.4 | 49.7 | 69.0 |
| CLIP-ViT-B/16 | CLIPood (ICML'23) | 视觉+文本 | 85.0 | 97.3 | 87.0 | 60.4 | 63.5 | 78.6 |
| CLIP-ViT-B/16 | CLIP-DTP (CVPR'25) | 视觉+文本 | 84.8 | 97.0 | 87.7 | 63.3 | 63.1 | 79.2 |
| CLIP-ViT-B/16 | 本文 (Ours) | 仅文本 | 89.0 | 98.5 | 93.2 | 75.1 | 75.8 | 86.3 (+7.1) |
在强调背景漂移的 NICO++ 基准(原论文 Table 2,采用 leave-one-group-out 协议)上,本文方法使 ResNet-50 的平均准确率从基线 LP 的 82.5% 跃升至 95.7%,几乎追平 CLIP 骨干的 97.5%,证明文本锚点能够极其干净地剥离前景语义与多变的背景要素。
消融实验¶
在 OfficeHome、PACS 与规模最大的 DomainNet 数据集上,对目标损失函数的三个组成模块进行消融分析(原论文 Table 3):
| \(\mathcal{L}_{\text{sem}}\) | \(\mathcal{L}_{\text{align}}\) | \(\mathcal{L}_{\text{comp}}\) | OfficeHome (RN50 / ViT / CLIP) | PACS (RN50 / ViT / CLIP) | DomainNet (RN50 / ViT / CLIP) | 说明 |
|---|---|---|---|---|---|---|
| ✓ | 73.4 / 82.4 / 85.2 | 92.6 / 92.3 / 96.8 | 35.5 / 52.8 / 60.3 | 仅使用单样本语义蒸馏 | ||
| ✓ | ✓ | 76.0 / 81.9 / 85.9 | 94.2 / 93.6 / 98.2 | 37.3 / 67.9 / 65.9 | 加入类均值方向对齐 | |
| ✓ | ✓ | 78.9 / 85.1 / 90.8 | 95.8 / 94.0 / 98.1 | 57.6 / 68.7 / 75.2 | 加入类内模长聚集压缩(提点最显著) | |
| ✓ | ✓ | ✓ | 79.0 / 86.4 / 93.2 | 96.9 / 94.1 / 98.5 | 58.3 / 68.8 / 75.8 | 完整模型:压缩与对齐形成互补最优 |
关键发现¶
- 压缩损失 \(\mathcal{L}_{\text{comp}}\) 是性能跃迁的核心驱动力:在 DomainNet 上,仅引入 \(\mathcal{L}_{\text{comp}}\) 就使 ResNet-50 的准确率从 35.5% 暴涨至 57.6% (+22.1%),印证了强行拉近不同源域同类特征、压缩类内方差对于抑制虚假特征至关重要。
- 视觉引导占比增加直接损害泛化性:在渐进加入 CLIP 图像引导比例的实验中,模型的泛化准确率随着图像引导权重提升单调下降,且对局部纹理敏感的 CNN(ResNet、RegNet)相较 Transformer 架构受害更深。
- 文本锚点的有效性具有模型无关性与稳定性:替换不同的语言模型(MiniLM 79.1%、MPNet 78.7%、CLIP 79.0%)在 OfficeHome 上性能高度一致;即使采用随机固定的正交锚点,也能达到 76.6% 的高准确率,说明固定外生锚点的拓扑约束本身是产生不变性的决定性因素。
亮点与洞察¶
- 反思视觉引导在域泛化中的负面效应:颠覆了传统“预训练大模型视觉表征越丰富泛化越好”的直觉认知,指出视觉特征不可避免地纠缠了域特异风格,将其用作蒸馏监督反而会稀释有限容量中的真正核心语义。
- 优雅的可分离 vMF 瓶颈代理损失:从球面分布的 CEB 变分上界出发,巧妙地将耦合的向量内积分解为非负模长极大化(类内紧致性)与余弦角度极大化(类中心语义保真),规避了数值优化时梯度饱和与不稳定的隐患。
- 跨骨干通用性强:方法不引入复杂的 prompt 学习或针对特定架构的注意力微调,对于从轻量 CNN、标准 ViT 到 DINOv2 和 CLIP 的各类特征提取器即插即用,表现出极强的泛化一致性。
局限与展望¶
- 极端上下文依赖场景的潜在失效:由于强制将视觉表征压缩至单一文本类别锚点,模型倾向于剔除背景信息;在少数高度依赖背景上下文线索(例如生态物种与生境强相关)的细粒度识别任务中可能损失有效判断依据。
- 静态单一文本提示的表达上限:当前采用最基础的模板如 "a photo of a [class]",未来可探索动态自适应或结构化层次文本提示,在保留域不变性的同时捕捉多层级细粒度语义。
- 跨域数据泄露评测偏差:部分大规模预训练骨干在无监督预训练中可能无意间见过下游基准的部分域,虽在 DINOv2 上已验证其增益的稳健性,但更严格无泄露的开放世界评测协议仍待推进。
相关工作与启发¶
- vs RISE / VL2V (视觉-语言蒸馏):现有方法将 CLIP 的图像编码器作为主要蒸馏教师、文本作为辅助正则;本文则证明视觉教师会传递域风格噪声,主张彻底抛弃视觉引导,仅以文本空间为唯一不变性锚点。
- vs IIB / INSURE (信息瓶颈域泛化):以往基于 IB 的 DG 方法通常学习图像级别的变分高斯分布并对齐到非语义先验(如 \(\mathcal{N}(0, I)\)),缺乏语义鉴别力且易陷入训练域偏差;本文构建基于文本特征的类条件球面 vMF 瓶颈先验,引导方向明确。
- vs CLIPood / DTP (CLIP 鲁棒微调):现有基于 CLIP 的方法重在避免微调破坏原本的零样本能力,通常只适用于 CLIP 自身架构;本文框架不依赖特定模型先验,可通用于任意传统和自监督视觉骨干。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 挑战了利用多模态视觉特征的既有共识,从理论与实证两端确立了纯文本锚定信息瓶颈在域泛化中的优越性。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 6 大主流域泛化基准与 7 类不同骨干架构,包含详尽的互信息诊断、Lipschitz 平滑度分析与 t-SNE 流向可视化。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻有力,理论推导严谨自洽,实证分析与消融实验层层递进。
- 价值: ⭐⭐⭐⭐⭐ 为多模态时代的迁移学习与分布外鲁棒性研究提供了极具启发性的极简新范式。