跳转至

MED-LCDS: Multi-Expert-Domain CLIP Classification via Logit Calibration

会议: ECCV 2026
论文: ECCV 2026
领域: 多模态VLM
关键词: 多专家领域分类, LoRA合并, Logit校准, 领域监督路由, 零样本开集识别

一句话总结

针对独立微调的多个特定领域 LoRA 专家合并到统一模型时因 logit 尺度不一致导致的跨域干扰与虚高置信度问题,本文提出 MED-DSLC(MED-LCDS),结合领域监督门控路由与可学习的领域级温度校准,恢复跨领域全局 logit 可比性,在联合类别空间下取得大幅性能提升。

研究背景与动机

以 CLIP 为代表的视觉语言模型(VLM)通过将图像特征与文本提示投影到共享嵌入空间,奠定了开集零样本分类的基础。该能力得以成立的核心先决条件在于所有候选类别的相似度打分(logit)在全局范围内具有直接可比性,从而使跨任意类别集合的 Softmax 归一化能够产出有意义的后验概率。然而,通用预训练 VLM 在特定细粒度领域(如航空器型号识别、专用卫星遥感或纹理材质分类)中,往往由于公开训练数据匮乏而表现欠佳。为补足领域知识,学界普遍采用参数高效微调(PEFT)技术(例如 LoRA)在特定领域数据上训练专门的适配器。这种独立特化微调虽然显著提升了各自域内的分类精度,却导致域外泛化能力急剧退化,催生出大量彼此割裂的专家适配器碎片生态。

多专家领域(Multi-Expert-Domain, MED)分类旨在将多个针对不同专门领域独立训练的 LoRA 专家合并为一个统一模型,使得模型在测试阶段无需预知样本来自哪个领域,即可在所有领域的联合类别集合上进行准确判别。然而,现有基于专家混合(MoE)的合并策略(如 MoLE)大多采用无监督门控机制,不仅需要繁琐复杂的专家负载均衡损失,更容易在测试时将样本路由到错误的专家分支。更严峻的内在矛盾在于,独立训练的专家隐式重构了各自输出 logit 的空间几何与数值尺度。根据 Softmax 函数对全局正标量缩放的不变性,各专家在独立优化时形成的绝对 logit 尺度彼此异构;当来自不同领域的类别 logit 在全空间 Softmax 下直接竞争时,某些数值尺度天然偏大的领域会产生压倒性的高分,即使对域外输入也会表现出灾难性的虚高置信度。

针对上述两大致命痛点,本文的切入视角是:在训练合并门控时,训练样本所属的专家领域完全可以由其真实类别标签直接查表确定,无需盲目依赖无监督路由;同时,跨领域 logit 尺度的失衡只需极低参数代价即可在输出端显式矫正。核心 idea:将多领域 LoRA 合并重构为「领域监督门控路由」与「领域级 Logit 温度校准」协同架构(MED-DSLC),通过监督信号约束专家指派,并通过每个领域一个可学习的温度标量拉齐异构 logit 的全局尺度,以极轻量参数在联合开集空间下重构全局可比性。

方法详解

整体框架

MED-DSLC 的输入为待分类图像特征与跨所有专家领域的联合类别文本提示集合,目标是在无测试时领域标签的前提下输出正确的细粒度类别概率分布。整个模型保持底层预训练 VLM(如 CLIP 图像/文本编码器)以及各领域独立预训练好的 LoRA 权重完全冻结,仅引入一个轻量级的领域门控网络和每个领域一个可学习的温度校准参数。图像输入经过冻结的基础编码器各层时,门控网络根据特征自适应预测针对各个领域专家的混合权重,动态合成多专家残差更新;在模型最后一层产生原始相似度 logit 后,系统依据类别与领域的隶属关系进行域特定的温度除法缩放,最后经全空间 Softmax 归一化输出预测概率。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 x"] --> B["冻结 VLM 特征提取"]
    B --> C["领域监督门控路由<br/>线性投影+Softmax 预测专家混合权重"]
    C --> D["冻结 LoRA 专家加权融合<br/>层级组合各领域残差特征"]
    D --> E["多域类别文本匹配<br/>计算联合类别空间原始 Logit"]
    E --> F["领域级 Logit 尺度校准<br/>按领域专属温度参数 tau_d 归一化缩放"]
    F --> G["联合全空间 Softmax 决策<br/>无域标签下跨所有类别竞争输出"]

关键设计

1. 领域监督门控路由:通过类别先验抑制跨领域负载失衡与错误分派

传统 MoE 架构(如 MoLE 或 Phatgoose)假设领域标签在训练阶段不可知,因此完全依赖无监督门控网络配合特定的负载均衡熵损失来避免专家坍缩。然而在 MED 设定中,所有用于训练合并网络的样本都带有细粒度类别标签 \(y\),而每个细粒度类别唯一归属于特定的专家领域 \(\mathcal{Y}_d\)。因此,样本的真实领域索引可通过指示函数直接离散索引确定:\(d^* = \arg\max_d \mathbb{I}(y \in \mathcal{Y}_d)\)。MED-DSLC 抛弃脆弱的无监督负载平衡损失,设计了显式的领域监督交叉熵损失 \(\mathcal{L}_{\text{domain}} = -\log \alpha_{d^*}(x)\),其中 \(\alpha_{d^*}(x)\) 为门控网络经过 Softmax 输出的第 \(d^*\) 个专家的路由概率。这种监督信号强力迫使门控网络学习本质的领域判别特征,从根源上杜绝了将汽车图像错误路由至花卉专家的问题;当每域训练样本数量均衡时,专家激活频率也自然实现了精确平衡。

2. 领域级 Logit 尺度校准:可学习温度系数对齐异构专家输出尺度

由于各个领域的 LoRA 专家是在不同数据集上独立微调优化得到的,其权重的范数和收敛平坦度差异会导致各专家输出的 logit 数值幅度存在系统性漂移。由于 Softmax 预测对单个域内的正数乘法缩放保持单调不变性,各专家在独立拟合交叉熵时并未受到统一的绝对值约束。当所有候选类别拼接到统一的超大类别空间 \(\mathcal{Y} = \bigcup_{d=1}^D \mathcal{Y}_d\) 时,数值尺度偏高的专家会无差别地对域外样本输出极高得分。针对该问题,MED-DSLC 为每个领域 \(d \in \{1, \dots, D\}\) 分配一个独立且可学习的温度标量 \(\tau_d > 0\)。对于任意属于领域 \(d\) 的候选类别 \(c \in \mathcal{Y}_d\),其原始匹配 logit \(z_c(x)\) 在送入跨域竞争前被校准为: $$ \tilde{z}_c(x) = \frac{z_c(x)}{\tau_d} $$ 该设计在数学上严格保证了每个领域内部类别的相对大小与细粒度排序分毫不变,仅仅拉齐了不同领域专家之间的绝对量级分布。更重要的是,整个校准机制在整个模型中仅仅引入了 \(D\) 个可学习标量参数(如 10 个领域仅增加 10 个浮点数),计算和存储开销几乎为零。

3. 联合全空间 Softmax 决策:保留域内细粒度判别并消除跨域置信度膨胀

在得到各个领域校准后的 logit 向量 \(\tilde{z}_c(x)\) 后,模型将其统一拼接成跨越全部领域类别的联合向量,并执行单次全量 Softmax 归一化: $$ p(c \mid x) = \frac{\exp(\tilde{z}c(x))}{\sum $$ 由于领域监督路由保证了前向传播时提取的高层表征主要由对应领域的 LoRA 特征主导,而领域级 logit 温度校准消除了其他未激活专家由于固有偏置导致的异常高分峰值,两者的协同效应彻底瓦解了跨域误报。这使得模型在推理阶段完全不需要知道输入图像究竟属于哪一个子领域,即可在数百个细粒度跨域类别的激烈竞争中实现精准召回。}} \exp(\tilde{z}_{c'}(x))

损失函数 / 训练策略

合并训练阶段,底层 CLIP 模型与各个领域的预训练 LoRA 专家完全冻结,仅优化门控网络权重 \(W_g\) 与各领域的温度标量序列 \(\{\tau_d\}_{d=1}^D\)。总训练目标由联合类别分类交叉熵损失与领域监督路由损失线性加权构成: $$ \mathcal{L} = \mathcal{L}{\text{cls}} + \lambda \mathcal{L} $$ 其中图像分类损失定义为联合超集上的标准交叉熵 }\(\mathcal{L}_{\text{cls}} = -\log p(y \mid x)\),领域监督损失为 \(\mathcal{L}_{\text{domain}} = -\log \alpha_{d^*}(x)\),超参数 \(\lambda\) 用于平衡类别判别与路由监督的梯度幅度。实验中采用 AdamW 优化器,在每个类别仅提供少样本(如 1-shot 或 16-shot)图像的情况下进行微调,训练收敛极快且无过拟合风险。

实验关键数据

主实验

论文在涵盖物体分类、纹理、场景、动作等 9 个主流细粒度基准(Caltech101, EuroSAT, Stanford Cars, Food101, Oxford Pets, Oxford Flowers, DTD, UCF101, FGVC Aircraft)构成的 10 专家领域环境(过滤重叠类后共 783 个类别)上进行评测。评测包含两个协议:跨领域评测(Cross-domain),将所有领域类别合并为统一联合空间,测试跨域直接竞争抗干扰能力;域内评测(In-domain),在独立数据集上分别测试保留能力。数据集切分为 Base(已见类别)和 All(已见+未见类别全集)。

下表展示了最核心、最具挑战性的跨领域(Cross-Domain)统一类别空间下的分类性能对比(摘自原文 Table 1):

方法 Base Split Mean (%) Base Split \(\Delta\) (%) All Split Mean (%) All Split \(\Delta\) (%) EuroSAT (All) Cars (All) DTD (All) FGVC (All)
Expert-LoRA (Oracle) 85.48 +15.36 71.60 +6.63 67.58 70.10 56.50 32.34
MED-DSLC (本文) 85.51 +15.39 71.80 +6.83 68.43 70.33 56.26 32.19
KnOTS-DARE-TIES [19] 78.17 +8.05 68.66 +3.69 58.28 70.51 49.88 27.51
KnOTS-TIES [19] 74.91 +4.79 67.70 +2.73 54.19 69.22 46.10 28.47
PHATGOOSE [12] 72.97 +2.85 59.77 -5.20 23.10 65.86 47.10 23.37
MoLE [21] 71.80 +1.69 65.85 +0.88 56.25 65.03 44.86 25.20
LoRA-Mean (基准平均) 70.12 +0.00 64.97 +0.00 45.81 66.98 42.67 26.13
Single-LoRA (联合微调) 42.35 -27.77 36.28 -28.69 28.10 27.27 25.65 0.99
原始零样本 CLIP 66.22 -3.90 62.52 -2.45 40.21 65.13 40.54 24.57

在跨领域全类别挑战下,MED-DSLC 展现出了令人瞩目的强健性,Base Split 达到 85.51%,All Split 达到 71.80%,不仅以巨大优势(超 5.9%~13.7%)碾压现有 SOTA 合并方案 MoLE 和 PHATGOOSE,甚至还微幅超越了拥有测试时领域先验的金标准 Oracle(Expert-LoRA)。

消融实验

下表给出了跨领域协议下各个组件对性能的贡献分析(包含是否使用 Logit 缩放、领域监督、以及门控激活函数选用 Softmax 还是 Sigmoid,摘自原文 Table 3):

Logit Scaling Domain Supervised 门控激活函数 Base Split Mean (%) Base \(\Delta\) (%) All Split Mean (%) All \(\Delta\) (%) EuroSAT (All) DTD (All)
\(\checkmark\) \(\checkmark\) Softmax 85.51 +15.39 71.80 +6.83 68.43 56.26
\(\times\) \(\checkmark\) Softmax 85.43 +15.31 71.61 +6.64 67.47 56.26
\(\checkmark\) \(\checkmark\) Sigmoid 79.21 +9.09 69.97 +5.00 69.04 49.76
\(\times\) \(\checkmark\) Sigmoid 78.55 +8.43 69.67 +4.71 68.94 49.35
\(\times\) \(\times\) Softmax (MoLE) 71.80 +1.69 65.85 +0.88 56.25 44.86

此外,在数据极端不均衡扫描(Target-Domain Imbalance Sweep)实验中,当目标领域仅保留 \(k=2\) 个类别时,Logit Scaling 使目标领域准确率额外提升了 +2.2 个百分点;在 1-shot 极少样本路由微调实验中(原文 Table 7),MED-DSLC 仅用每类 1 张图训练门控和温度,在 All Split 上就取得了 71.71% 的均值精度,与 16-shot 的 71.80% 几乎持平。

关键发现

  • 领域监督是避免专家混淆的决定性因素:消融表明,从无监督 MoLE(71.80% / 65.85%)引入领域监督后,模型性能直接跃升至 85.43% / 71.61%,证明在明确包含领域来源的学术数据集设定下,放弃天然的类别-领域映射先验而强行使用无监督聚类是极其低效的。
  • Logit 校准在类别高度不平衡与规模扩张时至关重要:在各领域类别数量均衡时,Logit 缩放带来的平均点数提升相对温和(+0.19%),但当领域类别严重失衡(如小样本极度受压制)或当类别子集规模增大时,Logit Scaling 能显著压低越界高分,消除直方图上的虚假重叠(如图 2、图 4 所示),在 \(k=2\) 的极限场景下带来 +2.2% 的关键净增益。
  • Softmax 门控显著优于独立 Sigmoid:在领域互斥且全覆盖的假设下,Softmax 显式强加了专家权重的归一化竞争,比彼此解耦的 Sigmoid 激活在 Base Split 上高出 6 个百分点以上。

亮点与洞察

  • 极简而高效的跨领域校准设计:仅需为每个领域增加 1 个标量温度系数(总共十几个浮点参数),即可通过微调对齐不同微调流派留下的异构 Logit 动态范围,以零推理延迟代价解决了大模型适配器合并中的尺度爆炸痛点。
  • 打破「合并必定逊于 Oracle」的思维定势:传统认知认为多专家合并的上限就是测试时已知领域的 Oracle Expert。然而 MED-DSLC 在 Base 和 All Split 上均微弱超越了 Oracle(85.51% vs 85.48%, 71.80% vs 71.60%),证明多领域 LoRA 的软加权集成不仅具备领域特化能力,还能在临近或共享概念上提供正则化效果,抑制单模型轻微过拟合。
  • 少样本训练数据的高效复用机制:路由门控和温度参数由于参数量极少(仅线性层和标量),在 1-shot 训练下即可完全收敛并取得与 16-shot 几乎一致的性能(71.71% vs 71.80%),使其在真实工业落地部署中拥有极高的实用价值。

局限与展望

  • 依赖预先定义且清晰划分的领域集合:方法假设每个训练类别能够唯一映射到一个具体的专家领域(\(\mathcal{Y}_d\) 互斥且明确),对于存在跨领域交叉概念(如 Caltech101 与 Flowers/Cars 之间共享的部分通用类别)时,必须人工介入清洗或剔除重叠类,限制了在全开放杂乱网络标签下的自适应能力。
  • 温度标量为领域级而非类别级:当前设计仅对每个领域统一施加单个温度标量 \(\tau_d\),假设同一领域内所有细粒度类别的 logit 膨胀程度一致;若领域内部不同类别的文本 prompt 长度或先验词频差异较大,可能仍存在域内细粒度的尺度失调。
  • 未来方向:探索无监督或软聚类下的自适应温度场校准,将类别级不确定性估计引入温度学习;同时拓展至更多模态任务(如多模态生成、跨领域视觉检索与问答)。

相关工作与启发

  • vs MoLE / Phatgoose: MoLE 和 Phatgoose 沿袭语言模型无监督 MoE 传统,使用无监督门控与辅助平衡损失进行路由,且忽略了不同专家输出 logit 的尺度不一致。本文明确利用了视觉类别天然隶属于特定领域的先验,引入监督路由,并首次提出领域级温度校准,在多域联合开集任务上实现了 12 点以上的绝对性能领先。
  • vs 参数空间合并方法(KnOTS / DARE / TIES / LoRA-Mean): 传统模型合并方法通过对 LoRA 权重进行低秩分解、奇异值空间投影或算术平均,试图在物理权重层面消除冲突。但多领域专家的任务差异巨大,权重层面的强行折中必然损失细粒度判别力。本文采用 MoE 激活空间动态混合结合输出端校准,不仅完全保全了各专家的域内特化能力,还完美解决了跨域干扰。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 明确揭示了 LoRA 专家合并中跨域 Logit 尺度失配的核心痛点,并提出了优雅简单的校准机制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 9 大基准、10 个专家领域、Base 与 All 两种严苛切分,包含不均衡扫描、少样本效率和架构普适性验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述清晰透彻,图表说服力强,数学公式推导直截了当。
  • 价值: ⭐⭐⭐⭐⭐ 对模块化大模型、PEFT 生态融合以及无痛扩展垂直领域专家具有极高的实际落地参考价值。