跳转至

TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings

会议: ECCV 2026
论文: ECCV 原文
领域: 信息检索/RAG
关键词: 通用多模态嵌入、任务冲突、混合专家、低秩适配、困难负样本

一句话总结

TSEmbed 用输入相关的 MoE-LoRA 分担多模态任务冲突,再在专家预热后根据路由相似度加权困难负样本,使仅使用 MMEB 训练的 2B/7B 模型分别达到 70.5/74.7 的总体分数,超过同设置 B3 基线 2.4/2.7 个百分点。

研究背景与动机

通用多模态嵌入希望把图像、文本及其组合映射到同一向量空间,让分类、视觉问答、检索和视觉定位都能通过相似度匹配完成。VLM2VEC 等方法把多模态大语言模型改造成编码器,借助其跨模态交互和知识储备取得比传统双编码器更强的表示,但共同训练这些任务不意味着它们需要相同的参数更新。论文图 1 中,Qwen2-VL-7B 的视觉问答从独立训练时的 70.9 降至联合训练的 57.8,差距为 13.1 个百分点。

作者进一步从三个角度诊断这一问题:独立任务 LoRA 的参数轨迹在 PCA 投影中分离,说明目标更新方向不同;定位与问答较早收敛,检索与分类需要更长训练,统一停止时刻不适合所有任务;数据较多的检索任务又更容易主导联合适配器。这里的轨迹投影和参数相似度是任务冲突的经验线索,并不是证明所有任务最优解必然互不相交的数学结论。真正需要解决的是,在保留一个通用编码接口的同时,不让所有目标争用同一个低秩更新。

因此,本文先改变参数共享方式,再利用这种结构产生的内部信号改善对比学习,而非单纯增加训练数据或引入外部难例教师。核心 idea:用路由器为不同输入组合不同 LoRA 专家,待这种分工稳定后,把“走过相近专家路径的负样本”赋予更高对比权重,从参数适配和判别边界两端缓解任务冲突。

方法详解

整体框架

模型以 Qwen2-VL 为骨干,接收查询或候选目标的多模态输入,从最后一层的末尾 EOS token 隐状态提取嵌入。查询、正目标与负目标均被编码,训练时比较它们的向量相似度,推理时仍输出供检索和匹配使用的向量,不要求生成答案或思维链。

普通 LoRA 对所有输入施加同一低秩残差;TSEmbed 将它替换为多个专家残差的输入相关加权组合。训练额外记录跨层路由分布,用于专家感知负样本加权,并通过两阶段学习决定何时启用该信号。下面的虚线表示训练侧信号或更新,实线表示编码或权重计算;推理不需要负样本加权分支。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["查询与候选目标"] --> Experts["MoE-LoRA<br/>条件适配"]
    Experts --> Embedding["EOS 嵌入<br/>推理相似度匹配"]
    Experts -.->|跨层路由分布| EANS["专家感知<br/>负样本加权"]
    EANS -->|仅第二阶段使用| Schedule["两阶段学习"]
    Embedding -.->|训练相似度| Schedule
    Schedule -.->|对比学习更新| Experts

关键设计

1. MoE-LoRA 条件适配:让不同输入不再共享唯一残差

在冻结的预训练线性变换旁,每个专家各自持有一对低秩矩阵,产生自己的残差输出。线性路由器读取当前输入,经带温度的 softmax 得到各专家权重,再对这些残差加权求和,与骨干输出相加。这样,两个任务仍使用同一个预训练模型,但可以偏重不同专家;同一个输入也可以混合多个专家,而不是被硬性分到互斥任务分支。原文描述的是 softmax 加权,并未给出 top-k 稀疏激活策略,不能把它直接理解成每个输入只运行一个专家。

这种设计切中了单 LoRA 的限制:问题不只是总参数量不足,更在于所有样本只能使用同一个更新方向。多个低秩子空间提供了不同的适配方向,路由器学习何时组合它们。默认采用 4 个专家、每个专家秩为 16,但没有显式规定某个专家必须对应分类、问答、检索或定位。作者把 4 个专家的较优表现解释为与 MMEB 的四类任务结构相适应,这是一种实验解释,不等于已证明专家与任务一一对应,也不等于完全消除了梯度干扰。

2. 专家感知负样本加权:用内部路径判断哪些负例值得多学

EANS 的出发点是,负目标若和查询激活相近的专家组合,二者很可能处于相近的任务语义区域,比跨任务的明显无关样本更值得区分。实现上,它收集全部 \(L\) 层、每层 \(G\) 个被适配投影矩阵的路由概率;每个概率向量含 \(N\) 个专家,展平后形成长度为 \(L\cdot G\cdot N\) 的路由签名。随后计算查询与各负例签名的 L1 距离,并除以总维数。这比较的是网络如何处理输入,而不是另请教师模型为负例打分。

距离越小,负例的原始权重越接近上界;距离越大,权重按指数衰减趋向下界。默认上下界为 10.0 和 0.1,衰减尺度 \(\sigma=0.002\)。尽管名字含有 sampling,正文实际描述的核心操作是对已有负样本重新加权,而不是从新语料库检索额外样本。路由相近也只能充当困难程度的代理,不能保证负例确实在细粒度内容上相近,更不能自动排除本应视为正例的假负样本。

为避免改变负例权重总量,作者对 \(M\) 个负例的原始权重进行归一化:

\[ {}\tilde{w}_i=w_i\cdot\frac{M}{\sum_{j=1}^{M}w_j}. \]

这是原文式 (8),使归一化权重之和等于负例数、平均权重为 1。之后把每个负例在 InfoNCE 分母中的指数相似度项乘以对应权重,正例项保持不变。需要区分“权重和不变”与“损失分母不变”:由于各负例相似度不同,前者并不严格保证后者,也不保证总梯度大小完全相同;原文关于严格保持负贡献的措辞应谨慎理解。

3. 两阶段学习:先学出可用的路由,再用路由监督难例

随机初始化的路由分布还不携带稳定任务语义,此时将相似路由当成困难负例信号,可能强化任意噪声。因此,第一阶段只用普通 InfoNCE 训练,让专家与路由器通过对比监督形成分工;达到预热步数后,第二阶段切换到 EANS 加权损失。这是同一个模型的渐进训练,不是先训练外部教师,也没有额外的生成式推理阶段。

默认总训练为 2,200 步,2B 模型在 600 步后启用 EANS,7B 模型在 1,200 步后启用。较大模型需要更长预热是本文设置下的经验选择,不是普适比例。表 3 提供了直接检验:2B 的 MoE-only 为 70.20,一开始就加 EANS 反而为 70.14,采用两阶段后为 70.52。因此需要把“专家结构带来的大幅收益”和“稳定路由之后的额外精修收益”分开理解。

一个完整示例

以“给一张商品图和一句属性要求,寻找匹配商品”为说明性例子,这不是论文报告的独立测试样本。训练批次中同时有匹配目标、外观接近但属性不符的目标,以及明显无关的候选。所有输入先经过同一骨干,但其低秩残差由路由器分别组合,最后形成可比较的 EOS 嵌入。

预热期间只根据嵌入相似度做普通对比学习。预热结束后,系统还比较查询和负例的跨层路由签名:若属性不符的商品恰好具有更相近的路由,它获得更高权重,训练就更强调把这组容易混淆的样本分开。这里的“恰好”很重要,方法并未显式识别商品属性,路由代理也可能失败。

例如,假设只有两个负例,原始权重分别恰好为 10.0 与 0.1,则经式 (8) 归一化后约为 1.98 与 0.02。这些数字只是解释权重再分配的算例,不是测得的路由输出。部署时不再构造这两个负例,直接编码输入并按向量相似度排序。

损失函数 / 训练策略

训练目标始终是拉近查询与正目标、推远查询与负目标。第一阶段使用标准 InfoNCE;第二阶段只改变分母里负例的相对权重,不增加作者另行定义的任务标签分类损失。当前全文缓存中式 (2)、(3)、(4)、(6)、(7)、(9)、(10) 存在符号提取损坏,因此这里依据相邻正文解释机制,不猜补它们的精确排版;需要实现时应核对原版 PDF。

实验使用 8 张 NVIDIA A800、AdamW、学习率 \(5\times10^{-5}\)、线性衰减,全局 batch size 为 1,024,每卡为 128。Gradient Caching 的 sub-batch chunk size 为 2,以降低大批量对比学习的显存压力。图像最小像素数设置为 401,408,LoRA scaling factor 为 64。

路由温度与对比温度不是 EANS 的 \(\sigma\):前者控制专家概率尖锐程度或相似度 logits,后者控制路由距离到负例权重的衰减。当前正文未完整交代温度取值、所有适配矩阵清单、token 级路由如何汇聚为样本签名,以及 EANS 权重是否停止梯度;复现时不能把这些细节自行假定为作者设置。

实验关键数据

主实验

MMEB 表 1 共评估 36 个数据集:分类 10 个、VQA 10 个、检索 12 个、定位 4 个;按分布又分为 20 个 IND 和 16 个 OOD 数据集。下表摘录同一 Qwen2-VL 骨干系列、仅用 MMEB 训练的方法。分数采用论文 hit@1 百分数口径,Overall 不是四类分数的简单平均。

模型规模 方法 分类 VQA 检索 定位 Overall
2B VLM2VEC 59.0 49.4 65.4 73.4 59.3
2B B3 67.0 61.2 70.9 79.9 68.1
2B TSEmbed 68.8 64.3 72.1 85.7 70.5
7B VLM2VEC 62.6 57.8 69.9 81.7 65.8
7B B3 70.0 66.5 74.1 84.6 72.0
7B TSEmbed 71.1 70.3 75.9 91.3 74.7

表 1 的 TSEmbed 实际模型参数量为 2.26B/8.40B,“2B/7B”是骨干系列称呼。7B 的 IND/OOD 分别为 78.8/69.6,对 B3 的 75.9/67.1 提高 2.9/2.5 个百分点。外部数据增强模型不属于同资源比较:例如 Qwen3-VL-Embedding 的较大模型 Overall 为 80.1,高于本文 74.7,因此不能将本文结论扩写为无条件领先所有模型。

消融实验

下表摘录原文表 3,保留两位小数。未使用两阶段的 “MoE + EANS” 表示没有先做路由预热,不能理解成删除 MoE。

模型规模 配置 Overall 对同规模 MoE-only 的差值
2B VLM2VEC 59.30 -10.90
2B MoE-only 70.20 0.00
2B MoE + EANS,无预热 70.14 -0.06
2B 完整模型 70.52 +0.32
7B VLM2VEC 65.80 -8.41
7B MoE-only 74.21 0.00
7B MoE + EANS,无预热 74.18 -0.03
7B 完整模型 74.68 +0.47

关键发现

  • MoE-LoRA 是主要收益来源:相对 VLM2VEC,2B/7B 提高 10.90/8.41 个百分点;EANS 配合预热的额外收益为 0.32/0.47 个百分点,不能把全部提升归因于困难负样本加权。
  • 私有生产数据的零样本结果见表 2:广告 Recall 从 11.33% 到 33.20%,提升 21.87 个百分点,而非相对增长 21.87%;主题 NDCG@5 从 84.17% 到 86.22%。这不是线上 A/B 测试收入或点击率收益。
  • 图 7 测试 2、4、6、8 个专家,4 个取得更稳健的跨任务表现,8 个通常退化;本文并未证明专家越多、任务规模越大就必然越好。
  • 图 5 的文字报告在 \(\sigma\in[2\times10^{-5},2\times10^{-1}]\) 范围内表现波动约在 1 个百分点以内;这里保留作者的近似概括,不从损坏的图形文本臆读精确曲线点。

亮点与洞察

  • 将任务冲突与困难负样本联系起来:路由既参与表示计算,也给出训练样本的内部结构线索。相比额外教师,这种复用减少了独立难例评分模块,但仍有路由签名聚合和距离计算成本。
  • 消融说明训练时序本身有价值:同一个 EANS 模块,接在随机路由之后和接在成熟路由之后效果不同。可迁移的经验是,内部信号驱动的自监督加权应先确认信号具有可用语义,而非默认训练起点就可信。
  • 将通用接口与参数完全共享分开考虑:一个向量编码器可以保持统一输入输出,同时在内部保留多个适配方向。对多领域检索系统,这比为每个任务部署完全独立骨干更值得探索。

局限与展望

  • 路由距离是语义代理而非相关性标签。相近任务中的真相关目标可能被误当困难负例,后续可加入假负例过滤,并直接评估路由距离与人工相关性、负例难度之间的关系。
  • 成本不能只看参数增量。表 4 在 A100 上报告广告 5,630 条数据的 2B 推理耗时从 35.72 到 44.67 分钟,游戏 6,532 条数据从 49.58 到 70.02 分钟,分别约增加 25.1% 和 41.2%;原文称延迟“可忽略”并不适用于这些相对增幅。
  • “任务扩展”证据主要来自固定 MMEB 任务集合下的结构替换和专家数扫描,未给出持续增加任务数量时的扩展曲线或新任务加入后的遗忘实验。后续应检验专家数量与任务簇结构变化之间的关系。
  • 原文没有单独的局限章节,也未报告多随机种子误差条;EANS 相对 MoE-only 的增益较小,需要重复实验确认稳定性。私有生产数据和若干实现细节缺乏完整公开描述,限制了独立复核。
  • 原文表 1 中 7B VLM2VEC 的 IND/OOD 为 65.2/56.3,却给出高于二者的 Overall 65.8,存在口径或排版疑点;本文保留原表 Overall,不自行修正,也不据该基线的分布列作衍生结论。

相关工作与启发

  • vs VLM2VEC:二者都把 MLLM 用作对比学习嵌入编码器。TSEmbed 改变的是低秩适配共享方式,并在路由稳定后重分配负例权重,不是通过增加生成长度提升检索质量。
  • vs B3 / QQMM-embed:B3 关注批次构造,QQMM-embed 强化困难负例梯度;TSEmbed 额外处理参数层面的任务干扰,并以专家使用模式判断负例权重。本文没有给出把这些策略全部组合后的实验,不能假定收益可相加。
  • vs PCGrad / GradNorm:这些多任务方法直接操作梯度或任务权重,本文通过条件适配间接减少共享冲突。文章并未在主结果表中直接比较它们,因此“更高效”的论述不是受控实验证明。
  • 进一步启发:可分别固定总适配参数量、固定专家数、逐步增加任务簇,检验收益究竟来自容量增加、条件路由还是任务结构匹配;这是由现有证据边界引出的后续问题,不是本文已经完成的实验。

评分

  • 新颖性: 4/5。MoE-LoRA 本身并非全新组件,利用跨层路由签名加权负例并配套预热具有明确组合价值。
  • 实验充分度: 4/5。覆盖两种规模、公开与私有任务及多项消融,但缺少多种子统计和真正的任务数量扩展实验。
  • 写作质量: 3/5。方法链条清晰,但权重归一化、效率与部分表格数字的表述需要更严格的边界。
  • 价值: 4/5。为多任务检索编码器提供了可复用的条件适配思路,落地仍需衡量延迟与复现成本。