TSEmbed: Unlocking Task Scaling in Universal Multimodal Embeddings¶
会议: ECCV 2026
论文: ECCV 原文
领域: 信息检索/RAG
关键词: 通用多模态嵌入、任务冲突、混合专家、低秩适配、困难负样本
一句话总结¶
TSEmbed 用输入相关的 MoE-LoRA 分担多模态任务冲突,再在专家预热后根据路由相似度加权困难负样本,使仅使用 MMEB 训练的 2B/7B 模型分别达到 70.5/74.7 的总体分数,超过同设置 B3 基线 2.4/2.7 个百分点。
研究背景与动机¶
通用多模态嵌入希望把图像、文本及其组合映射到同一向量空间,让分类、视觉问答、检索和视觉定位都能通过相似度匹配完成。VLM2VEC 等方法把多模态大语言模型改造成编码器,借助其跨模态交互和知识储备取得比传统双编码器更强的表示,但共同训练这些任务不意味着它们需要相同的参数更新。论文图 1 中,Qwen2-VL-7B 的视觉问答从独立训练时的 70.9 降至联合训练的 57.8,差距为 13.1 个百分点。
作者进一步从三个角度诊断这一问题:独立任务 LoRA 的参数轨迹在 PCA 投影中分离,说明目标更新方向不同;定位与问答较早收敛,检索与分类需要更长训练,统一停止时刻不适合所有任务;数据较多的检索任务又更容易主导联合适配器。这里的轨迹投影和参数相似度是任务冲突的经验线索,并不是证明所有任务最优解必然互不相交的数学结论。真正需要解决的是,在保留一个通用编码接口的同时,不让所有目标争用同一个低秩更新。
因此,本文先改变参数共享方式,再利用这种结构产生的内部信号改善对比学习,而非单纯增加训练数据或引入外部难例教师。核心 idea:用路由器为不同输入组合不同 LoRA 专家,待这种分工稳定后,把“走过相近专家路径的负样本”赋予更高对比权重,从参数适配和判别边界两端缓解任务冲突。
方法详解¶
整体框架¶
模型以 Qwen2-VL 为骨干,接收查询或候选目标的多模态输入,从最后一层的末尾 EOS token 隐状态提取嵌入。查询、正目标与负目标均被编码,训练时比较它们的向量相似度,推理时仍输出供检索和匹配使用的向量,不要求生成答案或思维链。
普通 LoRA 对所有输入施加同一低秩残差;TSEmbed 将它替换为多个专家残差的输入相关加权组合。训练额外记录跨层路由分布,用于专家感知负样本加权,并通过两阶段学习决定何时启用该信号。下面的虚线表示训练侧信号或更新,实线表示编码或权重计算;推理不需要负样本加权分支。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["查询与候选目标"] --> Experts["MoE-LoRA<br/>条件适配"]
Experts --> Embedding["EOS 嵌入<br/>推理相似度匹配"]
Experts -.->|跨层路由分布| EANS["专家感知<br/>负样本加权"]
EANS -->|仅第二阶段使用| Schedule["两阶段学习"]
Embedding -.->|训练相似度| Schedule
Schedule -.->|对比学习更新| Experts
关键设计¶
1. MoE-LoRA 条件适配:让不同输入不再共享唯一残差
在冻结的预训练线性变换旁,每个专家各自持有一对低秩矩阵,产生自己的残差输出。线性路由器读取当前输入,经带温度的 softmax 得到各专家权重,再对这些残差加权求和,与骨干输出相加。这样,两个任务仍使用同一个预训练模型,但可以偏重不同专家;同一个输入也可以混合多个专家,而不是被硬性分到互斥任务分支。原文描述的是 softmax 加权,并未给出 top-k 稀疏激活策略,不能把它直接理解成每个输入只运行一个专家。
这种设计切中了单 LoRA 的限制:问题不只是总参数量不足,更在于所有样本只能使用同一个更新方向。多个低秩子空间提供了不同的适配方向,路由器学习何时组合它们。默认采用 4 个专家、每个专家秩为 16,但没有显式规定某个专家必须对应分类、问答、检索或定位。作者把 4 个专家的较优表现解释为与 MMEB 的四类任务结构相适应,这是一种实验解释,不等于已证明专家与任务一一对应,也不等于完全消除了梯度干扰。
2. 专家感知负样本加权:用内部路径判断哪些负例值得多学
EANS 的出发点是,负目标若和查询激活相近的专家组合,二者很可能处于相近的任务语义区域,比跨任务的明显无关样本更值得区分。实现上,它收集全部 \(L\) 层、每层 \(G\) 个被适配投影矩阵的路由概率;每个概率向量含 \(N\) 个专家,展平后形成长度为 \(L\cdot G\cdot N\) 的路由签名。随后计算查询与各负例签名的 L1 距离,并除以总维数。这比较的是网络如何处理输入,而不是另请教师模型为负例打分。
距离越小,负例的原始权重越接近上界;距离越大,权重按指数衰减趋向下界。默认上下界为 10.0 和 0.1,衰减尺度 \(\sigma=0.002\)。尽管名字含有 sampling,正文实际描述的核心操作是对已有负样本重新加权,而不是从新语料库检索额外样本。路由相近也只能充当困难程度的代理,不能保证负例确实在细粒度内容上相近,更不能自动排除本应视为正例的假负样本。
为避免改变负例权重总量,作者对 \(M\) 个负例的原始权重进行归一化:
这是原文式 (8),使归一化权重之和等于负例数、平均权重为 1。之后把每个负例在 InfoNCE 分母中的指数相似度项乘以对应权重,正例项保持不变。需要区分“权重和不变”与“损失分母不变”:由于各负例相似度不同,前者并不严格保证后者,也不保证总梯度大小完全相同;原文关于严格保持负贡献的措辞应谨慎理解。
3. 两阶段学习:先学出可用的路由,再用路由监督难例
随机初始化的路由分布还不携带稳定任务语义,此时将相似路由当成困难负例信号,可能强化任意噪声。因此,第一阶段只用普通 InfoNCE 训练,让专家与路由器通过对比监督形成分工;达到预热步数后,第二阶段切换到 EANS 加权损失。这是同一个模型的渐进训练,不是先训练外部教师,也没有额外的生成式推理阶段。
默认总训练为 2,200 步,2B 模型在 600 步后启用 EANS,7B 模型在 1,200 步后启用。较大模型需要更长预热是本文设置下的经验选择,不是普适比例。表 3 提供了直接检验:2B 的 MoE-only 为 70.20,一开始就加 EANS 反而为 70.14,采用两阶段后为 70.52。因此需要把“专家结构带来的大幅收益”和“稳定路由之后的额外精修收益”分开理解。
一个完整示例¶
以“给一张商品图和一句属性要求,寻找匹配商品”为说明性例子,这不是论文报告的独立测试样本。训练批次中同时有匹配目标、外观接近但属性不符的目标,以及明显无关的候选。所有输入先经过同一骨干,但其低秩残差由路由器分别组合,最后形成可比较的 EOS 嵌入。
预热期间只根据嵌入相似度做普通对比学习。预热结束后,系统还比较查询和负例的跨层路由签名:若属性不符的商品恰好具有更相近的路由,它获得更高权重,训练就更强调把这组容易混淆的样本分开。这里的“恰好”很重要,方法并未显式识别商品属性,路由代理也可能失败。
例如,假设只有两个负例,原始权重分别恰好为 10.0 与 0.1,则经式 (8) 归一化后约为 1.98 与 0.02。这些数字只是解释权重再分配的算例,不是测得的路由输出。部署时不再构造这两个负例,直接编码输入并按向量相似度排序。
损失函数 / 训练策略¶
训练目标始终是拉近查询与正目标、推远查询与负目标。第一阶段使用标准 InfoNCE;第二阶段只改变分母里负例的相对权重,不增加作者另行定义的任务标签分类损失。当前全文缓存中式 (2)、(3)、(4)、(6)、(7)、(9)、(10) 存在符号提取损坏,因此这里依据相邻正文解释机制,不猜补它们的精确排版;需要实现时应核对原版 PDF。
实验使用 8 张 NVIDIA A800、AdamW、学习率 \(5\times10^{-5}\)、线性衰减,全局 batch size 为 1,024,每卡为 128。Gradient Caching 的 sub-batch chunk size 为 2,以降低大批量对比学习的显存压力。图像最小像素数设置为 401,408,LoRA scaling factor 为 64。
路由温度与对比温度不是 EANS 的 \(\sigma\):前者控制专家概率尖锐程度或相似度 logits,后者控制路由距离到负例权重的衰减。当前正文未完整交代温度取值、所有适配矩阵清单、token 级路由如何汇聚为样本签名,以及 EANS 权重是否停止梯度;复现时不能把这些细节自行假定为作者设置。
实验关键数据¶
主实验¶
MMEB 表 1 共评估 36 个数据集:分类 10 个、VQA 10 个、检索 12 个、定位 4 个;按分布又分为 20 个 IND 和 16 个 OOD 数据集。下表摘录同一 Qwen2-VL 骨干系列、仅用 MMEB 训练的方法。分数采用论文 hit@1 百分数口径,Overall 不是四类分数的简单平均。
| 模型规模 | 方法 | 分类 | VQA | 检索 | 定位 | Overall |
|---|---|---|---|---|---|---|
| 2B | VLM2VEC | 59.0 | 49.4 | 65.4 | 73.4 | 59.3 |
| 2B | B3 | 67.0 | 61.2 | 70.9 | 79.9 | 68.1 |
| 2B | TSEmbed | 68.8 | 64.3 | 72.1 | 85.7 | 70.5 |
| 7B | VLM2VEC | 62.6 | 57.8 | 69.9 | 81.7 | 65.8 |
| 7B | B3 | 70.0 | 66.5 | 74.1 | 84.6 | 72.0 |
| 7B | TSEmbed | 71.1 | 70.3 | 75.9 | 91.3 | 74.7 |
表 1 的 TSEmbed 实际模型参数量为 2.26B/8.40B,“2B/7B”是骨干系列称呼。7B 的 IND/OOD 分别为 78.8/69.6,对 B3 的 75.9/67.1 提高 2.9/2.5 个百分点。外部数据增强模型不属于同资源比较:例如 Qwen3-VL-Embedding 的较大模型 Overall 为 80.1,高于本文 74.7,因此不能将本文结论扩写为无条件领先所有模型。
消融实验¶
下表摘录原文表 3,保留两位小数。未使用两阶段的 “MoE + EANS” 表示没有先做路由预热,不能理解成删除 MoE。
| 模型规模 | 配置 | Overall | 对同规模 MoE-only 的差值 |
|---|---|---|---|
| 2B | VLM2VEC | 59.30 | -10.90 |
| 2B | MoE-only | 70.20 | 0.00 |
| 2B | MoE + EANS,无预热 | 70.14 | -0.06 |
| 2B | 完整模型 | 70.52 | +0.32 |
| 7B | VLM2VEC | 65.80 | -8.41 |
| 7B | MoE-only | 74.21 | 0.00 |
| 7B | MoE + EANS,无预热 | 74.18 | -0.03 |
| 7B | 完整模型 | 74.68 | +0.47 |
关键发现¶
- MoE-LoRA 是主要收益来源:相对 VLM2VEC,2B/7B 提高 10.90/8.41 个百分点;EANS 配合预热的额外收益为 0.32/0.47 个百分点,不能把全部提升归因于困难负样本加权。
- 私有生产数据的零样本结果见表 2:广告 Recall 从 11.33% 到 33.20%,提升 21.87 个百分点,而非相对增长 21.87%;主题 NDCG@5 从 84.17% 到 86.22%。这不是线上 A/B 测试收入或点击率收益。
- 图 7 测试 2、4、6、8 个专家,4 个取得更稳健的跨任务表现,8 个通常退化;本文并未证明专家越多、任务规模越大就必然越好。
- 图 5 的文字报告在 \(\sigma\in[2\times10^{-5},2\times10^{-1}]\) 范围内表现波动约在 1 个百分点以内;这里保留作者的近似概括,不从损坏的图形文本臆读精确曲线点。
亮点与洞察¶
- 将任务冲突与困难负样本联系起来:路由既参与表示计算,也给出训练样本的内部结构线索。相比额外教师,这种复用减少了独立难例评分模块,但仍有路由签名聚合和距离计算成本。
- 消融说明训练时序本身有价值:同一个 EANS 模块,接在随机路由之后和接在成熟路由之后效果不同。可迁移的经验是,内部信号驱动的自监督加权应先确认信号具有可用语义,而非默认训练起点就可信。
- 将通用接口与参数完全共享分开考虑:一个向量编码器可以保持统一输入输出,同时在内部保留多个适配方向。对多领域检索系统,这比为每个任务部署完全独立骨干更值得探索。
局限与展望¶
- 路由距离是语义代理而非相关性标签。相近任务中的真相关目标可能被误当困难负例,后续可加入假负例过滤,并直接评估路由距离与人工相关性、负例难度之间的关系。
- 成本不能只看参数增量。表 4 在 A100 上报告广告 5,630 条数据的 2B 推理耗时从 35.72 到 44.67 分钟,游戏 6,532 条数据从 49.58 到 70.02 分钟,分别约增加 25.1% 和 41.2%;原文称延迟“可忽略”并不适用于这些相对增幅。
- “任务扩展”证据主要来自固定 MMEB 任务集合下的结构替换和专家数扫描,未给出持续增加任务数量时的扩展曲线或新任务加入后的遗忘实验。后续应检验专家数量与任务簇结构变化之间的关系。
- 原文没有单独的局限章节,也未报告多随机种子误差条;EANS 相对 MoE-only 的增益较小,需要重复实验确认稳定性。私有生产数据和若干实现细节缺乏完整公开描述,限制了独立复核。
- 原文表 1 中 7B VLM2VEC 的 IND/OOD 为 65.2/56.3,却给出高于二者的 Overall 65.8,存在口径或排版疑点;本文保留原表 Overall,不自行修正,也不据该基线的分布列作衍生结论。
相关工作与启发¶
- vs VLM2VEC:二者都把 MLLM 用作对比学习嵌入编码器。TSEmbed 改变的是低秩适配共享方式,并在路由稳定后重分配负例权重,不是通过增加生成长度提升检索质量。
- vs B3 / QQMM-embed:B3 关注批次构造,QQMM-embed 强化困难负例梯度;TSEmbed 额外处理参数层面的任务干扰,并以专家使用模式判断负例权重。本文没有给出把这些策略全部组合后的实验,不能假定收益可相加。
- vs PCGrad / GradNorm:这些多任务方法直接操作梯度或任务权重,本文通过条件适配间接减少共享冲突。文章并未在主结果表中直接比较它们,因此“更高效”的论述不是受控实验证明。
- 进一步启发:可分别固定总适配参数量、固定专家数、逐步增加任务簇,检验收益究竟来自容量增加、条件路由还是任务结构匹配;这是由现有证据边界引出的后续问题,不是本文已经完成的实验。
评分¶
- 新颖性: 4/5。MoE-LoRA 本身并非全新组件,利用跨层路由签名加权负例并配套预热具有明确组合价值。
- 实验充分度: 4/5。覆盖两种规模、公开与私有任务及多项消融,但缺少多种子统计和真正的任务数量扩展实验。
- 写作质量: 3/5。方法链条清晰,但权重归一化、效率与部分表格数字的表述需要更严格的边界。
- 价值: 4/5。为多任务检索编码器提供了可复用的条件适配思路,落地仍需衡量延迟与复现成本。