跳转至

CoCo-IR: Conversational Composed Image Retrieval

会议: ECCV 2026
论文: ECCV 2026
代码: https://CoCo-IR.github.io
领域: 多模态 VLM
关键词: 组合图像检索, 交互式多轮对话, 大多模态模型, 表征学习, 负例挖掘

一句话总结

针对传统组合图像检索仅支持单轮孤立查询的缺陷,本文提出多轮交互式组合图像检索新任务 CoCo-IR,并设计了基于大多模态模型的可变图像表征架构 TIE 与自反思数据引擎,在严格轨迹评估下将 4 轮检索 R@1 从基准的 28.2% 提升至 44.1%。

研究背景与动机

基于文本指令的视觉搜索技术已经从简单的跨模态关键词检索拓展到了组合图像检索(Composed Image Retrieval, CIR)。在经典的单轮 CIR 范式中,用户输入一张参考图 \(I_{\text{src}}\) 并附带一条修改指令 \(T\)(如“将汽车颜色换成红色”),检索系统需要从大规模图库中召回满足变换要求的目标图像 \(I_{\text{tgt}}\)。依托于大规模多模态对齐编码器和基础模型推理能力,单轮 CIR 近年来取得了显著进展。

然而,现实场景中真实用户的视觉搜索行为本质上是渐进式、试探性和连续交互的。用户往往无法在一轮查询中穷尽复杂的视觉意图,更常见的情况是依据前几轮召回的中间图像逐步细化要求、调整搜索分支,甚至在浏览过程中改变思路(例如“先去掉水印,再换成黄昏,但保留最初的视角”)。现有 CIR 模型在架构上只能处理单图单文本输入,一旦用户需要多轮调整,系统只能要求用户推倒重来、重新构造极为复杂的单轮长 Prompt;即便引入前沿的大模型对多轮对话进行上下文摘要,也会不可避免地损失细粒度视觉细节与跨轮次指代线索,导致检索链条断裂。

为此,亟需建立一种能够原生理解交错图文历史、支持多轮连续迭代的检索范式。核心 idea:形式化定义上下文组合图像检索(CoCo-IR)任务并采用严格的整链召回评估指标,提出原生处理多轮图文交互的 TIE 模型(引入专门的 \(\langle\text{EMB}\rangle\) 瓶颈标记与单轮双向/跨轮因果混合注意力),并构建包含自反思与模型引导难负例验证的自主数据引擎。

方法详解

整体框架

CoCo-IR 旨在支持用户通过多轮对话连续检索图像。在第 \(t\) 轮(\(t \ge 1\)),用户给出当前修改指令 \(T_t\),系统输入由完整的历史交互序列 \(H_t = (I_0, T_1, I_1, \dots, T_{t-1}, I_{t-1})\) 以及 \(T_t\) 组成,要求从图库 \(\mathcal{C}\) 中检索出正确的目标图像 \(I_t\)。TIE(Transformable Image Embedding)模型基于大多模态模型(LMM)底座构建,将历史图像序列与文本指令统一编码为交错序列输入。在每轮对话的末尾,插入特殊的 \(\langle\text{EMB}\rangle\) 标记,经由混合注意力掩码完成上下文深度融合后,通过线性映射层投影得到可变查询嵌入向量 \(q_{t,i}\),与候选图像表征做单侧对比学习。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多轮交错输入<br/>I_0, T_1, I_1, ..., T_t"] --> B["多模态统一 Token 化<br/>视觉编码器 + 文本 Tokenizer"]
    B --> C["混合注意力机制<br/>轮内双向全融合 + 跨轮因果时序建模"]
    C --> D["全局信息瓶颈<br/>专属 EMB 标记汇聚上下文"]
    D --> E["线性投影层与单侧对比优化<br/>拉近正样本,推开难负例与批内负例"]
    E --> F["图库最近邻相似度检索<br/>召回当前轮目标图像 I_t"]

关键设计

1. 专属全局信息瓶颈 EMB 标记:打破自回归末尾偏置 传统基于因果大语言模型的检索方法多直接提取输入末尾最后一个 token 的隐状态作为检索向量。然而在长上下文多轮对话中,因果注意力的局部性与最近邻偏置会使最后一个 token 极度偏向最近输入的几个单词,严重忽略早期的参考图像或跨轮次的指代关系(例如用户在第 3 轮指令中提到“换回第 1 轮的视角”)。为解决这一表征塌缩问题,TIE 在每个检索轮次的末尾显式插入一个专属的特殊标记 \(\langle\text{EMB}\rangle\)。该标记扮演全局信息瓶颈的角色,强迫多模态 Transformer 的深层表征将整条交互轨迹中的多幅视觉图像和文本修饰指令充分压缩到紧凑的向量空间中,输出时仅取 \(\langle\text{EMB}\rangle\) 对应的最后一层隐状态经过轻量线性层得到检索嵌入,消融实验证实其显著优于传统的末尾 token 策略。

2. 轮内双向与跨轮因果的混合注意力:兼顾深层融合与时序因果 多轮检索对注意力机制提出了双重矛盾需求:一方面,在单轮查询内部,图像 patch tokens 与修改文本 tokens 之间需要完全无死角的互相感知,以实现精细的图文语义绑定;另一方面,不同轮次之间存在天然的时间演进顺序,后一轮的状态不能在前期推理时发生信息穿越。TIE 提出了混合注意力掩码(Hybrid Attention Mask):对于属于同一轮次的所有 tokens(包括当前图像与指令),采用双向完全注意力(Full Attention),促使视觉细节与指令语义在底层即刻完成深层融合;而对于不同轮次之间,则施加严格的时序因果注意力(Causal Attention),只允许当前轮关注历史轮次、禁止历史向前查看未来。该机制确保了模型能够精准追踪交互状态的转移。

3. 自反思与双向验证的自主数据引擎:低成本构建高质量多轮检索链 多轮上下文检索面临严重的数据缺乏问题,人工逐轮标注开销极大。本文提出了一个飞轮式自主数据引擎: - 候选对发现与双维自反思:首先通过特征聚类与网页共现挖掘潜在的变换图像对;随后利用大模型生成变换指令,并让大模型展开“自反思”,分别对“图像对本身的变换清晰度”以及“所生成指令的明确性”进行 1-5 分打分,双高阈值过滤剔除模糊噪声。 - 模型引导的难负例挖掘:对比学习极为依赖难负例。系统先在训练集挖掘与目标图视觉相似但不满足指令的图片,再调用 LMM 作为二元判别器对比正负样本,剔除假负例,仅保留经判别器确认“未能遵循指令”的真难负例。 - 对话链拼接与回溯式重写:将相连的单轮对拼接为长达 4 轮的交互链,并由大模型对后续轮次指令进行改写,注入“相较于第一张图”、“把第二张图中的...”等上下文回溯指代,构建出高度逼真自然的多轮评估基准。

一个完整示例

假设用户在探索旅行风景图: 1. 第 1 轮:输入哥本哈根新港白天的远景照片 \(I_0\) 和指令 \(T_1\):“去掉底部的文字水印”;TIE 将 \(I_0\)\(T_1\) 编码,\(\langle\text{EMB}\rangle\) 汇聚特征并召回无水印白日图 \(I_1\)。 2. 第 2 轮:用户接着输入 \(T_2\):“既然文字去掉了,把白天的场景换成黄昏,但找回最初那张图的拍摄角度”;此时上下文输入为 \((I_0, T_1, I_1, T_2)\),因果注意力使 \(T_2\) 能够回溯 \(I_0\) 的视角与 \(I_1\) 的无文字状态,成功召回黄昏广角图 \(I_2\)。 3. 第 3 轮:用户输入 \(T_3\):“其实还是换回白天吧,但要比第二张图更明亮温暖”;TIE 再次通过全局 \(\langle\text{EMB}\rangle\) 正确理解跨轮指代“第二张图”和反悔指令,连续命中最终目标。整条链在 \(m\)-turn 评估中判定为全胜。

损失函数 / 训练策略

训练采用单侧 InfoNCE 对比损失(Single-side Contrastive Loss)。对于第 \(i\) 个样本在第 \(t\) 轮的查询向量 \(q_{t,i}\),正样本为该轮对应目标图像提取的嵌入 \(p_{t,i}\),负样本候选池 \(\mathcal{C}_e\) 包含当前 batch 内所有样本在各轮次的目标图嵌入、初始原图嵌入以及模型挖掘的难负例嵌入。单样本单轮损失定义为:

\[ \mathcal{L}_{t,i} = -\log \frac{\exp(\text{sim}(q_{t,i}, p_{t,i})/\tau)}{\sum_{e \in \mathcal{C}_e} \exp(\text{sim}(q_{t,i}, e)/\tau)} \]

其中 \(\text{sim}(\cdot, \cdot)\) 为余弦相似度,\(\tau\) 为固定温度超参数。整体损失为所有样本及所有轮次的平均值。消融实验证明,针对检索任务设计的非对称单侧对比损失优于 CLIP 风格的双向对称损失。

实验关键数据

主实验

针对传统 CIR 模型无法输入多图的限制,论文构建了三种基线输入模式:拼接全部历史指令(Concat)、仅输入上一轮图片与当前指令(Latest)、以及调用 Gemini 2.5 Pro 读取完整交互历史并压缩重写为单轮 prompt(Summarized)。评估指标为严格的累积成功率 \(m\)-turn Recall@k(要求整个交互序列中每一轮的目标图像都在前 \(k\) 命中)。

模型 交互上下文模式 1-turn R@1 1-turn R@5 2-turn R@1 2-turn R@5 4-turn R@1 4-turn R@5
TIPS-SO400M Concat 历史指令 25.2 51.0 0.4 21.3 0.0 5.1
MagicLens (CLIP-L) Concat 历史指令 36.7 57.8 8.1 26.7 0.0 2.3
BGE-VL-MLLM-S1 Concat 历史指令 60.0 79.5 28.7 58.3 4.9 34.7
BGE-VL-MLLM-S1 Latest 上一轮输入 60.0 79.5 36.2 64.1 27.0 54.0
MagicLens (CLIP-L) Gemini 2.5 摘要上下文 43.5 66.5 19.8 47.0 10.7 33.0
BGE-VL-MLLM-S1 Gemini 2.5 摘要上下文 60.8 79.4 35.5 62.7 28.2 53.9
TIE-4B (Ours) 原生完整上下文 (Full Context) 74.5 89.8 48.3 79.5 31.1 65.8
TIE-12B (Ours) 原生完整上下文 (Full Context) 76.3 90.4 54.8 82.1 44.1 78.3

在标准单轮检索公开基准上,TIE 同样刷新了最优性能:在 CIRCO 上达到 39.4 mAP@5(超越 MagicLens 的 34.1 与 BGE-VL 的 39.2),在 CIRR 上达到 38.7 R@1,综合平均排名位列第一(Rank 1.50)。

消融实验

下表给出了架构核心设计组件(双向注意力 BA、单侧对比损失 SC、特殊标记 ET)的消融分析(原论文 Table 4):

配置 (BA / SC / ET) FIQ R@10 CIRR R@1 CIRCO mAP@5 CoCo-IR 1-turn R@1 平均 Rank ↓ 说明
完整模型 (✓ / ✓ / ✓) 40.1 37.7 37.8 75.4 1.50 三项设计联合效果最佳
缺少特殊标记 (✓ / ✓ / ✗) 39.2 37.2 35.9 75.5 3.00 退化为末尾 token 提取,CIRCO 掉点 1.9%
缺少单侧损失 (✓ / ✗ / ✓) 39.6 35.9 37.4 75.6 2.25 对称双向损失在检索候选区分度上较弱
缺少轮内双向注意力 (✗ / ✓ / ✓) 39.7 33.9 36.6 74.2 3.25 纯因果注意力损害同轮多模态融合,CIRR 骤降 3.8%

在数据规模方面(原论文 Table 5),得益于高质量自反思过滤与难负例挖掘,TIE-4B 仅使用 320K 样本即可在三大单轮基准上全面击败使用 36.7M 样本(超 100 倍数据)训练的 MagicLens(CIRCO mAP@5 达到 36.7 对比 34.1)。

关键发现

  1. 多轮图文信息不可无损压缩:即使采用当前最先进的商业多模态模型 Gemini 2.5 Pro 将多轮图文历史压缩成一条精炼文本,基线模型在 4 轮检索下的 R@1 最高仅为 28.2%,而 TIE-12B 达到 44.1%,证明中间关键视觉特征和精细变换细节无法由单纯的文字总结完全表达。
  2. 纯因果注意力的表征局限:消融显示去掉轮内双向注意力后,CIRR R@1 从 37.7 暴跌至 33.9,表明在单个查询内允许图像与文本 tokens 相互感知对细粒度语义理解起着决定性作用。
  3. 数据质量远胜于单纯堆量:结合自反思过滤与 LMM 二元验证的难负例挖掘,使得少量合成数据具备极高学习效率,以不到传统方案 1% 的数据量便实现了跨域基准的泛化飞跃。

亮点与洞察

  • 多轮严格累积评估指标:提出了 \(m\)-turn Recall@k,要求模型在整条交互路径中每一轮均不能脱轨,精准抓住了多轮会话检索“单步失误则后续语义失去参照”的真实物理约束。
  • \(\langle\text{EMB}\rangle\) 瓶颈标记的巧妙解耦:将自回归生成语言模型的长文本记忆机制转化为紧凑的检索向量空间,避免了传统因果末尾 token 对临近词的严重偏置。
  • 数据引擎自反思双向闭环:通过图像变换清晰度与指令无歧义性的两层评分,再配合训练模型与大模型的协同负例挖掘,构筑了无需人工介入的自进化数据飞轮。

局限与展望

  • 作者承认的局限:目前长对话链主要支持至 4 轮交互,更长轮次的样本在现实和合成数据中高度稀疏;受算力约束,训练中每个样本仅挖掘了一个难负例,且仅迭代了一轮挖掘。
  • 潜在不足与适用边界:静态基准假定每轮检索的上下文为 Ground-Truth 历史,无法实时模拟人类用户在某轮遭遇糟糕检索结果后的动态纠错与降级策略;推理时随着轮次增加,多图注意力缓存带来的显存消耗与时延会逐步上升。
  • 改进思路:探索结合多智能体强化学习(RL)模拟动态用户交互纠错环境,并在端侧引入显存紧凑的视觉 Token 压缩与键值缓存(KV-cache)淘汰机制。

相关工作与启发

  • vs MagicLens [ICML 2024]:MagicLens 依赖海量网页图文共现与生成模型合成 36.7M 数据且只支持单轮;TIE 拓展至交互式多轮,并通过自反思机制仅用不到 1% 的高质量数据即取得更优检索表现。
  • vs E5-V [2024] & BGE-VL [ACL 2025]:E5-V 和 BGE-VL 探索了利用 LMM 生成通用多模态向量,但缺乏针对多轮时序上下文的结构适配与因果/双向混合掩码设计;在面对多轮指代时容易发生灾难性遗忘。
  • vs IRR [ACM MM 2023] & MAI [ICLR 2025]:此类工作多局限于时尚服装单一垂直领域,且仅首轮允许输入图像、后续仅为纯文本反馈;CoCo-IR 实现了开放领域的任意轮次图文交错交互。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次形式化定义多轮交错图文组合检索任务并提出原生支持长上下文交互表征的 LMM 架构。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖单轮三项公开基准、多轮严格轨迹评估以及深度消融与数据效率验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密流畅,实验设计周全,对比策略扎实可信。
  • 价值: ⭐⭐⭐⭐⭐ 为下一代对话式多模态搜索引擎、电商导购与交互式图像生成系统奠定了坚实的基石。