跳转至

OCTOPUS: Multi-Agentic Universal Compositional Visual Retrieval

会议: ECCV 2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5802
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/13170.pdf
代码: https://github.com/zbzzbzzbz/OCTOPUS
领域: 多智能体 / 组合视觉检索
关键词: 组合检索、工具调用、语义自修正、图文代理、候选验证

一句话总结

OCTOPUS 用感知、创作、检索三个无需任务训练的智能体,将参考图像或视频与修改要求转化为图文代理,再通过双向跨模态检索和逐候选验证提高排序质量,ViT-L/14 下 WebVid R@1 达到 67.15%,FashionIQ 平均 R@10 达到 37.00%。

研究背景与动机

组合视觉检索不是寻找“与这张图最像”的内容,而是寻找“保留这张图的主体,同时满足指定修改”的目标。例如参考服装是印字上衣,用户要求换成绿色四叶草图案且不要文字,系统既不能把原来的文字保留下来,也不能只按“绿色”去找任意衣服。传统监督方法依靠参考内容、修改文本、目标内容组成的三元组学习融合,但图像与视频往往各训一套,训练数据也难跨领域复用。

零样本方法把问题搬到语言空间:Pic2Word、LinCIR 将参考视觉内容映射为伪词表示,CIReVL 等方法则生成参考描述,再由语言模型推理目标描述。这让修改操作更容易表达,却引入另一种瓶颈:描述可能遗漏关键对象,修改要求可能含糊,语言模型认为合理的词语也未必被 CLIP 正确理解。只有一个目标句子时,后续检索没有额外证据来判断到底漏了什么;直接加一张生成图,又可能把生成模型随意补出的背景当成重要特征。

OCTOPUS 因而把重点放在推理时的证据补充与检查,而不是重新训练一个融合编码器。它先明确哪些内容需要改变,再想象目标场景、筛选对象级线索,最后检查检索结果是否兑现修改要求。核心 idea:让语言负责明确修改约束,让图文代理补充可能遗漏的目标语义,再用候选验证修正相似度排序,使同一套工具协作流程服务于图像和视频组合检索。

方法详解

整体框架

输入是参考视觉内容和修改文本,输出是数据库中按匹配程度排列的真实图像或视频,而非生成的图像。感知智能体(Perceiver)把两种输入统一成目标描述;创作智能体(Creator)产生视觉代理和多条文本代理;检索智能体(Retriever)结合两条跨模态相似度路径,并对靠前候选进行验证。

这里的“智能体”主要指承担不同职责、调用现成工具的推理模块,并不是三个通过强化学习训练的独立策略。框架中的自修正发生在目标描述生成阶段,排序修正发生在检索末端;原文没有给出检索失败后无限回到图像生成阶段的外循环。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["参考图像或视频<br/>与修改文本"] --> Perceiver["感知与自修正"]
    Perceiver --> Creator["图文代理创作"]
    Creator --> Retrieval["双向跨模态检索"]
    Database["候选视觉内容<br/>与候选描述"] --> Retrieval
    Retrieval --> Verification["候选验证与重排"]
    Verification --> Output["真实目标的排序列表"]

关键设计

1. 感知与自修正:先形成能同时表达保留项与修改项的目标描述

感知智能体首先调用视觉描述工具。图像直接生成全局描述;视频先均匀采样 \(N\) 个关键帧,再用同类工具概括视觉语义,因此两个任务可以共享后续语言推理流程。随后,修改工具将参考描述与用户指令一起交给 LLM,生成初始目标描述。这不是把两个字符串机械拼接:如果用户要求把某个对象换掉,就必须删除旧对象的约束,同时保留没有要求修改的场景信息。

初始描述仍可能保留错误细节,或在推理过程中加入没有依据的内容。语义修正工具因此对照初始目标描述和参考描述,突出实际被操作的元素、过滤不准确内容,并保持上下文连贯。它处理的是“目标句子是否准确表达修改”,不是在数据库中验证目标是否存在。将这个边界讲清楚很重要:语言上的自洽只能减少描述错误,不能保证 CLIP 会理解该描述,更不能替代末端的候选检查。原文给出了提示驱动的修正流程,没有给出固定的多轮收敛准则。

2. 图文代理创作:用生成内容发现缺失语义,但不照单全收

仅靠参考内容很难表达尚未出现的对象或属性。创作智能体根据目标描述与参考描述先推理合理的整体场景、布局,再调用 Qwen-Image 等生成工具产生视觉代理。代理是一张帮助检索的想象图,不是要求像素级忠实的编辑结果。作者认为组合检索本身容许视觉差异,因此无需严格复原参考图的所有细节;即使输入为视频,仍主要使用图像生成,以避免视频生成的时间成本。

关键不是“生成一张图后直接检索”,而是继续从中提取对象级证据。对象检测工具分析参考内容和视觉代理,得到细粒度区域与显著对象;LLM 再根据组合查询区分目标中应该存在和不应该存在的对象,避免把生成图里的无关背景全部塞进查询。筛出的对象集合与目标描述一起用于生成 \(K\) 条文本代理,从不同措辞与语义侧面描述同一目标。这样,视觉生成提供的是候选语义,用户修改约束仍决定哪些语义可以进入检索。这种过滤也不能被视作事实保证,因为生成、检测和 LLM 判断都可能出错。

3. 双向跨模态检索:让视觉代理匹配候选描述,而不是直接匹配候选像素

第一条路径用文本代理匹配数据库中的视觉内容,即 text-to-vision;第二条路径用视觉代理匹配数据库中候选内容的文字描述,即 vision-to-text。第二条路径尤其容易被误读成图搜图:作者恰恰认为视觉代理与候选图像直接比较容易过分强调无关背景,所以改为比较生成视觉内容与候选文字语义。这要求候选端具备描述及其文本特征,系统并不只维护一个纯视觉索引。

对于单条文本代理 \(T_A\)、视觉代理 \(V_p\)、候选视觉内容 \(I\) 和它的描述 \(C_I\),两条路径的基本余弦相似度可按正文语义记为:

\[ s_{t2v}(T_A,I)=\cos\bigl(\Psi_t(T_A),\Psi_v(I)\bigr),\qquad s_{v2t}(V_p,C_I)=\cos\bigl(\Psi_v(V_p),\Psi_t(C_I)\bigr). \]

这里 \(\Psi_t\)\(\Psi_v\) 是 CLIP 文本与视觉编码器。这个写法只是将正文明确描述的两种相似度统一记号,不是补写原文缺损的门控式;多条文本代理如何聚合以及最终融合分数的精确实现,不能从这个式子推断。作者使用参数 \(\lambda\) 控制融合,并报告过强的视觉代理影响会遮蔽文本语义。缓存式 (2) 的运算符抽取不完整,因此这里不猜测相加、相乘或归一化细节,也不据“adaptive gating”一词宣称存在可学习门控网络。

4. 候选验证与重排:逐个判断修改是否兑现,而不是再算一次嵌入相似度

高相似度候选可能主体正确,却违反“不含文字”“领口更高”等细粒度条件。检索智能体因此调用 LLM 评估工具,将参考内容、组合查询以及候选描述纳入比较,对当前候选给出 Yes/No 和理由。这里的 pairwise comparison 是参考内容与候选内容之间的比较,不是所有候选之间两两比赛。

检查按初始排名依次进行,找到满足条件的候选就把它移到首位,或在达到最多检查 \(\alpha\) 个候选后停止。因此这不是对整个数据库重新评分,也不是对全部前排候选完成全排序。有限检查预算控制调用成本,同时使结果依赖召回阶段是否已经找到好候选;如果正确目标不在可检查范围内,验证本身无法把它凭空召回。缓存式 (3) 同样存在排版抽取损坏,以上以正文给出的停止规则为准,不补写缺失的排序算子。

一个完整示例

原文图 4 的服装修改包含“绿色”“四叶草”“不要文字”。下面按机制串起这些约束,是流程解释,不是复现论文未给出的逐步日志。感知与自修正先形成目标服装描述,删除与“不要文字”冲突的原有印字信息,而不是把原描述完整保留下来。

图文代理创作随后想象绿色四叶草服装,再由对象筛选保留符合要求的图案、排除不应存在的文字。多条文本代理围绕同一组约束展开,而不是分别检索互不相干的绿色物体与四叶草。双向跨模态检索同时利用这些描述和视觉代理,得到真实商品候选。

若靠前候选颜色正确但仍有字样,候选验证应拒绝它并继续检查后续候选,直到找到满足要求的结果或触及 \(\alpha\)。论文未提供此例的逐候选分数、实际检查次数与代理数量,因此不能给出虚构的候选缩减轨迹。

损失函数 / 训练策略

OCTOPUS 本身不训练任务专用参数,也没有提出新的训练损失;“training-free”指复用预训练工具,而不是这些工具从未经过训练。默认 LLM 为 GPT-4o-Mini,视觉生成使用 Qwen-Image。实现段列出 CLIP ViT-B/32、ViT-L/14、ViT-G/14,特征维度分别为 512、768、1024;本文选取的主结果与消融均使用 ViT-L/14。

原文报告 Toptee 与 CIRCO 在 \(\lambda\in[0.2,0.4]\) 较稳定,WebVid 在 \(\lambda=0.2\) 最好,但缓存未明确给出可复核的默认 \(N\)\(K\)\(\alpha\) 及完整代理聚合规则。不能据敏感性曲线补出每个任务的全部默认配置。

实验关键数据

主实验

下表摘录原文表 1、表 2,同一行的 OCTOPUS 与比较方法均为 ViT-L/14。数值以百分数表示,“提升”是百分点差,不是相对百分比。比较方法取原表中该列最强的其他方法,因而各行并非同一基线。

数据集 指标 最强比较方法 比较值 OCTOPUS 提升(百分点)
WebVid R@1 Pic2Word 48.47 67.15 +18.68
FineCVR R@1 CVRDM 17.25 20.16 +2.91
CIRCO mAP@5 IP-CIR 26.43 28.18 +1.75
FashionIQ 平均 R@10 OSrCIR 33.26 37.00 +3.74
FashionIQ 平均 R@50 OSrCIR 54.37 57.60 +3.23

R@k 衡量目标进入前 \(k\) 个结果的查询比例;CIRCO 每个查询有多个真实目标,故报告兼顾命中与排序位置的 mAP@k。FashionIQ 的平均值跨 Shirt、Dress、Toptee 三类。原文设置段称视频基准为 WebCVR,结果表使用 WebVid,本笔记沿用表名;虽然设置段列出 CIRR,当前缓存没有可核对的 CIRR 数值表,因此不将“五个基准”写成五组已核验结果。

消融实验

下表直接取原文表 3 的原始指标,不沿用其 Avg. 与相对下降叙述,避免四舍五入和不同指标聚合造成歧义。骨干仍为 ViT-L/14,默认 LLM 为 GPT-4o-Mini。

配置 WebVid R@1 WebVid R@5 CIRCO mAP@5 CIRCO mAP@10
完整 OCTOPUS 67.15 85.28 28.18 28.66
去掉修改推理 60.34 81.01 26.40 27.51
去掉语义自修正 60.45 80.70 24.67 25.62
去掉文本代理 62.06 81.28 23.84 25.02
去掉视觉代理 61.90 81.01 25.26 26.24
去掉整个创作智能体 59.44 79.21 22.84 23.76
替换双向检索 61.51 81.48 26.91 27.48
去掉候选验证 52.70 78.58 26.36 27.30

“替换双向检索”保留 text-to-vision,但用 vision-to-vision 替换 vision-to-text,不是完全禁用检索。“去掉文本代理”对应跳过语义增补阶段,不能视作独立证明所有文本多样性策略都有效。

关键发现

  • WebVid 对候选验证最敏感:R@1 从 67.15 降至 52.70,下降 14.45 个百分点,支持末端检查能修正靠前候选的细粒度错误。
  • CIRCO 更依赖创作智能体:去掉整个模块,mAP@5 从 28.18 降至 22.84,下降 5.34 个百分点;单独去掉文本代理则下降 4.34 个百分点。不同领域的主要瓶颈并不相同。
  • 作者报告每次查询平均 5.3 秒,IP-CIR 为 33.8 秒、AutoCIR 为 6.07 秒、OSrCIR 为 0.6 秒,且 OCTOPUS 超过 95% 的运行时间用于外部 API 调用。免训练并不等于低延迟,这些时间也受服务环境影响。

亮点与洞察

  • 生成模型可以成为检索语义的提案工具,而不必产出最终答案。先生成、再筛选对象、再形成文本代理,把“想象”转化成可以受用户约束检查的中间证据。
  • 双向检索的价值在于改变比较对象,而不只是增加一个分数。让视觉代理对候选描述做跨模态匹配,为减少生成背景干扰提供了具体设计思路。
  • 候选验证把“嵌入接近”与“修改成立”分开处理。类似机制可迁移到商品或素材检索,但应同时测量拒绝正确候选的风险与额外调用成本。

局限与展望

  • 作者报告的概念错位:图 5 中描述“exotic patterns”符合 LLM 的理解,却未被检索模型有效识别;换成“bold floral print”后检索改善。这表明可解释的语言接口仍可能需要人工改词,并非完全消除提示敏感性。
  • 视频能力的边界:统一入口依赖关键帧描述,创作阶段主要生成静态图像。笔记判断:这不足以证明系统同样擅长动作先后关系、运动速度或长时事件修改。
  • 计算与依赖成本:外部 LLM、生成、描述和验证调用增加延迟,候选描述也引入索引构建负担。作者计划轻量化;进一步值得测试预算自适应验证、代理缓存及本地工具组合。
  • 复现证据不足:当前缓存的融合与重排公式有抽取缺损,部分超参数与 CIRR 结果未明确给出。需要查原 PDF 或代码才能补齐,不应把本笔记当作完整实现规格。
  • 比较边界:相同 CLIP 骨干不等于相同推理资源,OCTOPUS 还调用生成模型和 LLM。现有消融支持各模块在该组合内有效,尚不能分离多智能体组织方式与额外计算预算各自贡献。

相关工作与启发

  • 对比 Pic2Word / LinCIR:伪词映射把视觉信息压入语言查询,OCTOPUS 则显式展开目标描述、生成代理并验证候选。后者提供可读中间过程,但调用成本明显更高。
  • 对比 CIReVL / LDRE / OSrCIR:这些方法分别强调语言推理、发散描述或检索前反思;本文进一步把对象筛选、视觉代理和检索后验证串起来,收益不是单一提示模板替换。
  • 对比 IP-CIR / AutoCIR:想象代理与自动协作已有相关先例,因此不宜把“首次多智能体检索”无条件当作事实。更稳妥的贡献定位是面向图像与视频的共享流程及具体的跨模态代理融合。
  • 对比 CoVR / CVRDE / CVRDM:这些方法侧重视频组合表征,OCTOPUS 通过语言接口复用工具实现跨域处理。统一工具流程与学习高质量时序表示仍是不同问题。

评分

  • 新颖性: 4/5。图文代理、双向匹配与末端验证组合明确,但多个组成思想已有先例。
  • 实验充分度: 4/5。跨域结果与模块消融有说服力,CIRR 可见证据和等预算比较仍不足。
  • 写作质量: 3/5。流程直观,但基准命名不一致,缓存公式缺损限制精确复现。
  • 价值: 4/5。适合愿意承担秒级推理延迟、需要可解释修改检索的场景。