跳转至

CMDR: Contextual Multimodal Document Retrieval

会议: ECCV 2026
论文: ECCV 原文
代码: https://cmdr-bench.github.io
领域: 多模态VLM
关键词: 多模态文档检索、上下文感知嵌入、延迟交互、对比学习、文档问答

一句话总结

针对现有视觉文档检索方法将页面独立编码而丢失跨页依赖的瓶颈,提出首个长文档上下文感知检索基准 CMDR-Bench 与 CMDR-Embed 模型,通过滑动窗口联合编码切分策略配合块内/文档内难负样本对比学习,实现了大幅超越非上下文模型的检索精度。

研究背景与动机

现实世界中的长文档(如设备手册、学术论文、项目提案与财务报表)本质上是高度多模态的,文字、表格、图示与排版信息紧密交织,且核心语义往往跨越多页连续分布。随着检索增强生成(RAG)和多模态大模型的快速发展,基于视觉的多模态文档检索(如 ColPali、VisRAG)通过直接将页面渲染为图像进行端到端编码,避免了传统 OCR 带来的排版破坏与识别噪声,成为了长文档理解的重要前沿方向。

然而,现有的多模态文档检索基准和检索模型均建立在单页独立编码的假设之上。现存评测基准(如 MMLB-Doc、SlideVQA、ViDoRe)主要考察查询词与单个页面之间的直接关键词或浅层语义匹配;现存检索器在处理多页长文档时,无一例外地将每个页面切分为孤立图像分别输入视觉编码器。这种设定忽略了一个关键事实:现实查询往往需要跨越多个页面进行间接推理——例如核心实体在上一页定义而在下一页展开、代词在后页指代前页图表、表格表头跨页截断、或多步逻辑推导链跨页延续。孤立编码使得页面嵌入完全丧失了所属文档的全局脉络与邻近上下文,导致模型无法间接检索出没有明确表面词匹配但实为答案载体的目标页。

为了打破这种单页孤立假定,必须构建能够评估与建模跨页上下文的多模态检索体系。这面临两个核心矛盾:一是评测端缺乏真正需要跨页上下文推理的长文档基准,二是建模端在联合编码多页时容易发生页面间信息泄漏,从而削弱目标页与干扰页的区分度。核心 idea:提出强调间接跨页推理的任务与人工标注基准 CMDR-Bench,并提出 CMDR-Embed 框架,采用分块联合编码后切分页面表示的机制捕获上下文,同时引入结合块内与文档内难负样本的上下文对比学习损失 CMCL,在建立跨页关联的同时牢固维持单页辨别力。

方法详解

整体框架

CMDR-Embed 针对包含 \(N\) 个页面的长文档,采用“滑动窗口分块联合编码 \(\rightarrow\) 页面级多向量切分 \(\rightarrow\) 查询与多向量延迟交互”的端到端检索流程。针对多页联合输入导致同一文档内页面表示过度平滑的问题,框架在训练期采用上下文多模态对比学习(CMCL)对目标正例页与同块/同文档内部的混淆负例进行强力分离。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["长文档多页图像输入<br/>D = {I1, ..., IN}"] --> B["分块与切分编码<br/>滑动窗口联合编码并拆解为页面多向量"]
    B --> C["细粒度多向量延迟交互<br/>查询与页面patch词级MaxSim求和匹配"]
    C --> D["上下文对比学习损失 CMCL<br/>引入块内与文档内难负样本联合优化"]
    D --> E["最终排序输出<br/>上下文感知目标页检索排名"]

关键设计

1. 分块与切分编码:滑动窗口联合编码长上下文与页面级表示剥离 现有视觉文档检索器独立编码每个页面,导致跨页代词、跨页表格切分和多步推理链完全断裂。为了在长文档中引入上下文,CMDR-Embed 采用分块切分机制(Chunk-then-Split)。对于一个由 \(N\) 页图像构成的文档 \(\{I_1, \dots, I_N\}\),系统使用步长为 \(s\)、窗口大小为 \(w\)(默认 \(s=2, w=4\))的滑动窗口划分页面块,第 \(t\) 个块包含序列 \(\{I_{s(t-1)+1}, \dots, I_{s(t-1)+w}\}\)。整个块内的连续多页图像一次性输入给大型多模态模型(如 ColPali/ColQwen 底座),利用 Transformer 全局注意力机制使临近页面充分交换特征。编码完成后,按照每个页面对应的图像 token 范围,将块隐层表示剥离为独立的页面级多向量嵌入 \(\mathbf{E}^{I_n} \in \mathbb{R}^{N^I \times D}\)。对于窗口重叠引入的重复页面,模型统一保留首次出现(早前块)的表示,既保证了页面获得足够前序上下文,又避免了冗余计算与状态冲突。

2. 细粒度多向量延迟交互:跨页上下文保留下的局部对齐 在获得富含上下文信息的页面嵌入后,常规做法若使用均值池化(Mean Pooling)或尾 token 池化将其压缩为单一向量,会严重抹杀图表局部文本、微小注记与跨页逻辑锚点的微观特征。CMDR-Embed 延续并升级了多向量延迟交互(Late Interaction, LI)机制。给定具有 \(N^q\) 个词向量的查询矩阵 \(\mathbf{E}^q \in \mathbb{R}^{N^q \times D}\) 与页面多向量矩阵 \(\mathbf{E}^{I_n} \in \mathbb{R}^{N^I \times D}\),检索打分采用逐查询 token 在页面所有视觉 patch 向量中的最大点积求和:

\[\text{LI}(q, I_n) = \sum_{i=1}^{N^q} \max_{j \in [1, N^I]} \langle \mathbf{E}^{q}_i, \mathbf{E}^{I_n}_j \rangle\]

这种晚期交互机制允许查询中的特定限定词(例如“下方的按键”、“表格中的下一行”)精确匹配到页面中经过上下文强化后的具体视觉 patch,使长距离上下文线索能与查询细粒度对齐。

3. 上下文对比学习损失 CMCL:利用双重同源难负样本抑制信息泄漏 将多页放在同一个上下文窗口联合编码会带来一个严重的副作用:注意力机制促使相邻页面表示相互渗透,使得同一文档甚至同一块内的无关页面与目标正例页面相似度异常升高,导致页面可区分度急剧下降。标准对比学习仅依赖批次内其他文档作为负例(In-Batch Negatives),无法对这种同源平滑形成梯度惩罚。为此,作者提出了上下文多模态对比学习(Contextual Multimodal Contrastive Learning, CMCL),构建了两种上下文感知难负样本:一是块内负样本 \(\mathcal{I}_{\text{chunk}}\)(与正例处于同一滑动窗口内的非目标页,专门对抗局部平滑);二是文档内负样本 \(\mathcal{I}_{\text{doc}}\)(属于同一篇长文档其他块的非目标页,专门对抗全局主题混淆)。总损失由上下文对比项与批次对比项加权组合:

\[\mathcal{L}_{\text{CMCL}} = \lambda \mathcal{L}_{\text{Context}} + (1 - \lambda) \mathcal{L}_{\text{Batch}}\]

其中上下文对比项 \(\mathcal{L}_{\text{Context}}\) 强制正例页面 \(I^+\) 在其上下文难负例集合 \(\mathcal{I}_{\text{chunk}} \cup \mathcal{I}_{\text{doc}}\) 中脱颖而出:

\[\mathcal{L}_{\text{Context}} = -\log \frac{\exp(\text{LI}(q, I^+)/\tau)}{\exp(\text{LI}(q, I^+)/\tau) + \sum_{I^-_n \in \mathcal{I}_{\text{chunk}} \cup \mathcal{I}_{\text{doc}}} \exp(\text{LI}(q, I^-_n)/\tau)}\]

通过将权重 \(\lambda\) 设为 0.5,模型在学习文档全局关联的同时,强力锁定了单个页面的判别边界。

损失函数 / 训练策略

模型采用两阶段渐进式优化。首先构建大规模合成数据集 CMDR-Synth(39,796 个高质量查询-页面对),利用 Qwen2.5-VL 72B 识别需要上下文的页面,通过 UniSE 检索关联上下文页,并由大模型依据跨页逻辑生成复杂查询。在模型训练中,冻结底层视觉编码器的大部分参数,使用 LoRA(秩 \(r=32\)、缩放系数 \(\alpha=32\))对视觉语言模型骨干的注意力和投射层进行微调。在 8 张 A100-80G 上以温度系数 \(\tau=0.02\)、学习率 \(2\times 10^{-4}\)、批大小 192 训练 3 个 epoch,并使用 FlashAttention 加速。在下游部署时,可配合分层 token 池化(Hierarchical Token Pooling)将多向量空间压缩 80%,在几乎无损精度的前提下实现检索吞吐大幅提升。

实验关键数据

主实验

评估在作者提出的 CMDR-Bench 基准上进行。基准包含 255 篇长文档(平均 183.5 页)与 800 条经严格人工标注过滤的高难度查询,涵盖文本补全(TC)、指代消解(CR)、结构化理解(SU)与多跳推理(MR)四大类别。评价指标采用 nDCG@5。

模型类型 模型名称 骨干网络 参数量 TC CR SU MR Overall
文本检索 BM25 纯词法检索 - 29.1 19.5 20.9 24.9 23.6
文本检索 Contriever BERT-base 109M 35.7 15.0 23.5 26.4 25.1
文本检索 BGE BERT-base 109M 42.8 18.4 28.5 29.5 29.8
文本检索 NV-Embed-v2 Mistral-7B 7.9B 36.2 16.9 28.6 30.4 28.0
通用多模态 SigLIP SOViT-400m 878M 24.5 8.7 15.5 22.2 17.8
通用多模态 E5-V LLaVA-1.6 8.4B 35.4 22.8 31.2 34.8 31.0
通用多模态 Qwen3-VL Embedding Qwen3-VL 8B 38.2 26.6 35.7 37.2 34.4
多模态文档 DSE Phi-3-V 4.2B 33.7 23.0 29.1 30.4 29.1
多模态文档 VisRAG-Ret MiniCPM-V 3.4B 35.3 19.8 27.8 33.9 29.2
多模态文档 ColPali PaliGemma 2.9B 39.1 24.2 30.2 35.4 32.2
多模态文档 ColPali + Finetune PaliGemma 2.9B 41.0 27.5 36.8 39.9 36.3
多模态文档 ColQwen Qwen2-VL 2.2B 38.0 28.9 30.0 35.9 33.2
多模态文档 ColQwen + Finetune Qwen2-VL 2.2B 45.8 34.8 38.7 42.2 40.4
上下文模型 (本文) CMDR-Embed_Pali ColPali 2.9B 53.8 33.3 57.7 54.3 49.8 (+13.5)
上下文模型 (本文) CMDR-Embed_Qwen ColQwen 2.2B 64.6 38.4 64.7 58.9 56.6 (+16.2)

消融实验

消融实验分析了核心组件(块内难负例、文档内难负例、CMCL 损失以及延迟交互算子)对模型整体检索性能(Overall nDCG@5)的影响。

模型配置 变体设定 CMDR-Embed_Pali CMDR-Embed_Qwen 说明
完整模型 Full Model 49.8 56.6 完整包含联合编码、LI 与双重难负例 CMCL
去除块内负样本 w/o In-Chunk Negatives 48.7 (-1.1) 53.9 (-2.7) 丢失对局部相邻相似页面的辨别力
去除文档内负样本 w/o In-Document Negatives 48.6 (-1.2) 53.2 (-3.4) 远距离跨块相似页面产生混淆
仅保留常规批负例 w/o CMCL Loss (仅保留 \(L_{\text{Batch}}\)) 45.2 (-4.6) 49.4 (-7.2) 丧失同源难负例约束,严重掉点
替换匹配交互算子 w/o LI (改用均值池化+余弦相似度) 23.3 (-26.5) 38.1 (-18.5) 单向量压缩抹杀细粒度视觉与局部锚点

关键发现

  • 上下文联合建模是提升长文档检索性能的决定性因素:即使使用相同的 CMDR-Synth 监督数据对 ColQwen 进行充分微调,其得分也仅有 40.4,而采用滑动窗口上下文联合编码的 CMDR-Embed_Qwen 跃升至 56.6(净胜 16.2 个百分点),证明非上下文独立编码结构本身构成了上限瓶颈。
  • 结构化理解与文本补全获益最为显著:CMDR-Embed 在结构化理解(SU)任务上取得了超 26 点的爆发式提升(ColQwen 从 38.7 提升至 64.7),在文本补全(TC)上提升 18.8 点,表明跨页切分的表格与段落极度依赖前后文拼接。
  • 两类难负样本发挥互补作用:在正例与上下文距离较近(1-2 页)时,块内负样本贡献突出;在距离较远(\(\ge 3\) 页)时,文档内负样本则发挥关键锚定作用,二者缺一不可。
  • 多向量匹配是上下文检索的基础底座:去除 Late Interaction 改用单向量均值池化会导致性能腰斩(Pali 暴跌 26.5 点),证明上下文模型学到的丰富信息必须通过词级-Patch 级的细粒度匹配才能有效释放。

亮点与洞察

  • 将“切块再切分”(Chunk-then-Split)思路引入端到端视觉文档检索:借鉴文本长程建模中 late chunking 理念并重构为多模态架构,打破了以往视觉检索模型“一页一张图单独送入 VLM”的思维定势。
  • 精准狙击联合编码带来的信息平滑弊端:敏锐发现多页自注意力会稀释页面间的独特性,专门设计块内与文档内两层对比负样本约束,以极简的目标函数平衡了“上下文共性吸收”与“单页特异性保持”。
  • 长文档视觉检索评测基准 CMDR-Bench 的建立:首次将检索评测从“所见即所查”的浅层匹配推进到多页上下文“间接推导”,为业界提供了平均页数达 183.5 页的高难度人工质检测试集。

局限与展望

  • 单向因果注意力的结构制约:底座 VLM 中的自回归 LLM 采用因果掩码(Causal Attention),导致当前页面的表示只能吸收前序页面的上下文,无法有效感知排在后方的后续页面线索(在错误分析中体现为后续上下文理解失误)。引入双向注意力编码器是未来改进的重要方向。
  • 窗口尺寸与显存开销的权衡:当前滑动窗口(\(w=4\))覆盖范围有限,面对超远距离(如跨越数十页的文献引用或全书宏观附录)的多跳推理仍显吃力,未来需探索更为高效的极长序列视觉压缩机制。
  • 细粒度复杂图表的辨识瓶颈:在学术论文和硕博论文等高密度图表场景下表现相对较弱,表明单纯的全局跨页上下文并不能弥补低层视觉表征对密集复杂公式与细小坐标轴文字的解析短板。

相关工作与启发

  • vs ColPali / ColQwen: ColPali 等模型开辟了基于 VLM 的端到端多向量文档检索先河,但它们将每个页面当作完全割裂的单图处理;CMDR-Embed 保留了其优秀的 Late Interaction 范式,但通过分块联合编码与 CMCL 损失打破了单页隔离,实现了上下文感知。
  • vs DAPR / ConTEB: DAPR 等工作指出了文本长文档中段落检索需要全局上下文的问题,但受限于纯文本模态,无法处理现实中排版复杂、图表嵌套的扫描件;CMDR-Bench 和 CMDR-Embed 将上下文检索完整升级到了多模态视觉长文档领域。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 提出了首个多模态长文档间接上下文检索基准,并将分块联合编码与针对性难负样本对比损失优雅结合。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 255 篇超长多类型真实文档,设立严谨人工基准,详尽完成了跨类别评测、距离敏感性分析、效率分析及消融验证。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照极清晰,问题定义与动机切中痛点,消融实验直击机制核心。
  • 价值: ⭐⭐⭐⭐⭐ 为多模态文档检索与 Document RAG 指明了从“孤立页匹配”走向“篇章上下文理解”的必由之路,实用性与学术参考价值极高。