MG2-RAG: Multi-Granularity Graph for Multimodal Retrieval-Augmented Generation¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Daboolu/MG2-RAG
领域: 图学习
关键词: 多模态检索增强生成 / 多模态知识图谱 / 细粒度视觉定位 / 多粒度图检索 / 跨模态推理
一句话总结¶
针对多模态检索增强生成中扁平向量检索忽略结构依赖、传统图检索依赖昂贵 MLLM 抽取文本三元组导致视觉细节丢失的问题,MG2-RAG 结合轻量句法解析与实体驱动开放词表分割构建统一多模态节点,并通过密集相似度聚合与重启随机游走实现跨模态高保真多跳检索与推理。
研究背景与动机¶
多模态大语言模型(MLLMs)在复杂的跨模态理解与推理任务中展现出强大能力,但在知识密集型专业领域,受限于静态预训练参数,模型极易产生模态幻觉或事实性错误。多模态检索增强生成(MM-RAG)通过引入外部多模态知识库,在推理阶段检索相关事实作为生成锚点,已成为缓解幻觉的核心手段。然而,主流扁平向量检索范式将图文切片映射至共享向量空间进行独立相似度匹配,割裂了多模态线索之间的拓扑依赖关系,难以应对需要跨越多个事实节点的多跳复杂推理。
为捕获结构化关联,近期研究转向基于多模态知识图谱(MMKG)的图检索方案。但现有方法普遍存在两大瓶颈:其一是图谱构建极其昂贵,高度依赖 MLLM 调用来抽取实体关系三元组,在规模化外部语料上面临巨大的计算耗时与 API 资金开销;其二是普遍采用“图像翻译为文本”(translation-to-text)的文本中心化图拓扑,将视觉图像简化为粗粒度文本描述后再建图,不仅丢弃了图像原生的细粒度空间几何与局部实体,还破坏了跨模态联合查询下的双向语义对齐与传播能力。
面对上述两难困境,研究的核心切入点在于摆脱 MLLM 三元组抽取流水线,直接在概念层建立文本实体与视觉区域的紧密原子对齐,同时设计适配多粒度异构拓扑的高效图扩散机制。核心 idea:将轻量级语言学依存句法解析与实体驱动的开放词表视觉定位深度结合,把文本实体与视觉目标局部融合为保留原子证据的统一多模态节点,并在文档块、图像、多模态节点异构图上通过密集相似度聚合与个性化 PageRank 实现低成本、高精度的多粒度检索。
方法详解¶
整体框架¶
MG2-RAG 包含两大核心模块:一是层次化多模态知识图谱构建(Hierarchical MMKG Construction),二是多粒度图传播检索(Multi-Granularity Graph Retrieval)。系统首先将无结构的多模态知识库解析为涵盖文档块、图像与统一多模态节点的异构拓扑网络,随后在检索阶段并行计算多粒度稠密匹配相似度,聚合至多模态节点作为种子,最后通过图扩散算法选出最相关的文档块送入生成模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多模态知识库<br/>文档块与关联图像"] --> B["轻量级层次化图谱构建<br/>spaCy依存解析 + SAM3实体驱动分割"]
B --> C["保模态统一多模态节点融合<br/>关联矩阵映射 + 异构图拓扑构建"]
D["多模态输入查询<br/>文本查询与视觉查询"] --> E["多粒度图传播检索<br/>多模态种子激活 + 个性化PageRank游走"]
C --> E
E --> F["Top-k 高相关上下文文档块<br/>MLLM 事实对齐生成"]
关键设计¶
1. 轻量级层次化图谱构建:实体驱动定位规避三元组抽取开销
现有图 RAG 严重依赖 MLLM 进行开放式实体三元组提取,计算成本高昂且难以扩展至十万级语料。MG2-RAG 采用确定性轻量工具链解耦文本与视觉抽取。在文本侧,利用基于 Transformer 的 spaCy 模型(en_core_web_trf)对文档块内的句子进行命名实体识别(NER)和词元级依存句法解析,依据动词谓词及名词修饰结构等预定义语法规则提取实体间关系,避免黑盒大模型的昂贵调用;在图像侧,摒弃全图无序密集检测,而是以抽取的文本实体名称作为语义 Prompt,批处理输入开放词表分割模型 SAM3 中,定向定位与实体直接对应的图像区域。若实体 \(e\) 在图像 \(I\) 中的预测置信度 \(\sigma > \tau\),则判定为有效定位目标:
这种“以文引图”的定向分割不仅滤除了无关视觉背景噪声,而且建立了精准的原生细粒度视觉实体集合,建图速度提升数十倍。
2. 保模态统一多模态节点融合:关联矩阵桥接跨模态原子证据
传统方法将图像转化为粗略文本描述后构建纯文本图,彻底丢失了原始视觉表征的原子细节。MG2-RAG 提出保模态融合策略,将文本实体 \(e\) 与其所有有效视觉定位区域 \(\mathcal{V}_o^e\) 绑定为一个统一多模态节点 \(v_m = (e, \mathcal{V}_o^e) \in \mathcal{V}_M\)。为了在保持图结构精简的同时维系内部精细构成,模型显式定义了两个双向关联矩阵:目标-多模态关联矩阵 \(\mathbf{M}_{\text{OMI}} \in \{0, 1\}^{|\mathcal{V}_O| \times |\mathcal{V}_M|}\)(记录视觉局部属于哪个多模态节点)以及句子-多模态关联矩阵 \(\mathbf{M}_{\text{SMI}} \in \{0, 1\}^{|\mathcal{S}| \times |\mathcal{V}_M|}\)(记录实体在哪些句子中出现)。
整个多模态知识图谱 \(\mathcal{G} = (\mathcal{V}, \mathcal{E}_G)\) 的节点划分为三层粒度:文档块节点 \(\mathcal{V}_C\)、图像节点 \(\mathcal{V}_I\) 以及统一多模态节点 \(\mathcal{V}_M\)。边集合 \(\mathcal{E}_G\) 则由三类维度组成:(1) 上下文边(Contextual Edges),连接文档块与其下辖的图像及实体,保留文档级层次来源;(2) 语义边(Semantic Edges),依据句法依存关系连接两多模态节点,保留文本逻辑链;(3) 定位边(Grounding Edges),连接多模态节点内的视觉目标与其来源大图,并以定位置信度 \(\sigma\) 作为边权重。三维拓扑结构在统一图网络中完备保留了层级归属、语言逻辑与跨模态空间对应。
3. 多粒度图传播检索:密集相似度聚合与重启随机游走推理
单一模态或单粒度的向量检索无法应对复杂的混合查询。MG2-RAG 借助统一编码器 EVA-CLIP-8B,在句子、文档块、整图和视觉目标四个层级上并行计算文本查询 \(q_t\) 与视觉查询 \(q_v\) 的密集余弦相似度向量。对于细粒度的句子和视觉目标,利用关联矩阵将其打分向核心多模态节点汇聚归一化:
其中 \(\mathbf{D}_S, \mathbf{D}_O\) 为对角线度归一化矩阵。随后引入尺度缩放因子 \(\omega_C, \omega_I\) 平衡块级与图像级证据,融合成综合初始激活种子向量 \(\mathbf{r}_0 = \lambda_t \mathbf{u}^{(t)} + \lambda_v \mathbf{u}^{(v)}\)。在此基础上,以保留 Top-k 的种子分布为重启源,通过个性化 PageRank(Personalized PageRank, PPR)在异构图上迭代扩散:
其中 \(\mathbf{W}\) 为列归一化转移矩阵,\(\alpha \in (0, 1)\) 控制扩散步长。收敛后提取文档块节点得分,召回前 \(k\) 个最高权重的文档块组装成上下文 Prompt,为 MLLM 提供具有严密拓扑支持的事实依据。
实验关键数据¶
主实验¶
论文在四类跨模态任务(检索、知识型 VQA、多模态科学推理、灾害分类)上进行了全面评估。下表展示了在 E-VQA 和 InfoSeek 检索基准以及知识问答上的主要对比结果:
| 模型 | 检索机制 / 主干模型 | E-VQA R@1↑ | E-VQA R@10↑ | InfoSeek R@1↑ | InfoSeek R@10↑ | E-VQA VQA (All)↑ | InfoSeek VQA (All)↑ |
|---|---|---|---|---|---|---|---|
| CLIP ViT-L/14 | 单模态检索 (V→V) | 17.8 | 36.4 | 32.7 | 59.6 | - | - |
| EVA-CLIP-8B | 跨模态检索 (V→T) | 42.0 | 69.5 | 56.5 | 82.2 | - | - |
| EchoSight | 稠密向量检索 / LLaMA-3.1-8B | - | - | - | - | 47.23 | 30.40 |
| mKG-RAG | 多模态图检索 / LLaMA-3.1-8B | - | - | 49.7 | 78.0 | - | 32.10 |
| VaLiK (5k) | MLLM图检索 / Qwen2.5-VL-7B | - | - | - | - | 15.22 | 2.51 |
| MMGraphRAG (5k) | 场景图检索 / Qwen2.5-VL-7B | - | - | - | - | 16.52 | 0.50 |
| MG2-RAG (Ours) | 多粒度图检索 / LLaMA-3.1-8B | 44.9 | 72.0 | 59.6 | 83.8 | 47.77 | 32.58 |
| MG2-RAG (Ours) | 多粒度图检索 / Qwen2.5-VL-7B | 44.9 | 72.0 | 59.6 | 83.8 | 48.59 | 35.48 |
| MG2-RAG (Ours) | 多粒度图检索 / Qwen3.5-27B | 44.9 | 72.0 | 59.6 | 83.8 | 52.19 | 37.87 |
| MG2-RAG (Ours) | 多粒度图检索 / GPT-5.2 | 44.9 | 72.0 | 59.6 | 83.8 | 60.30 | 39.30 |
在图构建效率方面,MG2-RAG 展现了压倒性的优势:相比基于 MLLM 抽取的 VaLiK 与 MMGraphRAG,MG2-RAG 在 ScienceQA 上的建图速度达到 77.1 倍加速,构建成本降低 45.2 倍;在所有五个数据集上平均取得 43.3 倍速度提升与 23.9 倍资金成本削减。
消融实验¶
下表列出论文在 E-VQA (5k)、ScienceQA 和 CrisisMMD 上的核心模块消融实验结果(采用统一主干模型):
| 配置 | E-VQA R@1 / R@5↑ | E-VQA BEM Score (All)↑ | ScienceQA Acc. (Avg.)↑ | CrisisMMD Acc. (Avg.)↑ | 说明 |
|---|---|---|---|---|---|
| MG2-RAG (完整模型) | 57.8 / 83.1 | 60.24 | 97.85 | 59.12 | 包含 HGC、MNF 与 GP 全部机制 |
| w/o HGC (无层次化图构建) | 40.7 / 61.5 | 51.72 | 97.48 | 56.70 | 退化为平坦检索,E-VQA R@1 下降 17.1% |
| w/o MNF (无多模态节点融合) | 43.8 / 78.0 | 55.38 | 97.67 | 58.62 | 割裂文本与图像局部,BEM 评价指标跌落 4.86 |
| w/o GP (无图游走扩散传播) | 25.5 / 76.0 | 54.69 | 97.51 | 58.90 | 仅依靠初始相似度,R@1 剧烈暴跌 32.3% |
关键发现¶
- 图扩散传播(GP)对精确定位首选证据贡献最显著:去掉 GP 后,E-VQA 的 R@1 从 57.8% 暴跌至 25.5%,下降幅度超过一半,证实单靠密集向量相似度极易被表层相似干扰,通过图拓扑的多跳扩散是抓取深层关联证据的核心驱动力。
- 层次化多模态结构(HGC & MNF)保障多跳事实一致性:去掉层次化图构建或多模态节点融合后,问答端的 BEM 得分分别大幅下滑 8.52 和 4.86 点,表明即使检索到相关图像,若缺乏实体到局部视觉目标的精准原子锚定,大模型在生成复杂事实时依然会出现幻觉。
- 高可扩展性与强基座兼容性:在知识库规模从 1k 扩增至 100k 时,MG2-RAG 的构建时间呈现近乎线性的平缓上升趋势(单机两卡 RTX 6000 Ada 下 100k 仅需 32.8 小时);而在下游模型上,无论配备开源 Qwen2.5/3.5 还是闭源商业大模型 GPT-5.2,均带来稳定正向增益。
亮点与洞察¶
- 实体驱动的开词表视觉定位代替全图密集抽取:直接以 spaCy 抽取的实体关键词作为 Prompt 输入 SAM3 定向分割,避免了传统无差别密集目标检测产生大量冗余噪声框,在极低算力开销下精准抓取视觉证据。
- 关联矩阵聚合设计巧妙维持图精简度:将细粒度的句子和物体碎片保留在关联矩阵中作为打分汇聚通道,而不是将每一个像素切片都建为显式独立图节点,有效避免了图扩散时节点数量爆炸与拓扑稀疏化。
- 即插即用的无训练设计:构建与检索全流程完全免微调(training-free),可直接无缝挂载到任何预训练视觉编码器(如 EVA-CLIP)和生成式 MLLM 上,工程落地壁垒极低。
局限与展望¶
- 作者承认的局限:对极低频或长尾专业领域实体,spaCy 的规则依存抽取和 SAM3 开放词表提示定位可能出现误报或漏检,导致相应多模态节点未完整包含视觉证据。
- 深度观察的局限:个性化 PageRank 游走的重启概率 \(\alpha\) 与多粒度相似度权重 \(\omega_C, \omega_I\) 目前依赖经验超参数调整,在不同噪声密度的领域语料之间迁移时可能需要重新校准。
- 改进方向:可进一步探索将自适应门控机制引入种子打分加权中,动态判断文本查询与图像查询对不同层次证据的依赖强度,实现全自动化超参感知。
相关工作与启发¶
- vs VaLiK / MMGraphRAG: 现有图 RAG 依赖 MLLM 生成文本三元组或把图片转换为描述,耗时昂贵且牺牲视觉细节;MG2-RAG 采用轻量句法解析与 SAM3 定向分割,建图提速 43.3 倍同时保留原生视觉原子目标。
- vs EchoSight / 平坦多模态向量检索: 纯向量检索将文本和图像隔离在全局向量层面,无法处理跨段落、跨图像的多跳关联事实;MG2-RAG 借助异构图上的 Personalized PageRank 扩散,有效拉近具有深层逻辑链的多模态证据。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 实体驱动定向定位与关联矩阵多粒度图扩散的设计简洁高效,打破了依赖 MLLM 建图的思维定势。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖检索、VQA、科学推理与灾难分类四大任务,并在 100k 规模上给出了详尽的效率和消融数据。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对照清晰,动机分析和形式化推导高度自洽。
- 价值: ⭐⭐⭐⭐⭐ 解决了多模态图 RAG 落地的速度与成本死穴,代码开源,具备极高学术与工业参考价值。