跳转至

Towards High-Resolution Visual Perception via Hierarchical Entity Exploration

会议: ECCV 2026
论文: ECCV 原文
领域: 目标检测 / 多模态VLM
关键词: 高分辨率视觉感知, 多模态大语言模型, 实体探索, 分层树搜索, 免训练

一句话总结

针对高分辨率图像几何切分造成的实体割裂与背景干扰瓶颈,提出免训练且模型无关的分层实体探索框架(HEE),通过目标检测发现语义完整实体、语义聚类递归细化、双重评分筛选与置信度引导回溯,显著提升多模态大模型在超高分辨率场景下的感知精度与推理效率。

研究背景与动机

当前主流多模态大语言模型(如 Qwen2.5-VL、InternVL2.5、LLaVA-OneVision)通常采用固定的预训练视觉输入分辨率(例如 448×448 或 336×336)。当处理 4K 甚至 8K 的超高分辨率图像时,常规的直接缩放会导致微小物体严重模糊失真与几何形变,从而在细粒度目标定位、密集文字 OCR 以及密集干扰环境下的视觉搜索任务中出现明显的性能断崖。为了弥补分辨率差距,学术界主要演化出两类路线:基于微调训练的方法(如引入缩放工具并结合强化学习的 DeepEyes)虽然能让模型学会主动放大,但微调成本高昂、训练周期长且缺乏跨模型架构的迁移能力;而基于启发式规则的免训练方法(如 ZoomEye、RAP)则通过几何网格划分或固定步长的局部裁剪进行搜索与重组。

然而,现有免训练方法的核心瓶颈在于几何划分与物体的语义边界完全脱节。这种几何盲目性带来了两大顽疾:一是实体割裂(Entity Fragmentation),跨越网格切分边界的目标会被生生切断成残缺碎片,使得任何单个候选局部都不包含完整的语义目标;二是背景干扰(Background Interference),按照固定网格或滑动窗口切出的区域不可避免地充斥着大面积无关背景。论文通过精细的解耦消融实验进一步证实:在不执行任何图像放大的前提下,仅逐步剔除真实目标外部的背景像素,各开源多模态大模型的推理准确率便呈现单调上升;反之,若在目标周围扩充无语义背景,性能则急剧恶化。这表明局部裁剪技术的核心收益主要源于消除背景噪声而非单纯的目标放大。

针对几何划分无法贴合目标边界的根本矛盾,本文打破了基于网格坐标切图的传统范式,提出以真实物理实体为基本单元的层次化语义探索方案。核心 idea:将高分辨率感知重塑为基于实体引导的分层树搜索,利用冻结检测器提取完整物体并聚类生成语义候选区域,结合多模态双重评分与置信度引导回溯机制,实现无须训练的自适应高精度视觉感知。

方法详解

整体框架

分层实体探索框架(HEE)整体流程将静态图像理解转换为由用户查询驱动的动态实体树搜索。整个流程分为四个紧密相连的核心模块:首先由实体驱动节点划分利用冻结目标检测器抽取局部或全局视野内的完整语义单元并聚类成候选子区域;接着通过双重评分机制综合评估候选区域与问题的语义关联度和模型回答证据充分度;随后自适应递归探索沿着得分最高的路径向下深入推进;若深层探索仍无法给出高置信度答案,则触发置信度引导回溯返回上层重新评估备选节点。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入:高分辨率图像与用户问题"] --> B["实体驱动节点划分<br/>检测物体实体并聚类生成语义候选"]
    B --> C["双重评分机制<br/>融合视觉语言语义对齐与大模型置信度"]
    C --> D{"置信度是否超过阈值 tau"}
    D -->|是 / 满足终止条件| G["生成最终回答"]
    D -->|否且未达最大深度| E["自适应递归探索<br/>深入展开最优候选子区域"]
    E --> B
    D -->|分支探索受阻 / 得分均低于阈值| F["置信度引导回溯<br/>返回上层重新评估备选候选节点"]
    F --> C

关键设计

1. 实体驱动节点划分:消除实体割裂与背景干扰的语义区域构建 传统几何均匀切分方法最大的缺陷是破坏物体完整性且混入冗余背景。为此,HEE 在第 \(l\) 层探索区域 \(\mathcal{I}^{(l)}\) 上调用冻结的目标检测器 \(\mathcal{D}\)(默认采用支持开放词表理解的 DINO-X,亦可适配 YOLO-World)提取物体级实体集合 \(\mathcal{E}^{(l)} = \{e_i^{(l)}\}_{i=1}^{N_l}\),每个实体由边界框、类别标签及其语义嵌入表征。为了将繁杂细碎的单体边界框组织成具有宏观语义连贯性的候选探索节点,HEE 在语义嵌入空间执行 K-Means 聚类得到 \(K\) 个聚类簇 \(\mathcal{C}^{(l)} = \{C_k^{(l)}\}_{k=1}^K\)。随后对每个簇内的实体边界框进行紧致包包围合并,得到显式语义候选集 \(\mathcal{R}_{\text{entity}}^{(l+1)} = \{r_k^{(l)}\}_{k=1}^K\)。此外,为防止场景中存在检测器漏检的目标,算法通过区域掩码差分操作计算未被任何实体覆盖的图像残差区域 \(\mathcal{R}_{\text{residual}}^{(l+1)} = \text{MaskDiff}(\mathcal{I}^{(l)}, \bigcup_{k=1}^K r_k^{(l)})\),二者并集共同构成下一层探索的搜索空间 \(\mathcal{R}^{(l+1)} = \mathcal{R}_{\text{entity}}^{(l+1)} \cup \mathcal{R}_{\text{residual}}^{(l+1)}\)。该机制使候选框天然贴合实体语义外缘,在保证视场全覆盖的同时极大提高了目标前景占比。

2. 双重评分机制:兼顾跨模态语义匹配与视觉证据充分度判别 在获得候选节点集合后,系统需要准确裁定哪个区域最具回答当前问题的潜力,以及当前区域是否已经包含足够证据以避免无节制的深度搜索。单一的视觉语言对齐模型往往只关注全局图文相似度而忽视具体推理逻辑,而多模态大模型自身在面对模糊局部时的直接判别又容易出现幻觉。HEE 设计了双重评分函数,综合冻结视觉匹配模型(如 SigLIP)与目标大模型两者的优势: $\(S(r) = \lambda s^{\text{vlm}}(r) + (1-\lambda) s^{\text{sim}}(r)\)$ 其中 \(s^{\text{sim}}(r) = S(q, r)\) 度量问题文本 \(q\) 与裁剪区域图像 \(r\) 的特征相似度,而 \(s^{\text{vlm}}(r) = M(r, q)\) 则由目标多模态大模型评估该局部作为问题证据的置信度。实验表明 \(\lambda = 0.5\) 达到了两者的最佳平衡。评分机制既借助跨模态对齐提供了快速过滤无关大背景的锚点,又依赖大模型的推理感知确保了对证据充分性的把握。

3. 自适应递归探索:由粗到细的渐进式视场聚焦 基于双重评分的结果,HEE 维护一个全局候选优先级队列。如果当前层候选节点中的最高评分 \(\max_{r} S(r)\) 超过预设的置信度阈值 \(\tau\)(默认设为 0.5),表明当前局部已完全具备回答问题的信息量,系统立即停止搜索并生成最终回答,避免了不必要的推理计算开销。若未达到终止置信度,算法则选出得分最高的区域 \(r^* = \arg\max_r S(r)\) 作为下一步的展开根节点,递归调用实体划分进入下一层搜索;其余未被展开的候选节点则保存在备选池中作为后续回溯的依据。搜索过程在以下三种条件之一成立时自适应收敛:最高置信度超过阈值 \(\tau\)、检测出的实体数量少于最小基数阈值 \(\eta\)(如仅剩 1-2 个独立实体)、或达到最大探索步数 \(T_{\max} = 50\)。这种按需动态下钻的设计使得模型能够在极短的步数内从全景航拍或复杂街景快速收敛到底层单个细微实体。

4. 置信度引导回溯:防止局部误判与单路径不可逆失效 传统的贪婪下采样或单链放大机制极易因某一层的高分噪声而陷入局部死胡同,一旦选错分支便无法修复。HEE 引入了置信度引导的回溯机制。在探索到达叶节点或最深层后,若所有候选实体评分仍旧低于置信度阈值(即 \(\max_i S(e_i) < \tau\)),系统会判定当前探索路径已被伪线索误导或线索中断,进而主动激活回溯。算法退回至上一决策层级,提取该层历史评分队列中的次优候选节点(如 Top-2、Top-3),重新对其进行实体划分与多层验证。这种闭环验证机制赋予了模型如人类视觉探寻般的审视与纠偏能力,显著降低了密集干扰物环境下的误检率。

实验关键数据

主实验

在 Visual Probe(4K 视觉搜索挑战集,包含 Easy、Medium、Hard 三个难度子集)、HR-Bench 4K 与 HR-Bench 8K(包含细粒度单实例 FSP 与跨实例 FCP 任务)上,HEE 在不同模型家族上均取得了显著超越基线以及同类免训练方法的表现。

基准数据集 / 分割 评估模型 基线准确率 (%) HEE (本文) (%) 性能提升 (Δ) 参照方法性能 (RAP / ZoomEye)
Visual Probe (Easy) Qwen2.5-VL-7B 39.1 67.4 +28.3 52.5 / 55.3
Visual Probe (Medium) Qwen2.5-VL-7B 26.0 47.0 +21.0 31.7 / 35.5
Visual Probe (Hard) Qwen2.5-VL-7B 23.9 50.0 +26.1 34.0 / 41.5
Visual Probe (Easy) InternVL2.5-8B 49.6 60.3 +10.7 –
Visual Probe (Hard) InternVL2.5-8B 17.0 41.5 +24.5 –
Visual Probe (Easy) LLaVA-ov-7B 36.2 61.0 +24.8 56.7 / 61.0
Visual Probe (Hard) LLaVA-ov-7B 13.4 38.6 +25.2 31.1 / 31.1
HR-Bench 4K (Overall) Qwen2.5-VL-7B 66.5 73.9 +7.4 71.1 / 71.4
HR-Bench 8K (Overall) Qwen2.5-VL-7B 62.1 71.1 +9.0 69.4 / 67.9
HR-Bench 8K (FSP) InternVL2.5-8B 59.5 81.8 +22.3 –
HR-Bench 8K (Overall) LLaVA-ov-7B 57.3 67.9 +10.6 60.3 / 66.8

在真实多场景评测基准 MME-RealWorld 上,Qwen2.5-VL-7B 搭载 HEE 后,在遥感(Remote Sensing)上准确率从 39.22% 提升至 46.39% (+7.17%),在监控场景(Monitoring)从 38.52% 提升至 46.02% (+7.50%),平均准确率提升 3.39%(从 59.99% 上升至 63.38%)。

此外,在推理吞吐与总耗时对比中(HR-Bench-4K,Qwen2.5-VL-7B),HEE 展现了显著的效率优势:

方法 处理吞吐率 (samples/min) ↑ 全测试集耗时 (min) ↓ 准确率 (%) ↑
RAP 1.6 126 71.1
ZoomEye 4.3 46 71.4
HEE (本文) 8.3 24 73.9

消融实验

消融实验深入验证了各设计模块对推理表现的具体贡献,并在 Visual Probe 数据集上使用 Qwen2.5-VL-7B 进行详尽测试。

配置变体 Easy 准确率 (%) Medium 准确率 (%) Hard 准确率 (%) 平均准确率 (%) 说明
HEE 完整模型 67.3 47.0 50.0 54.7 包含实体探索、双重评分与回溯
移除实体探索 (改为网格均匀划分) 61.7 44.7 37.7 48.0 Hard 上掉点达 12.3%,几何切分碎裂严重
移除置信度回溯 60.3 44.8 41.5 48.9 无法从错误高分分支中恢复
实体聚类数 \(K=2\) 61.7 45.5 42.5 49.9 区域聚类过大,混杂无关背景
实体聚类数 \(K=8\) 62.4 45.1 37.7 48.4 实体切分过度碎片化,搜索树分支过繁
移除语义相似度 \(S(q, r)\) 64.5 45.9 43.4 51.3 仅依赖大模型置信度,缺少多模态锚定
移除模型置信度 \(M(r, q)\) 56.0 42.9 21.7 40.2 仅靠图文相似度过滤,大模型无法控制停机
评分权重 \(\lambda = 0.2\) 65.9 44.8 41.5 50.7 偏向图文特征匹配
评分权重 \(\lambda = 0.7\) 66.7 46.6 46.2 53.2 偏向模型置信度

关键发现

  • 实体探索在困难场景(Hard)贡献最大:在干扰密集且目标微小的 Hard split 上,去掉实体探索改用均匀网格切分会导致准确率从 50.0% 剧降至 37.7%(-12.3%),证明在极端高分辨率下,保持物理实体边界的完整性是解决实体割裂的关键生命线。
  • 模型置信度判别对终止至关重要:完全去除模型证据充分度评分 \(M(r, q)\) 会让平均分从 54.7% 跌至 40.2%(特别是在 Hard split 上从 50.0% 腰斩至 21.7%),说明纯表层跨模态特征极易被图文相关的显著背景诱导,必须由大模型对局部视场的推理能力进行闭环校验。
  • 探索步数呈快速单峰收敛特性:步数分布统计显示超过 60% 的样本在 8 至 15 步内即自适应终止,Easy 与 Medium 集中在 10 步左右。由于聚类有效合并了琐碎框,HEE 的平均吞吐比 RAP 快 5.2 倍、比 ZoomEye 快近 2 倍。

亮点与洞察

  • 颠覆了超高分辨率裁剪的传统认知:论文通过严格的背景遮蔽实验揭示,局部放大切片的核心增益来自对冗余背景像素的剔除(Background Removal),而非单纯放大细节。这一认知洞察直接动摇了几何切分范式的合理性,确立了以目标为中心的语义边界探索方向。
  • 残差区域机制保障无死角召回:在依靠聚类提取语义候选的同时,设计了掩码差分(MaskDiff)捕获检测器盲区残差。实验表明即便利基检测器偶有漏检,依然有 3.55% 的难题通过残差与上下文被模型正确攻克。
  • 免训练与即插即用的通用工程价值:不修改大模型权重、不需要微调下游视觉工具,直接兼容 Qwen2.5-VL、InternVL2.5 和 LLaVA-OneVision 等不同模型架构,在保持极低计算开销的同时全面超越现有 SOTA。

局限与展望

  • 极微弱视觉差别的细粒度分类瓶颈:作者通过失败案例指出,在金属雕塑、复杂反光或极端相似动物(如袋鼠与鸸鹋徽章)等细粒度场景下,即使 HEE 精确定位了目标局部,基础多模态大模型自身的细粒度先验不足仍会导致识别错误(占总错误的 24.82%)。
  • 偶发性置信度漂移(Confidence Misalignment):在极少数复杂场景中,搜索过程中可能经历正确的候选区域,但由于局部幻觉而在非最优分支上输出了虚高置信度,导致搜索过早偏航。
  • 未来改进可探索结合强化学习与轻量后验校准器,对大模型的局部置信度打分做校准,并将实体探索范式扩展至高分辨率长视频理解。

相关工作与启发

  • vs ZoomEye: ZoomEye 使用固定比例的均匀四叉树网格递归缩放,极易将跨越划分线的目标切碎并引入大面积无关背景;HEE 以目标检测边框为种子聚类,候选区域天然贴合实体语义外缘,在 Hard 数据集上准确率领先近 9%。
  • vs RAP: RAP 采用固定尺度滑动 patch 切片,再根据图文匹配检索 Top-k 并在全景中拼接画卷;这种全局平铺带来了高昂的 token 冗余和长达 126 分钟的推理时延;HEE 采用分层自适应深入树搜索,将推理总时间压缩至 24 分钟且精度提升 2.8%。
  • vs DeepEyes: DeepEyes 依赖强化学习微调多模态大模型以掌握放大工具使用;HEE 属于全免训练(Training-free)架构,不依赖昂贵的人工标注和多轮强化学习对齐,具有极佳的即插即用跨模型泛化性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 颠覆网格切割认知,首次提出基于实体聚类与差分残差的免训练分层探索范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4K/8K 基准、超大规模真实场景集,多模型跨架构验证并包含严谨的效率与机制解耦分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑链条严密,动机实验与方法设计紧密呼应,图表直观且对比深刻。
  • 价值: ⭐⭐⭐⭐⭐ 免训练、低算力开销且效果显著,为高分辨率多模态感知提供了高可用性的实用落地方案。