跳转至

LocateAnything: Fast and High-Quality Vision-Language Grounding with Parallel Box Decoding

会议: ECCV 2026
论文: ECCV 原文
领域: 多模态 VLM
关键词: 视觉定位, 目标检测, 多模态大模型, 并行框解码, 多Token预测

一句话总结

LocateAnything 提出了并行框解码(Parallel Box Decoding, PBD)范式与统一的块级表示,将 2D 几何边界框作为不可分割的原子单元进行单步并行生成,在 1.38 亿大规模定位数据预训练与混合回退推理策略驱动下,实现了相比基线 2.5 倍以上的吞吐量提升和更高的定位精度。

研究背景与动机

视觉定位与目标检测是视觉语言模型(VLM)与物理世界及图形交互系统进行交互的基础感知能力。在下一词预测(Next-Token Prediction, NTP)自回归范式下,主流多模态模型通常将空间坐标序列化为一维离散 Token 流输出——要么拼写为逐位文本数字(例如将坐标 1024 拆为 "1","0","2","4"),要么使用量化坐标标识符(如 \(\langle x_1 \rangle \langle y_1 \rangle \langle x_2 \rangle \langle y_2 \rangle\))。然而,这种一维序列化策略与几何框天然耦合的二维结构存在严重错配,使得模型在推理时必须机械地逐步解码每个坐标甚至每个数字,单框预测往往耗费 10 到 20 步自回归循环,成为密集目标检测和实时具身智能中不可承受的计算瓶颈。

现有的多 Token 预测(Multi-Token Prediction, MTP)或扩散语言模型虽然能够通过并行生成缓解自回归延迟,但传统的 MTP 方法大多是结构无关的(Structure-Agnostic),通常采取随机分块或统一遮罩预测机制。当这种无结构的分块直接套用于空间坐标时,切分边界往往会横跨不同的边界框乃至类别标签,迫使模型去拟合不规则且充满噪声的跨实体转移分布。这种伪相关性不仅严重破坏了几何结构的内在一致性,还会引发显著的误差累积,导致模型在复杂场景下频发格式错乱、坐标漂移以及虚假重叠框。

面对高效解码与精确几何结构建模之间的核心矛盾,本文跳出将坐标视为普通语言文本的惯性思维,将几何元素提升为最小预测单位。核心 idea:提出并行框解码(Parallel Box Decoding, PBD)与原子块输出表征,将边界框坐标绑定为单步并发预测单元,配合 NTP 与 MTP 双表征隔离对齐的联合训练目标及语法/空间置信度驱动的混合自适应回退机制,在彻底打破自回归生成延迟瓶颈的同时大幅增强高精度几何定位质量。

方法详解

整体框架

LocateAnything 采用原生分辨率多模态大模型架构,由 Moon-ViT 视觉编码器、MLP 投影层以及 Qwen2.5 语言解码器组成。视觉编码器在原生图像分辨率下提取细粒度视觉特征 \(Z = \text{Encoder}(\mathcal{I})\),保留高精度定位所需的丰富空间细节;语言解码器则接收视觉 Token 与自然语言指令,以半自回归的方式逐步输出结构化的原子预测块序列。

整体处理流程从输入图文开始,经过视觉特征抽取与块级序列建模,在统一表征下支持多目标定位、GUI 定位与文档解析等多类任务。在推理阶段,模型优先通过并行块解码实现全框并发生成,当检测到格式错乱或空间歧义时无缝激活局部 NTP 纠错机制。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与文本指令<br/>原生分辨率图文对"] --> B["原生分辨率视觉编码与投影<br/>Moon-ViT + MLP 抽取特征 Z"]
    B --> C["原子块表征建模<br/>固定长度 L=6 的结构化块序列"]
    C --> D["双表征联合训练与块因果掩码<br/>因果 NTP 引导 + 块内双向 MTP"]
    D --> E["按需多模态解码与置信度自适应回退<br/>Fast 并行生成与 Slow 纠错切换"]
    E --> F["高吞吐高精度定位输出<br/>边界框/指向点/GUI 元素/文本框"]

关键设计

1. 原子块表征建模:将耦合几何元素封装为不可分割的固定长度原子块

现有模型将边界框拆解为孤立的标量 Token,忽略了 \((x_1, y_1, x_2, y_2)\) 强相关的闭环几何约束。LocateAnything 将连续空间坐标归一化到 \([0, 1000]\) 整数空间并离散化后,彻底重构为块序列 \(B = (b_1, b_2, \dots, b_N)\)。每个预测块 \(b_i\) 具有恒定长度 \(L = 6\),恰好容纳起始结构标记、4 个量化坐标以及闭合标记(例如 \(\langle\text{box}\rangle\langle x_1\rangle\langle y_1\rangle\langle x_2\rangle\langle y_2\rangle\langle/\text{box}\rangle\)),未填满位置使用 \(\langle\text{null}\rangle\) 补齐。模型预设了四类功能块:编码实体类别的语义块(跨块长文本分段存储)、包含完整坐标的框块、用于显式表达未召回目标的负样本块,以及指示序列终止的结束块。该设计使生成张量尺寸高度规整,将多 Token 预测的粒度严格对齐到几何实例层级。

2. 双表征联合训练与块因果掩码:兼顾语言因果推理与块内并发几何感知

直接在多模态语言模型上强制并行解码容易破坏模型固有的自回归因果推理能力,引发严重的分布偏移。为此,本文设计了单输入序列的多流拼接方案 \(x_{\text{all}} = x_{\text{vis}} \oplus x_{\text{q}} \oplus x_{\text{ntp}} \oplus x_{\text{blk}}\),在共享图文上下文的同时并行优化 NTP 与块级 MTP。核心机制由定制的混合注意力掩码驱动:NTP 序列与共享上下文遵循严格的因果注意力,且完全屏蔽 \(x_{\text{blk}}\) 以杜绝信息泄漏;在 MTP 序列 \(x_{\text{blk}}\) 中,块与块之间严格因果依赖(当前块可单向观察前面已提交的所有历史块,从而建立目标间抑制与关联,避免漏检与重检),而块内部的所有 Token 之间则开放双向全连接注意力。块内部仅保留首个 Token 作为提示前缀,其余 Token 全部用 \([\text{mask}]\) 遮蔽,迫使模型在单个前向步内同时预测完整框的所有内部信息。总训练目标通过联合最小化两者交叉熵实现:

\[\mathcal{L} = \mathcal{L}_{\text{ntp}} + \mathcal{L}_{\text{blk}}\]

3. 按需多模态解码与置信度自适应回退:动态权衡极速吞吐与极端场景几何鲁棒性

并行解码在面对极度复杂的跨类别边界时可能出现格式错乱(如标签和坐标混乱交织),而在密集规则网格排列的微小物体上可能由于双向平均效应而产生坐标模糊(输出处于两个物体间隙的平滑值)。为消除这两种长尾失效,LocateAnything 提供了三种可选推理模式:纯并行的高吞吐 Fast Mode、纯自回归的高稳定 Slow Mode,以及兼具两者优势的默认 Hybrid Mode。在混合模式下,系统在每个并行生成步持续监控语法合法性与输出置信度。当同时触发以下两个条件时判定发生空间歧义:

\[P(\text{top-1}) < 0.7 \quad \text{且} \quad \max(\text{top-5}) - \min(\text{top-5}) > 80\]

一旦捕获语法违规或高空间歧义,模型立即丢弃当前损坏的块,回退到已验证的前缀位置,局部调用标准 NTP 自回归纠正该块的预测,待该块完成后无缝切回 MTP 继续极速生成。该设计在保留绝大部分并行加速红利的前提下,彻底消除了极端场景下的灾难性崩溃。

损失函数 / 训练策略

模型训练分为三个连续阶段: 1. 基础对齐预训练:在通用图文语料上仅进行常识与语言对齐,完全排除定位与检测数据。 2. 第一阶段有监督微调(Stage-1):引入精心构建的 LocateAnything-Data 大规模数据集(包含 1200 万张图像、1.38 亿条自然语言查询和 7.85 亿个精确边界框标注),全方位打通多目标检测、UI 定位、指称表达理解、OCR 与版面分析等多任务能力。 3. 第二阶段密集场景微调(Stage-2):将通用训练数据降至 20%,大幅提高包含超多实例图像(如 MOT20Det、SKU110K 密集货架)的数据配比,大幅增强密集重叠边界下的判别力。几何坐标采用左上角距离(Top-Left Distance)进行空间排序,以保证自回归与半自回归序列生成的稳定单调性。

实验关键数据

主实验

在通用目标检测(LVIS、COCO)以及密集物体检测基准(Dense200、VisDrone)上,LocateAnything 在仅 3B 参数量下展现出显著优于现有自回归 VLM 和专用检测器的综合性能,并在单张 NVIDIA H100 GPU 上取得了突破性的吞吐量表现。

数据集 / 场景 指标 LocateAnything-3B (本文) Rex-Omni-3B (SOTA VLM) Grounding DINO-Swin-T 性能增益 / 优势
LVIS (Zero-Shot) Mean F1 / [email protected] 50.7 / 31.1 46.9 / 20.7 38.8 / 22.7 Mean F1 +3.8%, 高精度 [email protected] 大幅跃升 +10.4%
COCO (Zero-Shot) Mean F1 / [email protected] 54.7 / 19.3 52.9 / 15.9 56.6 / 23.0 相比同量级 VLM 提升 +1.8% F1,远超一般通用大模型
VisDrone (密集无人机) Mean F1 / [email protected] 39.9 / 63.0 35.8 / 61.6 38.5 / 55.2 密集微小目标 Mean F1 +4.1%,显著优于专用检测器
Dense200 (超密集物体) Mean F1 / [email protected] 58.7 / 18.5 58.3 / 10.3 33.1 / 19.7 极高重叠场景 [email protected] 高达 18.5(Rex-Omni 为 10.3)
ScreenSpot-Pro (GUI) Average F1 60.3 36.8 - 远超专用模型 GUI-Owl-32B (58.0) 与 30B 级大模型
DocLayNet (版面分析) Mean F1 76.8 70.7 81.1 (DocLayout-YOLO) VLM 领域新 SOTA,[email protected] 从 28.4% 跃升至 35.8%
解码吞吐量 (Throughput) BPS (Boxes/Sec) 12.7 (Hybrid) / 16.9 (Fast) 5.0 - 比 Rex-Omni 快 2.5×,比 Qwen3-VL (1.1 BPS) 快 11.5×

消融实验

在 COCO 数据集上将训练范围严格隔离在 COCO 内,剥离大规模预训练数据红利,全面评估坐标表示、MTP 机制与推理模式的独立贡献(汇报指标均为各 IoU 阈值下的平均值)。

维度与配置 吞吐量 (BPS) Recall (R) Precision (P) Mean F1 核心分析与结论
坐标表征:文本数字 (Textual) 1.3 45.7 52.3 49.1 逐字输出导致极低推理效率,表征过于稀疏易产生幻觉
坐标表征:量化标记 (Quantized) 3.9 48.2 52.2 50.1 自回归输出量化值,速度有所改善但仍受限于步长
坐标表征:PBD (Slow NTP) 3.9 49.4 55.2 52.1 框对齐结构有效提升表征质量,即使单步生成精度亦达最优
MTP范式:无结构 SDLM-B6 5.5 45.1 47.5 46.1 任意切块引入跨边界伪相关性,随着块长度增大精度持续暴跌
MTP范式:块扩散 Block Diff-B6 4.7 45.1 44.3 44.8 无结构扩散去噪难以保证空间边界对齐,精确率大幅滑坡
MTP范式:本文 PBD (Fast Mode) 16.9 45.6 54.6 49.6 严格按框对齐解锁最高并发吞吐,相比 SDLM 提速超 3× 且 F1 高 3.5
损失与模式:仅 \(\mathcal{L}_{\text{ntp}}\) (Slow) 3.9 48.2 52.2 50.1 缺少 MTP 联合约束,模型上限受限
损失与模式:仅 \(\mathcal{L}_{\text{blk}}\) (Fast) 16.7 45.6 49.0 47.2 缺少因果 NTP 引导,模型易出现长距离语法退化
双损失联合:PBD (Hybrid Mode) 13.2 48.7 54.8 51.6 兼顾 13.2 BPS 极速吞吐与 51.6 F1 高精度,实现最佳工程平衡

关键发现

  • 框对齐结构是多 Token 预测成功的核心前提:对比 SDLM-B4/B6/B8 发现,无结构的通用 MTP 存在显著的“吞吐换精度”负面权衡,增大 Block 尺寸会导致 F1 从 46.5 持续下滑至 45.8;而 PBD 将 Block 严格对齐至 6-Token 几何原子块,不仅吞吐飙升至 16.9 BPS,F1 更达到 49.6,证明几何一致性是消除自回归误差累积的关键。
  • 高 IoU 指标取得飞跃式突破:在 LVIS 和 Dense200 的 [email protected] 极限严格测试中,LocateAnything 分别达到 31.1% 与 18.5%,相较 Rex-Omni 的 20.7% 与 10.3% 取得近乎翻倍的提升,这强有力地证实了一拍式全框预测能更好地锁死长宽比与坐标耦合关系,避免逐点漂移。
  • 目标数量扩展性优异:随着单图待检测目标数量从 20 激增至 300,传统 NTP 的生成时间呈陡峭线性上升,而 PBD 的总生成耗时几乎维持恒定,在密集场景下单卡吞吐量从 12 BPS 攀升至近 25 BPS,展现出 2× 到 6× 的实际加速比。

亮点与洞察

  • 几何与语言 Token 解耦并行:常规自回归将几何框打散为 4 个甚至更多离散标量,PBD 创新性地在保持半自回归序列因果序的同时,将单框内的双向注意力与全量坐标并发结合,在统一 VLM 内自然达成了目标级并行。
  • 置信度感知的自适应回退机制:针对多 Token 预测固有的空间平滑与格式异常缺陷,利用轻量级输出分布特征(top-1 概率与 top-5 极差)精准触发局部重解码,不改动全图上下文而仅重跑故障块,以极小代价锁定了确定性精度。
  • 数据与架构的协同扩展:构建了涵盖 1.38 亿指令样本与 7.85 亿高质量标注框的 LocateAnything-Data,并通过两阶段微调显式强化密集多目标场景,为几何表征的通用泛化奠定了坚实基础。

局限与展望

  • 目前依赖纯监督微调:当前框架完全基于 SFT 训练,未引入强化学习反馈机制。作者指出,未来可进一步引入 RL 针对块级解码策略与回退触发阈值进行强化优化,以在困难样本中降低回退率。
  • 超高分辨率密集小目标的计算开销:尽管 Moon-ViT 提取原生分辨率特征,但面对上千目标的工业级全景图或微距缺陷检测时,视觉 Token 的自注意力计算及 KV 缓存开销依然偏大。
  • 三维与时序空间的拓展潜力:PBD 目前针对二维平面框与点定位设计,将该原子块思想扩展至 3D 边界框 \((x,y,z,w,h,d,r)\) 或视频时空管(Spatio-Temporal Tubes)是极具前景的研究方向。

相关工作与启发

  • vs. Rex-Omni: Rex-Omni 采用点引导与量化标量逐步输出,单卡吞吐仅 5.0 BPS 且密集场景 [email protected] 较低;LocateAnything 采用原子框并行解码,吞吐提升至 12.7~16.9 BPS,高阈值定位质量成倍提升。
  • vs. Qwen-VL / DeepSeek-VL 系列: 通用大模型采用纯文本逐字生成坐标,单图解码耗时随着目标数成倍暴涨(仅 1.0~1.3 BPS);LocateAnything 通过块级 MTP 与专用掩码设计,实现了上万倍的工程实用性飞跃。
  • vs. SDLM / Block Diffusion: 通用文本半自回归模型任意切块,破坏了空间坐标的强关联;LocateAnything 确立了以几何实体为物理边界的分块原则,为结构化多模态生成提供了示范。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将多 Token 预测(MTP)与视觉定位几何属性进行严格物理对齐,突破了自回归多模态定位的速度极限。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖密集检测、LVIS、GUI、文档版面、OCR 与 REC 等多领域基准,消融实验严格剥离数据红利与架构贡献。
  • 写作质量: ⭐⭐⭐⭐⭐ 结构清晰,问题剖析透彻,图表设计极其详实且论证严密。
  • 价值: ⭐⭐⭐⭐⭐ 成功将实时多目标定位吞吐量推向实用化区间,对具身智能和端侧 GUI Agent 部署具有极高指导意义。