跳转至

Molmo-Point: Better Pointing for VLMs with Grounding Tokens

会议: ECCV 2026
论文: ECCV 官方
代码: https://allenai.org/blog/molmopoint
领域: 多模态VLM
关键词: 视觉定位, 视觉语言模型, 指向定位, Grounding Tokens, 粗到细分层检索

一句话总结

针对现有视觉语言模型依赖文本坐标导致学习低效与高解码开销的痛点,MolmoPoint 提出一种利用三阶段定位 Token(<PATCH><SUBPATCH><LOCATION>)直接跨注意力索引视觉特征的粗到细定位机制,在 PointBench、PixMo-Points 及 ScreenSpotPro 等图像、GUI 与视频追踪任务上刷新多项最先进纪录。

研究背景与动机

在多模态视觉语言模型(VLM)中,通过指向(Pointing)实现像素级空间定位已成为具身智能机器人抓取与导航规划、计算机操作助手(GUI Agent)交互、以及基于视觉思维链(Visual CoT)计数等任务的核心基石。然而,绝大多数现有 VLM 均采用“文本坐标生成”机制,无论是自回归输出连续数字字符串还是离散坐标分箱 Token,都强制模型在自回归语言空间中死记硬背一套人工设定的绝对坐标映射体系。

这种文本坐标范式存在三大本质瓶颈:其一,坐标系统与视觉表征严重解耦——视觉编码器和 LLM 隐层本已对物体、部件及动作建立了丰富的空间特征,但模型却被迫将这些高维视觉特征费力地翻译为文本数字;其二,生成代价高昂,每个坐标点需要输出多达 8 个 Token(6 位数字加空格与分隔符),在密集点集或长视频定位时解码延迟急剧上升;其三,泛化脆弱,由于依赖固定的坐标系标定,模型在面对推理期动态图像切片变化或未见过的超高清分辨率时极易失效。

本文的切入角度是打破“视觉感知→语言翻译→文本坐标”的弯路,直接让语言模型在隐层特征空间中通过注意力机制寻址输入视觉 Token。核心 idea:引入粗到细分层的 Grounding Tokens(<PATCH><SUBPATCH><LOCATION>)直接点积索引视觉 Token 与 ViT 底层特征,结合相对旋转位置编码(RoPE)与终止判定类,构建高效且具备无限分辨率自适应的高精度视觉定位架构。

方法详解

整体框架

MolmoPoint 的整体定位流程分为三个逐级精细化的自回归生成阶段。当模型需要预测定位点时,首先生成一个 <PATCH> Token,其隐层状态投影为查询向量,与 LLM 层的图像 Token 隐层特征做缩放点积注意力,直接选出目标物体所属的粗粒度图块;随后生成 <SUBPATCH> Token,以类似注意力方式在被选中图块底层的 ViT 未池化特征中挑出细粒度子图块;最后由 <LOCATION> Token 通过单个线性层预测子图块内的 3×3 局部坐标网格,达到像素级精度。选出的图块与子图块特征会即时回填到后续解码步的输入表征中,使自回归过程持续感知已定位的空间上下文。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像 / 视频序列 + 文本指令"] --> B["粗粒度图块检索<br/>PATCH Token 跨注意力匹配 LLM 视觉隐藏状态"]
    B --> C["细粒度子图块细化<br/>SUBPATCH Token 匹配未池化 ViT 原始特征"]
    C --> D["局部网格坐标精确定位<br/>LOCATION Token 预测 3×3 局部网格点"]
    D --> E["终止判定与相对空间感知<br/>RoPE 编码历史相对位移 + no-more-points 终止类"]
    E --> F["输出高精度有序目标点序列"]

关键设计

1. 粗粒度图块检索:跨注意力直接索引 LLM 视觉隐藏状态

针对传统文本坐标生成脱离视觉特征的痛点,模型在语言词表中加入专用 <PATCH> Token。当自回归解码产生该 Token 时,其隐层状态 \(h_p \in \mathbb{R}^{D \times 1}\) 经归一化和线性变换映射为查询向量 \(q_p = W_{pq} \text{Norm}(h_p)\)(维度为 \(M\),实验设 \(M=512\))。同时,输入序列中所有视觉 Token 的隐层状态 \(H_i \in \mathbb{R}^{D \times I}\) 映射为键向量矩阵 \(K_p = W_{pk} \text{Norm}(H_i)\)。两者的缩放点积直接产生整个图像图块的评分分布: $\(s_p = \frac{K_p^\top q_p}{\sqrt{M}}\)$ 在推理时选取最高分图块 \(p^* = \arg\max(s_p)\)。由于 Molmo2 架构中每个图像 Token 聚合了底层 ViT 的 4 个图块(覆盖 \(28 \times 28\) 像素),该步骤直接锁定了粗定位区域。当该 <PATCH> 转换为后续自回归的输入时,系统将其原始嵌入与被选中图像 Token 的输入嵌入相加(\(q_p + E_i[:, p^*]\)),将定位位置显式传递给后续上下文。

2. 细粒度子图块细化:穿透检索底层 ViT 原始未池化特征

\(28 \times 28\) 像素的粗图块无法满足小目标、高分辨率 GUI 元素或部件级追踪的要求。为此,模型紧接着发射 <SUBPATCH> Token,其隐层状态生成查询 \(q_s\),并与预先缓存的该图块内部 4 个 ViT 原始 Patch 特征 \(U_s\) 进行点积打分,从中选出最佳的 \(14 \times 14\) 像素子图块 \(s^*\)。在输入侧,同样通过投影矩阵 \(W_{se}\) 将未池化的 ViT 局部特征注入到 <SUBPATCH> 的输入嵌入中。

为了达到单像素级精度,模型随后生成第三个 <LOCATION> Token。其隐层特征通过轻量线性分类头,将 \(14 \times 14\) 像素子图块划分为 \(3 \times 3\) 的规则网格并预测所属网格索引。该设计使模型在无论多大尺寸的输入图像上,均能恒定保持约 4.7 像素的定位分辨率,彻底摆脱了随图像放大而导致坐标字符串数值爆炸的问题。

3. 相对空间感知与终止判定:RoPE 相对位置编码与 no-more-points 类别

在连续预测多个目标点或视频多帧追踪时,模型容易出现重复定位或陷入无限生成大量冗余点的退化行为。本文引入了两项关键设计: 首先,在 <PATCH> 打分阶段引入旋转位置编码(RoPE),计算候选视觉 Token 相对于上一个已生成点所属 Token 的相对位移: $\(s_p = \frac{\text{Rot}(K_p, p_i)^\top \text{Rot}(q_p, p_q)}{\sqrt{M}}\)$ 其中 \(p_i\) 为候选视觉 Token 位置索引,而 \(p_q\) 为前一个定位点所处位置。同时在训练和推理时将前一位置之前的视觉 Token 全部 Mask 掉,强迫模型按照自左至右、自上而下的扫描顺序有序发射点,极大增强了上下文的空间相对感知。 其次,在键向量矩阵中增设一个可学习的静态向量 \(h_{done} \in \mathbb{R}^{M \times 1}\) 作为“无更多点”(no-more-points)类别:\(K_p = [W_{pk}\text{Norm}(H_i);\, h_{done}]\)。一旦模型判断图像中已无目标需要标注,\(q_p\) 将匹配到 \(h_{done}\),系统立即截断生成并输出闭合标记 >,彻底消除过量冗余点的退化问题。

一个完整示例

以指令“定位最左侧汽车的右刹车灯”为例: 1. 模型接收高分辨率街道图像并完成视觉 Prefill,缓存图像 Token 隐层特征 \(K_p\) 与未池化的 ViT 特征 \(K_s\); 2. 模型自回归输出 <PATCH> Token,查询向量 \(q_p\) 在全图数百个视觉 Token 中检索,精准激活最左侧车辆车尾所在的 \(28 \times 28\) 像素图块 \(p^*\); 3. 系统将该图块嵌入回填,模型接着生成 <SUBPATCH> Token,在对应的 4 个 ViT 子图块中点积比对,选中右上角包含刹车灯的 \(14 \times 14\) 像素子图块 \(s^*\); 4. 模型继续生成 <LOCATION> Token,线性层在 \(3 \times 3\) 网格中分类得到局部位置编号 5(子图块中心略偏右),结合预存的映射表转换为精确的全局像素坐标; 5. 模型发射下一个 <PATCH> Token,此时注意力得分最高的为 \(h_{done}\)(no-more-points),模型触发终止条件,输出列表终止符并结束生成。全过程仅消耗 4 个输出 Token,远低于文本坐标所需的数十个数字 Token。

损失函数 / 训练策略

训练时,目标点在预处理阶段被映射为 (图像 Token 索引 tp, ViT 子图块索引 ts, 局部网格索引 tl) 三元组。 模型损失由标准自回归文本交叉熵损失与各定位步骤的交叉熵损失直接相加: $\(\mathcal{L} = \mathcal{L}_{\text{LLM}} + \mathcal{L}_p(s_p, t_p) + \mathcal{L}_s(s_s, t_s) + \mathcal{L}_{loc}(s_{loc}, t_l)\)$ 其中 \(\mathcal{L}_p\)\(\mathcal{L}_s\)\(\mathcal{L}_{loc}\) 分别代表图块、子图块和局部网格的真实标签交叉熵。超参数 \(M=512\)。新引入的投影层与定位参数采用独立学习率,设定与图文连接层(Connector)的学习率一致。推理时通过缓存键向量,仅增加相当于 1-2 层 LLM 键值缓存的极低显存开销。

实验关键数据

主实验

论文训练了三个版本:通用多模态模型 MolmoPoint-8B、GUI 专用模型 MolmoPoint-Img-8B(基于合成的 36K 高清屏幕数据集 MolmoPoint-PointSyn 训练)以及轻量视频专用模型 MolmoPoint-Vid-4B。在自然图像定位(PointBench、PixMo-Points)、GUI 界面交互(ScreenSpot-Pro、OSWorldG)及视频多目标追踪(Molmo2Track)上均展现出显著超越基线的优异性能。

数据集 任务领域 评价指标 MolmoPoint-8B / Img-8B 前代基线 (Molmo2-8B) 性能提升
PointBench 自然图像定位 平均得分 (Avg.) 70.7 68.7 +2.0
PixMo-Points 多目标精细定位 F1 分数 89.2 85.2 +4.0
ScreenSpot-Pro 高清 GUI 定位 准确率 (Acc.) 60.2 (64crops: 61.1) 30.4 (微调版: 52.3) +8.8 (相对微调版)
OSWorldG GUI 交互定位 准确率 (Acc.) 70.0 54.1 (微调版: 66.1) +3.9 (相对微调版)
Molmo2Track 视频多目标追踪 J&F / HOTA 62.5 / 60.0 56.2 / 57.5 +6.3 / +2.5
BURST-VC 视频目标计数 准确率 / 临近准确率 61.6 / 76.9 60.8 / 75.0 +0.8 / +1.9

消融实验

在轻量级实验设置下(以冻结的基础模型在相同图像与视频定位数据上微调 6000 步),论文详细评估了 RoPE 相对编码、终止类以及有序点生成约束对性能的影响:

配置 PixMoPoint (F1) PointBench (Avg.) Molmo2-VC (Correct) Molmo2-VC (Close) 过度计数率 (Overcount ↓) 说明
完整模型 (Molmo2-P-Ablation) 85.2 67.8 58.0 36.6 3.6% 基线消融完整配置
w/o rotary (去除 RoPE 相对编码) 84.5 67.6 56.8 33.0 4.5% 相对空间建模受损,视频计数显著下滑
w/o no-more-points (去除终止类) 84.7 66.6 52.3 32.8 10.3% 缺乏终止机制导致过量预测率暴增近 3 倍
w/o point sorting (去除排序约束) 83.6 71.2 40.0 24.4 3.2% 视频跟踪严重崩溃(计数正确率暴跌 18 点)

关键发现

  • 样本学习效率大幅飞跃:仅需 8192 条定位样本微调,MolmoPoint 即可达到接近饱和的优异性能,相比文本坐标基线在同等极少数据下的 F1 分数高出整整 20 点;预训练过程中达到顶峰性能的速度也显著更快。
  • 动态超高清分辨率无损自适应:在测试期将图像动态切片数提升至 64 crops 时,文本坐标模型(如 Molmo2-GUI-8B)因绝对坐标系紊乱导致精度骤降 30-60 点,而 MolmoPoint 凭借基于局部图块索引的自适应机制,指标反向提升至 61.1%,证明了特征索引范式的鲁棒性。
  • 消除视频定位的病态退化:实验中去除 no-more-points 类别后,模型在长视频中的 Overcount(预测点数超过真实值 2 倍且大于 10)从 3.6% 飙升至 10.3%,证明固定终止特征对于模型自主判定“目标已找全”至关重要。

亮点与洞察

  • 从“生成坐标”到“引用特征”的范式革新:以往模型将隐层视觉概念强行解码为离散字符,割裂了感知与定位;MolmoPoint 证明直接用生成 Query 召回视觉 Key 向量不仅数学形式上极为简洁,更能天然复用大模型已学到的实体表征。
  • 粗到细三级解耦设计:将定位空间分解为 LLM 视觉图块、ViT 原始子图块和 \(3 \times 3\) 网格,既保留了全局大场景的快速检索能力,又利用未池化的底层特征穿透到约 4.7 像素精度的微小局部。
  • 极大节省推理开销与上下文窗口:每个定位点由 8 个字符 Token 缩减至 3 个定位 Token,对于需要密集输出成百上千个轨迹点的视频追踪或 GUI 多步骤规划,大幅降低了 KV Cache 占用与解码延迟。

局限与展望

  • 密集高频重复物体的偶发计数偏差:在排列极其紧密的重复网格纹理或大批相似密集物体中,模型偶尔会出现 \(\pm 1\) 的越界或漏标现象。
  • 仅局限于视觉输入模态:目前该套 Grounding Token 机制主要在图像和视频特征上实现闭环验证,尚未扩展到文本 Token 引用(如长文档溯源)或音频流时间戳直接定位。
  • 后续优化思路:探索结合强化学习(RL)进一步优化空间定位奖励;将 Grounding Tokens 与扩散模型或分割掩码解码器无缝融合,提供统一的点、框、掩码多粒度交互输出。

相关工作与启发

  • vs Molmo / PixMo 系列:前代 Molmo 依赖纯文本字符串生成坐标(如 [x, y]),每个点产生 8 个 Token 且在超高分辨率切片变更时容易失真;MolmoPoint 用 3 个 Grounding Tokens 替换文本坐标,在 PixMo-Points 上取得 4.0 点的全面领先。
  • vs PaDT / GUI-Actor:PaDT 需依赖独立的外部解码器生成;GUI-Actor 虽然使用 <ACTOR> Token 做单层 cross-attention,但缺乏多层级细化能力且仅限单个 GUI 目标点;本文构建了完备的粗到细多级投影机制并拓展到长视频追踪。
  • vs 闭源商业模型 (Gemini 3 Pro / GPT-5):在无需高昂专有数据清洗与复杂多轮 RL 的前提下,完全开源的 MolmoPoint-8B 在 PointBench 等评测上斩获 70.7 分,战胜了众多商业闭源大模型,证明了纯架构优化带来的空间定位潜力。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 彻底抛弃文本坐标生成,提出基于 Grounding Tokens 的粗到细特征索引定位新范式。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖图像、GUI、视频多目标跟踪及基础 QA 等多维度基准,且包含详尽的消融与学习效率对比。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑结构严谨,图文对照直观,动机明确且工程落地细节交代完整。
  • 价值: ⭐⭐⭐⭐⭐ 为开源社区提供了兼具高精度、低延迟与强分辨率泛化能力的视觉定位统一基准与全新思路。