跳转至

Token-Based Affordance Grounding with Large Vision-Language Models

会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/DrFirstLee/tokAG
领域: 多模态 VLM / 机器人/具身智能
关键词: 可承受性定位 / 大视觉语言模型 / 零样本学习 / 交叉注意力机制 / 空间感知词元选择

一句话总结

提出无需下游微调与监督信号的零样本可承受性定位框架 TokAG,通过聚合大视觉语言模型全层全头的交叉注意力图并结合物体空间掩码筛选主导词元,将模型隐式语义先验转化为高精度功能区域热力图。

研究背景与动机

可承受性定位(Affordance Grounding)旨在定位视觉场景中能够支撑特定人类动作的功能区域,是具身感知、物理智能与机器人抓取操作的关键基石。长期以来,该领域主要依赖弱监督学习范式,即利用带有动作级标签的外中心(Exocentric)图像来指导自中心(Egocentric)视角的交互区域定位。然而,现存方法受制于两大根本瓶颈:其一是外中心图像中多动作共存带来的视觉多义性(经统计 AGD20K 中高达 31.7% 的外中心图像被重复用于不同类别,例如抓取与刷牙动作同时出现在同一把牙刷上),导致模型难以剥离特定动作的纯净视觉线索;其二是现有方法过度依赖简短的动作短语,缺乏足够的语义细节来区分同一物体上语义相近的微观动作(例如难以区分摩托车上的“坐(sit on)”与“推(push)”,最终往往对不同动作激活相同的物体区域)。

随着通用大视觉语言模型(LVLM,如 Qwen3-VL、InternVL3)的飞速发展,模型参数中沉淀了极其丰富的开放词表动作语义与世界常识。当给定图像与特定动作引导的文本提示时,模型自回归生成的描述文本在隐式层面上深刻关联着图像局部的空间线索。然而,通用 LVLM 本质上是为自回归文本生成而优化,缺乏显式的动作级热力图输出接口;若直接启发式提取中间交叉注意力,又会因自回归解码特有的注意力汇聚(Attention Sinks)与背景漫反射现象,产生大量无关背景响应与层头间的表征震荡,无法直接提供精准的可承受性定位。

针对上述核心矛盾,本文摒弃了依赖监督微调或复杂外中心知识蒸馏的传统路线,直接探索未微调通用 LVLM 内部潜在的跨模态语义-空间对齐能力。核心 idea:构建完全免训练的零样本可承受性定位框架 TokAG,全面聚合 LVLM 所有语言层与注意力头中的跨模态注意力,并引入轻量物体空间先验筛选出在目标物体上激活最集中的单个核心词元,将其跨模态注意力图映射为精确的可承受性热力图。

方法详解

整体框架

TokAG 接收一张自中心测试图像 \(I\)、目标物体类别 \(O\) 与待定位动作 \(A\),旨在零样本输出该动作对应的局部功能区域热力图 \(H\)。整个流程无需任何下游可承受性微调,完全由冻结的视觉语言大模型和现成分割工具驱动:首先构造结构化动作意图查询提示词输入 LVLM 生成描述文本;随后提取解码序列中每个词元在所有网络层和多头上的跨模态图像注意力并进行全局聚合;接着借助开集分割模型生成目标物体的粗粒度空间掩码;最后在物体掩码约束下评估每个词元的物体区域能量激活度,挑选出响应最突出的 Top-1 词元,并将其对应的受约束注意力热力图双线性上采样为最终定位结果。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["自中心图像 I + 动作 A + 物体 O"] --> B["意图诱导提示生成<br/>'When people perform A with O, which part...'"]
    B --> C["冻结 LVLM 自回归解码<br/>输出词元序列 T = {t1, t2, ..., tN}"]
    C --> D["跨层与跨头注意力聚合<br/>整合所有层与头得到 M_ti"]
    A --> E["开集物体掩码提取<br/>CLIPSeg 提取物体先验 M_obj"]
    D --> F["空间感知词元选择<br/>哈达玛积打分 S_i = sum(M_ti ⊙ M_obj)"]
    E --> F
    F --> G["Top-1 核心词元定位<br/>选取最大激活词元 t* = argmax S_i"]
    G --> H["双线性插值上采样<br/>输出最终可承受性热力图 H"]

关键设计

1. 意图诱导提示词与跨层多头注意力全局聚合:解决表征离散与局部头噪声

单纯将动作短语输入 LVLM 难以激活深层的功能推理通路。TokAG 采用显式引导思考路径的结构化提示词:“When people perform \(A\) with \(O\), which part of the \(O\) is used for '\(A\)'? Answer in one sentence.”。在 LVLM 生成输出词元序列 \(T = \{t_1, t_2, \dots, t_N\}\) 的过程中,每个生成词元与视觉补丁(Visual Patches)之间存在高维跨模态交叉注意力。然而,不同语言深度层(早期浅层偏重底层边缘纹理、深层偏重全局概念)和不同注意力头的空间关注点高度离散且存在大量无关背景漂移。以往无监督定位工作常尝试启发式挑选特定几层或固定注意力头,但在零样本条件下确定最优层头几乎不可行。TokAG 提出打破硬性子集剪枝,采用全量层与头的平权聚合策略,将词元 \(t_i\) 在所有 Transformer 层和多头上的注意力权重直接平均积分,得到综合保留细粒度局部特征与宏观概念定位的全局注意力图 \(\mathcal{M}_{t_i} \in \mathbb{R}^{H \times W}\)

2. 目标物体空间约束引导:抑制背景注意力汇与漫散射噪声

自回归解码过程中的 Attention Sink 机制会导致模型把大量注意力权重分配给视觉无关的背景或句首标点符号,导致原始聚合注意力图 \(\mathcal{M}_{t_i}\) 呈现弥散状。为了在不引入监督标注的前提下过滤非交互区域的误导性激活,TokAG 引入目标物体级空间先验。利用冻结的预训练开集分割模型(如 CLIPSeg 或 SAM 3)提取目标物体 \(O\) 的二值掩码 \(M_{\text{obj}} \in \{0, 1\}^{H \times W}\)。通过逐像素哈达玛积操作将全局注意力图约束在实体边界之内,构建受约束注意力图:

\[\widetilde{\mathcal{M}}_{t_i} = \mathcal{M}_{t_i} \odot M_{\text{obj}}\]

这一操作物理上阻断了漂移到无关背景、桌面或其他共存物体上的注意力伪影,确保后续指标评估纯粹基于目标物体本身的有效相互作用区域。

3. 空间感知词元评分与 Top-1 显著性判别:规避固定位置与词性启发式的局限

传统生成式模型提取空间线索常盲目选用固定位置词元(例如首个生成词元、句尾词元)或机械地限定为名词词元。但作者实证发现,自回归解码中预测下一个核心词元时,其空间注意力往往已提前在先行词(例如冠词“a”、“the”)中显著爆发,固定选取名词或首词会导致关键空间线索严重丢失。为此,TokAG 提出基于目标物体内部累积能量的空间感知词元评分机制。对输出序列中的每一个词元 \(t_i\),计算其受限注意力图在物体区域内的空间激活总和:

\[S_i = \sum_{x,y} \widetilde{\mathcal{M}}_{t_i}(x,y)\]

进而挑选具有最高物体内激活集中度的单一最优词元 \(t^*\)

\[t^* = \operatorname{argmax}_{t_i \in T} S_i\]

最终的可承受性热力图 \(H\) 直接通过对 \(\widetilde{\mathcal{M}}_{t^*}\) 进行双线性插值上采样获得:\(H = \operatorname{UP}(\widetilde{\mathcal{M}}_{t^*})\)

词元可解释性与语义涌现分析

通过将选出的 Top-1 词元 \(t^*\) 逆映射回文本词汇,实验揭示了该选择机制的高度物理可解释性:例如在“Cut with knife”任务中系统自动选中“blade(刀刃)”,在“Lie on bed”中选中“mattress(床垫)”,在“Sit on bicycle”中选中“seat(车座)”,在“Push motorcycle”中选中“handle(把手)”,在“Open bottle”中选中“cork(瓶塞)”。进一步量化统计显示,在 2B 模型中选中的词元有 54.3% 属于明确的动作词、空间区域词或功能部件词;而在 32B 模型中,这一比例显著攀升至 62.4%(其中纯功能部件词占比从 21.5% 跃升至 40.4%)。这有力地证明了参数量更大的前沿 LVLM 能够自发形成更加精确、聚焦的功能性物理概念对应。

实验关键数据

主实验

在代表性基准数据集 AGD20K(包含 Set 1 见过的动作-物体组合与 Set 2 未见过的跨物体泛化测试)以及人-物交互定位基准 HICO-IIF 上,将零样本且免训练的 TokAG 与前沿弱监督竞争方法(利用外中心监督图像训练)进行横向评测。评估指标包括 Kullback-Leibler 散度(KLD,越低越好)、相似度(SIM,越高越好)与归一化扫描路径显著性(NSS,越高越好)。

数据集 方法 监督模式 KLD ↓ SIM ↑ NSS ↑
AGD20K (Set 1, Seen) Cross-View-AG+ (CVPR'22) 弱监督 (外中心) 1.489 0.342 0.981
LOCATE (CVPR'23) 弱监督 (外中心) 1.226 0.401 1.177
INTRA (ECCV'24) 弱监督 (外中心) 1.199 0.407 1.239
WSMA (AAAI'24) 弱监督 (外中心+文本) 1.176 0.416 1.247
LoopTrans (ICCV'25) 弱监督 (外中心闭环) 1.088 0.445 1.322
Moon et al. (ICCV'25) 弱监督 (CLIP对比学习) 1.124 0.433 1.280
TokAG (2B, Ours) Zero-Shot (免训练) 1.020 0.459 1.406
TokAG (32B, Ours) Zero-Shot (免训练) 1.010 0.458 1.424
AGD20K (Set 2, Unseen) Cross-View-AG+ (CVPR'22) 弱监督 (外中心) 1.765 0.279 0.882
LOCATE (CVPR'23) 弱监督 (外中心) 1.405 0.372 1.157
INTRA (ECCV'24) 弱监督 (外中心) 1.365 0.375 1.209
WSMA (AAAI'24) 弱监督 (外中心+文本) 1.335 0.382 1.220
LoopTrans (ICCV'25) 弱监督 (外中心闭环) 1.247 0.403 1.315
Moon et al. (ICCV'25) 弱监督 (CLIP对比学习) 1.243 0.405 1.368
TokAG (2B, Ours) Zero-Shot (免训练) 1.060 0.455 1.514
TokAG (32B, Ours) Zero-Shot (免训练) 1.043 0.455 1.549
HICO-IIF Cross-View-AG+ (CVPR'22) 弱监督 (外中心) 1.779 0.263 0.946
LOCATE (CVPR'23) 弱监督 (外中心) 1.593 0.327 0.966
WSMA (AAAI'24) 弱监督 (外中心+文本) 1.465 0.358 1.012
LoopTrans (ICCV'25) 弱监督 (外中心闭环) 1.399 0.379 1.226
Moon et al. (ICCV'25) 弱监督 (CLIP对比学习) 1.358 0.378 1.234
TokAG (2B, Ours) Zero-Shot (免训练) 1.056 0.459 1.600
TokAG (32B, Ours) Zero-Shot (免训练) 1.032 0.449 1.655

消融实验

表1:词元选择策略消融(AGD20K Set 2, 2B 模型)

验证空间感知 Top-1 词元筛选相比于各类启发式规则的优越性:

词元选择配置 策略细节说明 KLD ↓ SIM ↑ NSS ↑
Average All Tokens 对序列中所有生成词元的注意力直接求平均 1.111 0.435 1.457
First Output Token 强制取序列第一个生成词元 1.078 0.444 1.493
Last Output Token 强制取序列最后一个词元(如句号或终止符) 1.358 0.364 1.116
Noun Tokens Only 仅在词性标注为名词的词元中计算最大激活 1.112 0.435 1.461
Top-5 Tokens 选取物体内激活累积最高的 Top-5 词元融合 1.084 0.444 1.482
Ours (Spatial Top-1) 根据物体区域内激活累积选出最优单一词元 1.060 0.455 1.514

表2:层与注意力头聚合策略消融(AGD20K Set 2, 2B 模型)

对比固定中间代表性层/头与全层头聚合的性能差异:

聚合配置 选取的网络层与注意力头 KLD ↓ SIM ↑ NSS ↑
L25-H5 仅取第 25 层第 5 个注意力头 1.132 0.441 1.431
L25 聚合第 25 层全部注意力头 1.090 0.450 1.471
H5 跨所有层聚合第 5 个注意力头 1.062 0.454 1.510
L16-H15 仅取第 16 层第 15 个注意力头 1.135 0.446 1.459
L16 聚合第 16 层全部注意力头 1.100 0.461 1.466
H15 跨所有层聚合第 15 个注意力头 1.100 0.450 1.476
Ours (All Layers & Heads) 全网络层 + 全注意力头无加权均匀聚合 1.060 0.455 1.514

关键发现

  • 零样本大幅击败弱监督基线:在 AGD20K Unseen(Set 2)测试集中,TokAG-2B 达到 1.514 NSS,相比此前弱监督最佳方法(Moon et al. 的 1.368)相对提升达 10.7%;在 HICO-IIF 上提升幅度更是达到 29.7%(1.655 vs 1.234)。这说明未微调的前沿大模型内部潜在的空间-语义关联远比从有限外中心噪声数据中蒸馏出的特征更为泛化和可靠。
  • 为何名词限制反而劣于全局选择:定性分析表明,在自回归模型预测如“cut with a knife”时,模型在生成冠词“a”或“the”的时刻,由于注意力需要前瞻加载后续目标实体的视觉上下文,往往已经在刀刃区域产生了极强爆发式激活;若强行过滤掉非名词词元,反而会抹杀这一提前对齐的宝贵先验。
  • 基座规模正向缩放:从 2B 换为 32B LVLM 基座,不仅综合指标持续提升,而且选出直接描述物理功能部件词元的概率翻倍(40.4% vs 21.5%),展现出显著的语义涌现特性。

亮点与洞察

  • 完全免训练的极简几何投影:无需设计复杂的交叉注意力重对齐损失或 prompt 调优,仅靠全层头注意力均值加开集二值掩码过滤,便将自回归语言模型的隐式认知投射到二维物理像素空间。
  • 自然自发激活多实例与多部件:尽管 TokAG 仅挑选单一的 Top-1 词元,但由于视觉语言模型的底层交叉注意力图天生具备全局泛化性,当场景中存在相同动作属性的多个同类物体或对称功能部件(如多个椅子座垫、多把叉子)时,热力图能无缝且同步高亮所有可交互位置。
  • 与基础模型级联方案的鲜明对比:传统尝试让 LVLM 直接输出检测框/坐标点(如 Bbox 或中心点预测,再送入 SAM 3 分割),其 NSS 仅有 1.085 与 0.675;原因是动作可承受性往往是物体上的非独立亚部件(Sub-part),基础检测/分割模型缺乏这类非刚性语义概念,而 TokAG 的词元激活直接绕过了离散坐标预测的精度瓶颈。

局限与展望

  • 单词元对复合动作建模能力的不足:当前架构假设一个动作由单一最优词元所主导,这在标准单点交互基准上成立;但对于双臂协同(例如一手稳固瓶身、一手旋转瓶盖)或复合动作(如倾倒液体需要同时关注手柄与壶嘴),单一词元难以同时承载两个空间分离的功能区域,未来需拓展多词元协同聚类策略。
  • 自回归推理的计算开销:由于依赖 LVLM 的自回归前向解码并提取完整多头交叉注意力,TokAG 在 RTX 3090 上的推理速度为 0.59 FPS(32B 模型为 0.20 FPS),远慢于专用轻量级 CNN/ViT 定位头(WSMA 约 20.4 FPS),限制了其实时机器人在线闭环控制的部署。
  • 视觉混淆与显著性干扰错误:错误分析表明在 77 个失败案例中,除 37.7% 源于前端粗糙分割掩码失效外,其余多由于物体表面高对比度标志(如鼓面品牌 Logo、滑板印花)抢夺了视觉注意力,导致热力图偏离实际可操作区域。

相关工作与启发

  • vs Cross-View-AG [28] & LOCATE [23]:早先弱监督方法依赖外中心图像构建原型进行跨视角特征迁移,饱受 31.7% 数据中动作共存多义性的困扰;TokAG 完全省去外中心训练集,直接从自中心视角询问大模型,彻底规避跨视角域差距与标签混叠。
  • vs WSMA [42] & Moon et al. [32]:后续工作引入简短文本动作标签和 CLIP 特征对比,但简短动作词缺乏区分摩托车“推”与“坐”的细粒度描述能力;TokAG 利用指令级提示促使大模型输出完整解释句子,进而从句中捕获功能部件级的高纯度注意力。
  • vs 启发式注意力头剪枝工作 (如 Kang et al. [17]):以往工作试图通过监督指标寻找专门用于视觉定位的黄金注意力头;本文证明在零样本下,全网络层与全注意力的全局平均聚合反而能有效平滑奇异噪声并保留最大化的语义鲁棒性。

评分

  • 新颖性: ⭐⭐⭐⭐ [摆脱外中心弱监督迁移旧范式,另辟蹊径以免训练词元注意力解锁零样本定位]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 AGD20K 跨类别泛化、HICO-IIF 及 EPIC-Aff,提供深入词元语义统计与基础模型基线对比]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑严密,图表对比清晰,动机阐释与消融设计高度自洽]
  • 价值: ⭐⭐⭐⭐ [为具身智能抓取操作与大模型底层可解释性研究提供了极具复用性的即插即用工具]