Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention¶
会议: ECCV 2026
论文: CVF / ECCV Poster
代码: https://github.com/cvlab-stonybrook/Gazette
领域: 人体理解
关键词: 视线解码、多模态大模型、指令微调、自顶向下注意力、认知上下文
一句话总结¶
本文提出了首个生成式凝视到文本解码框架 Gazette,将传统受限于固定离散类别的视线意图推断拓展为开放词表自然语言生成,并通过 GPT-4 合成多被试跨视角不变的“有声思考记录”作为辅助任务,有效解耦个体行为噪声并精确还原人类自顶向下的认知意图。
研究背景与动机¶
推断人类的注意力与行为意图在人机协作、无障碍辅助交互、驾驶员监测及心理诊断等领域扮演着基石角色。眼动仪记录的凝视轨迹(gaze scanpaths)提供了一种高时间分辨率且无创、经济的意图感知途径,相比于昂贵且具侵入性的 EEG、fMRI 或 ECoG 神经解码更具实用落地价值。然而,以往的视线解码研究普遍将其框定为封闭集合下的判别式分类任务——例如二分类判断“自由浏览还是目标导向”,或是从预设的数十个固定物体标签中多分类预测“正在寻找哪个类别”。这种离散分类范式在类别数极少时过于粗糙,无法提供下游交互所需的细粒度属性(如物体的具体空间方位、材质或相对关系);而在类别空间扩张时又受限于长尾标注的匮乏,根本无法刻画人类自然语言和复杂认知意图的开放性。
将视线解码提升至开放式自然语言生成的瓶颈在于:虽然最终的任务目标(如找到“右侧的红色汽车”)是由任务驱动且明确的,但传感器捕获的单条人类眼动轨迹却严重混杂了个体生理习惯、随机探索、局部视觉显著性差异等特异性噪声。这意味着同一目标在不同被试身上呈现出高度发散的扫视路径,监督信号极其微弱且存在严重混淆。此外,现有多模态大语言模型(MLLM)缺乏眼动生理先验,直接端到端微调会导致模型拟合个体特异的无意义伪相关,难以沉淀出稳定的认知因果映射。
基于贝叶斯理想观察者模型(Bayesian ideal-observer model)与认知相关性理论(Cognitive Relevance Theory),不同人类被试在面对同一视觉刺激和共同意图时,其最优注视策略中的目标驱动成分是跨被试收敛且不变的,而个体习惯则近似于相互正交的扰动。本文的切入角度是:在训练阶段借助多被试共享目标的集群眼动数据,通过语言大模型提取这种跨被试不变的时空注意力分配策略,以此作为中间认知脚手架指导 MLLM。核心 idea:将视线解码重塑为多模态自回归生成任务,并在训练阶段引入由大模型提炼的“有声思考记录”(think-aloud transcripts)作为辅助对齐目标,借由多被试共有认知逻辑解耦个体扰动,实现单轨迹下的开放式意图文本生成。
方法详解¶
整体框架¶
Gazette 基于 LLaVA-1.5-7B 多模态架构构建,整体输入包含原始图像 \(I\) 以及将眼动扫描路径 \(S\) 离散文本化后的语言提示,输出为解析人类认知上下文的自然语言文本 \(D\)。模型生成的认知上下文呈层级化结构:宏观层面上识别粗粒度的行为类型 \(D_{\text{type}}\)(如目标存在/不存在的视觉搜索、指代理解 Object Referral、视觉问答 VQA),微观层面上生成细粒度的刺激描述 \(D_{\text{goal}}\)(从搜索目标类别到开放式指代表达或疑问句)。
在训练期,Gazette 同时接受主解码任务指令(GazeDec)与辅助的有声思考任务指令(ThinkAloud)进行 LoRA 指令微调;在推理阶段,仅需单被试的一条扫描路径即可直接自回归生成最终的意图描述,无需辅助文本输入。整体流程与任务协作如下所示:
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["图像输入 I + 视线扫描路径 S"] --> B["文本化提示构建<br/>(GazeDec / ThinkAloud)"]
B --> C["视觉编码器 + 跨模态线性投影"]
C --> D["大语言模型自回归生成"]
D --> E["时空注意力分配解释生成<br/>(有声思考辅助监督)"]
D --> F["层级化认知上下文解码<br/>(行为类型与细粒度意图文本)"]
关键设计¶
1. 视线扫描路径文本化序列建模:直观保留时空与语义线索
眼动仪输出的原始眼动扫描路径 \(S = \{f_i\}_{i=0}^{N-1}\) 由一系列注视点构成,每个注视点 \(f_i = (x_i, y_i, t_i)\) 记录了归一化坐标 \((x_i, y_i) \in [0, 1]^2\) 与注视持续时间 \(t_i\)。为了直接利用预训练多模态大模型的语言理解与空间感知先验,同时避免额外引入复杂的专用网络组件,Gazette 将这一时序几何结构序列化为结构化提示词 \(T_{\text{GazeDec}}\)(形如 Given scanpath [(0.4, 0.4, 20), ..., (0.1, 0.3, 60)], decode the behavior type and stimulus)。在底层,图像经过 CLIP 视觉编码器后由线性投射层映射至 LLM 嵌入空间,与注视点文本序列沿词表维度拼接,使得模型能够在大模型的自注意力层中同时感知场景全局特征与注视点所落物体区域的视觉语义。
2. 基于集群视线不变性的有声思考记录生成:从多被试数据中解耦个体噪声 针对单被试眼动数据中目标导向信号与个体特异性噪声(如偶然注视、个人习惯)深度耦合且不可辨识的数学困境,论文将单轨迹建模 \(S_i = f(I_i, D_i) + U_i\) 拓展为同一视觉刺激与目标下的多被试群组观测 \((I, D, \{S_i \mid i \in G\})\)。尽管各被试的注视序列 \(S_i\) 各不相同,但驱动眼动的自顶向下任务意图 \(D\) 保持不变。论文引入文本端 GPT-4 作为元模式提取器,将场景物体边界框、类别标签以及该组所有被试的时空扫描路径作为提示输入,要求 GPT-4 归纳出所有被试共通的认知决策流程,形成符合认知心理学范式的“有声思考记录”(think-aloud transcript)。每个记录由三大思维单元(idea units)构成: - 自顶向下的注意力分配解释(如“被试首先注视中央的大型障碍物,随后视线移向右侧的黑色车辆并进行反复比对确认”); - 目标空间定位边界框预测(在目标存在时输出归一化坐标,缺失时输出空描述); - 扫描路径长度计数(量化反映搜索的探索性与专注程度)。 这套由大模型合成的高阶认知伪标注在微调阶段作为辅助任务 \(T_{\text{ThinkAloud}}\) 提供给 Gazette,让模型学会如何从视线时空转移规律中提炼目标,而在推理时并不依赖任何群体数据或思考记录,单凭单条测试轨迹即可解码。
损失函数 / 训练策略¶
模型采用预训练 LLaVA-1.5-7B 为底座,仅在语言模型自注意力层注入 LoRA 低秩权重以防止在小样本眼动数据上过拟合。训练阶段采用标准的自回归交叉熵语言建模损失,将 \(T_{\text{GazeDec}}\) 和 \(T_{\text{ThinkAloud}}\) 两类指令混合训练。模型在 2 块 NVIDIA RTX A6000 GPU 上以总批次大小 32、学习率 \(2 \times 10^{-5}\) 展开训练。
在推理阶段,输入仅包含图像与单条待测眼动轨迹构成的 \(T_{\text{GazeDec}}\),采用贪婪解码(greedy decoding)生成文本。解析得到的粗粒度行为 \(D_{\text{type}}\) 通过 MiniLM 句子编码器与候选行为词表进行余弦相似度最近邻匹配确定;细粒度意图 \(D_{\text{goal}}\) 在 VQA 和指代任务中直接作为开放式文本输出,在封闭集搜索任务中则映射到 18 类目标类别上。
实验关键数据¶
主实验¶
在开放式生成的指代理解(RefCOCO-Gaze 数据集,Task A)与视觉问答(AiR-D 数据集,Task B)任务中,Gazette 与通用 LLaVA-1.5 基线、仅关注末次注视点物体的 LLaVA-last 基线以及不带辅助思考任务的消融版本(w/o ThinkAloud)进行全面对比。
| 任务 | 方法 | BLEU-1 | BLEU-4 | METEOR | ROUGE-L | CIDEr |
|---|---|---|---|---|---|---|
| 人类标注一致性 | RefCOCO-IAC | 0.500 | 0.057 | 0.244 | 0.452 | 1.115 |
| Object Referral (Task A) | LLaVA-1.5 [39] | 0.066 | 0.000 | 0.077 | 0.105 | 0.062 |
| LLaVA-last | 0.170 | 0.014 | 0.113 | 0.221 | 0.113 | |
| Gazette (w/o ThinkAloud) | 0.479 | 0.070 | 0.232 | 0.443 | 0.872 | |
| Gazette (Full) | 0.519 | 0.098 | 0.248 | 0.480 | 0.974 | |
| VQA (Task B) | LLaVA-1.5 [39] | 0.124 | 0.006 | 0.039 | 0.103 | 0.047 |
| Gazette (w/o ThinkAloud) | 0.329 | 0.095 | 0.147 | 0.286 | 0.263 | |
| Gazette (Full) | 0.364 | 0.159 | 0.160 | 0.324 | 0.367 |
在视觉搜索目标预测(COCO-Search18 数据集)的离散类别设置下,Gazette 与传统判别式 SOTA 方法展开对比:
| 任务 | 方法 | Precision | Recall | F1 | Accuracy |
|---|---|---|---|---|---|
| Target-Present (Task C) | GazeGNN [68] | 0.338 | 0.345 | 0.319 | 0.335 |
| GST [48] | - | - | - | 0.544 | |
| Mondal et al. [45] | - | - | - | 0.776 | |
| Gazette (w/o ThinkAloud) | 0.768 | 0.746 | 0.742 | 0.742 | |
| Gazette (Full) | 0.786 | 0.775 | 0.775 | 0.773 | |
| Target-Absent (Task D) | GazeGNN [68] | 0.241 | 0.251 | 0.218 | 0.270 |
| GST [48] | - | - | - | 0.385 | |
| Mondal et al. [45] | - | - | - | 0.387 | |
| Gazette (w/o ThinkAloud) | 0.437 | 0.424 | 0.420 | 0.445 | |
| Gazette (Full) | 0.438 | 0.426 | 0.424 | 0.443 |
消融实验与分析¶
除了语言重合度指标外,论文通过 GPT-4 裁判评分(LLM-as-a-Judge,1-10 分评分制)量化评估了生成意图的语义准确性与指代等价性:
| 评估维度 / 任务 | 评测细项 | LLaVA-last | w/o ThinkAloud | Gazette (Full) |
|---|---|---|---|---|
| Object Referral (Task A) | 表达重叠度 (Expression Overlap) | 3.515 | 5.019 | 5.980 |
| 指代等价性 (Referential Equivalence) | 4.100 | 5.771 | 6.638 | |
| 类别准确性 (Category Correctness) | 7.577 | 8.376 | 8.743 | |
| VQA (Task B) | 问题重叠度 (Question Overlap) | - | 2.103 | 2.792 |
| 答案等价性 (Answer Equivalence) | - | 1.642 | 2.135 |
关键发现¶
- 完整轨迹建模远优于启发式单点: LLaVA-last 仅使用注视结束点的物体属性进行描述,在指代生成任务上 BLEU-4 仅为 0.014,CIDEr 仅为 0.113。这表明复杂场景下的指代目标并不能单纯由落点决定,前序的扫描比较、上下文参照轨迹对于解析属性和空间关系至关重要。
- 有声思考微调极大强化了高阶文本表征能力: 引入 ThinkAloud 辅助监督后,在 RefCOCO-Gaze 上 BLEU-4 相对提升 40.00%(0.070 → 0.098),甚至在 BLEU-1 到 BLEU-4 和 ROUGE-L 上超越了多人类标注间的自身一致性(RefCOCO-IAC)噪声上限;在 VQA 上 BLEU-4 增幅达 67.37%(0.095 → 0.159),CIDEr 提升 39.54%。
- 目标不存在(Target-Absent)搜索中的瓶颈: 在目标不存在的搜索场景下,加入 ThinkAloud 的增益较为微弱(F1 0.420 → 0.424)。作者深入分析指出,当目标缺失时,人类眼动随时间推移逐渐退化为无目的的自由注视(free-viewing),导致被试间的注意力和行为一致性急剧下降,削弱了 GPT-4 提取共有注意力分配逻辑的先验优势。
亮点与洞察¶
- 从分类器跃迁至认知翻译器: 论文首次突破了持续数十年的闭集离散类别意图推断框架,将注视轨迹视作一种隐式意图语言,通过 MLLM 翻译为开放词表的自然语言,大幅拓展了可穿戴设备中对未知长尾目标的理解空间。
- 群组不变性化解欠定逆问题: 面对“单条轨迹无法剥离个体主观偏置”的理论死结,巧妙利用“同一刺激与目标下被试群体共享不变注意力逻辑”的认知学机理,借由离线 LLM 生成认知剧本作为辅助弱监督,既避免了在线推理的高昂开销,又教会了模型通用的眼动阅读能力。
局限与展望¶
- 依赖跨被试注意力一致性: 该框架高度依赖被试间的一致性先验。在类似“目标缺失”或高度发散的主观审美自由浏览任务中,注视轨迹的随机性占主导,导致大模型抽取的公共模式失效。
- 大模型先验引发的认知偏见: 有声思考记录均由 GPT-4 结合物体检测框生成,它反映的是 LLM 的常识推理先验,而非人类受试者真实的脑电与实时潜意识心理流,可能导致模型学到的注意力归因偏向统计主流认知。
- 多模态对齐粒度有待加深: 目前采用文本串联注视点坐标方式输入,未充分发挥连续时间注视热力图在视觉特征层级上的时空连续卷积特性。
相关工作与启发¶
- 对比分类式搜索意图解码 (GST / GazeGNN / Mondal et al. 2025): 以往方法依赖固定类别分类器或预设词表的向量对齐,在测试阶段无法生成“左数第二个带把手的杯子”等非预设复杂描述;Gazette 采用多模态自回归生成式架构,不仅在分类指标上与专用 SOTA 相当,更具备开放式指代和问答解码能力。
- 对比基于注视的图像个性化生成 (Xue et al. CVPR 2026): 该工作在训练期将注意力信息压缩为主体嵌入用于个性化描述,但在推理期不接受眼动输入;Gazette 则以眼动轨迹为核心输入,旨在实时根据注视反推即时的认知目标。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次提出开放式文本视线解码任务,提出基于群体不变性的有声思考记录训练机制,视角极具开拓性。
- 实验充分度: ⭐⭐⭐⭐☆ 覆盖指代、VQA、目标存在与不存在四大视觉搜索场景,结合 NLP 指标与 LLM 裁判进行了立体评估。
- 写作质量: ⭐⭐⭐⭐⭐ 理论推导扎实(结合贝叶斯理想观察者与认知相关理论),框架图与消融逻辑层次清晰严谨。
- 价值: ⭐⭐⭐⭐⭐ 为 AR 眼镜、人机交互与无障碍辅助系统提供了极具落地前景的隐式意图理解技术范式。