跳转至

GazeFlow: From Human Gaze Behavior to Generative Egocentric Gaze Prediction

会议: NeurIPS2026(任务清单归属;缓存为 arXiv v1)
arXiv: 2609.38519
论文: https://arxiv.org/abs/2609.38519
领域: 人体理解 / 第一人称视线预测
关键词: 视线轨迹、条件流匹配、任务条件、时序依赖、第一人称视频

一句话总结

GazeFlow 用视频局部特征和全局任务 token 条件化整段视线轨迹的流匹配生成,在 EGTEA Gaze+ 上取得 F1 0.491、平均角度误差 9.01,同时改善轨迹位移统计,但其默认模型依赖未来帧,不能直接当作在线眼动追踪器。

研究背景与动机

第一人称相机记录了佩戴者看到的场景,却不直接记录眼睛注视哪里。若能仅从视频推断视线,就可能减少眼动硬件和标定的成本,并服务于注视点驱动的视频压缩、辅助理解和模仿学习。难点不是找到每帧最显眼的像素:人在同一场景里可以选择不同注视目标,但选择并非任意,既受任务意图影响,也受到注视与扫视交替的时间结构约束。

逐帧回归容易把多个合理目标平均成一个并不合理的位置;GLC 一类热图模型能保留单帧不确定性,却不保证从各帧热图独立抽出的点构成自然轨迹。AT 和 EgoM2P 用递归或自回归引入历史依赖,但逐步生成可能积累误差。另一方面,当前帧的局部显著性不足以判断用户下一步要处理什么,整段视频中的后续动作往往能反过来解释当前注视,因此本文选择离线、完整窗口条件下的分布建模。

作者把观测到的一条标注轨迹视为视频条件分布的一次实现,而不是唯一正确答案。核心 idea:让带时序交互的速度网络同时读取逐帧视觉证据和视频提炼的任务上下文,把整段高斯噪声运输成一条连贯视线轨迹,而不是先生成独立热图再拼接轨迹。

方法详解

整体框架

输入是第一人称视频窗口,输出是每帧二维视线坐标组成的整条轨迹。双路视频条件先提供“当前画面有什么”和“这段活动整体在做什么”;条件速度网络随后反复更新整条带噪轨迹;轨迹流运输从不同噪声起点生成多种可能的视线行为。长视频采用重叠窗口融合,评测热图则由多个轨迹样本的单帧边缘分布近似得到。

这里有两条不同的时间轴:视频帧索引表示行为发生的先后,流时间表示从噪声到轨迹的生成进度。一次速度网络调用会处理窗口内所有帧,不是每调用一次就预测下一视频帧。默认训练窗口包含 64 帧,生成器是在该窗口内联合建模,而不是对任意长视频直接执行一个全局 ODE。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    V["第一人称视频窗口"] --> C["双路视频条件"]
    C -->|逐帧视觉与全局任务 token| N["条件速度网络"]
    X["带噪整段轨迹<br/>及流时间"] --> N
    N -->|整段坐标速度| F["轨迹流运输"]
    F -->|下一积分步| X
    G["标注轨迹与随机噪声"] -.->|仅训练:速度回归监督| N
    F -->|多窗口轨迹样本| W["重叠窗口融合"]
    W --> O["长轨迹或采样热图"]

关键设计

1. 双路视频条件:让局部视觉证据与活动上下文分工

底层视觉分支使用 V-JEPA 2 ViT-L,将帧缩放为 256×256 后得到 16×16 的空间 token 网格。原始特征宽度为 1024,再投影到 256,加入二维正弦位置编码,经逐帧的两层 Transformer 整理空间信息。这个额外空间编码器不跨帧混合;不过 V-JEPA 2 本身是视频骨干,不能把“逐帧读取条件”理解为骨干完全没有时间上下文。

任务分支先对空间 token 求平均得到每帧摘要,再沿时间求平均形成一个全局 token。只靠均值可能稀释少数关键动作,所以增加 4 个可学习查询,对全部帧摘要做交叉注意力;最终任务库包含全局 token 和 4 个查询输出。它相当于从同一视频抽取低带宽但可选择的活动线索,不是把人工动作类别或语言指令输入模型。

这种分工尤其适用于手部操作:局部空间特征辨认当前物体位置,全局任务线索帮助判断哪个可见物体更值得注视。动作、动词、名词标签只用于训练后线性探针,不是视线模型的必需监督;Ego4D 子集没有这些标签,模型仍能训练。探针结果支持任务 token 含有语义,但并未证明这些 token 等同于可直接解释的人类心理意图。

2. 条件速度网络:每次更新都兼顾轨迹依赖、当前画面和任务

每帧的带噪二维坐标和流时间被嵌入为一个视线 token,然后通过 6 个 DiT 风格块。每块按顺序执行带一维 RoPE 的视线自注意力、同帧视觉交叉注意力、任务交叉注意力和前馈网络,最后线性输出每帧的二维速度。注意力采用 8 个头,模型宽度为 256。

视线自注意力使窗口内各帧的候选位置彼此约束,这是速度网络中视线 token 直接跨帧交互的通道。RoPE 用相对帧距离表达相邻注视的联系,而非依赖某帧恰好位于裁剪窗口的第几个位置。默认没有因果掩码,因此一个位置可以参考前后两侧的候选轨迹状态。

视觉交叉注意力只让某帧的视线 token 读取该帧空间 token,避免把不同帧的物体坐标直接混在一起;任务交叉注意力则让所有帧读取共享任务库。两者都在每个 DiT 块中使用,而不是只在输入处拼接一次,所以任务条件能随当前候选轨迹变化重新被查询。

任务残差有逐层、逐通道的 sigmoid 门,门参数初始为 -2,初始权重约 0.12;视觉残差没有此门。随机初始化的任务查询因此不会一开始就强烈扰动视觉预测。附录观察到部分自注意力头偏向回看、部分偏向前看,也发现视觉注意力对手和操作物体有不同偏好;这些是模型行为分析,不是额外的手部、物体或扫视监督分支。

3. 轨迹流运输:用完整路径的随机性代替逐帧独立采样

初始状态是整条轨迹空间中的标准高斯噪声。速度网络告诉每个坐标在当前生成阶段应向哪里移动,数值积分持续修改所有帧,终点就是一个轨迹样本。重新抽取噪声会产生另一条轨迹;默认并行生成 50 条,每条使用 50 个显式 Euler 步。视频条件只编码一次,后续积分复用,避免每一步重新运行骨干。

\[ \mathbf{x}_0\sim\mathcal{N}(\mathbf{0},\mathbf{I}_{2T}),\qquad \frac{d\mathbf{x}_s}{ds}=\mathbf{v}_\theta(\mathbf{x}_s,s,\mathbf{c}),\qquad \hat{\mathbf{g}}=\mathbf{x}_1. \]

此处 \(T\) 是视频帧数,\(s\) 是流时间,\(\mathbf{c}\) 包含两路视频条件。整条轨迹共享运输过程和跨帧自注意力,因而可以表达“注视保持一段时间,再转向另一个目标”,并非从每帧各抽一点后事后平滑。模型没有显式规定注视时长或扫视生理参数,这些规律要由轨迹数据学得。

附录 B 的理论依据是:如果各帧条件边缘分布被完美估计,它们的乘积仍会丢失跨帧依赖,剩余 KL 误差对应条件总相关;人口分布层面,理想 CFM 速度回归可恢复目标分布。这说明联合建模的必要性,却不是有限数据、有限模型或有限 Euler 步下已恢复真实人类分布的证书。

实现还加入自条件化:把上一步估计的干净轨迹作为额外输入,第一步从零开始。训练中有一半机会提供该估计,另一半使用零输入;推理时每步都启用。这样模型可以利用已有的整体路径猜测继续修正,而不是每次只根据当前噪声状态重新推断。

4. 重叠窗口融合:扩展视频长度,但不夸大全局联合性

长视频被切成长度 64、步幅 32 的窗口,各窗口独立编码和采样,重叠位置按帧索引线性插值,使权重从前窗口逐渐转向后窗口。短视频重复最后一帧填充,输出再截回实际长度,填充位置不参与训练损失。这个方案解决接缝和内存问题,但相邻窗口不是由同一个完整长视频联合模型共同采样,融合也没有提供全局概率一致性的证明。

当任务需要热图时,在每帧的 50 个样本点上放置标准差 25 像素的高斯核,再求平均。它把联合生成结果转为单帧边缘热图,以便和 GLC 等热图方法比较;热图评测的提升并不自动等于抽取一条样本轨迹时也有同样精度。坐标训练归一化至 \([-1,1]\),热图生成前恢复到评测所用像素空间。

一个完整示例

以一段“切番茄”的 64 帧窗口说明机制,这只是流程示例,不是另报一项实验。空间 token 包含手、刀和番茄等局部证据;任务库从整段帧摘要提取操作上下文,并不需要输入“切番茄”这个类别。初始高斯轨迹在各帧没有可用注视含义,DiT 反复借助同帧物体信息、全局任务和跨帧位置关系,逐渐形成注视目标与转移顺序。

50 次不同噪声采样可以得到不同合理路径,单帧平均热图表示这些路径的边缘分布。若视频继续超过一个窗口,则下一窗口独立生成,再在 32 帧重叠区融合;不能由此声称两段采样已经恢复了任意长度的真实联合分布。若佩戴者突然看向相机画外的目标,当前输入缺少该目标证据,模型仍可能集中在可见物体上。

损失函数 / 训练策略

正文与算法 1 使用线性插值:在标注轨迹与随机噪声之间选一个中间状态,让网络回归从噪声到标注的速度。对 EGTEA 的眨眼和短片填充位置用有效性掩码屏蔽,训练轨迹仍保留有效的注视和扫视帧,不是只拿注视点训练。

\[ \mathbf{x}_s=(1-s)\mathbf{x}_0+s\mathbf{g},\qquad \mathcal{L}_{\mathrm{CFM}}= \mathbb{E}_{\mathcal{V},s,\mathbf{x}_0,\mathbf{g}} \left[\left\|\mathbf{m}\odot\left(\mathbf{v}_\theta(\mathbf{x}_s,s,\mathbf{c})-(\mathbf{g}-\mathbf{x}_0)\right)\right\|_2^2\right]. \]

附录 E.4 的实际超参数另外指定 OT 形式插值,\(\mathbf{x}_s=(1-(1-\sigma_{\min})s)\mathbf{x}_0+s\mathbf{g}\),其中 \(\sigma_{\min}=10^{-3}\),并称它相对正文线性插值只是小修正。两者不是字面相同的路径,尤其终点仍有微量噪声;这里分别记录,不能把正文式子直接称为实现的精确完整目标。自条件化也是正文简化算法未展开的实现细节。

视频骨干只训练 query/value 投影的 LoRA,秩 16、缩放系数 32、dropout 0.05,其余骨干权重冻结;投影和速度网络参与训练。使用 AdamW,学习率从 \(10^{-4}\) 余弦衰减至 \(10^{-6}\),最多 80 个 epoch,有效 batch 为 16,权重衰减 \(10^{-4}\),梯度裁剪范数 1.0;EMA 衰减为 0.995,评测使用 EMA 权重,早停耐心值为 15。

训练在 4 张 H100 上使用 BF16,EGTEA 和 Ego4D 分别约需 3 天和 5 天。附录估计可训练参数约 12.2M,速度网络约 10.4M,视频骨干约 327.8M;这些都是原文近似统计,不能将冻结骨干忽略后声称整个模型仅有十余百万参数。

实验关键数据

主实验

EGTEA Gaze+ 为烹饪视频,训练/验证片段数为 8,299/2,022,原始分辨率 640×480、24 fps;Ego4D Aria 视线子集为 12,178/5,202,分辨率 1088×1080、30 fps。主对比使用 LoRA 模型和完整验证划分;指标先在片段内对帧平均,再对片段平均,不使较长片段自动获得更大权重。

下表选取原文表 2 的核心定位指标。F1 为阈值扫描后的 Adaptive F1,P/R 取对应阈值;AAE 为平均角度误差,越低越好。附录先写“固定阈值”再说明扫描协议,本笔记采用后者的具体定义,不称其为统一预设阈值结果。

数据集 方法 AUC ↑ F1 ↑ Recall ↑ AAE ↓
EGTEA Gaze+ GLC 0.953 0.421 0.531 10.21
EGTEA Gaze+ AT 0.956 0.419 0.547 9.88
EGTEA Gaze+ EgoM2P LoRA 0.921 0.293 0.515 12.81
EGTEA Gaze+ GazeFlow 0.964 0.491 0.603 9.01
Ego4D GLC 0.947 0.355 0.530 11.52
Ego4D AT 0.954 0.346 0.487 12.01
Ego4D Random Walk 0.763 0.109 0.662 14.38
Ego4D GazeFlow 0.958 0.392 0.540 10.46

相对两数据集最强 F1 基线 GLC,F1 增幅分别为 16.6% 和 10.4%;EGTEA 的 AAE 相对 AT 从 9.88 降到 9.01。不能把这些概括成“所有指标均第一”:Ego4D Random Walk 的 Recall 0.662 高于本文 0.540,附录表 9 中 AT 的 Ego4D KL 2.156 也优于本文 2.213。

下表来自表 3,衡量 EGTEA 的整条路径及帧间移动。ADE 为逐帧欧氏距离平均;DTW 为单调时间对齐后的长度归一化距离。两者单位均为 100 像素,Best 是在 50 个样本中利用真值取最优,不能解释成部署时无需真值就能挑出的结果。位移均值/中位数相对人类参考取比值,人类参考分别为 12.5/4.0 像素;JSD 比较 100-bin 位移直方图,使用自然对数。

方法 ADE Mean ↓ ADE Best ↓ DTW Mean ↓ DTW Best ↓ 位移均值比 位移中位数比 JSD ↓
GLC 1.13 1.01 1.03 0.87 5.77 11.75 0.352
AT 1.32 1.12 1.22 0.99 9.70 24.55 0.476
EgoM2P LoRA 1.50 0.96 1.37 0.81 2.69 3.03 0.058
GazeFlow 1.04 0.60 0.95 0.48 0.82 1.08 0.002

消融实验

以下来自表 6,使用冻结编码器和固定 EGTEA 验证子集,不是上面完整验证集的 LoRA 模型。ADE/DTW 列在此省略,因为原表没有像表 3 那样直接标明 Mean/Best,避免把协议含糊的数值混入主轨迹比较。

配置 AUC ↑ F1 ↑ AAE ↓ 位移中位数比 JSD ↓
完整模型 0.970 0.493 8.81 1.08 0.0011
去掉逐帧视觉条件 0.961 0.431 9.22 1.17 0.0012
去掉任务条件 0.965 0.476 9.14 1.09 0.0013
去掉时间 RoPE 0.968 0.477 8.94 1.40 0.0027
确定性回归替代联合生成 0.903 0.451 9.12 2.01 0.0729

去视觉条件的 F1 损失最大;去 RoPE 对位移分布的影响比 AUC 更明显。回归替代同时改变随机分布建模和轨迹耦合,不能把该消融当作只隔离“CFM 优于所有其他联合生成器”的证据。更直接的生成目标比较在附录表 15:同网络、50 步时 CFM/扩散 F1 为 0.493/0.485,5 步时为 0.506/0.359,显示这里的 CFM 更适合低步数采样。

关键发现

  • 任务库并非仅靠全局均值:表 5 去掉可学习查询后 F1 从 0.493 降至 0.484,改为条件拼接降至 0.469。线性探针表 4 中全局 token 的动作 Top-1 为 49.1%,两个探针预测取并集为 54.6%;这个“至少一个探针答对”的并集不是单一联合分类器精度。
  • 默认单 H100、64 帧、50 样本和 50 步耗时 3.37 秒,编码约 450 毫秒,采样约 2.92 秒,峰值显存 9.2 GB。表 10 的 30 样本、5 步配置耗时 0.73 秒、F1 0.493;它提高离线吞吐,但仍需完整输入窗口。
  • 表 12 的样本数分析中,单样本 ADE/DTW 为 1.05/0.96,50 样本均值为 1.04/0.95,最优值则降至 0.60/0.48。因此多采样的主要路径收益是覆盖更多候选,不是每条样本都变准。表 10 与表 12 的单样本 F1 分别为 0.405 和 0.398,原文未说明差异原因,不将两次 sweep 合并成同一数值。
  • 因果变体表 14 的 F1 从 0.493 降至 0.437,但 AAE 从 8.81 改善至 8.71;不能声称所有指标都下降。子集过滤后含 1,536 个帧级配对观测,作者使用 Wilcoxon 检验;相关视频帧的显著性不等同于跨训练随机种子的稳定性证明。

亮点与洞察

  • 把“位置准”和“移动像人”分开评估,是本文较有价值的实验视角。逐帧指标好的模型仍可能生成跳跃过大的路径,因此视线应用不宜只看热图 F1。
  • 全局均值加少量可学习查询提供了一种无需动作标签的任务条件提取方式。可借鉴到视频条件行为轨迹生成,但应通过下游任务与干预实验检验其语义,而不只看注意力图。
  • 减少 Euler 步数并未在此设置下必然降低热图准确率。工程上应同时扫描样本数和步数,而不是把主实验保守预算当成唯一可用部署配置。

局限与展望

  • 默认模型读取未来帧,只适用于离线估计或允许整段缓存的场景;因果变体另有准确率取舍。窗口吞吐 88 fps 不表示对新到达帧具有低延迟因果预测能力。
  • 视频条件已经固定了头部运动,模型估计的是该视频下剩余的眼动变化,不是不同观察者自由转头时完整的头眼联合行为。可扩展到头部与眼动共同生成。
  • 相机视野外扫视缺少目标视觉证据,记录还可能把真值夹在图像边界。更宽视野、画外状态检测和扫视事件建模比单纯加强可见物体显著性更有针对性。
  • 每段视频只有一条人类轨迹,采样数量多、位移 JSD 小都不能证明条件分布已校准。需要重复观察、多用户轨迹以及覆盖率、概率校准等评测;Best-of-50 还应与无真值选择或平均样本结果并列报告。
  • 基线协议并非完全同构:AT 在 Ego4D 因无注视/扫视事件标签只重训 SP 阶段;Random Walk 使用上一帧真值,是带特权历史的参考而非普通无眼动输入预测器。附录对部分基线写统一上采样至 480×640,而热图转换又写原生评测分辨率,具体跨分辨率实现仍应查代码,不能从文本猜补。

相关工作与启发

  • vs GLC:GLC 借全局局部关联预测逐帧热图;GazeFlow 先联合生成轨迹,再估计单帧热图。区别在建模对象,不是“GLC 完全不读全局视频”。
  • vs AT / EgoM2P:前者通过递归注意力转移、后者通过离散视线 token 自回归表达历史依赖;本文更新整条连续轨迹,避免逐帧自回归滚动,但付出多次速度网络计算和完整窗口条件的代价。
  • vs 扩散视线生成:DiffEye 面向自然图像条件眼动生成,本文面向第一人称视频条件轨迹。本文同架构扩散替代实验支持其低步数优势,不足以推出流匹配对所有图像或视频眼动生成都更好。
  • 可延伸问题:把窗口边界当成显式概率连接问题,设计带重叠轨迹条件的跨窗采样,并用重复人类观看数据检查长程一致性与校准;这是由本文边界推导的研究方向,不是作者已完成的实验。

评分

  • 新颖性: 4/5 — 将行为机制、双路视频条件与联合轨迹流匹配连成明确方案,贡献主要在任务建模与架构组合。
  • 实验充分度: 4/5 — 两个数据集、轨迹指标、消融和成本分析较完整,但缺重复观察分布验证与跨种子误差条。
  • 写作质量: 4/5 — 方法主线清楚,附录提供训练细节;插值、阈值及部分表号/协议表述需区分阅读。
  • 价值: 4/5 — 为离线第一人称视线估计提供有用基线,实时与画外行为仍有明确限制。