Infinite Gaze Generation for Videos with Autoregressive Diffusion¶
会议: ECCV 2026
论文: ECCV 2026 官方页 / 项目页
领域: 人体理解 / 视频理解
关键词: 注视轨迹生成, 自回归扩散, 视频显著性, 长视频建模, 眼动预测
一句话总结¶
本文首次把视频注视预测做成「任意长度视频上的原始注视轨迹生成」:给 UNISAL 加一个压缩瓶颈,把逐帧视频刺激压成低维显著性潜变量并每 5 帧注入一次扩散主干,再用最近 90 帧(3 秒)注视坐标当干净历史前缀、以滑动窗口方式自回归去噪未来 45 帧(每秒 30 个采样点的连续 x,y 坐标),在 DIEM 与 DHF1K 上的 Levenshtein、DTW、最大时序相关性均优于 6 个被适配到视频域的图像注视/扫描路径模型(离散 Fréchet 距离除外)。
研究背景与动机¶
人类注视建模长期走两条路线:一条是显著性图,给出与时间无关的空间概率分布(DeepVS、UNISAL 等视频显著性模型);另一条是扫描路径,把眼动离散成有先后的注视点序列(DeepGaze III、GazeFormer、HAT、TPP-Gaze 等)。这两套抽象在静态图像上足够好用,代价却是把原始眼动数据里的高频时序动态压平了——视频里最常见的平滑追踪(smooth pursuit)在注视点序列里几乎表达不出来。更麻烦的是,现有模型的评测窗口普遍固定在 3–5 秒量级,而真实内容里的观看行为依赖跨越更长的时间尺度:观众可能在几十秒后才因为场景里重新出现的物体改变策略,短窗模型看不到这类长程依赖,也就无法合成真正长时段的注视行为。
与此同时,高保真眼动数据的采集受限于昂贵硬件、繁琐标定与隐私约束,这让「生成」而非「采集」注视数据成为刚需。近期视频世界模型已经证明可以逐帧因果地生成内容,这提示了一条新路径:把人的注视本身当作被生成的对象,让模型在观察动态世界的同时持续产出下一步看哪里。难点在于,图像帧的信息量比单张图像大一个量级,逐帧 RGB 条件既昂贵又冗余;而定长窗口的全序列扩散模型只会生成固定长度片段,天然不适合变长外推——要生成任意长的轨迹,模型必须既能消费流式的视觉输入,又能把自己的历史输出当作条件滚动下去。
本文的做法是把视频逐帧喂进模型,每预测完一段就把新生成的注视坐标回填进历史缓存,由一个扩散模型在这个自回归窗口内去噪未来的注视坐标。作者抓住的一个关键观察是:对「什么会引起眼动」这件事而言,显著性比通用视觉特征更强也更省——显著性图的每个像素值本身就等于被注视的概率,与待预测的坐标处在同一个语义空间。于是条件不再是 RGB 或通用视觉 token,而是压缩过的显著性潜变量。核心 idea:把显著性潜变量条件与「干净历史前缀 + 噪声未来窗口」的自回归扩散结合,让扩散模型在滑动窗口里流式生成任意长度视频的原始注视轨迹。
方法详解¶
整体框架¶
形式化地,视频刺激记为 \(V=\{I_t\}_{t=1}^{T}\),\(I_t\in\mathbb{R}^{H\times W\times 3}\),目标是预测注视轨迹 \(R\in\mathbb{R}^{T\times 2}\)——每个时间步是一个帧内二维坐标 \((x,y)\),采样率高到每秒 30 个点,因此生成的是连续的原始眼动而非若干离散注视点。沿用 DiffEye 的建模方式,注视预测被写成一个条件生成问题 \(p_\theta(R\mid V)\),用 DDPM 去逼近注视轨迹的条件分布,噪声预测网络是层次化 1D 卷积块加多尺度自注意力、并用正弦嵌入注入扩散时间步的 U-Net。在这个骨架上,本文只做两处改动:把生成过程改写成自回归形式,以及重新设计视频刺激的条件机制。
端到端看,整条管线是流式的:视频逐帧进入显著性分支,产出压缩后的显著性潜变量;扩散主干每一轮同时吃三样东西——干净的注视历史前缀、待去噪的未来窗口、以及每隔 5 帧注入一次的显著性潜变量;采样结束后把新坐标接到历史尾部、整个窗口右移,如此往复,轨迹长度只受视频时长限制。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["视频帧流 + 注视历史缓存"] --> B["显著性潜变量条件<br/>逐帧提取、每 5 帧注入"]
B --> C["自回归扩散去噪<br/>90 帧干净历史 + 45 帧噪声未来"]
C --> D["滑动窗口滚动推理<br/>采样结果回填历史"]
D -->|窗口右移,复用刚生成的坐标| C
C --> E["任意长度原始注视轨迹"]
关键设计¶
1. 显著性潜变量条件:把视频刺激压成「人可能看哪里」的低维编码
视频条件的第一重困难是体量:逐帧 RGB(或逐帧视觉 token)既慢又冗余,而视觉 tokenizer 给出的离散全局摘要与注视行为之间隔着一层需要模型自己学的隐式映射。作者的第二重观察更关键——对诱导眼动而言,像素外观并不是最相关的信号,显著性才是更强也更直接的事前概率。因此条件改用视频显著性图:单通道、语义明确,且与内容外观解耦,显著性值本身就等于该空间位置被注视的概率。
具体做法是以视频显著性模型 UNISAL 为骨干,但现有显著性模型是为预测精度而非紧凑表示设计的,于是作者在它的 encoder–decoder 之间插入压缩瓶颈:RNN 通道数从 256 降到 64,encoder 输出的潜变量再用 2D 平均池化压缩空间维度;压缩后的显著性潜变量通过扩散主干每个 block 的 cross-attention 注入。显著性特征逐帧提取并沿时间拼接,但条件只按降低后的时间频率(每 5 帧)施加一次,进一步压低算力开销。这样做的收益在效率对比里被量化得很清楚:相比直接拿原始像素当条件,参数从 32.33M 降到 8.27M、前向 FLOPs 从 71.65G 降到 1.18G、峰值显存从 974.90MB 降到 49.50MB,吞吐反而从 17.61 提升到 49.19 samples/s。消融也支持「形状比大小更重要」这一判断:换成 MAGVIT2 的通用 token 条件后模型直接不收敛,DTW 从 12.33 恶化到 54.92。⚠️ 论文未明确交代显著性分支(UNISAL)是与扩散主干联合训练还是冻结复用,以原文为准。
2. 自回归扩散去噪:用干净历史前缀锚定,只去噪未来窗口
定长窗口的全序列扩散无法外推变长轨迹,而逐点递归又容易让误差回灌、条件分布漂移。本文借自回归扩散(Diffusion Forcing 一类)的范式,把一段长度为 \(n\) 的注视片段在输入向量里拆成两半:前 \(k\) 个坐标是条件前缀,代表已经发生的历史;后 \(n-k\) 个坐标是要生成的未来。训练时从真值片段中随机采样长度为 \(k\) 的历史窗口,模型在给定历史 \(R_{1:k}\) 与视频条件 \(S\) 下预测 \(R_{k+1:n}\),扩散损失只在被预测的那一段上计算:
历史段既不参与加噪也不贡献损失——它是「已经发生的事实」,而不是待去噪的变量。历史长度取 \(k=90\) 帧(约 3 秒),依据是视觉工作记忆在 1–6 秒内衰减的心理学测量,取中点以在时间上下文、噪声与算力之间折中。
这样设计的好处在训练与推理的一致性上:因为历史始终是干净的,模型不需要去猜自己「已经看过」的轨迹,条件分布更稳定;又因为监督信号只压在未来段,模型学到的是「给定过去与当前场景,接下来会看哪里」的映射,这与推理时把已生成坐标当作历史继续外推的用法完全对齐,中间不存在训练/推理的分布错位。
3. 滑动窗口滚动推理:任意长度轨迹的流式生成
推理阶段没有真值可依赖,模型迭代地把最近 \(k\) 个已生成坐标当作条件输入去预测后续注视点,新生成的结果接回历史缓存、窗口整体右移,轨迹于是可以一直延伸。由于条件窗口长度恒定,单步计算量与视频总长无关,模型便能处理任意长度的视频——这就是标题里 "infinite" 的实际含义:不是训练出超长序列,而是把 3 秒窗口无限次滚动。
作者还检验了这个窗口的初始化有多关键。主实验用 90 帧真值历史做热启动;把初始缓存换成单个真值坐标复制 90 次(等于零速度冷启动、抹掉全部速度与方向线索)后,Levenshtein(3.41 对 3.40)与最大时序相关性(0.235 不变)几乎完全一致,只有 DTW 从 12.33 微升到 12.39,作者归因于历史尚未通过自回归建立起来时的初始错位。这说明模型并不依赖历史中显式的运动线索,注视的动态可以从显著性潜变量与自回归过程本身恢复。窗口预设也决定了长程一致性的上限:把预测段拉长到 90 帧时,Levenshtein 从 3.40 升到 3.77、DTW 从 12.33 升到 14.65,自回归误差的累积清晰可见——这正是作者在局限中承认的「固定长度滑动窗口承载不了更长程的记忆」。
损失函数 / 训练策略¶
训练目标就是上式的 DDPM ε-预测损失,只加噪并监督未来段。噪声调度为线性,范围 \(1\times10^{-4}\) 到 \(2\times10^{-2}\);训练用 1000 步扩散,采样改用 DDIM 压到 50 步以在几乎不损质量的前提下提速。优化器为 Adam,常数学习率 \(1\times10^{-4}\),共训练 70 个 epoch。关键超参:历史长度 90 帧、预测长度 45 帧、显著性条件每 5 帧注入一次、注视采样率每秒 30 个点;训练使用 DIEM 的 80% 划分。
实验关键数据¶
主实验¶
实验在 DIEM(域内基准:84 段视频,1280×720,时长 30–209 秒,平均 67 名观察者,累计观看时长 553,116 秒)与 DHF1K(泛化性检验:1,000 段视频,17–42 秒,640×360,17 名观察者,按慢/快镜头运动与慢/快场景运动四类各取 4 段共 16 段评测)上进行,DIEM 按 80/20 划分训练与测试。指标全是路径级的:Levenshtein 距离衡量序列顺序结构的相似性,离散 Fréchet 距离衡量沿轨迹的最大逐点偏差,DTW 衡量允许速度/长度差异的最优对齐,最大时序相关性衡量两条时序信号的最高互相关。评测时每个视频生成 10 条轨迹,与多条真值路径两两比较,分别报告 best(10 次比较中的最优)与 mean(10 次平均),best 反映峰值能力、mean 反映一致性。由于本文是首个视频注视轨迹生成模型、没有直接基线,作者把 6 个图像域方法适配到视频:按 3 秒分块生成再拼接,每块只喂首帧(基线均为单图模型),可控制起始位置的模型(HAT、DeepGaze III)用上一块的末位置作为下一块起点,并把所有基线的采样密度统一重采样到本文的每秒 30 个点、DiffEye 则均匀降采样。
下表为 mean 口径(best 口径下结论一致,本文在 DIEM/DHF1K 的 Levenshtein best 分别为 3.31 / 1.50):
| 数据集 | 方法 | Levenshtein ↓ | Disc. Fréchet ↓ | DTW ↓ | Max Temp Corr. ↑ |
|---|---|---|---|---|---|
| DIEM | DeepGaze III | 4.36 | 4.78 | 20.07 | 0.149 |
| DIEM | DiffEye | 3.78 | 3.82 | 12.47 | 0.176 |
| DIEM | GazeFormer | 4.26 | 4.17 | 15.64 | 0.188 |
| DIEM | HAT | 4.45 | 5.16 | 23.44 | 0.131 |
| DIEM | Chen et al. | 4.23 | 4.36 | 15.97 | 0.175 |
| DIEM | TPP-Gaze | 4.26 | 3.60 | 15.17 | 0.131 |
| DIEM | 本文 | 3.40 | 4.14 | 12.33 | 0.235 |
| DHF1K | DeepGaze III | 3.61 | 3.12 | 11.12 | 0.136 |
| DHF1K | DiffEye | 1.76 | 2.34 | 4.24 | 0.232 |
| DHF1K | GazeFormer | 1.76 | 2.49 | 4.43 | 0.258 |
| DHF1K | HAT | 1.84 | 3.12 | 6.08 | 0.179 |
| DHF1K | Chen et al. | 1.77 | 2.54 | 4.70 | 0.265 |
| DHF1K | TPP-Gaze | 1.78 | 2.34 | 4.30 | 0.225 |
| DHF1K | 本文 | 1.57 | 2.50 | 4.01 | 0.290 |
效率上,把显著性潜变量压缩条件换成原始像素条件后:参数量 8.27M 对 32.33M(3.91× 更少),检查点 37.89MB 对 348.54MB(9.20× 更小),数据加载 0.0085s 对 0.6353s(74.85× 更快),前向 FLOPs 1.18G 对 71.65G(60.95× 更少),吞吐 49.19 对 17.61 samples/s(2.79× 更高),峰值显存 49.50MB 对 974.90MB(19.69× 更低)。
消融实验¶
下表为 DIEM 上的消融(默认设置:90 帧历史、45 帧预测):
| 配置 | Levenshtein ↓ | Disc. Fréchet ↓ | DTW ↓ | Max Temp Corr. ↑ | 说明 |
|---|---|---|---|---|---|
| 本文默认 | 3.40 | 4.14 | 12.33 | 0.235 | 90 帧历史 + 45 帧预测 |
| 预测 10 帧 | 3.97 | 3.67 | 17.31 | 0.048 | 短程更简单、漂移更小,但长序列上鲁棒性下降、时序相关性崩塌 |
| 预测 90 帧 | 3.77 | 4.38 | 14.65 | 0.230 | 自回归误差累积,长程不确定性上升 |
| 无初始历史(冷启动) | 3.41 | 4.13 | 12.39 | 0.235 | 单点复制填满窗口,Levenshtein 与时序相关性不变 |
| MAGVIT2 通用 token 条件 | 3.82 | 7.97 | 54.92 | 0.054 | 通用 tokenizer 条件训练不收敛,全面崩坏 |
作为条件机制的补充对照,作者还重训了一个「DiffEye + 同样的显著性潜变量、但不做自回归」的模块化基线:在各自原生 3 秒窗口下(表 2 口径)它的 DTW 为 2.224、最大时序相关性仅 0.037,而本文为 1.599 / 0.156——说明增益来自「显著性条件 + 自回归扩散」的组合,单独给 DiffEye 换上显著性条件并不够。
关键发现¶
- 条件信号的「形状」比「压缩率」重要得多:MAGVIT2 通用 token 条件把 DTW 从 12.33 推到 54.92、最大时序相关性从 0.235 掉到 0.054,训练直接不收敛;而显著性潜变量在参数少 3.91×、FLOPs 少 60.95× 的前提下反而训练稳定。这支持了作者的核心判断——与注视同语义的概率型表示(显著性)比通用视觉摘要更适合当注视生成的条件。
- 预测长度存在明确的折中:10 帧短预测的离散 Fréchet mean 更低(3.67 对 4.14),说明短程建模更简单、漂移更小;但它的 DTW 恶化到 17.31、时序相关性只剩 0.048,在整段视频上并不稳。拉到 90 帧则相反,误差累积让 Levenshtein 与 DTW 双双变差。45 帧是短期精度与长期稳定性的最佳平衡点。
- 历史前缀的作用比想象中弱,但并非无用:冷启动实验里 Levenshtein 与时序相关性几乎不变,只有 DTW 略升,说明运动动态也能从显著性潜变量里恢复;不过这些条件是训练时随机采样窗口、且历史始终干净的前提下得到的,长程仍靠窗口滚动维持。
- 离散 Fréchet 与人类感知不一致:本文在它上面并非最优(TPP-Gaze 在 DIEM mean 上 3.60 更低)。作者做了用户研究:从两个数据集各随机取 3 段视频共 6 段,按离散 Fréchet 选出两边最接近真值的预测,以移动圆点叠加在视频上,12 名被试在可反复回放后选择更像真值的一条。本文在 85% 的情况下被选中(逐视频为 67% / 83% / 83% / 92% / 100% / 83%,每一条都更高)。作者据此认为该指标强调轨迹上的最大逐点偏差,对视频中常见的短促扫视与轻微时序错位过度敏感,不适合评价视频注视的全局时序结构。
- 方法在长窗口与原生 3 秒窗口下都占优:长窗口评测里除离散 Fréchet 外的指标全面最好;原生 3 秒窗口下趋势相同,Levenshtein mean 0.447(第二好为 0.461)。
亮点与洞察¶
- 把「人的注视」当作世界模型的生成目标:以往自回归扩散/世界模型生成的是视频帧或动作,本文把它转向人类对动态场景的行为反应,用同一个范式产出连续眼动轨迹——这是一条可以推广到鼠标轨迹、驾驶行为、机器人操作等连续人类行为数据的思路。
- 条件设计与被预测目标同语义空间:显著性图的值本身就是「被注视的概率」,与要去噪的注视坐标同源,所以条件不必再经模型翻译。这个「让条件与输出共享语义」的原则,对任何条件生成任务都有借鉴价值:与其喂通用表征,不如喂一个已经指向目标量的先验。
- 压缩瓶颈是显式设计原则而非事后优化:视频条件的信息体量是流式生成的主要瓶颈,本文用「降 RNN 通道 + 空间池化 + 降时间注入频率」三板斧把条件从 71.65G FLOPs 压到 1.18G,同时不损指标。这种「先想清楚条件里真正需要保留什么」的做法,比直接上更小的编码器更有解释性。
- 干净历史 + 只在未来段监督:把历史当条件而非待去噪变量,使训练分布与「用自己的生成结果继续外推」的推理用法对齐,是一个可以直接搬到任何自回归扩散系统的技巧。
- 先质疑指标再补人类评测:面对唯一落败的指标,作者没有回避,而是用用户研究证明指标与感知不一致,并明确指出「所有轨迹指标都只与单条真值路径两两比较、无法反映注视的多模态性」。这种处理方式比强行调参冲榜更有价值。
局限与展望¶
- 长程记忆缺失:模型只依赖固定长度(90 帧 / 3 秒)的滑动窗口,无法承载更长时距的行为依赖;在人眼观看中,数十秒前的场景理解会影响当下选择,静态镜头与持续背景结构下尤甚。作者建议借鉴视频世界模型里维护长期空间记忆的机制。
- 评测指标的固有缺陷:现有轨迹指标都以单条真值路径做两两比较,既不能反映人类注视的多模态性(多条风格迥异的路径可能同样合理),离散 Fréchet 还对局部离群点高度敏感。作者呼吁设计与感知有效性对齐的新指标。
- 未建模头部运动:训练数据的注视轨迹在固定头姿下采集,桌面观看场景下问题不大,但在物理世界与宽视场显示(VR/AR)中头动是主要成分。把生成扩展到头部朝向与相对注视的联合建模,是通向模仿学习与 VR/AR 应用的直接一步。
- 我看到的其他局限:其一,"infinite" 的成立依赖窗口滚动,但消融显示预测段拉长即误差累积,视频越长累计漂移是否仍在可接受范围,论文没有给出按视频时长分档的结果(只在 3 秒与全长两个口径上评测);其二,推理时需要 90 帧真值历史热启动,冷启动虽被验证鲁棒,但「完全从零、无任何真值」的极端设定未被评测;其三,显著性分支的能力上限直接约束生成质量,若换成更弱/更强的显著性模型,结论是否稳固未做敏感性分析;其四,评测指标均为路径距离,缺少显著性图常用的 AUC/CC/NSS 之类的空间重合度指标(这是输出从热图换成坐标序列的自然结果),因此与显著性预测文献的横向比较需要谨慎。
相关工作与启发¶
- vs DiffEye:两者共用同一套 DDPM 公式与 U-Net 1D 卷积骨干,但 DiffEye 以图像 patch 特征为条件、只做定长(3 秒)生成;本文改为视频输入 + 显著性潜变量条件 + 自回归滑动窗口。作者的「DiffEye 用同样显著性条件重训但去掉自回归」消融很关键:它把增益拆成两部分,说明单靠显著性条件不够,二者是互补的。
- vs 自回归扩散 / 视频世界模型(Diffusion Forcing、长时空间记忆视频世界模型、EPONA 等):范式相同——用条件化的干净历史去噪未来、支持变长滚动;区别在于被生成的量从视频帧或自动驾驶动作换成了人眼注视坐标,且视频条件被压成显著性潜变量而非 RGB。这也意味着本文可以直接吸收这类工作在长程记忆上的进展。
- vs 360° 内容上的扫描路径生成(ScanDMM、ScanGAN360、ScanTD、VPT360 等):这些方法处理的是球面几何下的注视,但大多建模视口或头部朝向,而非高频 2D 眼动,因此与在常规 RGB 视频上采集细粒度眼动的数据集不可直接比较。这也解释了本文为何要做「无直接基线、自行适配图像方法」的评测设计。
- vs 视频显著性预测(例如作为本文条件骨干的 UNISAL):那些工作输出的是时间无关或弱时序的热图,不给出注视的顺序与时间戳;本文把显著性模型反过来当成条件的特征提取器,用它的潜变量去驱动坐标序列的生成,是一个颇有启发性的角色转换。
- vs TPP-Gaze:它基于神经时序点过程建模注视动力学,是本文在离散 Fréchet 上唯一的「胜者」,但在序列结构(Levenshtein)、时序对齐(DTW)与时序相关性上都落后,且在用户研究中被判为不如本文(仅 15%)。这一对比恰好体现了「点过程指标视角」与「轨迹相似度视角」的差异。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首个面向任意长度视频的原始注视轨迹生成框架,把自回归扩散与世界模型范式成功迁移到人类注视行为建模。
- 实验充分度: ⭐⭐⭐⭐ 两个数据集、6 个适配基线、5 组消融、效率对比与 12 人用户研究俱全;但域内只训 DIEM、DHF1K 仅评测 16 段,且缺少按视频时长分档的长程漂移分析。
- 写作质量: ⭐⭐⭐⭐ 方法叙述清楚、动机具体,对唯一落败指标的处理(承认 + 用户研究 + 反思指标)尤其诚实;篇幅所限部分实现细节(显著性分支是否冻结、UNISAL 的具体配置)交代略简。
- 价值: ⭐⭐⭐⭐ 为「合成人类行为数据」提供了一个可复用范式:显著性潜变量条件 + 干净历史前缀的自回归扩散,可迁移到其他连续行为生成任务;同时指出视频注视评测指标亟待重做。