跳转至

Escaping the Low-Frequency Bias: Adversarial Frequency Perturbation for Generalisable Gaze Estimation

会议: ECCV 2026
论文: ECCV 原文
领域: 人体理解
关键词: 视线估计 / 域泛化 / 频域分析 / 对抗扰动 / 自适应实例归一化

一句话总结

本文揭示了视线估计模型跨域性能骤降的主因在于对源域低频成分的过拟合,提出了无需目标域数据的对抗低频扰动框架(ALFP),通过 PGNet 生成实例级扰动图并在频域利用 AdaIN 混合振幅统计量,显著提升跨域泛化能力。

研究背景与动机

基于深度学习的外观视线估计(appearance-based gaze estimation)近年来取得了显著进展,在虚拟与增强现实、人机交互以及辅助医疗诊断等领域得到了广泛应用。然而,现有方法在跨域场景(如跨数据集评估)下往往出现严重的性能退化。先前的研究普遍将这种域差距归因于空间域的表观差异,例如环境光照条件、背景变化、受试者肤色和外观差异以及相机成像风格等。为了缓解上述表观迁移带来的影响,学术界探索了特征纯化、旋转一致性约束、对比回归和对抗对齐等策略,但这些方案几乎全部在空间像素域操作,未能从频域角度清晰厘清域偏移的物理与统计本质。

从频域的物理特性审视,背景、光照和肤色等导致跨域退化的域特异性因素在空间上均表现为缓慢、平滑的变化,其能量高度集中在低频成分中。通过对标准 CNN(如 ResNet-18)在频域上的梯度敏感度分析,作者发现模型在预测视线时对低频频带表现出极度反常的超高敏感性。更重要的是,诊断性实验证实,若将源域低频振幅成分直接滤除,模型视线预测能力会发生彻底崩溃(平均角误差从 8.54° 飙升至 14.53°);而若在训练期间对低频振幅进行随机尺度缩放扰动,跨域角误差则显著降低至 7.20°。这一对比实验给出了明确的技术启示:低频成分蕴含着面部与眼部的基本轮廓与几何依赖,不能简单粗暴地舍弃,跨域退化的根源在于模型对源域特有的低频分布产生了病态过拟合。

因此,跨域视线估计的关键在于打破模型对源域低频统计特性的依赖,同时保留视线几何与语义所需的频域信息。核心 idea:提出对抗低频扰动框架(ALFP),通过扰动生成网络(PGNet)自适应合成最具攻击性的对抗扰动图,并在频域通过 AdaIN 统计量混合动态扰动输入图像的低频振幅分布,驱动视线估计网络在保留全局结构的同时学习低频鲁棒的不变表征。

方法详解

整体框架

ALFP 的核心目标是在不接触任何目标域数据的前提下,通过对源域图像施加动态的、实例自适应的低频振幅扰动,迫使视线估计网络(GazeNet)摆脱对源域低频风格特征的过拟合。算法流程包含两大核心步骤与交替对抗训练机制:首先,扰动生成网络(PGNet)以 GazeNet 提取的深层图像特征与随机噪声为条件,在有界空间域生成对抗扰动图像;接着,将源图像与扰动图像转换至频域,提取低频圆域内的振幅统计量(均值与标准差),借助 AdaIN 机制进行连续统计混合,并与源图像原本的相位谱重构出低频失真但视线几何完好的增强图像;最后,GazeNet 与 PGNet 展开交替对抗博弈。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入人脸图像 Is"] --> B["特征提取与空间对抗扰动生成<br/>PGNet 结合特征 f 与噪声 z 生成扰动图 Ip"]
    B --> C["基于 AdaIN 的低频振幅统计混合<br/>2D FFT 分离振幅与相位,AdaIN 混合低频统计量"]
    C --> D["逆傅里叶变换重构<br/>混合振幅 Aaug 与原相位 Φs 重构 Iaug"]
    D --> E["双网络交替对抗训练<br/>GazeNet 优化预测一致性,PGNet 最大化预测误差"]
    E --> F["输出:具备跨域泛化能力的视线预测模型 GazeNet"]

关键设计

1. 空间域条件对抗扰动图生成:保证对抗优化稳定性与实例特异性

以往的对抗数据增强若直接在频域搜索振幅矩阵,极易因高维振幅谱具有重尾分布和极端数值范围而引发数值溢出与梯度爆炸。针对这一问题,ALFP 选择在有界的空间域 \([0, 1]^{3 \times H \times W}\) 内构建轻量级扰动生成网络 PGNet。对于输入的源图像 \(I_s\),GazeNet 提取的中间特征向量 \(f\) 与高斯随机噪声 \(z \sim \mathcal{N}(0, I)\)(维度 \(d_z = 100\))进行拼接,经 4 层反卷积上采样模块处理,末端施加 Sigmoid 激活函数输出空间扰动图 \(I_p\): $\(I_p = \sigma(P(z, f)) \in [0, 1]^{3 \times H \times W}\)$ 这种设计带来了两个关键机制优势:其一,由于扰动图仅作为提取频域振幅统计量的中间媒介,它无需承载具体的人脸语义,规避了繁琐的人脸生成约束;其二,生成过程显式条件化在当前人脸特征 \(f\) 上,使得对抗扰动具有实例针对性,能够针对当前人脸的特有低频分布动态构建最具威胁的风格扰动。

2. 基于 AdaIN 的低频振幅统计量混合:解耦频域风格与视线几何

若在频域对低频成分进行逐像素点替换或乘加扰动,会彻底破坏傅里叶频谱内局部各频率点之间的相对能量比例,导致重构图像出现严重的人工伪影并破坏注视几何结构。为此,ALFP 采用基于自适应实例归一化(AdaIN)的统计级平滑混合。通过二维快速傅里叶变换(2D FFT)获取源图像与扰动图像的振幅谱 \(A_s, A_p\) 以及源图像相位谱 \(\Phi_s\)。定义以频谱中心为原点、半径 \(r = \beta \cdot \min(H, W)/2\)\(\beta \sim \mathcal{U}(0, 0.5]\))的圆形区域 \(R\) 为低频频带。计算通道级的低频统计标量 \((\mu_s, \sigma_s)\)\((\mu_p, \sigma_p)\),并采样通道级混合系数 \(\lambda \sim \mathcal{U}(0, 1)\): $\(A_{\text{lowmix}} = [\lambda \sigma_s + (1-\lambda)\sigma_p] \cdot \frac{A_s[R] - \mu_s}{\sigma_s} + [\lambda \mu_s + (1-\lambda)\mu_p]\)$ 将 \(A_s\)\(R\) 区域替换为 \(A_{\text{lowmix}}\) 得到 \(A_{\text{aug}}\),结合原始相位谱 \(\Phi_s\) 执行二维逆傅里叶变换(IFFT)得到增强图像 \(I_{\text{aug}} = \text{IFFT}(A_{\text{aug}}, \Phi_s)\)。由于傅里叶相位谱主导图像的空间结构与边缘轮廓(眼睛朝向与面部几何),而振幅谱的低频统计量反映光照、色温与全局对比度,这一设计既彻底扰动了低频域风格分布,又严格保证了增强人脸在视线标签上的绝对几何真实性。

3. 批次级频域统计约束与多分支对抗协同优化:杜绝退化捷径与维持预测一致

在交替对抗训练中,如果仅仅让 PGNet 最大化 GazeNet 的视线误差,PGNet 极易通过输出纯白饱和图像或二值极端噪波来暴力摧毁整幅图像,从而利用对抗捷径欺骗损失函数。为防止扰动失控,ALFP 为 PGNet 引入了基于对数空间的批次级统计约束损失 \(L_{\text{stat}}\): $\(L_{\text{stat}} = \|\log(\bar{\mu}_p) - \log(\bar{\mu}_s)\|_2^2 + \|\log(\bar{\sigma}_p) - \log(\bar{\sigma}_s)\|_2^2\)$ 其中 \(\bar{\mu}_s, \bar{\sigma}_s\)\(\bar{\mu}_p, \bar{\sigma}_p\) 为批次内样本的低频振幅平均均值与标准差。该项在批次层面上将扰动能量限定在合规的物理幅度范围内,同时保留了单样本扰动的丰富多样性。PGNet 的总优化目标为 \(L_P = -L_{\text{gaze}}(G(I_{\text{aug}}), g_{\text{gt}}) + L_{\text{stat}}\)。与此同时,固定 PGNet 优化 GazeNet 时,采用多分支三项联合损失函数维持干净样本精度与扰动不变性: $\(L_G = L_{\text{ori}} + L_{\text{aug}} + L_{\text{cons}}\)$ 其中 \(L_{\text{ori}} = \|G(I_s) - g_{\text{gt}}\|_1\) 确保原始数据拟合度,\(L_{\text{aug}} = \|G(I_{\text{aug}}) - g_{\text{gt}}\|_1\) 监督增强人脸的绝对视线真值,\(L_{\text{cons}} = \|G(I_{\text{aug}}) - G(I_s)\|_1\) 则显式惩罚因低频抖动引起的视线预测漂移。

损失函数 / 训练策略

训练采用 Adam 优化器,学习率统一设置为 \(10^{-4}\),在单台配备 NVIDIA RTX 3090 GPU 的机器上进行 10 个 epoch 的对抗训练,批大小(batch size)为 256。输入人脸图像分辨率标准化为 \(224 \times 224\) 且归一化至 \([0, 1]\),训练过程中完全不依赖任何传统空间几何数据增强(如随机旋转、擦除、色彩抖动等)。在推理阶段,辅助网络 PGNet 被完全剥离,仅使用 GazeNet 进行纯空间前向视线角度(pitch 与 yaw)回归,不增加任何频域变换或浮点运算开销。

实验关键数据

主实验

实验在 ETH-XGaze(DE)、Gaze360(DG)、MPIIFaceGaze(DM)和 EyeDiap(DD)四大公开基准上展开,采用标准角误差(单位:度 °,越低越好)作为评测指标。对比对象涵盖了当前无目标域泛化(Domain Generalization)的 SOTA 方法。

方法 骨干网络 DE→DM DE→DD DG→DM DG→DD 平均误差 (Avg)
Baseline (ERM) ResNet-18 7.29 9.77 8.05 9.03 8.54
Baseline (ERM) ResNet-50 6.84 9.06 7.31 9.09 8.08
PureGaze (AAAI 2022) ResNet-50 7.08 7.48 9.28 9.32 8.29
CDG (CVPR 2023) ResNet-18 6.73 7.95 7.03 7.27 7.25
Xu et al. (AAAI 2023) ResNet-18 6.50 7.44 7.55 9.03 7.63
FSCI (CVPR 2024) ResNet-18 5.79 6.96 7.06 7.99 6.95
GFAL (CVPR 2024) ResNet-18 5.72 6.97 7.18 7.38 6.81
CLIP-Gaze (ECCV 2024) ViT-B/16 6.41 7.51 6.89 7.06 6.97
LG-Gaze (ECCV 2024) ViT-B/16 6.45 7.22 6.83 6.86 6.84
ALFP (本文) ResNet-18 5.92 6.36 6.10 7.26 6.41
ALFP (本文) ResNet-50 5.68 5.90 5.84 7.19 6.15

消融实验

消融实验以 ResNet-18 为骨干网络,系统验证扰动生成空间、振幅混合方式、统计损失设计以及扰动图像来源等核心决策。

模块设计验证 实验变体配置 DE→DM DE→DD DG→DM DG→DD 平均误差 (Avg) 说明
生成域选择 纯频域直接生成振幅 (Softplus) 6.25 6.56 6.60 7.87 6.82 重尾分布破坏优化稳定性
空间域生成扰动图 (Ours) 5.92 6.36 6.10 7.26 6.41 有界空间显著收敛平稳
混合策略 逐频点独立元素混合 (Element-wise) 7.04 7.87 7.68 13.08 8.92 破坏内部频谱相干性,性能剧烈衰退
基于 AdaIN 统计混合 (Ours) 5.92 6.36 6.10 7.26 6.41 保持频带相对几何拓扑
统计约束 \(L_{\text{stat}}\) 移除约束 (w/o \(L_{\text{stat}}\)) 6.35 6.86 7.12 9.64 7.49 网络坍缩为纯白全饱和欺骗捷径
样本级单体约束 (Sample-level) 6.40 7.09 6.92 7.37 6.95 限制扰动范围,样式过于同质化
像素级均值/方差约束 (Pixel constraint) 6.40 6.82 6.63 9.19 7.26 全频混合统计,无法精准针对低频
多样性驱动方差最大化 (Diversity-based) 6.12 8.42 6.56 8.81 7.48 坍缩为二值黑白斑块极端异常图
批次频域对数约束 (Ours) 5.92 6.36 6.10 7.26 6.41 兼顾多样性与频域幅值有效边界
扰动源对比 域内随机图像配对混合 6.33 6.68 6.40 7.75 6.79 静态样本无法提供最大对抗难度
外部人脸库 (VGGFace2) 6.54 6.76 6.83 8.44 7.14 外部固定分布无法定向靶向弱点
外部动物库 (AP-10K) 6.51 6.53 6.69 7.94 6.92 跨物种分布依然逊色于动态合成
PGNet 实例对抗生成 (Ours) 5.92 6.36 6.10 7.26 6.41 自适应搜索最具破坏性的脆弱点

关键发现

  • 对抗频域扰动对顽固域迁移的击穿效果:在极具挑战的 DE→DD(高分辨率严苛光照实验室环境迁移至低分辨率 VGA 视频)设置下,ALFP 将 ResNet-18 误差从 9.77° 压降至 6.36°(相对改善 34.9%);在 DG→DM 设置下,ALFP 以 5.84° 较先前最优基线超越达 15.0%,展现了对抗频域扰动对未知目标域光照与背景干扰的强鲁棒性。
  • 低频扰动半径 \(\beta\) 的临界点效应:将高频截止半径比例 \(\beta\) 在 0.1 到 1.0 之间进行扫描时,平均角误差呈现清晰的“U”形曲线,在 \(\beta = 0.5\) 处取得最优值 6.41°。当 \(\beta < 0.5\) 时扰动未能全面覆盖域特异性低频分量;而当 \(\beta > 0.5\) 时扰动蔓延至高频边缘细节区域,损害了瞳孔中心和虹膜轮廓等决定性几何线索。
  • 频域敏感度图谱的根本转变:径向敏感度曲线 \(S(r)\) 分析表明,未加入 ALFP 的模型在低频区域存在高耸的梯度响应尖峰,而经 ALFP 训练后,低频敏感度被显著拉平,且保留了适度的生理必要基底,验证了模型真正摆脱了对源域低频统计特性的病态依赖。

亮点与洞察

  • 跳出空间表观对齐的思维定式:本研究敏锐地指出光照、背景和肤色等宏观表观干扰本质上是傅里叶频域中的低频振幅分布,从而通过数学上更底层的频域统计变换统一化解了多样化的表观迁移问题。
  • 空间生成与频域统计混合的优雅分工:PGNet 在有界空间域内生成平滑的无语义扰动图像,避免了频域直接生成振幅矩阵带来的重尾发散;而振幅提取后又在频域借助 AdaIN 调节全局能量分布,实现了“空间生成稳定性”与“频域物理可解释性”的兼得。
  • 可复用的频域数据增强范式:该框架中“PGNet 动态对抗生成 + AdaIN 统计替换 + 批次级对数谱约束”的轻量管线,具备极佳的任务泛用性,能低成本直接迁移至面部表情识别、人脸活体检测和深度估计等受光照背景强干扰的通用人像理解任务中。

局限与展望

  • 空间姿态偏差未直接纳入建模:作者坦承 ALFP 专注于化解频域低频分布偏差,但对于头部姿态分布的剧烈不匹配(Head Pose Bias)、视线角度极端偏转(如驾驶环境中的超大角度注视)以及严重的面部遮挡等空间几何层面的域漂移,尚无法提供针对性的补偿。
  • 频带划分形态较为单一:目前模型采用固定的同心圆形截断区域划分低频空间,忽略了不同方向纹理在二维频谱平面内的非各向同性特征。未来可探索基于方向滤波或可学习椭圆频谱掩膜的频域扰动机制。

相关工作与启发

  • vs PureGaze / Xu et al.:PureGaze 试图在特征隐空间通过解耦对抗消除身份与光照表征,Xu 等人则在空间域注入对抗风格纹理。相比之下,ALFP 无需复杂的特征正交解耦头,直接在傅里叶频谱上通过 AdaIN 重塑低频统计量,保留纯净相位结构,从根本上隔离了注视几何与域特异风格。
  • vs CLIP-Gaze / LG-Gaze:近期工作引入大体量视觉语言模型(CLIP)的文本先验正则化视线隐空间,不仅参数体量巨大且推理依赖复杂微调。ALFP 仅以轻量 ResNet-18 为骨干便在全指标上反超了基于 ViT-B/16 的大模型方案,且推理期零额外计算开销,为工业级边缘设备的视线追踪部署提供了兼顾超强泛化与极简推理的高效范本。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [首次从频域敏感度视角揭示低频过拟合机理,并提出空间生成-频域 AdaIN 混合的对抗扰动架构]
  • 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 4 大基准 6 种跨域配置,包含详尽的频域敏感度图谱、扰动源与统计损失消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [机理剖析逻辑清晰,诊断性实验层层递进,设计动机与实验结论高度自洽]
  • 价值: ⭐⭐⭐⭐⭐ [跨域性能超越现有 SOTA 达 15% 以上,推理时完全剥离无开销,工程落地与学术启发价值极高]