TRAM: Fine-Tuning-Free Test-Time Adaptation with Few Bonafide Samples for Generalized Face Anti-Spoofing¶
会议: ECCV 2026
论文: ECCV 原文
领域: 人体理解
关键词: 人脸活体检测, 测试时自适应, 免微调, 相对关系建模, 提示词学习
一句话总结¶
针对跨域人脸防假体攻击(FAS)中目标域假体样本极其匮乏且重新微调开销大的痛点,TRAM 提出免微调测试时自适应框架,以目标域极少数真脸为锚点构建图像对,结合光度差异提示词学习与共识注意力正则化进行相对关系对比学习,实现即插即用的域偏移消除。
研究背景与动机¶
人脸防假体攻击(FAS)在生物特征认证与门禁系统中起着至关重要的安全防护作用,然而现实场景中的攻击形式层出不穷,包括照片打印、屏幕重放以及高仿 3D 硅胶面具等。尽管现有基于深度神经网络与视觉大模型的方法在单一数据集上取得了饱和指标,但面对未见过的目标域时性能往往急剧恶化。这种泛化瓶颈的根源在于:活体检测算法极易捕捉到由特定采集设备、光照环境、分辨率与色彩风格带来的底层 domain 偏移,并将这些域特异性偏差误判为真伪判据。
为了缩小源域与目标域的分布间隙,传统的无监督域适应(UDA)或测试时自适应(TTA)方法通常依赖对目标域数据的模型参数更新。然而,在 FAS 实际落地场景中,收集未知目标域的假体攻击样本成本极高、甚至在部署前完全不可行;而对每一个部署终端进行持续梯度微调或风格迁移投影不仅计算开销庞大,还伴随着模型崩塌和灾难性遗忘的风险。相比之下,在目标场景中采集极少数合规的真脸样本(bonafide samples)却极其低廉且可控。
由此引发的核心矛盾是:如何仅利用目标域少量且无攻击配对的真脸样本,在完全不更新网络权重的前提下抹除跨域环境噪声并凸显伪造线索。本文的切入点在于,同一目标场景下的任意待测人脸与该场景的真脸样本共享了相同的成像条件、光照与相机色调偏差。核心 idea:将目标域极少数真脸样本作为参考锚点(Anchor),通过构建待测样本与锚点的图像对进行相对关系对比学习,并引入光度差异属性提示词与共识注意力正则化,在免微调条件下纯推理消除共有域偏差。
方法详解¶
整体框架¶
TRAM 的核心流程是输入待测图像与目标域真脸锚点构成的图像对,利用文本引导的相对关系建模判断两者差异。模型由预训练冻结的 CLIP 视觉编码器提取图像表征,经过锚点相对特征编码器得到二者的交互关系特征,并在文本空间中与特定设计的关系提示词进行相似度匹配。同时,为了刻画假体介质特有的微观光度失真,设计了细粒度关系提示词学习模块挖掘伪光度属性,动态丰富攻击类的描述文本。最后,通过共识注意力正则化防止模型过拟合于偶发假体伪影。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入待测人脸 Ix 与目标域真脸锚点 IA"] --> B["锚点相对交叉注意力 RCA<br/>做 Q/K 特征差分与人脸先验调制"]
A --> C["细粒度关系提示词学习 FRPL<br/>ACA 挖掘对比度/白平衡等伪属性"]
C --> D["条件属性平衡损失 Lfg<br/>动态生成细粒度假体提示词 t+D"]
B --> E["相对图像对-文本对比学习 I2CL<br/>关系特征与自适应文本匹配"]
D --> E
E --> F["共识注意力正则化 CAR<br/>EMA 维护类级 Grad-CAM 并约束 JS 散度"]
F --> G["免微调输出真实/伪造分类结果"]
关键设计¶
1. 锚点相对交叉注意力(RCA):差分消除共享域特征
以往基于 CLIP 的活体检测方法通常将单张人脸与 "This is a real/spoof face" 进行对齐,不可避免地编码了大量非关键的背景与成像风格信息。TRAM 设计了锚点相对 FAS 编码器 \(f_R\),其第一层即为锚点相对交叉注意力(RCA)。针对输入图像特征 \(x\) 和真脸锚点特征 \(A\),分别线性投影为 \(Q_x, K_x, V_x\) 与 \(Q_A, K_A, V_A\)。由于两者在同域下具有相近的全局面部轮廓和环境风格,RCA 显式引入 Query 与 Key 的差分向量: $\(\mathrm{RCA}(Q_A, Q_x, K_A, K_x, V_A) = \mathrm{Softmax}\left( \frac{(Q_x - Q_A)(K_x - K_A)^\top}{\sqrt{d} \cdot \mathcal{T}(M_x, M_A)} \right) V_A\)$ 其中 \(M_x\) 与 \(M_A\) 为人脸区域先验掩码,\(\mathcal{T}(\cdot)\) 为温度调制函数。通过差分操作直接抵消了共有的身份不相关背景和全局传感器噪声,强迫注意力权重聚焦于局部假体瑕疵与面部差异区域。
2. 细粒度关系提示词学习(FRPL):挖掘底层光度物理失真
真实的假体介质(如打印纸张反射率、电子屏幕像素栅格或硅胶材质)在对比度、饱和度、色彩丰富度以及白平衡等光度属性上与真脸存在明显物理缺陷。针对现有数据集缺乏细粒度属性标注的难题,TRAM 引入基于锚化交叉注意力(ACA)的伪影提取器 \(f_A\)。该模块以待测特征查询锚点特征(\(\mathrm{ACA}(Q_x, K_A, V_A)\)),并在无监督下基于成对图像的光度比值构建伪标签。为解决真实样本间因光照产生的虚假差异噪声以及极端类别不平衡,提出条件属性平衡交叉熵损失: $\(\mathcal{L}_{fg} = -\frac{1}{D}\sum_{d=1}^D \left[ \alpha \cdot \mathbb{I}(y = \text{spoof}) \log \hat{y}^+_d + (1 - \alpha \cdot \mathbb{I}(y = \text{spoof})) \log \hat{y}^-_d \right]\)$ 其中 \(D\) 为光度属性维度,\(\alpha\) 用于平衡权重。推理时,\(f_A\) 判别为存在显著异常的光度属性文本会被动态拼接(\(\cup\))至假体描述提示词中,构成更具辨识力的细粒度关系描述。
3. 共识注意力正则化(CAR):防止局部伪影过拟合
视觉语言模型在少样本或零样本微调时极易出现稀疏注意力塌陷,导致模型过度迷信某些特定伪影模式(如特定手持照片的边框或 3D 面具眼部开孔),降低对未知攻击形式的泛化力。TRAM 为真实类和各典型攻击类分别维护动态演进的共识注意力图 \(\bar{G}_c\)。在训练迭代中,样本的 Grad-CAM 热力图 \(G_c^{(i)}\) 通过指数滑动平均(EMA)更新共识图: $\(\bar{G}_c^{(n+1)} = \mu \bar{G}_c^{(n)} + (1 - \mu) G_c^{(i)}\)$ 在共识图稳定后,引入共识注意力正则化损失 \(\mathcal{L}_{car}\),最小化单样本注意力与对应类别共识图之间的 Jensen-Shannon 散度(\(\mathrm{JS}(G_c^{(i)} \parallel \bar{G}_c)\)),强迫同类样本的判别关注区域在全局拓扑上保持一致,显著抑制了偶发孤立伪影的过拟合。
损失函数 / 训练策略¶
为了防止特征提取器 \(f_R\) 与伪影提取器 \(f_A\) 联合训练时的相互干扰与崩塌,TRAM 采取精巧的三阶段训练策略: 1. 阶段 1(基础关系预训练):冻结 CLIP 基础主干,仅利用基础分类损失 \(\mathcal{L}_{cls}\) 优化视觉编码器高层与 \(f_R\),使网络掌握基于基础关系文本提示("This is a {real/spoof} face. The face is {the same as/different from} the anchor.")的活体表征建模; 2. 阶段 2(光度伪影挖掘):冻结 \(f_R\),专门训练光度伪影提取器 \(f_A\),利用条件属性平衡损失 \(\mathcal{L}_{fg}\) 拟合底层光度差异属性; 3. 阶段 3(端到端联合微调):引入由 \(f_A\) 预测的细粒度属性提示词并融入整体文本特征,联合利用总目标 \(\mathcal{L}_{sum} = \mathcal{L}_{cls} + \lambda_1 \mathcal{L}_{car} + \lambda_2 \mathcal{L}_{fg}\) 微调 \(f_R\)。实验中设定 \(\alpha=0.9, \theta=0.9, \mu=0.9, \lambda_1=1, \lambda_2=1\)。在测试阶段,目标域仅需提供 5 张真脸样本作为候选锚点库,根据简单的图像平均亮度相似度匹配即刻完成免微调自适应推断。
实验关键数据¶
主实验¶
论文在 Protocol 1(一对一小规模交叉域)和 Protocol 2(留一跨域评估,M: MSU-MFSD, C: CASIA-FASD, I: Idiap Replay-Attack, O: OULU-NPU)等经典基准上进行了详尽对比,评估指标为半总错误率 HTER(越低越好)、AUC 以及 TPR@FPR=1%(越高越好)。
Protocol 2 跨数据集留一测试结果对比(HTER / %):
| 数据集组合 | 指标 | TRAM (本文) | SOTA (BUDoPT) | 相比 SOTA 变化 |
|---|---|---|---|---|
| O&C&I → M | HTER | 0.00 | 0.40 | -0.40% |
| O&M&I → C | HTER | 0.11 | 0.26 | -0.15% |
| O&C&M → I | HTER | 1.85 | 1.38 | +0.47% |
| I&C&M → O | HTER | 1.27 | 1.60 | -0.33% |
| 平均 Avg. | HTER | 0.81 | 0.91 | -0.10% |
在 Protocol 1 的 12 项单向迁移测试中,TRAM 取得了 1.65% 的平均 HTER,较此前视觉语言最强方法 TF-FAS(1.99%)和传统免微调自适应 GDA(14.4%)实现大幅度性能飞跃。在更具挑战性的大规模多模态多民族基准 Protocol 3(WMCA, CASIA-CeFA, CASIA-SURF)中,TRAM 平均 HTER 达到 8.45%,显著优于此前 SOTA 方法 MVP-FAS(12.92%)。在面对高精真 3D 面具攻击的 Protocol 4(WMCA → HKBUMARsV2+)中,TRAM 将 HTER 压低至 0.91%(AUC 达 99.83%),而对比基线 FLIP 系列最低为 1.97%。
消融实验¶
在 Protocol 2 下对各个关键组件及其内部运算子进行消融验证(指标均为 HTER / %):
主要核心组件消融(Protocol 2 表现):
| 配置 | I2CL | CAR | FRPL | OCI→M | OMI→C | OCM→I | ICM→O | 平均 HTER | 说明 |
|---|---|---|---|---|---|---|---|---|---|
| Baseline (FLIP-IT) | - | - | - | 5.27 | 0.44 | 2.94 | 2.31 | 3.05 | 仅单图文本对齐 |
| + I2CL | ✓ | - | - | 0.24 | 0.67 | 4.05 | 1.87 | 1.70 | 引入真脸锚点成对对比,错误率降 44% |
| + I2CL + CAR | ✓ | ✓ | - | 0.00 | 0.33 | 3.55 | 1.41 | 1.32 | 施加共识注意力正则,避免局部伪影过拟合 |
| Full Model | ✓ | ✓ | ✓ | 0.00 | 0.11 | 1.85 | 1.27 | 0.81 | 结合细粒度光度属性学习,错误率进一步压低 38% |
RCA 算子结构消融(Protocol 2 平均 HTER): - 孪生双塔特征拼接(Siamese baseline):3.66% - 标准单向交叉注意力(Cross-attention baseline):2.80% - 仅做 Query 差分:2.40% - 仅做 Key 差分:2.46% - 同时做 Q 与 K 差分(无温度调制):2.04% - 完整 RCA(Q/K 双重差分 + 人脸先验掩码温度调制):1.70%
关键发现¶
- 锚点数量的极度轻量性:在目标域仅使用 5 张真脸样本(5-shot bonafide)即可使检测性能趋于饱和;超过 5 张后 AUC 曲线基本持平,这极大降低了实际系统部署与冷启动的标定门槛。
- 锚点选择策略的鲁棒性:对比基于深度语义(ResNet-18 特征)、局部色彩统计与图像全局灰度亮度的锚点匹配策略,基于亮度的最简单准则反而取得最低的平均 HTER(0.81% vs 语义 0.97%)。这说明高层语义特征反而引入了不必要的人脸身份偏置,底层全局光照对齐才最契合活体任务。
- 对假体伪影的类单分类关注机制:Grad-CAM 热力图表明,真脸输入能与真脸锚点形成集中且一致的人脸面部空间注意力;而当假体样本输入时,模型注意力呈现高度弥散且不规则的离散分布,本质上通过相对关系的破缺完成了高置信度拒识。
亮点与洞察¶
- 将无监督域适应解耦为相对关系建模:传统域自适应往往纠结于对抗训练或复杂的分布距离对齐,容易在少量目标样本下发生过拟合。TRAM 敏锐抓住“同一域内图像共享相同成像系统与光照噪声”的物理共性,通过与锚点做差分和比对,将域适应问题优雅转化为成对差分判别任务。
- 基于物理光度先验的伪标签自引导机制:传统多模态提示词多依赖 LLM 编造通用词汇,缺乏对视觉底层像素缺陷的敏锐感知。TRAM 基于图像处理中的白平衡、饱和度、对比度差值构建伪标签,并通过条件属性平衡损失驯化提示词生成,设计高度紧凑闭环。
- 即插即用的免微调落地友好性:算法在测试阶段对网络所有权重实行绝对冻结,不需要反向传播即可实时适应目标域,极大地降低了端侧与边缘设备的内存占用与运算延迟。
局限与展望¶
- 极端光照剧烈变化下的配对脆弱性:若待测人脸处于强逆光或局部强阴影下,而 5 张候选锚点均为正面均匀光照,基于全局亮度的启发式匹配可能产生错误的基准对比,导致真脸被误拒。
- 假体样本缺乏直接对齐引导:由于假设目标域无任何攻击样本,关系提示词完全由源域假体训练先验及伪属性迁移而来,对于从未见过的新型物理介质攻击(如新型变色发光膜)可能无法生成精准的细粒度描述。
- 未来方向:可进一步探索结合轻量级头部姿态与人脸 3D 形状先验的自适应锚点重加权机制,并在边缘端人脸识别芯片中部署验证多路并行的图像对推理效率。
相关工作与启发¶
- vs FLIP / BUDoPT / TF-FAS:现有 CLIP-based FAS 方法主要采用单图输入,依靠手工或可学习提示词挖掘全局活体语义,容易被跨域成像风格干扰;TRAM 将单图分类重构为图像对相对关系建模,以同域真脸为基准消解域特异性偏差。
- vs ViTAF / SDA-FAS++:传统 Few-shot 或测试时自适应方法在测试阶段需要多次梯度迭代更新权重,且往往需要伪标签或目标域假体样本参与平衡;TRAM 彻底抛弃参数更新机制,利用前向传播中的双图差分注意力直接输出判别结果。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙利用同域真脸作为参考锚点重塑 FAS 泛化问题,免微调与相对建模构思新颖。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 8 个公开数据集与 5 大严苛评估协议,消融与超参分析详实严密。
- 写作质量: ⭐⭐⭐⭐⭐ 叙述流畅,方法各模块与物理直觉紧密扣合,图表与数学表达清晰。
- 价值: ⭐⭐⭐⭐⭐ 对人脸活体检测在工业安防、刷脸支付等终端场景的免微调即时落地具有极高实用价值。