Noise-Robust Facial Expression Recognition via Mamba-driven Neighbor Weight Refinement¶
会议: ECCV 2026
论文: ECCV 官方页面
领域: 人体理解
关键词: 面部表情识别, 标签分布学习, 邻域权重细化, 状态空间模型, 标签噪声
一句话总结¶
针对野外人脸表情识别中众包主观标注模糊与标签噪声难题,提出 Mamba 驱动的邻域权重细化框架(Mamba-NWR),结合交叉注意力路由初始化与状态空间迭代优化,动态平衡历史状态并聚合高质量邻域标签分布。
研究背景与动机¶
在自然无约束场景(in-the-wild)下进行人脸表情识别(FER)具有极高的实际应用价值,广泛涉及人机交互与情感计算等方向。然而,真实野外数据往往存在天然的主观模糊性,细微表情、过渡表情在不同观察者之间极易产生认知偏差;加之大规模学术基准普遍依赖众包数据标注,不可避免地混入系统性标签噪声与不一致错误。这些问题导致传统基于硬标签交叉熵的监督信号变得不可靠,严重制约了深层模型的鲁棒性与泛化能力。
为缓解这一瓶颈,近年来基于标签分布学习(LDL)和样本间邻域关系的方法应运而生。这类方法试图在辅助表征空间(如面部关键点或情绪连续维度)中检索近邻样本,将邻居的预测软标签聚合为更加平滑可靠的监督信号。然而现有方案普遍采用静态的单步启发式加权(例如基于余弦相似度或欧式距离),在噪声严重干扰时,初始计算出的邻居关系本身就极易发生偏移;缺乏迭代纠错机制的静态加权往往不仅无法抑制噪声,反而将邻域内的错误预测成倍放大。
针对单步加权易受噪声污染的根本缺陷,本文将邻域权重的确定转化为序列化的动态迭代优化过程。本文的核心 idea 是:在效价-唤醒度(V–A)情感空间检索近邻样本,首先通过细粒度交叉注意力路由(CAR)完成邻域权重的稳定初始化,随后引入基于 Mamba 状态空间模型的序列化迭代细化(MIR),在全局上下文与历史状态约束下动态矫正邻居贡献权重,最终与原始标签进行可学习自适应融合构建抗噪监督。
方法详解¶
整体框架¶
Mamba-NWR 的整体流程包含四个阶段:在辅助效价-唤醒度空间构建邻域、基于交叉注意力路由的多路径权重初始化、基于 Mamba 状态空间模型的邻域权重与分布迭代细化,以及原始标签与细化邻域分布的动态融合。输入图像在特征提取后,与检索到的 \(K\) 个邻居进行细粒度语义对齐,经多轮状态空间更新剔除噪声邻居干扰,最终构建出高信噪比的软目标用于端到端监督。在推理阶段,仅保留骨干网络前向分类,不增加任何额外的推理计算开销。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入样本与邻居图像<br/>x_i 与 K 个近邻 x_{ik}"] --> B["效价-唤醒度辅助空间检索<br/>KNN 邻域构建"]
B --> C["交叉注意力路由初始化<br/>多路径局部特征对齐"]
C --> D["Mamba 状态空间迭代细化<br/>历史状态保留与新输入吸收"]
D --> E["动态可学习融合<br/>原始硬标签与邻域分布平衡"]
E --> F["联合抗噪目标函数<br/>自适应交叉熵 + 判别损失"]
关键设计¶
1. 交叉注意力路由初始化:突破粗粒度距离度量的多路径局部语义对齐 在连续效价-唤醒度(Valence–Arousal, V–A)二维空间中,通过预训练模型估算样本的伪 V–A 坐标并使用 KNN 检索最近的 \(K=8\) 个近邻。传统方法直接依赖低维空间距离计算权重,极易受到粗粒度误差干扰。为此,本文设计了交叉注意力路由(Cross-Attention Routing, CAR)模块。中心样本和近邻样本经共享特征提取器输出深层特征后,首先投影到 \(N_l\) 条局部特征路径: $$ \mathbf{U}i \in \mathbb{R}^{N_l \times d_l}, \quad \mathbf{U} $$ 各局部路径经特征范数归一化后,通过可学习变换张量 } \in \mathbb{R}^{N_l \times d_l\(\mathbf{W}_{n,m} \in \mathbb{R}^{N_l \times N_h \times d_l \times d_h}\) 投影至高层语义空间并进行类投票。对于每条局部路径 \(n\),中心与近邻特征的语义一致性计算为点积相似度,并通过 Softmax 归一化跨邻居分配路由系数: $$ \alpha_{i_k}^{(n)} = \frac{\exp\left(\langle \hat{\mathbf{U}}i^{(n)}, \hat{\mathbf{U}}}^{(n)} \rangle / \sqrt{d_h}\right)}{\sum_{j=1}^K \exp\left(\langle \hat{\mathbf{U}i^{(n)}, \hat{\mathbf{U}} $$ 最终取所有局部路径的均值得到初始邻居贡献权重 }^{(n)} \rangle / \sqrt{d_h}\right)\(w_{i_k}^{(0)} = \frac{1}{N_l}\sum_{n=1}^{N_l} \alpha_{i_k}^{(n)}\),满足 \(\sum_{k=1}^K w_{i_k}^{(0)} = 1\)。多路径向量化设计使得模型能够从多维局部情感线索评估语义一致性,规避了单一全局相似度的脆弱性。
2. Mamba 状态空间迭代细化:历史状态平衡与噪声邻居渐进式纠偏 在获得初始权重后,多数方法直接单步聚合并停止优化,导致被错误赋予高权重的异常样本污染全局。本文将权重重标定建模为离散状态空间系统的多步迭代演化。在第 \(t\) 步迭代中,当前聚合邻域标签分布定义为加权预测和: $$ \mathbf{p}i^{(t)} = \sum $$ 将权重隐状态 }^K w_{i_k}^{(t)} \hat{\mathbf{y}}_{i_k\(\mathbf{w}_i^{(t)}\) 与分布表征映射至相同隐空间维度 \(d_z\)。Mamba 模块的状态转移机制采用门控选择性状态更新公式: $$ \mathbf{w}_i^{(t+1)} = \mathbf{A} \odot \mathbf{w}_i^{(t)} + \mathbf{B} \odot \mathbf{p}_i^{(t)} $$ 其中矩阵 \(\mathbf{A}\) 与 \(\mathbf{B}\) 为可学习参数,\(\mathbf{A}\) 负责决定上一步邻域权重保留程度,维持历史推断的稳定性;\(\mathbf{B}\) 则调控新吸收的邻域分布信息对权重演化的修正幅度。通过 \(T=3\) 轮循环递推,全局上下文语义与各邻居的微观一致性实现交互校准,异常样本的权重在迭代中被平滑衰减,最终输出高纯净度的邻域分布 \(\mathbf{p}_i^{\text{nbr}} = \sum_{k=1}^K w_{i_k}^{(T)} \hat{\mathbf{y}}_{i_k}\)。
3. 动态可学习自适应融合:自信息置信度与邻域共识的弹性权衡 考虑到并非所有样本的邻域分布都绝对优于原始标签,本文引入自适应融合因子 \(\lambda_i \in [0, 1]\),由轻量预测头直接输出并参与反向传播。最终的合成软标签构建为: $$ \tilde{\mathbf{p}}_i = \lambda_i \mathbf{y}_i + (1 - \lambda_i) \mathbf{p}_i^{\text{nbr}} $$ 当中心样本自身特征清晰、置信度高且与邻居冲突时,网络倾向于分配较大的 \(\lambda_i\),优先信任自身原始硬标签;反之,若中心标注严重受噪声污染或处于表情分界处,较低的 \(\lambda_i\) 则允许网络完全借助邻居共识进行纠错。
损失函数 / 训练策略¶
模型采用复合损失函数进行端到端优化。主损失为合成软标签与网络分类预测概率 \(\hat{y}_{i,c}\) 之间的交叉熵: $$ \mathcal{L}{\text{CE}} = - \sum}^N \sum_{c=1}^C \tilde{p{i,c} \log \hat{y} $$ 为进一步强化特征空间的类内紧凑度与类间分离度,抑制错误标签诱导的特征漂移,引入判别中心损失(Discriminative Loss): $$ \mathcal{L}{\text{dis}} = \sum}^N \left( |\mathbf{fi - \boldsymbol{\mu}|2^2 - \frac{1}{C-1} \sum} |\mathbf{fi - \boldsymbol{\mu}_c|_2^2 \right) $$ 其中 \(\boldsymbol{\mu}_c\) 表示第 \(c\) 类的特征均值中心。总损失函数定义为: $$ \mathcal{L} = \mathcal{L} $$ 在实现中设置平衡系数 }} + \beta \mathcal{L}_{\text{dis}\(\beta = 0.1\),优化器采用 Adam,批量大小固定为 32。
实验关键数据¶
主实验¶
在对称随机标签噪声(Symmetric Noise)设置下,人工向 RAF-DB、AffectNet 和 FERPlus 注入 10%、20%、30% 比例的错误标签,全面对比主流抗噪 FER 算法:
| 数据集 | 噪声比例 | 本文 (Ours) | SCN | RUL | EAC | LDLVA | MCR | 相对最优提升 |
|---|---|---|---|---|---|---|---|---|
| RAF-DB | 10% | 89.97% | 82.18% | 86.17% | 88.02% | 87.98% | 89.28% | +0.69% vs MCR |
| RAF-DB | 20% | 88.38% | 80.10% | 84.32% | 86.05% | 86.81% | 87.61% | +0.77% vs MCR |
| RAF-DB | 30% | 87.62% | 77.46% | 82.06% | 84.42% | 85.85% | 86.08% | +1.54% vs MCR |
| AffectNet | 10% | 66.18% | 58.58% | 60.54% | 61.11% | 64.37% | 62.33% | +1.81% vs LDLVA |
| AffectNet | 20% | 65.66% | 57.25% | 59.01% | 60.29% | 63.89% | 61.35% | +1.77% vs LDLVA |
| AffectNet | 30% | 63.91% | 55.05% | 56.93% | 58.91% | 62.57% | 59.50% | +1.34% vs LDLVA |
| FERPlus | 10% | 88.11% | 84.28% | 86.93% | 87.03% | - | - | +0.09% vs LA-Net |
| FERPlus | 20% | 87.62% | 83.17% | 85.05% | 86.07% | - | - | +0.77% vs LA-Net |
| FERPlus | 30% | 87.15% | 82.47% | 83.90% | 85.44% | - | - | +1.14% vs LA-Net |
在更贴合真实困惑分布的非对称噪声(Asymmetric Noise,如恐惧误标为惊讶、厌恶误标为愤怒)测试中,RAF-DB 上 10%/20%/30% 噪声下分别取得 89.30% / 87.44% / 83.56%,相比先前 SOTA 方案 SOFT(88.01% / 86.35% / 81.92%)分别高出 1.29% / 1.09% / 1.64%。
消融实验¶
针对核心组件初始化策略、Mamba 迭代细化及动态融合的消融验证如下:
| 消融配置/变量 | 10% 噪声 | 20% 噪声 | 30% 噪声 | 结论说明 |
|---|---|---|---|---|
| RAF-DB: V–A 距离初始化 | 88.04% | 87.51% | 85.96% | 单纯低维欧式距离易失真,高噪声下显著下滑 |
| RAF-DB: 特征余弦相似度初始化 | 88.43% | 87.45% | 86.16% | 全局特征相似度缺乏多路径细粒度对齐能力 |
| RAF-DB: CAR 路由初始化 (Ours) | 89.97% | 88.38% | 87.62% | 多路径局部交叉注意力提供最抗噪的初始状态 |
| RAF-DB: 移除 Mamba 细化 | 88.15% | 86.81% | 86.43% | 单步固定加权导致误差累积,30% 噪声下跌 1.19% |
| RAF-DB: 包含 Mamba 细化 (Ours) | 89.97% | 88.38% | 87.62% | 状态空间多步校准显著滤除高危噪声邻居 |
| RAF-DB: Mamba 迭代 T=1 | 87.68% | 87.22% | 86.36% | 单轮更新未充分吸收全局共识 |
| RAF-DB: Mamba 迭代 T=2 | 88.19% | 87.73% | 87.15% | 渐进优化有效提升鲁棒性 |
| RAF-DB: Mamba 迭代 T=3 (Ours) | 89.97% | 88.38% | 87.62% | 取得全局精度最优点 |
| RAF-DB: Mamba 迭代 T=4 | 89.21% | 88.10% | 87.34% | 过多迭代引发轻微信息平滑与冗余更新 |
| RAF-DB: 固定 λ=1 (仅自身硬标签) | 84.28% | 82.09% | 80.12% | 完全暴露在噪声标注下,高噪声性能急剧崩溃 |
| RAF-DB: 固定 λ=0 (仅邻域分布) | 88.35% | 87.51% | 86.74% | 缺失自身个性化特征,易产生邻域过度平滑 |
| RAF-DB: 可学习动态 λ (Ours) | 89.97% | 88.38% | 87.62% | 自适应兼顾自信息纯净度与邻居纠错能力 |
关键发现¶
- Mamba 迭代的纠偏增益随噪声增强而放大:在 10% 对称噪声下,加入 Mamba 使 RAF-DB 提升 1.82%;而在 30% 极端噪声下,AffectNet 上没有 Mamba 时准确率为 62.72%,加入后跃升至 63.91%,证明序列化状态转移能有效切断噪声恶性循环。
- 动态门控优于全盘信赖:无论单纯依赖原始硬标签(\(\lambda=1\) 在 30% 噪声下跌至 80.12%),还是全盘接受邻居(\(\lambda=0\) 仅为 86.74%),均不及可学习动态融合(87.62%)。模型学会在中心特征置信时坚持自我,在标签存疑时退回邻域共识。
亮点与洞察¶
- 将单步邻域加权升级为状态空间时间序列推断:突破了传统 LDL 静态加权在噪声扰动下易发生误差扩散的缺陷,巧妙运用 Mamba 线性复杂度序列建模能力,把邻域聚合转化为在隐状态空间渐进式过滤坏邻居的动态过程。
- 零推理成本的训练期正则化设计:复杂的 KNN 检索、CAR 局部路由与 Mamba 序列递推全部仅在训练反向传播时用于重构监督信号 \(\tilde{\mathbf{p}}_i\);测试部署时仅需 ResNet-18 骨干单图前向,完全保留了轻量级端侧实时推理的实用性。
- 跨模态与跨任务可迁移性强:该“多局部路径交叉对齐 + 状态空间序列细化”范式不仅适用于人脸表情,对于医学图像分级、商品细粒度分类以及动作识别等依赖众包标注、存在长尾与高模糊性的视觉任务具有广泛的通用参考价值。
局限与展望¶
- 依赖预训练伪 V–A 空间的质量:邻域检索的先验建立在辅助 V–A 空间上,若外部模型估计的效价-唤醒度坐标在极端姿态或严重遮挡下产生显著系统性偏差,可能导致近邻候选集本身缺乏正相关语义。
- 未来方向:探索端到端联合微调 V–A 空间表征,或将面部动作单元(Action Units, AU)与三维人脸几何结构作为多源互补辅助空间,使近邻检索不仅感知情感连续域,也能对齐微观解剖学生理运动。
相关工作与启发¶
- vs LDLVA (Chen et al., CVPR 2020 / Le et al., WACV 2023): LDLVA 利用图卷积或不确定性估计在 V–A 空间构建静态软标签分布;本文进一步发现静态图卷积权重容易被噪声拓扑污染,转而设计了 CAR 局部多路径对齐与 Mamba 动态多步纠错机制,在 AffectNet 上取得了 1.81% 的显著领先。
- vs LA-Net (Wu & Cui, ICCV 2023): LA-Net 依赖显式人脸关键点特征辅助邻域挖掘;本文则证明连续情绪度量结合序列状态空间细化,能够在不依赖几何关键点检测器前提下更精准地捕获抽象情感共识。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ [首次将 Mamba 状态空间模型迁移至邻域加权细化,从序列动力学视角重构了 LDL]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖 3 大基准,涵盖 10%-30% 对称与非对称噪声,消融设计极其详尽扎实]
- 写作质量: ⭐⭐⭐⭐☆ [逻辑清晰严密,数学符号体系完备,消融实验论证闭环]
- 价值: ⭐⭐⭐⭐⭐ [为噪声标签与弱标注人脸情感计算提供了即插即用且无推理负担的强力抗噪范式]