跳转至

Revisiting the Volumetric Data of 4DME: Compression, Extension and Benchmarking for Micro-Expression Analysis

会议: ECCV 2026
论文: ECCV 2026 Official
代码: https://github.com/1nO1SB/4DMEplus
领域: 人体理解
关键词: 微表情分析, 面部动作单元, 3D体积数据压缩, V-PCC, 双流光流网络

一句话总结

针对 4D 面部微表情动作单元(ME-AU)检测中体积数据量庞大、伪影噪声严重及基准缺失等瓶颈,本文系统清洗并扩充了 4DME 数据集(实现跨文化平衡),提出解耦外观与几何动态的双流网络 VoluME,并验证了利用 V-PCC 实现约 3000 倍数据压缩且仅损失约 1% F1 值的可行性。

研究背景与动机

面部微表情(Micro-Expressions, MEs)是在情绪抑制状态下短暂、无意识发生的面部肌肉微小运动,持续时间通常仅在 40 至 500 毫秒之间。相比于按粗粒度离散情绪分类的微表情识别(MER),基于面部动作编码系统(FACS)的微表情动作单元(ME-AU)检测直接聚焦于肌肉群激活,更具理论客观性与结构化组合表达能力。然而,微表情肌肉运动在时空域具有极高的稀疏性与微弱性,传统 2D 视频易受光照、姿态与平面外形变模糊的限制。尽管近期出现的 4DME 与 CAS(ME)3 等 3D/4D 体积数据集提供了具有时序一致性的高精度 3D 面部重建网格,为人脸深度特征与微小肌肉运动解耦创造了可能,但其高昂的数据存储与传输门槛、异构的数据格式以及严苛的计算约束严重阻碍了 4D 微表情领域的普及与基准复现。

深入审视现有的原始 4DME 数据集会发现,由于双目立体多视角重建缺陷,未清洗的数据集内部普遍存在大面积几何伪影:多达 40% 的序列包含跨帧持续的时序一致重建伪影,55% 存在单帧特异性外围杂斑,45% 存在传感器层面的统计离群点,真正无损的序列仅占 33%。这些几何不稳定性不仅破坏了网格拓扑对齐、体素化(Voxelization)和点对点距离度量的前提,还使大批采集数据因伪影而被直接丢弃。此外,若要推动大规模研究,动辄每秒数百兆的 4D 网格必须进行高倍率压缩;但微表情信号极其细微,常规以人类全局视觉或通用 3D 点云保真度为目标的编码压缩标准,能否保留高频微小 AU 变形信息此前从未被严谨探究过。

本文切入这一空白,旨在建立一套覆盖“几何去噪与数据扩增—动作感知压缩评测—双流时空检测基准”的端到端 4D ME-AU 分析体系。核心 idea:设计三阶段几何去噪流程挽救被剔除序列并构建跨文化平衡的 4DME 扩展版,提出解耦外观与深度动态的双流光流网络 VoluME,并通过感知实验与下游检测任务证明采用 V-PCC 进行约 3000 倍极端压缩仍可完好保留微妙的 AU 运动表征。

方法详解

整体框架

本文构建的 4D 微表情动作单元分析与压缩基准主要包含三个核心环节: 1. 三阶段几何去噪与数据扩充:对原始立体重建网格分别进行统计去噪、序列级密度感知去噪以及人工精细交互修正,去除网格离群噪点与时序非一致伪影,使可用序列由 130 篇扩充至 265 篇(涵盖欧亚文化对称分布)。 2. 面向下游任务的体积数据压缩评测:分别引入基于网格几何编码的 Draco 与基于视频投影的 MPEG V-PCC 标准,在多档量化参数(QP)下压缩解压,评估客观几何/纹理质量与人眼主观 AU 辨识度。 3. VoluME 双流微表情动作单元检测模型:将 4D 面部表面投影解耦为 RGB 纹理流与 Depth 几何深度流,分别在起始帧(onset)与顶点帧(apex)间计算水平/垂直光流分量及光应变(Optical Strain)分量,输入轻量级 CNN 提取时空特征,并在特征层进行融合后送入独立的 AU 专属二分类 MLP。

整体处理与模型推理流程如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["原始采集 4DME 网格序列<br/>(含重建伪影与离群噪点)"] --> B["三阶段网格几何去噪<br/>统计GMM + 时序密度掩码 + 精细修正"]
    B --> C["4DME+ 扩充数据集<br/>265个序列 / 跨文化平衡 (23:20)"]
    C --> D["MPEG V-PCC / Draco 体积数据压缩<br/>(评估几何保真度与下采样损失)"]
    D --> E["投影解耦为动态RGB-D流<br/>外观 C(x,y,t) 与深度 D(x,y,t)"]
    E --> F["双流光流与光应变计算<br/>OF_rgb 与 OF_depth (各含 u, v, |ε|)"]
    F --> G["VoluME 卷积特征提取与特征级融合<br/>(CNN骨干提取 + 双流拼接)"]
    G --> H["AU 专属独立分类器<br/>(解耦多标签干扰的独立 MLP 预测)"]

关键设计

1. 三阶段网格去噪与跨文化数据扩充:消除重建伪影并挽救废弃序列 针对原始多视角立体视觉重建中产生的边缘畸变和伪面,直接基于体素或点云滤波往往会误伤面部高曲率细节。本文设计了由粗到精的三阶段去噪算法:首先针对传感器离群噪点,分析局部三角形边长分布,构建高斯混合模型(GMM)过滤非正常超长边并剔除孤立顶点;第二阶段解决跨帧持续的立体匹配错误,将整段微表情序列的时间轴投影聚合为统一的三维体素占用率掩码(Occupancy Mask),利用面部区域在时序上的高密度聚集特性与离群伪影的稀疏散乱特性,施加邻域统计滤波生成稳定面部时空包络;第三阶段对残留的紧邻高密度伪影进行人工交互微调。该流程使法向量发散度降低 86%、占用不稳定性降低 52%、表面曲率稳定性提升 47%,成功使 4DME 可用序列从 130 翻倍至 265,不仅常见 AU 样本量大幅提升(如 AU6 增长 233%、AU12 增长 224%),更构建出首个亚裔与高加索裔人数均衡(23 比 20)的 3D 微表情基准。

2. 解耦表面投影与双流光流提取:规避三维体素流尺度混乱与应变缺失 传统 3D 微表情方法通常尝试直接求解全三维体素光流方程 \(\frac{\partial I}{\partial x}u + \frac{\partial I}{\partial y}v + \frac{\partial I}{\partial z}w + \frac{\partial I}{\partial t} = 0\),将面内平移与法向深度变形混杂在单一三维矢量中,导致几何形变与外观变化相互干扰,且难以计算表征细微撕裂与挤压的光应变(Optical Strain)。VoluME 将面部网格明确假设为单重视角可见表面 \(P^*(x, y, t) := \{C(x, y, t), D(x, y, t)\}\),将外观色彩 \(C\) 与几何深度 \(D\) 严格分离,并分别在 2D 投影平面上独立计算光流: $$ \frac{\partial C}{\partial t} = -\left(\frac{\partial C}{\partial x}u_{\text{rgb}} + \frac{\partial C}{\partial y}v_{\text{rgb}}\right), \quad \frac{\partial D}{\partial t} = -\left(\frac{\partial D}{\partial x}u_{\text{depth}} + \frac{\partial D}{\partial y}v_{\text{depth}}\right) $$ 针对外观流与深度流,分别提取起始帧与顶点帧之间的水平位移 \(u\)、垂直位移 \(v\) 以及反映局部剪切形变强度的法向光应变分量 \(|\epsilon_{uv}| = \sqrt{(\frac{\partial u}{\partial x} - \frac{\partial v}{\partial y})^2 + (\frac{\partial u}{\partial y} + \frac{\partial v}{\partial x})^2}\)。三通道分量 \((u, v, |\epsilon_{uv}|)\) 作为输入直接保留局部形变先验,并保持外观与深度双流完全独立。

3. 特征级双流融合与解耦 AU 专属分类器:抗衡过拟合与空间标签冲突 针对微表情数据集样本量较小极易导致高参数网络过拟合的痛点,VoluME 采用经过轻量化改造的浅层 CNN 骨干(如 SSSNet、STSTNet 与 Off-ApexNet)作为流内编码器。与直接在输入层将 RGB 与 Depth 堆叠为多通道图像的早期融合不同,VoluME 保持视觉流与深度几何流在浅层卷积阶段互不干扰,直至高层特征阶段再进行拼接融合,这使得网络能够分别学习主要由纹理变化驱动的 AU(如细小眼角皱纹)和主要由形变隆起驱动的 AU(如抬眉、抿嘴)。进一步地,考虑到面部不同肌肉群在空间上高度集中且伴随协同运动,传统多标签联合输出层极易因强相关性产生负迁移干扰。VoluME 针对每个目标动作单元构建独立的单任务多层感知机(MLP)分类头,以 One-vs-Rest 的解耦模式独立判定各 AU 激活,显著提升了空间密集重叠区域的微弱动作检出率。

损失函数 / 训练策略

模型在训练过程中遵循严格的受试者独立(LOSO)协议。对于每个独立的 AU 分类头,由于正负样本分布存在显著失衡,采用加权二值交叉熵损失函数(Binary Cross-Entropy Loss): $$ \mathcal{L}_{\text{BCE}}^{(k)} = - \left( w_k y_k \log(\hat{y}_k) + (1 - y_k) \log(1 - \hat{y}_k) \right) $$ 其中 \(y_k \in \{0, 1\}\) 为第 \(k\) 个动作单元的真实标注,\(\hat{y}_k\) 为预测概率,\(w_k\) 为基于当前折训练集负正样本比例设定的正样本惩罚权重。在跨数据集验证(LODO)协议下,模型在完整 4DME 扩充集或 CAS(ME)3 Part C 数据集上训练,直接在另一未见数据集上进行域泛化测试。

实验关键数据

主实验

论文在扩展清洗后的 4DME 数据集上进行了严格的受试者留一交叉验证(LOSO),以汇聚二值 F1 分数(BF1)及各 AU 单项 F1 为核心评价指标。主结果表明,VoluME 系列架构全面超越了现有仅有的 3D/4D 微表情检测基准。

模型 AU1 AU2 AU4 AU6 AU7 AU12 AU17 AU45 总体 BF1
RGBD AlexNet [Li et al., 2023] 0.111 0.182 0.264 0.200 0.371 0.452 0.000 0.000 0.323
CCDN [Li et al., 2023] 0.130 0.255 0.361 0.000 0.323 0.304 0.000 0.085 0.336
VoluME (Off-ApexNet) 0.283 0.291 0.247 0.071 0.398 0.457 0.039 0.210 0.397
VoluME (STSTNet) 0.279 0.311 0.511 0.117 0.402 0.474 0.073 0.145 0.424
VoluME (SSSNet, 本文) 0.344 0.327 0.467 0.189 0.383 0.424 0.000 0.452 0.475

在跨数据集留一数据集验证(LODO,4DME 与 CAS(ME)3 互为训练与测试集)中,VoluME (SSSNet) 同样取得最佳泛化性能(BF1 达到 0.387,显著高于 RGBD AlexNet 的 0.318 与 CCDN 的 0.274)。

消融实验

为系统分析双流机制、特征级融合模式以及光应变分量的贡献,作者在 LOSO 与 LODO 两个严苛协议下进行了关键组件消融,指标为 Macro-F1(各 AU 等权宏平均 F1):

配置 / 变体 LOSO Macro-F1 LODO Macro-F1 说明
VoluME-SSSNet (完整模型) 0.485 0.389 特征级双流融合 + 光应变 (u, v, |ε|)
单流:仅 RGB 纹理流 0.405 0.300 缺失几何深度运动建模,LOSO 掉点 8.0%
单流:仅 Depth 深度流 0.364 0.312 缺失面部表层纹理光流,LOSO 掉点 12.1%
输入级融合 (Input Fusion) 0.396 0.217 RGB 与 Depth 在通道层直接拼接,LODO 骤降 17.2%
去除光应变 (No Strain) 0.364 0.175 移除 |ε| 仅保留 (u, v),跨数据集泛化性能腰斩

体积压缩评测实验

研究进一步验证了不同 3D 编码标准在不同压缩比下对下游 ME-AU 识别的保真度(下表为 4DME LOSO Macro-F1):

压缩方案与级别 几何压缩比 (CRgeom) 总压缩比 (CRtotal) 平均 Macro-F1 性能衰减
原始未压缩数据 1.0× 1.0× 0.356 0.0% (基准)
V-PCC R3 640× 1575× 0.356 0.0% (无损保留)
V-PCC R2 1665× 3155× 0.344 -1.2% (近乎微弱衰减)
V-PCC R1 2955× 5780× 0.306 -5.0% (严重形变)
Draco QP9 10.7× - 0.352 -0.4%
Draco QP8 12.0× - 0.321 -3.5%
Draco QP6 16.0× - 0.283 -7.3%

关键发现

  • 光应变(Optical Strain)是抗域漂移的核心:在消融实验中,去掉光应变 \(|\epsilon_{uv}|\) 使 LODO 跨数据集泛化指标由 0.389 暴跌至 0.175,跌幅高达 55%,证明微表情不仅关乎像素宏观位移,其肌肉微变形率是抑制个体和跨传感器域差异的关键不变量。
  • 特征级融合极大提升跨域鲁棒性:直接在输入端把 RGB 与 Depth 堆叠(Input Fusion)在跨域实验中仅取得 0.217,相比特征级融合(0.389)存在明显落后,证明外观纹理与表面几何需要由独立子网络充分解耦表征。
  • V-PCC 压缩在 3000 倍率下仍具强健下游保真度:在总压缩比达到 3155× 的 V-PCC R2 配置下,ME-AU 平均检测 F1 仅由 0.356 降至 0.344(衰减仅约 1%),且在主观人工感知实验中 AU 检出率保持在 95.6%,彻底打破了 4D 体积数据难以分发存储的现实壁垒。

亮点与洞察

  • 从三维体流向双路表面光流与光应变的巧妙降维:作者没有盲目堆叠高开销的三维 3D 卷积或纯点云时空 Transformer,而是紧扣面部几何作为单一可见流形的前提,解耦出外观与深度正交投影,完美继承了 2D 光应变先验并规避了计算爆炸。
  • 用下游感知和任务驱动压缩参数寻优:没有止步于通用的 PSNR 或 Chamfer 距离,而是创新地同时开展人工 AU 盲测与深度模型任务下游回归,证明即使在极端视觉压缩比下,微表情关键生理运动特征仍能高度保留。
  • 可复用的数据工程范例:利用时空体素占用一致性(Occupancy Consistency)配合 GMM 边长建模,为带有严重立体匹配瑕疵的历史 3D 人脸/表情数据集提供了一套非侵入式、高保真的去噪挽救 SOP。

局限与展望

  • 稀疏 AU 的长尾识别困境仍未彻底根除:如 AU17(下颏推移)在整个扩展数据集中仅 6 个受试者呈现阳性样本,在受试者留一(LOSO)测试中全模型几乎均录得 0 分,受试者间运动个性化异质性难以用小规模数据克服。
  • 顶点帧(Apex Frame)依赖假设:当前光流与应变计算依赖预先给定的 onset 与 apex 帧标注,但在实际野外或长视频连续微表情检测(Spotting & Detection)中,定位顶点帧本身是一大挑战。
  • 未来方向:探索端到端的无顶点标注 4D 流式时空分析,并将 V-PCC 压缩编码直接嵌入到神经表示(如 4D 3DGS)中实现超紧凑存储与实时流式推理。

相关工作与启发

  • vs CCDN 与 RGBD AlexNet:以往少数 3D 微表情工作仅输入静态 Apex 帧的 RGB-D 单图或使用粗糙的 3D 卷积,完全遗失了 onset-to-apex 动态时间信息;VoluME 通过双流光流显式注入时序位移与剪切形变,在 4DME LOSO 上实现了从 0.336 到 0.475 的质的飞跃。
  • vs 端到端 3D Transformer(如 AUFormer 拓展):在仅有数百个 4D 样本的小样本情境下,高容量注意力网络往往因过拟合而崩溃,VoluME 采用轻量 CNN + 强物理归纳偏置(光应变与独立分类头),为数据受限的几何时空分析提供了示范。

评分

  • 新颖性: ⭐⭐⭐⭐ [首次系统研究 4D 动态微表情数据的压缩极限与保真边界,提出解耦双流表面光应变机制]
  • 实验充分度: ⭐⭐⭐⭐⭐ [涵盖网格去噪质量、主观人眼感知评测、LOSO/LODO 双基准、压缩衰减对比及组件消融]
  • 写作质量: ⭐⭐⭐⭐⭐ [问题拆解层层递进,数据工程与建模动机清晰连贯]
  • 价值: ⭐⭐⭐⭐⭐ [扩展并清洗了 4DME 数据集使其可被社区真正使用,大幅降低了 4D 微表情研究的数据与算力门槛]