跳转至

Mind-to-Face: Neural-Driven Photorealistic Avatar Synthesis via EEG Decoding

会议: ECCV2026
论文: ECCV 2026
领域: 医学图像 / 3D视觉
关键词: EEG 解码, 脑机接口, 人脸表情合成, 3D 高斯泼溅, 稠密位置图

一句话总结

Mind-to-Face 首次把非侵入式 16 通道 EEG 直接解码成 256×256 的稠密 3D 位置图(约 6.5 万顶点),再驱动绑定在网格面上的 3D 高斯泼溅渲染出保留被试身份与情绪强度的写实面部头像,为此搭建了一套 EEG 与 16 路多视角高速相机帧级同步的双模态采集系统。

研究背景与动机

当前的表情与头像系统几乎完全建立在视觉线索上——摄像头、动作捕捉、语音分析。这类方法在一个被忽视的场景里会整体失效:当人脸被头显(HMD)遮挡,或者情绪只是"内心经历"而没有被外显出来时,任何外部传感器都读不到东西。而情绪与认知本来起源于先于面部动作的神经活动。与此同时,三条本应相连的研究线各自为政:视觉模型只负责重建外部几何,情感计算把 EEG 分类成 happy/sad 这类粗标签,脑机接口关注的是符号与运动意图。把神经状态接到视觉表达上的那一环始终是缺的。

EEG 是这条路上最现实的入口:非侵入、可穿戴、时间分辨率高,而且已有大量证据表明 EEG 与情绪状态、与符号化的面部表情之间存在稳定相关性。但 EEG 极少被当作视觉合成的驱动信号,已有的基于学习的 EEG 表情工作大多只做离散标签分类。这里的瓶颈不只是"标签太粗",而是离散类别根本无法承载写实头像所需的连续、细粒度动态;而直接从 EEG 做高保真重建本身也很难——通道数少、信噪比低,且神经响应高度个体化:同一段刺激在不同被试身上会产生不同的 EEG 指纹,这说明现阶段谈"通用跨被试模型"并不现实。

本文因此先把问题收敛到"单个被试、给定刺激下的连续表情重建",并围绕它解决两个具体障碍:一是 EEG 与面部几何必须帧级对齐,否则监督信号本身就是错的;二是从低维 EEG 到高维面部几何的映射不应该经过"表情系数"这层瓶颈。核心 idea:用一套靠线性时间码严格同步的双模态采集装置拿到配对的 (EEG 窗口, 多视角人脸视频),把多视角摄影测量重建出的稠密 3D 位置图当作解码目标,用 CNN-Transformer 编码 EEG、用随机初始化的 VAE 解码器回归位置图,再由改造后的 3D 高斯泼溅管线渲染出写实头像——把"神经信号 → 视觉表达"建成一个端到端可监督的连续映射。

方法详解

整体框架

整条 pipeline 的输入是一段 16 通道、125Hz 采样的原始 EEG 与同期的多视角人脸视频,输出是视角一致、带情绪表达的写实面部头像。中间经过四步:EEG 先做 4–40Hz 带通滤波、逐通道标准化,再切成 375 个采样点(125Hz 下正好 3 秒)的滑动窗;同时多视角视频经摄影测量重建出拓扑一致的 3D 人脸网格,刚体对齐到规范坐标系后转成 256×256 的 UV 位置图作为监督;随后 CNN-Transformer 编码器把 EEG 窗压成潜在向量,VAE 解码器把它解成稠密位置图;最后从位置图采样顶点成网格,用每个三角面驱动一组绑定好的 3D 高斯做可微渲染。整条链路里推理时只有 EEG 是输入,视频与网格只出现在训练和评测阶段。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["16 通道 EEG<br/>+ 多视角视频"] --> B["双模态同步采集与配对监督<br/>帧级同步 → 重建位置图"]
    B --> C["CNN-Transformer EEG 编码器<br/>时空卷积 + 自注意力"]
    C --> D["稠密位置图解码<br/>VAE 解出稠密位置图"]
    D --> E["高斯绑定渲染<br/>网格驱动 3D 高斯泼溅"]
    E --> F["EEG 驱动的写实头像"]

关键设计

1. 双模态同步采集与配对监督构建:让 EEG 与面部几何在帧级对上

要在 EEG 和面部几何之间做监督学习,前提是两路信号在时间上真正对齐,而这恰恰是最容易被低估的工程难点——EEG 头帽与相机阵列由不同的硬件时钟驱动,几十毫秒的漂移就足以让"这一段脑电"对应到错误的帧。本文的做法是把整个采集搬进 Light Stage:被试面对一块播放情绪诱发影片的显示屏,四周以 15° 间隔均匀布置 16 台电影级全局快门相机(最高 8K、120fps)提供稠密视角覆盖,相机之间用 genlock 与时间码发生器同步;EEG 用 OpenBCI 的 Cyton-Daisy 采集 16 通道、125Hz 信号,电极按国际 10–20 系统排布并涂抹导电胶把阻抗压在 500kΩ 以下。最关键的一步是用 Arduino Teensy 产生一路线性信号,把 EEG 头帽与相机阵列钉在同一个时间轴上,形成帧级对齐的双模态数据。刺激素材选自 OpenLAV 与 Coan & Allen 的情绪诱发片段,按时长归为 neutral、disgust、funny、angry、sad 五类,每类构成一个 trial,中间隔 30 秒静息以避免情绪残留;另有一段来自 EMOSTIM 的混合情绪视频完全不参与训练,专门作为 leave-one-trial-out 的跨 trial 测试序列。每个被试完成 5 个情绪 trial 加 1 段测试序列(引言按 6 段 trial 统计),单次录制约 25–30 分钟。

监督信号一侧同样需要专门的设计:每帧视频都要重建出 3D 人脸网格。本文先用 ICT-FaceModel 的 3DMM 在某个中性帧上解出被试身份,再把身份模板网格拟合到多视角摄影测量观测上,用 Laplacian 变形保持拓扑一致,并用光流做时序精修。随后对每个网格做刚体 Procrustes 对齐,消除头部位姿,把整段序列统一到同一个规范坐标系里——这一步很划算,它让解码器的监督目标只剩非刚性表情形变,等于免费地把一个更简单的问题交给网络。对齐后的网格再转成 \(P(t) \in \mathbb{R}^{256\times256\times3}\) 的位置图,每个像素编码人脸表面在 UV 空间中的 \((x,y,z)\) 坐标,与对应的 EEG 窗组成配对样本。之所以值得自己搭这套装置,是因为已有的最接近的公开数据 MAHNOB-HCI 只有 1 路彩色加 5 路单色相机,分辨率与色彩格式都不足以做 3D 人脸重建,无法支撑这条监督链路。

2. CNN-Transformer EEG 编码器:从低维噪声信号里抽出与表情同步的表征

EEG 只有 16 个通道、125Hz 采样,而且混着肌电、眼动与工频噪声,直接回归面部几何几乎不可能。本文先把一个 EEG 窗 \(E(t) \in \mathbb{R}^{W\times C}\)\(W=375\)\(C=16\))重排成 \(1\times C\times W\) 的单通道张量,把它当作一张"时空图像"来卷积:第一层沿时间轴做卷积(40 个输出通道、卷积核 40)捕捉短程波形模式,第二层横跨全部 16 个电极做空间卷积(卷积核 16)建模电极间的空间相关性——这正是 CNN 类 EEG 解码器的标准做法,用可学习卷积替代手工设计的带功率或 CSP 特征。卷积分支输出后接 BatchNorm、ELU 与平均池化,把时间维从 375 压到约 19 个特征片段,压缩掉冗余的同时保留情绪相关的慢变成分,再由 1×1 卷积投影到 \(E=40\) 的嵌入维度,形成 19 个 token 的序列。

接下来是 6 层 Transformer 编码器:每层用 pre-LN,10 头多头自注意力,前馈网络把嵌入维度扩 4 倍后接 GELU 与 dropout(\(p=0.5\)),注意力与前馈两条子层都带残差。卷积负责局部时空结构,自注意力负责整个 3 秒窗内的长程依赖——这两者缺一不可,只有同时抓住"电极间的瞬时空间格局"和"一个窗内情绪的演化趋势",才可能从信噪比很低的信号里抽出与表情同步的分量。需要说明的是,这个编码器是受 EEG-Conformer 启发的成熟骨干,本文的贡献不在结构本身,而在于它被接到了一个稠密几何目标上。

3. 稠密位置图解码:用 6.5 万顶点取代 52 维 blendshape

编码器输出的潜在向量 \(z(t)\) 经若干全连接层投影成 \(4\times8\times8\) 的潜特征图,再由一个 VAE 解码器解出 3 通道粗输出,最后经两层转置卷积上采样成 \(256\times256\times3\) 的位置图,每个像素同样编码表面的 \((x,y,z)\)。这个解码器是随机初始化、与 EEG 编码器联合训练的——也就是说,训练信号只有位置图上的 MSE 与平滑正则,没有任何来自图像或 FLAME 系数的中间监督。

之所以不去预测表情系数而选择位置图,作者给出了两条具体理由。其一是表达力:把 EEG 映射到固定的 52 个 blendshape 系数,相当于在原本已经很窄的 EEG 瓶颈之后再套一层 52 维瓶颈,模型会倾向于给出"平均化"的预测,细微表情被抹平;而位置图上约 6.5 万个顶点(对比 FLAME 的约 5000 顶点)能承载皱纹这类中频几何细节。其二是可监督性:位置图是 UV 参数化的规则二维网格,可以直接用标准 2D 卷积网络和图像解码器处理,不需要为不规则网格设计专用算子。此外,训练时用一张二值 mask 把监督限制在内脸区域,让解码器专注表情形变而不是刚性头动;再加一项自监督的 Laplacian 正则提升表面的平滑与连续。消融实验(Tab. 1)验证了这一选择的实际收益。

4. 无 FLAME 依赖的跟踪与高斯绑定渲染:把几何与外观解耦

渲染端沿用 GaussianAvatars 的 3D 高斯框架,但几何来源被整体替换。标准 GaussianAvatars 依赖 VHAP 库做关键点检测、再从 FLAME 参数算出面几何;而在本文的采集场景里,被试必须戴 EEG 头帽,头帽会干扰关键点检测,情绪诱发影片带来的极端表情又超出 FLAME 参数的表达能力,两者叠加会让跟踪出错甚至几何完全崩坏。本文因此直接用自己那条鲁棒跟踪管线产出的拓扑一致网格作为几何中枢:训练时不再拟合 FLAME 参数,而是从跟踪网格取几何,让 3D 高斯拟合到更贴近真实表情的形状上。

绑定策略是这套渲染方案的核心。初始化时每个三角面分配一个高斯,高斯的局部参数——相对面中心的旋转 \(r\)、位置 \(\mu\)、尺度 \(s\)——在三阶球谐颜色之外保持为可学习量;渲染时按照面自身的旋转 \(R\)、平移 \(T\)、缩放 \(k\) 变换到全局坐标:

\[r' = Rr,\quad \mu' = kR\mu + T,\quad s' = ks\]

也就是说,高斯的局部参数只在规范帧里学一次,动画时更新的只是它所绑定三角形的全局变换。这样一来外观与几何就被解耦了:任何新的位置图只要采样出网格,同一组高斯就能立即跟着网格运动并渲染,无需重训练,也天然保证了视角一致性。训练时每次迭代随机采样一个(网格、相机、图像)三元组渲染并回传梯度,优化目标在 L1、D-SSIM 之外还加了位置与尺度两项正则,约束高斯不要漂离所绑定的面中心、尺度不要失控。

一个完整示例

以推理时的一段 3 秒 EEG 为例走一遍。原始信号先过 6 阶 Butterworth 带通(4–40Hz)滤掉漂移与高频噪声,再按训练集统计量做逐通道 z-score,切成 \(1\times16\times375\) 的窗。时间卷积(40 通道、核 40)与空间卷积(核 16)先后作用,接 BN/ELU/平均池化后时间维变成 19 个片段,1×1 卷积把它们投到 40 维,得到一个 19 个 token 的序列;6 层 Transformer(10 头、FFN×4、dropout 0.5)输出 40 维的 \(z(t)\)\(z(t)\) 经全连接投成 \(4\times8\times8\) 潜特征图,VAE 解码器输出 3 通道粗图,两层转置卷积把它升到 \(256\times256\times3\)——这就是预测的位置图 \(\hat P(t)\)。按模板 UV 布局从位置图采样顶点坐标,得到约 6.5 万顶点的网格 \(\hat M(t)\);网格上每个三角面带着自己的高斯做全局变换后泼溅渲染,输出该时刻写实、视角一致的面部图像。窗口之间是有重叠的,所以相邻时刻的位置图会平滑过渡,序列在时间上自然连贯,不需要额外做时序平滑。

损失函数 / 训练策略

位置图解码的损失由监督项与平滑项组成,\(\mathcal{L}_{\mathrm{rec}}\) 是 mask 内逐像素的 MSE、\(\mathcal{L}_{\mathrm{smooth}}\) 是施加在预测位置图上的 Laplacian 平滑损失:

\[\mathcal{L}_{\mathrm{pm}} = \lambda_{\mathrm{rec}}\mathcal{L}_{\mathrm{rec}} + \lambda_{\mathrm{smooth}}\mathcal{L}_{\mathrm{smooth}}\]

⚠️ 论文 PDF 的公式抽取中该式的权重符号有损坏,此处按正文描述还原为两项加权和,具体系数以原文为准。

渲染阶段的 3DGS 训练损失在重建项外加了位置与尺度正则,\(\mathcal{L}_{\mathrm{pos}} = \|\max(\mu, \epsilon_{\mathrm{pos}})\|^2\) 约束高斯相对面中心的偏移、\(\mathcal{L}_{\mathrm{scale}} = \|\max(s, \epsilon_{\mathrm{scale}})\|^2\) 约束高斯尺度:

\[\mathcal{L} = (1-\lambda)\mathcal{L}_1 + \lambda\mathcal{L}_{\mathrm{D\text{-}SSIM}} + \lambda_{\mathrm{pos}}\mathcal{L}_{\mathrm{pos}} + \lambda_{\mathrm{scale}}\mathcal{L}_{\mathrm{scale}}\]

⚠️ 抽取文本中 \(\lambda\)\((1-\lambda)\) 的归属不清晰,以原文为准;3DGS 的其余超参沿用 GaussianAvatars 的设置。数据划分上,每个情绪 trial 的最后 15% 帧留作测试、其余用于训练(遵循信号处理中防止统计泄漏的惯例),EMOSTIM 序列完全不入训练,只用于评测跨 trial 泛化。

实验关键数据

主实验

本文自述这是首篇把 EEG 解码到稠密人脸几何的工作,因此没有可比基线,正文的定量评测落在"稠密位置图 vs. blendshape"这一表示方式的对比上:在同一套 EEG 解码框架内分别预测位置图与 FLAME blendshape,比较驱动出的头像几何相对摄影测量真值的点对面距离(仅在 mask 内的面部区域统计,单位 mm)。

Trial 位置图·被试1 均值 位置图·被试1 <1mm 位置图·被试2 均值 位置图·被试2 <1mm Blendshape·被试1 均值 Blendshape·被试1 <1mm Blendshape·被试2 均值 Blendshape·被试2 <1mm
Angry 0.4982 87.37% 0.5534 84.28% 1.0792 60.76% 1.6492 42.79%
Disgust 1.0238 61.89% 0.6347 80.57% 1.7680 42.03% 1.3410 60.35%
Funny 0.9614 69.12% 0.7432 78.24% 1.3385 56.56% 1.6195 48.93%
Neutral 0.4028 92.85% 0.3245 95.84% 0.3270 94.99% 1.3065 52.91%
Sad 0.3571 94.60% 0.3112 96.60% 0.5391 84.95% 1.3134 56.22%
EMOSTIM 0.5158 86.76% 0.7077 78.88% 0.6838 78.78% 1.5078 52.22%

表中均值单位为 mm。EMOSTIM 一行是 leave-one-trial-out 的跨 trial 泛化结果,该序列的刺激内容与其情绪类别都未参与训练。原文另外给出了 <3mm 顶点占比(位置图驱动下普遍 ≥92.8%),此处从略;正文只给出了这一张定量表,图像层面的指标(FID、身份相似度等)被推到补充材料。

消融实验

由于论文的消融以定性为主,下表把原文给出的两项消融整理在一起:有数值的一项由本笔记据上表逐 trial 汇总(原文未给出总平均),无数值的一项忠实标注为定性证据。

消融维度 配置 几何误差(6 trial 均值,mm) <1mm 顶点占比(均值) 依据 / 说明
几何表示 稠密位置图(被试1 / 被试2) 0.627 / 0.546 82.1% / 85.7% 上表逐 trial 汇总(本笔记计算)
几何表示 FLAME blendshape(被试1 / 被试2) 0.956 / 1.456 69.7% / 52.2% 上表逐 trial 汇总(本笔记计算)
跟踪管线 本文鲁棒跟踪 Fig. 6 定性:EEG 头帽遮挡与极端表情下保持稳定
跟踪管线 GaussianAvatars 的 VHAP + FLAME Fig. 6 定性:预测错误表情,甚至几何崩塌(原文打红叉)
嘴部增强 GFP-GAN 后处理(仅作用于嘴内) 作者声明只修嘴内、不改变解码出的情绪
监督区域 内脸 mask + Laplacian 平滑 论文说明其作用(聚焦形变、提升表面平滑),未单独量化

跨 trial 泛化可以看作第三项消融:完全没见过的 EMOSTIM 混合情绪序列上,位置图驱动仍拿到 0.5158 / 0.7077 mm 的均值误差,说明性能并非来自对训练片段情绪类别的记忆。

关键发现

  • 稠密位置图在几乎全部条件下优于 blendshape:除被试1 的 Neutral(0.4028 vs 0.3270,blendshape 略优)外,位置图驱动的几何误差在所有 trial 上都更低;被试2 上则是 6 个 trial 全线更优。汇总后的平均误差从 0.956 / 1.456 mm 降到 0.627 / 0.546 mm,<1mm 顶点占比平均从 69.7% / 52.2% 提到 82.1% / 85.7%。
  • 差距集中在情绪强度大的 trial 上:Disgust 上被试2 的对比是 0.6347 对 1.3410 mm、<1mm 占比 80.57% 对 60.35%,而被试1 的 Disgust 更是 1.0238 对 1.7680 mm。这与作者的解释一致——52 维 blendshape 基底的表达范围有限,面对幅度大、形变复杂的表情会明显"缩小幅度",而被试1 的 Disgust 误差反而高于其 Angry 与 Funny,也提示该 trial 的形变强度更大或信号更难解码。
  • 平滑与低幅表情最容易:Neutral 与 Sad 在两个被试上误差都最低(0.31–0.40 mm),情绪表达越弱、越接近静态,EEG 与几何的对应关系越简单。
  • 跟踪管线是可用性的隐形前提:作者明确指出 GaussianAvatars 的默认跟踪在无遮挡场景下渲染质量与本文接近,但一旦进入"戴 EEG 头帽 + 极端表情"的场景就会跟踪失误甚至完全崩坏。换句话说,本文的鲁棒跟踪不是为了刷指标,而是让整个任务在这套采集条件下变得可行。
  • 定性结果(Fig. 5)显示 EEG 驱动的头像能复现情绪(悲伤时皱眉、有趣片段时微笑、厌恶时眉/鼻收紧),并保留被试个体化的强度差异(例如笑的幅度因被试而异),说明模型学到的是主体定制的表达而不是粗类别。
  • 嘴内区域靠预训练 GFP-GAN 后处理补齐:这是承认 3DGS 头像在口腔内部建模上的固有短板,作者强调增强严格限制在嘴内,不触碰解码出的情绪。

亮点与洞察

  • 把"EEG → 离散标签"换成"EEG → UV 参数化的稠密位置图":位置图既是连续几何、又是规则二维网格,于是可以复用标准图像解码器(VAE + 转置卷积)和成熟的 3DGS 渲染管线,绕开了"EEG → 表情系数 → 几何"的两级降维瓶颈。这是让两端能接起来的关键接口设计,也是最能迁移的思路。
  • 用 Procrustes 对齐做"免费的降难度":把刚性头动在监督信号里先消掉,解码器只需要学非刚性形变。对一个信噪比本就很差的输入信号来说,这种对目标空间的预处理,比在网络结构上加东西更划算。
  • 几何与外观解耦的绑定策略:高斯局部参数在规范帧学一次,动画时只更新绑定面的全局变换,因此同一组高斯可以跟随任意新的位置图运动,天生视角一致且无需逐帧重训。
  • 数据集与同步方案本身就是贡献:EEG 与 16 路 8K 相机在帧级对齐,且相机布局支持摄影测量重建——这套采集配置此前没有,它把"神经信号 ↔ 高保真面部几何"的配对监督变成了可能,也是本文承诺公开的资产。
  • 可迁移方向:把"低维噪声生物信号 → 稠密规范空间表示 → 可微渲染"这条链路整体搬到别的通道上,例如用 EMG、眼动或 fNIRS 驱动同类位置图,或把位置图换成 SMPL-X 的稠密位置图做神经信号驱动的全身姿态/手势合成;位置图作为通用接口这一点在跨模态生成里应该都能复用。

局限与展望

  • 作者承认的局限:数据只来自 2 名被试、每人 6 段 trial(5 个情绪 trial + 1 段测试序列)、单次录制约 25–30 分钟,且明确不做跨被试建模,只做 subject-specific 表达控制。未来计划扩充被试与刺激多样性,并在解码时引入刺激上下文,以解耦"感知"与"情感"两类信号。
  • 缺少直接对照:作者自述没有可比基线,全文唯一的定量对比是"位置图 vs. blendshape"这一内部消融。这意味着我们无法判断"CNN-Transformer 编码器 + VAE 解码"这条具体链路相对一个更简单的 EEG 回归基线(例如直接用 EEG-Conformer 回归 blendshape)究竟好多少。
  • 评测指标偏窄:定量只报告了几何点对面误差,图像层面的质量指标(FID、身份相似度、LPIPS、landmark 误差)被推到补充材料;而对一个渲染写实头像的系统来说,图像质量恰恰是读者最关心的部分。
  • 情绪条件偏弱:每个 trial 只对应一种情绪,没有逐帧的情绪标注,因此模型有可能学到的是"该 trial 的平均表情倾向"而非逐帧情绪动态;EMOSTIM 的跨 trial 测试说明泛化性存在,但不能排除这一风险。
  • 输入端的物理上限:消费级设备只有 16 通道、125Hz 采样,4–40Hz 带通还把 γ 波段排除在外,而情绪相关的高频成分常被认为有信息量。此外监督用的位置图来自摄影测量重建,其自身误差会成为整个系统的误差下界。
  • 嘴内需要外挂 GFP-GAN 修图,说明几何+3DGS 这条路线在口腔内部仍不可靠,而这部分又恰好是头显遮挡场景下最需要生成的内容。
  • 可改进方向:引入 subject embedding 或轻量 adapter 做跨被试迁移;用对比学习把 EEG 表征与面部运动单元(AU)显式对齐,让潜在空间有可解释的中间层;在训练目标里加情绪分类辅助损失,反向验证情感信息是否真的进入了预测几何。

相关工作与启发

  • vs 基于 EEG 的表情分类工作(如用 CNN+GA 解码面部表情 BCI 的工作):他们从 EEG 预测离散表情类别,输出是标签;本文输出的是连续的稠密 3D 几何再渲染成写实图像。区别不在于模型大小,而在于目标表示——标签的空间无法承载写实头像需要的细粒度动态,这是本文选择的出发点。
  • vs MAHNOB-HCI 等多模态情感数据集:同样同步采集面部视频与 EEG,但 MAHNOB-HCI 是 1 路彩色 + 5 路单色、分辨率低,只能做 2D 层面的分析,无法支撑摄影测量的 3D 人脸重建。本文的采集配置是首个能同时给出高保真 3D 几何与 EEG 的同步数据。
  • vs GaussianAvatars:他们用 FLAME 表情系数驱动绑定在网格上的高斯,在表情温和、面部无遮挡的常规场景下是最优解;本文把几何中枢换成自己跟踪出的稠密位置图,去掉 FLAME 依赖,代价是失去参数化的可编辑语义,收益是在头帽遮挡与极端表情下仍然稳定。
  • vs NeRF 系头像方法(如动态 NeRF、IMavatar、Neural Head Avatars):这些方法同样能重建写实头部,但本文选择 3DGS 是因为它提供显式场景表示,几何可控、渲染高效,适合"几何由外部信号驱动"这种需要精确控制的任务。
  • vs 语音/音频驱动头像:语音是外部行为信号,本质上仍是对面部运动的间接观测;EEG 是内部神经信号,在面部被头显完全遮挡、外部线索彻底失效时,它是唯一可能可用的通道。这也是本文场景设定的价值所在。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首个把非侵入式 EEG 解码到稠密 3D 人脸几何并渲染写实头像的工作,问题设定与接口设计都很新。
  • 实验充分度: ⭐⭐ 只有 2 名被试,没有可比基线,定量仅几何误差一项,图像质量指标全在补充材料。
  • 写作质量: ⭐⭐⭐⭐ pipeline 与设计动机交代得比较清楚,对 subject-specific 定位与无基线的局限也算坦诚;但正文公式在抽取版本中有损坏,定量表也偏单薄。
  • 价值: ⭐⭐⭐⭐ 同步采集管线与"神经信号 → 稠密位置图 → 3DGS"的思路具备长期价值,数据集公开后会成为该方向的稀缺资源;但离可用的遮挡场景头像驱动系统仍有相当距离。