跳转至

TimeWalker: Personalized Neural Space for Lifelong Head Avatars

会议: ECCV 2026
论文: ECCV 原文
代码: https://TimeWalker2026.github.io/
领域: 3D视觉
关键词: 头部虚拟化身, 终生建模, 神经参数化模型, 2D高斯泼溅, 动态网格重建

一句话总结

针对传统头部化身仅建模瞬时静态或短视频片段的局限,TimeWalker 提出个性化神经线性组合空间与动态 2D 高斯泼溅(DNA-2DGS),仅需网络非结构化跨年龄照片集合即可构建兼具跨年龄身份一致性与多维度显式解耦控制的终生 3D 头部化身。

研究背景与动机

计算机图形学与视觉领域在头部化身建模上取得了长足进步,从经典 3DMM 到 NeRF、3DGS 以及各类可驱动神经头部身,化身渲染日益逼真。然而,既有工作几乎都隐含着一个核心假设——个体的头型与几何在短时间内是恒定不变的(Shape Invariance),化身往往只是单次拍摄、受控多视距扫描或几段短视频的瞬时副本(Momentary Replicas)。但在社会学与心理学关于自我认同的理论中,一个人的身份并非由单一时刻定义,而是贯穿一生的连续叙事。

当我们将 3D 头部建模推进至终生尺度(Lifelong Scale)时,面临三重本质困境:其一,终生时间跨度打破了几何恒定假设,随年龄增长骨骼肌肉结构发生重塑,外加发型、皱纹等表观剧烈演变,如何在长周期大形变下维持身份一致性;其二,现实中无法采集跨越数十年的多视角扫描或连续视频,数据主要为网络上视点极度不均、光照复杂、数量稀缺的非结构化散图;其三,现有动画驱动方法多依赖特定模板网格,在面对低质量稀疏数据时难以实现表情、头部形状、年龄阶段与视角的全面显式解耦驱动,同时兼顾高保真表面网格重建。

为了在无须大规模跨身份预训练的前提下克服严重的数据稀疏性与大跨度形变,本文追溯至经典 3DMM 的线性基组合思想,将其升维为神经线性表征空间。核心 idea:将个体的终生身份建模为规范空间中共享的不变平均头部表征与一组通过动态神经基混合模块(Dynamo)自适应剪枝的时刻特异属性神经基的加权累加,并结合显式逆向形变引导的动态 2D 高斯泼溅(DNA-2DGS),在解耦表情与年龄维度的同时实现高质量动态稠密网格的延迟形变重建。

方法详解

整体框架

TimeWalker 的核心任务是从目标人物跨越数十年的非结构化照片集合中,学习一个结构可解释、支持显式解耦控制的个性化神经参数化空间。系统整体分为两层形变驱动架构:第一层通过神经线性组合空间,将规范空间中基于 FLAME 模板初始化的平均头部 2D 高斯面元(Gaussian Surfels)形变到特定人生阶段(Lifestage / Moment-specific);第二层通过 DNA-2DGS 引入基于 FLAME 表情系数引导的几何变换矩阵与延迟形变机制,实现表情动作(Motion / Expression)的实时驱动与高保真动态表面网格提取。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["非结构化跨年龄图像集"] --> B["规范空间平均表征<br/>FLAME 初始化 2DGS"]
    B --> C["1. 动态神经基混合模块<br/>多分辨率哈希网格与动态剪枝"]
    C --> D["2. 残差全局补偿<br/>阶段残差向量与变形/颜色 MLP"]
    D --> E["时刻特异静态化身<br/>属性形变相加"]
    E --> F["3. 动态高斯逆向变形渲染<br/>Frenet 局部坐标系仿射矩阵变换"]
    E --> G["4. 延迟变形动态网格重建<br/>泊松重建后驱动顶点变形"]
    F --> H["多维度解耦化身渲染"]
    G --> I["高质量动态网格序列"]

关键设计

1. 动态神经基混合模块:自适应紧凑表征时刻核心变异 如果为每个生活阶段单独分配一个固定的独立特征基,不仅参数冗余、容易对表面光照和配饰过拟合,而且丢失了个体跨年龄共有的深层身份特征。为此,TimeWalker 提出了 Dynamo 模块。系统假设人物在任意时刻的特征都可以表示为 \(N\) 个神经头部基的线性组合: $\(f(\mathbf{x}_c) = \sum_{i=1}^N \omega_i H_i(\mathbf{x}_c)\)$ 其中 \(H_i\) 由多分辨率哈希网格(Multi-resolution Hashgrid)紧凑存储并通过三线性插值查询。为了消除冗余并避免死记硬背阶段外观,Dynamo 引入了动态基剪枝机制:在训练迭代中,以采样间隔 \(q\) 监控各个哈希网格在所有阶段 \(k\) 上的混合权重 \(\omega_i^k\)。若某一网格的权重持续低于预设阈值 \(\kappa\)(即 \(\mathbb{I}(\omega_i^k < \kappa) = 1\) 在多阶段恒成立),表明该网格未学到有意义的共享变异特征,系统将主动将其停用。这样在训练收敛时保留下一组最紧凑、表达力最强的神经基,平衡了模型容量与跨阶段泛化能力。

2. 残差全局补偿与高斯属性加法形变:消除基混合盲区 仅依靠线性加权基可能在局部微小细节和极端光照补偿上表达不足。TimeWalker 为每个年龄阶段分配一个全局可学习残差嵌入向量 \(\mathbf{l}_{\text{res}}\),并将其与混合特征 \(f(\mathbf{x}_c)\) 拼接后送入形变多层感知机 \(\text{MLP}_{\text{deform}}\)。该网络预测出 2D 高斯面元的位置增量 \(\delta \mathbf{x}\)、旋转增量 \(\delta \mathbf{r}\)、缩放增量 \(\delta \mathbf{s}\) 和不透明度增量 \(\delta \sigma\)。随后,中间形变特征再输入 \(\text{MLP}_{\text{color}}\) 得到球谐系数增量 \(\delta \mathbf{C}\)。所有增量直接累加至规范空间的平均高斯属性上: $\([\mathbf{x}_d, \mathbf{r}_d, \mathbf{s}_d, \sigma_d, \mathbf{C}_d] = [\mathbf{x}_c, \mathbf{r}_c, \mathbf{s}_c, \sigma_c, \mathbf{C}_c] + [\delta \mathbf{x}, \delta \mathbf{r}, \delta \mathbf{s}, \delta \sigma, \delta \mathbf{C}]\)$ 该过程在无需显式 3D 监督的情况下,以分析合成(Analysis-by-Synthesis)的方式自底向上解耦出目标人物在特定人生阶段的中性静态头部基准。

3. 动态高斯逆向变形渲染:局部坐标系导向的表情驱动 在时刻特异的高斯面元生成后,若简单使用神经隐式变形场驱动表情,往往难以捕捉眼球、嘴唇等极细微开合,且易导致外观与表情混淆;而直接绑定网格又受限于固定的面部拓扑。DNA-2DGS 引入基于局部微分几何的逆向形变算子:通过 FLAME 模型拟合提取规范空间模板网格 \(M_{\text{canon}}\) 与表情追踪网格 \(M_{\text{def}}\)。对于每个高斯面元 \(\mathbf{x}_d\),通过最近邻三角形搜索构建局部 Frenet 坐标系变换矩阵: $\(F = L_{\text{def}} \cdot \Lambda^{-1} \cdot L_{\text{canon}}^{-1}\)$ 其中 \(\Lambda\) 包含局部三角面的尺度放缩。面元坐标进一步更新为 \(\mathbf{x}'_d = F \cdot \mathbf{x}_d\)。该闭环显式变换将表情与形状变形严格约束在微分几何先验内,使高斯面元随着表情自然位移与旋转,再经 2D 高斯光栅化输出高保真动态图像。

4. 延迟变形动态网格重建:绕过序列泊松重建的算力瓶颈 2D 高斯面元(Gaussian Surfels)本身具备优秀的局部法向与深度平滑约束,适合提取精确几何,但传统管线若对动态序列每帧执行屏蔽泊松网格重建(Screened Poisson Surface Reconstruction),计算开销巨大且易在快速说话区域(如内唇缝隙)出现几何飞溅与拓扑撕裂。TimeWalker 提出了延迟形变策略(Defer-Warping):不在每帧表情驱动后再做网格重建,而是在时刻特异的静态表征阶段执行泊松重建,先获得属于该人生阶段的高精度静态基础网格;随后,将表情驱动与逆向形变场直接迁移到重建出的网格顶点上进行动画更新。这既消除了运动伪影对泊松曲面拟合的干扰,又保证了动态网格时序拓扑的一致性与极高的导出效率。

损失函数 / 训练策略

系统采用端到端联合优化,训练目标包括图像级光度重建损失、几何平滑/法线正则损失以及形变场正则项: $\(\mathcal{L}_{\text{total}} = \mathcal{L}_{\text{image}} + \mathcal{L}_{\text{geometry}} + \mathcal{L}_{\text{regulation}}\)$ 在正式训练前,设计了预热阶段(Warm-up Phase):暂时冻结 Neural Head Basis 的优化,仅引导规范空间的 2D 高斯面元拟合人物跨年龄的全局平均外观,自适应执行高斯劈裂(densify)与剪枝(pruning),为后续神经基混合提供稳定的基准锚点。

实验关键数据

主实验

论文构建了包含 40 位名人、270 万帧的大规模终生跨年龄人头数据集 TimeWalker-1.0。在包含 5 位代表性人物、每人 8~13 个年龄阶段的子集上,评测了两种协议:协议一(1 vs 1)为单个模型学习所有人生阶段;协议二(1 vs N)中基线方法为每个阶段分别训练一个独立模型,而本文仍保持单模型。

评测协议 方法 表征基底 PSNR ↑ SSIM ↑ LPIPS ↓ ID Score ↑
协议一 (1 vs 1) INSTA NeRF 20.68 0.697 0.299 51.59
协议一 (1 vs 1) INSTA++ (PAV复现) NeRF 26.39 0.879 0.139 85.37
协议一 (1 vs 1) FlashAvatar 3DGS 22.14 0.771 0.267 66.97
协议一 (1 vs 1) TimeWalker (本文) 2DGS 27.28 0.949 0.071 93.71
协议二 (1 vs N) Gaussian Surfels 2DGS 26.98 0.950 0.141 82.73
协议二 (1 vs N) GS++ (动态版) 2DGS 27.61 0.948 0.134 76.98
协议二 (1 vs N) INSTA NeRF 25.47 0.860 0.170 87.96
协议二 (1 vs N) FlashAvatar 3DGS 24.90 0.848 0.165 84.17
协议二 (1 vs N) TimeWalker (本文, 单模型) 2DGS 27.28 0.949 0.071 93.71

消融实验

表 1:Dynamo 哈希网格数量与剪枝机制消融 | 配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 说明 | |---|---|---|---|---| | w/o Dynamo (仅用坐标) | 21.69 | 0.767 | 0.197 | 移除基混合,退化严重 | | 1 Hashgrid | 24.84 | 0.890 | 0.119 | 单一全局网格容量不足 | | All Hashgrid (匹配阶段数) | 26.86 | 0.938 | 0.078 | 每阶段一网格,略有过拟合 | | 20 Hashgrids (固定超量) | 26.94 | 0.935 | 0.077 | 固定超额网格冗余 | | Ours (Dynamo 自适应剪枝) | 27.20 | 0.941 | 0.077 | 自适应剪枝平衡容量与泛化 |

表 2:多人生阶段联合训练 vs 单阶段独立训练效果对比 | 训练数据配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 说明 | |---|---|---|---|---| | 单阶段独立训练 (One stage data) | 23.69 | 0.959 | 0.072 | 缺乏跨年龄通用几何先验,PSNR 显著偏低 | | 全阶段联合训练 (Full stages, Ours) | 27.22 | 0.955 | 0.070 | 多阶段互补共享先验,PSNR 提升达 3.53 dB |

关键发现

  • 在单模型拟合全生命周期的严格设定下(1 vs 1),传统方法(如 INSTA、FlashAvatar)发生剧烈混叠或欠拟合,而 TimeWalker 的 ID Score 达到 93.71,大幅领先 INSTA++(85.37),感知指标 LPIPS 仅为 0.071,展现了强大的抗混叠与解耦能力。
  • 即使面对基线各阶段单独用专有模型过拟合的优势配置(1 vs N),TimeWalker 凭借单模型在 LPIPS 和 ID Score 上依旧全面占优,证明跨年龄共享特征空间为稀疏视角提供了强力的跨时期几何与纹理互补约束。
  • 几何网格重建实验中,传统 COLMAP 和静态 Gaussian Surfels 在单视点稀疏抓拍数据下几乎完全重建失败(大量空洞与飞刺),而延迟形变策略配合共享先验能够导出具有精确解剖结构的面部连续网格。

亮点与洞察

  • 经典 3DMM 线性可加性哲学在神经表征时代的成功复兴:将复杂的人脸终生演变剥离为“规范空间平均表征 + 时刻特异神经基混合 + 显式逆向运动形变”,数学形式规整,且天然具备线性插值实现“时间旅行”的平滑能力。
  • Dynamo 的动态自适应剪枝策略:通过监测跨阶段权重活跃度剔除惰性哈希网格,既节省了显存占用,又强迫保留下来的基向量承载最具辨识度的本质身份特征,防止模型简单记住某一时期的配饰或光影。
  • 延迟形变网格管线的设计智慧:洞察到泊松曲面重建对运动伪影的极端敏感性,将重建阶段前置至中性静态时刻,再通过顶点映射进行动画重放,巧妙化解了动态 2DGS 导出序列网格耗时与拓扑抖动的两难问题。

局限与展望

  • 依赖 FLAME 先验的固有缺陷:眼球深处结构、舌头等口腔内部复杂肌肉运动未在 FLAME 拓扑中显式建模,在夸张表情驱动时偶有拉伸或空洞。
  • 野外采集数据的长尾噪声限制:真实网络历史老照片存在严重分辨率不足、偏色、重度遮挡与抠图边缘伪影,极端侧脸视角的表观一致性仍有待提升。
  • 无法自主幻象未观测年龄段:当前模型本质上是在已有观测阶段间进行高保真连续流形插值,若某人缺乏童年或老年数据,模型无法凭空推演无样本支持的极端衰老变化,未来结合跨身份大模型生成先验是重要演进方向。

相关工作与启发

  • vs INSTA / PAV: INSTA 采用 NeRF 及网格反向包裹场驱动短视频化身,但在长生命周期非结构化数据下容易崩塌;PAV 引入了外观嵌入向量,但仍依赖单一隐式变形场,无法实现表情、形状与年龄的多维度精准解耦,且渲染开销高。
  • vs FlashAvatar / GaussianAvatars: 后两者虽然借助 3DGS 提升了单序列头部化身的实时渲染画质,但由于绑定在瞬时单帧网格且采用体积高斯球,不仅无法跨越年龄大尺度形变,而且极难提取光滑无噪的连续多边形表面网格。
  • vs GAGAvatar / One-shot 扩散模型: 通用单图驱动模型(One-shot Generative Avatars)虽然具备广泛先验,但跨年龄重演时身份漂移明显(ArcFace ID Score 仅约 63.39,远低于本文的 93.71),几何三维一致性弱,无法作为严肃的个性化数字资产留存。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性定义并解决终生尺度(Lifelong)3D 头部化身重建与解耦驱动任务,神经线性组合框架设计精巧。
  • 实验充分度: ⭐⭐⭐⭐⭐ 提出大规模终生数据集 TimeWalker-1.0,设计了 1 vs 1 与 1 vs N 严谨协议,跨年龄重演与网格消融深入详实。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机立意深刻,从社会学自我认同切入,公式符号与物理流程阐述清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为影视特效老龄化还原、数字人终生记忆资产归档以及人脸生成模型解耦提供了重要基准范式。