跳转至

HairOrbit: Multi-view Aware 3D Hair Modeling from Single Portraits

会议: ECCV 2026
论文: ECCV 原文
项目页: Pinscreen / MBZUAI
代码: 待开源
领域: 3D 视觉 / 视频生成
关键词: 3D头发建模、单视角重建、视频扩散先验、神经朝向提取器、混合隐式场

一句话总结

HairOrbit 借助视频扩散模型内在的跨视角时空先验,将单张肖像的发丝级 3D 头发重建任务重塑为标定的多视角重建流程,配合全视角神经朝向提取器与结合占据和方向的混合隐式场,显著消除了遮挡区域与侧后视角的发型失真。

研究背景与动机

从单幅肖像图像中重建发丝级(strand-level)3D 头发几何是数字人建模中最具挑战性的任务之一。头发具有极度繁复的三维空间拓扑结构,包含严重的自遮挡、非刚性纠缠以及卷曲度、发缝分界、层次长度等微观几何属性。单视角重建本质上是一个严重欠定的反问题:正面视角所能观测到的线索非常有限,而后脑勺、侧边等不可见区域必须依赖先验知识进行推断。然而,现有的合成 3D 头发数据集(如 USC-HairSalon 和 Difflocks)在发型风格多样性、拓扑真实度以及物理逼真感上存在严重瓶颈,导致基于纯数据驱动或隐空间纹理生成的单视角算法往往只能生成正面平滑“看似合理”、但一旦旋转到侧视角和后视角就出现发长失调、卷度断裂甚至结构塌陷的产物。

与此同时,近期基于多视角或单目环绕视频的发丝重建方法虽然能够借助多视角的几何一致性建立精细且连续的发丝几何,但它们高度依赖昂贵的多相机采集阵列或用户绕头拍摄的长视频,单例优化往往耗时数小时乃至数天,极难直接面向大众单图应用落地。因此,一个核心矛盾在于:高质量多视角发丝重建依赖完备一致的环绕观测,而实际真实场景往往只提供单张正面肖像。

受近期视频扩散 Transformer(如 WAN)卓越时间连贯性与内在 3D 几何先验的启发,本文提出打破直接从单图回归 3D 头发的传统思路。核心 idea:将单视角 3D 头发重建任务重新表述为标定的轨道多视角重建问题,利用轻量微调的视频扩散模型作为单视角到 360° 环绕视角的“桥梁”,并结合全视角神经朝向提取与高效混合隐式场实现端到端高质量发丝生长。

方法详解

整体框架

HairOrbit 的完整工作流程分为两个核心阶段:多视角视频合成与几何先验构建阶段,以及发丝级 3D 隐式场重建与发丝生长阶段。输入一张未对齐的单视角肖像 \(I_{in}\),系统首先通过面部关键点拟合将其与标准模板图像对齐得到 \(I_{aligned}\)。随后,利用经 LoRA 微调的视频生成模型生成绕头 360° 运行的标定轨道多视角图像序列 \(\{I_i^m\}\),并通过超分辨率增强恢复高清毛发纹理细节。在多视角重建端,一方面通过快速 2D Gaussian Splatting 与 Marching Cubes 提取几何网格表面并渲染多视角深度图 \(\{D_i\}\);另一方面利用全视角神经朝向提取器并行估计多视角的无向局部发丝朝向图 \(\{O_i\}\)。最后,将多视角特征融合输入混合隐式场,通过 scalp-root 与局部补充段的双阶段发丝生长算法导出精细的 3D 发丝模型。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["单张正面肖像输入<br/>Landmark 对齐到模板"] --> B["轨道多视角视频生成<br/>WAN-DiT LoRA + 超分辨率"]
    B --> C1["几何与深度重建<br/>2DGS 表面提取渲染深度图"]
    B --> C2["全视角神经朝向提取<br/>无向局部像素对齐 U-Net"]
    C1 --> D["混合隐式场构建<br/>占据与朝向联合编码"]
    C2 --> D
    D --> E["双阶段发丝生长算法<br/>头皮主发丝 + 局部补全与寸头修复"]
    E --> F["高保真 3D 发丝几何模型"]

关键设计

1. 轨道视频扩散多视角生成:以生成式时空先验架起单视角与多视角的桥梁

传统单视角头发重建直接从受限的 3D 合成数据集中拟合先验,极易在背部和侧面造成过度平滑或伪影。为了将单视角转换为成熟的多视角重建任务,HairOrbit 选择具备强 3D 一致性的 WAN 视频扩散模型作为基座。作者选取涵盖发长、卷曲度与分界发缝等多维度的典型 3D 头发模型渲染出 97 个轨道视角的合成视频,仅通过在 DiT 模块的注意力投影矩阵(Q, K, V, O)以及前馈网络两端线性层(FFN.0, FFN.2)注入轻量 LoRA 参数进行微调。这一设计既将视频扩散模型约束为精确的 360° 匀速轨道相机旋转轨迹,又最大限度保留了基础模型对真实发质、光泽与发丝分布的先验知识。针对显存与推理速度瓶颈,基础视频以低分辨率生成,随后接入 Flux.1-dev Upscaler 超分辨率模块,补齐高频发丝纹理与微观边缘。

2. 全视角神经朝向提取器:从局部像素对齐中克服视点域偏移

多视角发丝重建严重依赖 2D 发丝朝向图(Orientation Map),以往方法采用传统 Gabor 滤波器,不仅噪声极大,而且对光照阴影极其敏感,往往需要耗费数小时进行跨视角补丁平滑优化;而现存的神经方法(如 HairStep)试图预测带有全局流向信息的“有向发丝图”(Directional Strand Map),由于严重依赖全局语义线索且仅在正面数据(HiSa)上标注,在侧面与背面视角泛化极差。本文发现:发丝在 2D 投影中的切线走向本质上是一项局部感知、像素对齐(pixel-aligned)的低层纹理任务,无需感知发丝从头皮到发梢的全局流向。因此,本文同样基于 U-Net 架构,但将学习目标重定义为无向(undirectional)局部朝向图,仅利用合成正面标注并施加几何变换增强,即可完美泛化至 360° 全视角。这彻底摆脱了 Gabor 滤波的噪声敏感性与繁琐滤波去噪后处理。

3. 联合表征混合隐式场:摆脱独立占据场并实现全并行发丝追踪

传统发丝隐式场通常独立建模两个场:一个空间占据场(Occupancy Field)用于界定毛发外轮廓边界,另一个向量朝向场(Orientation Field)用于引导发丝在边界内延伸。这种割裂的表征在生成发丝时需要繁琐的光线投射(Ray-casting)或逐点占据查询,且发丝在不同步数跳出边界时终止条件不一致,极大阻碍了 GPU 并行计算。HairOrbit 将二者融为一体,构建混合隐式场 \(\mathcal{F}\):在毛发体积内部,场向量等于单位长度的三维发丝生长方向向量 \((d_x, d_y, d_z)\);在毛发外部,网络直接输出零向量 \((0, 0, 0)\)。输入多视角朝向图与深度图通过 Stacked Hourglass 网络提取多视角像素对齐特征,与三维查询点的坐标位置编码拼接后输入轻量解码器。由于体积外的向量模长为零,发丝追踪在步进中遇到边界会自然“减速至静止”,任何后续生长步数都会收敛在同一端点,从而使发丝追踪可以以固定步数进行完全平行的张量计算,带来数十倍的速度提升。

4. 双阶段混合发丝生长与寸头修复:兼顾全局完整度与微观薄层几何

单纯依赖头皮预设采样根节点(scalp-root)向外生长发丝计算速度极快,但在朝向预测存在微小局部误差时,发丝可能过早碰到边界导致发梢缺失或留下局部空洞;而纯粹的散乱短发段(segment-based)生长并拼接虽然完备,但计算代价极其高昂。HairOrbit 采取折中互补策略:第一阶段由头皮预设采样点快速并行长出骨干发丝,覆盖超过 90% 的主体可见区域;第二阶段仅在检测到几何空缺的边缘区域生成局部的补充短发段(supplementary segments),并通过平滑过渡将其挂接至最近的头皮发丝上。针对预采样根部在短发/寸头(buzz-cut)超薄结构中极易发生的向量塌陷和杂乱短发问题,系统设计了多视角投影一致性过滤(必须在至少两视角发掩模内投影命中),并借助 2DGS 提取的头部网格切平面法向与投影均向,对塌陷根节点执行法向重投影与二次再生长,完美恢复贴皮寸头的清晰几何。

损失函数 / 训练策略

  1. 轨道视频扩散 LoRA 训练:在冻结 WAN 基础模型的前提下,最小化标准流形/噪声预测目标: $\(\mathcal{L}_{\text{denoise}} = \mathbb{E}_{\mathbf{x}_0, \boldsymbol{\epsilon}, t} \left[ \left\| \boldsymbol{\epsilon}_\theta(\mathbf{x}_t, t, \mathbf{c}) - \boldsymbol{\epsilon} \right\|_2^2 \right]\)$ 其中 \(\mathbf{c}\) 为对齐肖像图像 \(I_{aligned}\) 经过 VAE 编码得到的条件潜变量。
  2. 混合隐式场网络训练:网络监督目标为预测三维朝向矢量与真实矢量的平均分量 \(L_1\) 误差: $\(\mathcal{L}_{\text{ori}} = \frac{1}{N} \sum_{i=1}^N \sum_{k \in \{x,y,z\}} \left| d_{i,k}^* - d_{i,k} \right|\)$ 其中外部点监督目标强制设为 \((0,0,0)\)。推理时,只需设定向量模长阈值(文中设定为 0.1)即可精准划分发丝内外边界。

实验关键数据

主实验

论文对多视角朝向提取、单视角发丝重建进行了细致评估。 在全视角朝向提取任务中,论文在自建的涵盖 7 位不同发型模特、共 395 张全视角真实标注图像上测试平均角度误差(Mean Angular Error, 单位为度,越低越好):

方法 nastya (62视) ksyusha (66视) jenya (70视) shortCurly (58视) whiteCurly (42视) midWavy (33视) midCurly (64视) Overall (395视) ↓
Gabor 滤波 [44] 11.88 16.56 18.88 18.87 24.56 11.31 10.79 16.05
HairStep [42] 6.28 10.98 13.16 13.68 21.57 6.32 5.54 10.88
HairOrbit (Ours) 1.79 4.97 6.09 6.72 13.50 2.15 2.12 5.13

在单视角 3D 发丝重建基准(196 种复杂发型测试集)上,比较投影到图像平面的几何朝向误差 HairSale(度,越低越好)、相对深度准确率 HairRida(%,越高越好)以及毛发轮廓重合度 IoU(越高越好):

方法 HairSale (°) ↓ HairRida (%) ↑ IoU ↑
DiffLocks [25] 26.50 69.67 0.593
HairStep [42] 17.38 77.01 0.639
Im2Haircut [30] 16.24 79.38 0.757
HairOrbit (Ours) 12.83 80.52 0.847

消融实验

论文设计了 4 种配置验证各关键模块的贡献(Table 3): - C0: 将全视角神经朝向提取器替换回传统 Gabor 滤波器。 - C1: 去除补充段与修复算法,仅从头皮根部生长发丝(Purely Scalp-rooted)。 - C2: 去除多视角视频扩散桥接,仅使用单张输入视角推断 3D 隐式场(单视角基线)。 - Full: 完整的 HairOrbit 流水线。

配置 输入视角 HairSale (°) ↓ 输入视角 IoU ↑ 8个合成视角 HairSale (°) ↓ 8个合成视角 IoU ↑ 说明
Full (本文完整模型) 12.83 0.847 9.97 0.900 全功能流水线
w/o 神经朝向提取器 (C0) 16.42 (-27.98%) 0.794 13.45 (-34.90%) 0.878 Gabor 噪声严重干扰发缝与朝向
w/o 补充段生长算法 (C1) 13.70 (-6.78%) 0.828 10.37 (-4.01%) 0.887 边界处发梢出现轻微空洞
w/o 多视角桥接生成 (C2) 19.10 (-48.87%) 0.680 24.14 (-142.1%) 0.658 侧后视角几何崩溃,仅正面可看

关键发现

  • 多视角桥接是解决侧后视角失真的决定性因素:消融实验中去掉多视角桥接(C2)导致新视角下的发丝朝向误差激增 142.1%(由 9.97° 恶化至 24.14°),同时 IoU 大跌至 0.658。这强力证明了利用预训练视频扩散模型提供多视角观测是单图头发建模跨越“正面幻觉”瓶颈的核心杠杆。
  • 无向局部表征带来朝向提取质的飞跃:在 395 真实视角测试中,本文提出的无向神经朝向提取器相比 Gabor 滤波将平均角度误差从 16.05° 压低至 5.13°(性能提升超 68%),且大幅领先仅针对正面的 HairStep(10.88°),为隐式场注入了极高信噪比的几何线索。
  • 混合隐式场实现了并行效率与边界约束的兼得:通过将占据与朝向合并为零向量终止机制,消除了独立占据场查询的时间消耗与分支分歧,使数万根发丝能在一秒内完成并行追踪,且避免了传统方法在边界外部的伪发丝漂移。

亮点与洞察

  • 将单图 3D 重建升维为视频时序推断:传统方法执着于从极度匮乏的单视角 3D 头发数据集中强行拟合 3D 先验,而 HairOrbit 敏锐地洞察到大规模预训练视频生成模型(如 WAN)在时序旋转中已经吸收了强大的跨视角物理自洽性,通过轻量 LoRA 微调将“单图几何欠定”转化为“成熟的多视角立体重建”,思路极具启发性。
  • 表征目标的化繁为简:先前工作(如 HairStep)认为必须预测带有毛囊到发尾的“有向图”,反而引入了非局部的语义歧义,导致侧后视角完全失效;本文反其道而行之,将学习目标降阶为“无向局部朝向”,成功在仅用正面标注训练的情况下零样本泛化至 360° 侧面与背部视角。
  • 面向并发加速的混合场精巧数学设计:将二值占据隐式场与连续朝向场通过乘积合二为一,使超出毛发体积的向量自然恒为零向量。这一构想不仅抹去了昂贵的跨场双重采样与光线碰撞检测,更使得所有发丝追踪迭代次数固定、并在边界自收敛,为数字人毛发实时生成提供了极具价值的工程启示。

局限与展望

  • 极端异形发饰与剧烈自遮挡:对于佩戴复杂发饰(如大发卡、头巾)或发丝严重被帽子遮挡的肖像,视频扩散模型在旋转合成时可能产生纹理混淆或身份漂移,进而导致隐式场几何受到污染。
  • 极端非结构化卷发与碎发:对于极度蓬松的非洲卷发(Afro)、细碎杂乱的毛躁碎发,2D 高斯表面提取的几何深度以及 U-Net 提取的朝向均会出现局部平滑化,难以完全还原单根随机飞散的发丝。
  • 两阶段串联的累积误差与耗时:目前流水线需要经历视频生成、超分辨率放大、2DGS 深度提取、神经朝向预测以及隐式场拟合多个离散步骤。未来若能将隐式场条件扩散模型与发丝生长端到端打通,有望进一步压缩延迟并减少跨模块误差传导。

相关工作与启发

  • vs HairStep (CVPR 2023): HairStep 开创了从单图利用神经朝向图直接回归发丝隐式场的范式,但其依赖有向发丝图且无外部视角线索,导致侧面和背面重建完全失真;HairOrbit 通过视频扩散提供 360° 真实观测,并将朝向图解耦为易于泛化的无向局部表征,全面压制 HairStep(HairSale 误差 12.83° vs 17.38°)。
  • vs Difflocks (CVPR 2025): Difflocks 利用扩散模型在头皮纹理隐空间中生成头发参数,但在推理时严重缺乏与原图严格的空间像素对齐,容易遗漏前额刘海或局部卷曲特征;HairOrbit 坚持使用像素对齐特征提取与多视角深度硬约束,IoU 达到 0.847(Difflocks 仅 0.593)。
  • vs Im2Haircut (ICCV 2025): Im2Haircut 借助可微渲染与单目深度(DepthPro)进行优化重建,但优化速度慢且由于单目深度缺乏多视角几何支撑,侧视与正面过渡区结构凌乱;HairOrbit 通过视频环绕与 2DGS 重建显式提供了精准的多视角几何与深度一致性。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ [将视频扩散时序几何先验巧妙迁移至单图3D发丝重建,表征设计新颖]
  • 实验充分度: ⭐⭐⭐⭐⭐ [自建395视全视角多发型真实评测集,消融对比深入详实]
  • 写作质量: ⭐⭐⭐⭐⭐ [逻辑清晰、动机阐述层层递进、方法与图示对应严密]
  • 价值: ⭐⭐⭐⭐⭐ [攻克了单视角肖像难以高质量生成侧后发丝几何的长期难题,实用性极强]