Unwarping the Lens: A Physics-Grounded Approach to Video Glasses Removal¶
会议: ECCV 2026
论文: ECCV 2026 Poster 3821
代码: https://radimspetlik.github.io/unwarpingthelens/
领域: 图像生成
关键词: 视频编辑, 图像编辑, 眼镜去除, 物理光学模拟, 视线保持
一句话总结¶
针对传统生成式修复在去除眼镜时存在的身份漂移与时序闪烁问题,提出将大规模生成先验转移至轻量确定性前馈网络JFSnet,并结合严格的三阶段硬样本几何筛选、透镜折射与高动态范围反射的物理模拟增强,以及平移等变性约束,实现了 27.68 FPS 下高保真、视线精准保持的视频眼镜去除。
研究背景与动机¶
高分辨率视频中人脸属性的精细化局部编辑一直是计算机视觉中的难题。在日常人像中,眼镜并非简单的二维不透明遮挡块,而是具有复杂物理光学特性的透明介质。它会引入随视线与深度变化的屈光折射形变(如近视透镜造成的局部眼睛缩小与边缘畸变),并在镜片表面形成强烈的视点依赖性高光镜面反射。现有的通用图像修复与生成式编辑模型通常难以将这些罕见的光学失真与人脸原生的底层三维几何解耦,在对眼部区域进行重绘时经常丢失眼眶轮廓和瞳孔细节,导致身份特征漂移。
目前基于生成对抗网络或潜在扩散模型的眼镜去除方法,严重依赖黑盒随机先验在遮挡区域进行幻觉填补。人类视觉系统对眼部结构极其敏感,轻微的视线偏移、眼睛大小缩放或表情扭曲都会引发强烈的“非同一人”感知。黑盒生成式模型在单帧修复中可能生成纹理逼真的眼睛,但往往改变了原有的注视方向、眼球形态与微表情;若简单地逐帧应用到动态视频中,由于缺乏跨帧确定性物理约束,更会产生严重的局部高频闪烁与伪影。而传统的视频修复算法缺乏专门的面部结构先验,无法恢复被镜片反射与阴影污染的眼球几何,极易残留重影或未擦净的镜架残骸。
为了兼顾大规模生成模型的真实面部纹理与物理世界的几何连续性,本文提出一种基于物理光学落地的生成先验转移框架。核心 idea:利用大规模商业级生成模型构建多姿态多表情人脸,通过严格的三阶段几何与重建过滤剔除漂移样本,并在训练阶段在线注入基于物理光线追踪的镜片折射与 HDR 镜面反射模拟,将强大的生成先验蒸馏进轻量像素级确定性恢复网络 JFSnet,辅以平移等变性约束消除时序闪烁。
方法详解¶
整体框架¶
本文框架旨在将大规模生成模型中蕴含的逼真无眼镜人脸先验转移到确定性前馈恢复网络中。整个系统主要包含三个核心阶段:首先利用大规模生成模型(Nano Banana / Gemini 3 Pro Image)合成包含 13 种头部姿态与表情的多视角人脸图像对,配合精确分割掩膜与 ARAP 几何对齐,并执行三阶段硬样本过滤剔除漂移数据;其次,在训练过程中对清洗后的数据进行物理光学透镜模拟增强,利用 3D 头部几何与光线追踪精确模拟不同屈光度镜片的折射形变与环境 HDR 镜面反射,合成逼真的佩戴眼镜输入帧;最后,将合成退化图像输入前馈网络 JFSnet(结合 DINOv2 语义先验与卷积解码器,并具备像素级残差跳连),在联合重建、局部眼部感知、对抗损失及平移等变性约束下训练,输出保真、稳定的无眼镜人脸。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视角生成先验提取<br/>Nano Banana 生成 13 姿态图像对与掩膜"] --> B["三阶段结构过滤与 ARAP 对齐<br/>背景/眼部 L1 过滤 + U-Net 筛选 + 网格对齐"]
B --> C["物理透镜光学模拟增强<br/>Snell 定律光线追踪折射 + 逆视点 HDR 镜面反射"]
C --> D["JFSnet 特征-空间联合恢复网络<br/>DINOv2 语义编码 + 卷积解码 + 输入直连跳连"]
D --> E["平移等变性时序约束与局部损失优化<br/>空间平移正则化 + 瞳孔局部损失"]
E --> F["输出高保真无眼镜视频帧"]
关键设计¶
1. 三阶段结构过滤与 ARAP 几何对齐:剔除生成先验的微小漂移 直接使用大规模生成模型合成“戴眼镜”与“无眼镜”成对数据时,生成模型固有的潜空间随机性与 ViT 空间特征过度压缩会导致两张图像在姿态、注视方向及表情上出现亚像素级乃至明显的结构漂移。为构建严格配对的基准真值,论文设计了三阶段层级过滤与精细网格形变流水线。第一阶段利用背景像素的 \(L_1\) 误差筛除头部发生旋转与刚性位移的样本;第二阶段在眼部局部区域计算结构一致性与注视方向差异,淘汰出现视线偏移或眼形改变的漂移样本(针对大于 3/4 侧脸的大角度极端姿态降低权重);第三阶段训练一个轻量级 U-Net 重建网络作为质量代理,剔除重建误差高于阈值的残余伪影样本。对通过过滤的数据,利用 As-Rigid-As-Possible (ARAP) 变形网格结合人脸关键点与多尺度光度损失,将无眼镜基准图微调变形,与戴镜图像中的人脸骨骼完全对齐,最终精选出 1,860 个高度一致的合成身份(共计 24,180 个图像对)。
2. 基于物理光线追踪的镜片折射与 HDR 反射模拟:填补光学合成缺口 纯生成模型输出的眼镜往往带有强烈的“简易性偏差(simplicity bias)”,无法复现真实世界中厚重矫正镜片造成的几何变形和反光涂层多样性。为此,论文在训练时将镜片区域剥离,在线注入基于物理光学的透镜渲染。首先通过单目深度估计模型(Depth Anything)与 3D 人脸参数化模型对齐输入图像的姿态矩阵 \(R\) 与平移 \(t\),并以标准成人头宽锚定绝对物理尺度;将瞳孔 3D 坐标沿法向量外推 15mm 放置双球面矫正镜片。透镜曲率由目标屈光度 \(D\)(采样范围 \(-6.0\) 至 \(+1.0\) 屈光度)通过 Vogel 经验法则计算:\(D_1 = D/2 + 6.0\),\(D_2 = D - D_1\),折射率设为 \(n \approx 1.5\)。对镜片区域内每个像素发射视线,由 Snell 定律解析求解折射路径,并在人脸表面相交生成密集的空间扭曲重采样场 \(W\)。对于反射,生成模型被提示生成后方逆视点环境全景图,并在高动态范围(HDR)下沿反射方向采样镜面高光,组合可变反光膜涂层衰减。合成输入图像表达为: $\(I = (1 - M_{\text{lens}}) \odot G_{\text{glasses}} + M_{\text{lens}} \odot (W(G_{\text{clean}}) + R)\)$ 使得模型强行学习反转空间位移场 \(W\) 并解耦加性反射 \(R\)。
3. JFSnet 特征-空间联合恢复架构:保留非流形高频细节 传统的潜在扩散模型由于依赖预训练 Autoencoder 的降采样潜空间瓶颈,在恢复精细皮肤纹理和眼球巩膜细节时极易发生高频丢失。JFSnet 采用直接操作全分辨率像素空间的端到端混合架构。编码端采用预训练的 DINOv2 (ViT-L/14) 提取富含全局身份与语义信息的鲁棒表征,在训练中冻结前部层、仅微调最后 4 层以适配恢复任务;解码端由多尺度 ResNet 卷积块构成,并接收来自 ViT 各层特征的融合。尤为关键的是,网络引入了一条从输入像素图像直连解码后期的残差跳连(Direct Skip Connection),不仅避开了潜空间信息瓶颈,还让未受损的人脸大部分区域能够无损旁路传输,从而让解码器全力聚焦于学习折射反转与反光消除。
4. 平移等变性时序正则化:免光流的确定性视频防抖 在视频应用中,逐帧运行独立前馈网络容易由于微小亚像素位移导致输出高频纹理不断震荡抖动,而多帧光流对齐或时序注意力计算代价高昂。本文引入平移等变性(Translation Equivariance)作为隐式时序稳定约束。在训练迭代中,对输入图像 \(I\) 施加微小的随机二维空间平移算子 \(T_{\Delta s}\),要求网络算子 \(f_\theta\) 与平移算子对易: $\(\mathcal{L}_{\text{temp}} = \| f_\theta(T_{\Delta s}(I)) - T_{\Delta s}(f_\theta(I)) \|_1\)$ 该约束强迫网络学会平滑的空间变换特性,阻止模型因人脸在视频中的微弱刚性平移而生成不一致的局部高频幻象,在完全不需要跨帧计算开销的前提下,显著抑制了视频播放时的眼眶闪烁。
损失函数 / 训练策略¶
JFSnet 采用全局与局部结合的多任务损失进行监督优化,总损失函数为: $\(\mathcal{L} = \lambda_{\text{pix}}\mathcal{L}_{\text{pix}} + \lambda_{\text{perc}}\mathcal{L}_{\text{perc}} + \lambda_{\text{eye-pix}}\mathcal{L}_{\text{eye-pix}} + \lambda_{\text{eye-perc}}\mathcal{L}_{\text{eye-perc}} + \lambda_{\text{adv}}\mathcal{L}_{\text{adv}} + \lambda_{\text{temp}}\mathcal{L}_{\text{temp}}\)$ 其中 \(\mathcal{L}_{\text{pix}}\) 为整图预测与真实无眼镜基准图的全局 \(L_1\) 距离;\(\mathcal{L}_{\text{perc}}\) 为基于 VGG-19 各层特征 Gram 矩阵的风格感知损失。针对面积较小的眼部区域,以镜片掩膜重心为中心截取 \(64 \times 64\) 像素局部窗口,分别计算局部重建损失 \(\mathcal{L}_{\text{eye-pix}}\) 与局部感知损失 \(\mathcal{L}_{\text{eye-perc}}\),保证瞳孔细节锐利。判别器采用 PatchGAN 结构计算对抗损失 \(\mathcal{L}_{\text{adv}}\)。优化器使用 AdamW,在 JAX/Flax 框架下以 \(518 \times 518\) 分辨率训练 400,000 步,JFSnet 主干学习率为 \(3 \times 10^{-4}\),DINOv2 后四层微调学习率为 \(1 \times 10^{-5}\)。
实验关键数据¶
主实验¶
评估在包含 12,163 张高分辨率人像的 FFHQ 真实眼镜子集上进行。模型运行输出与无眼镜自然参考人像进行分布级对比(计算 FID),并采用 MediaPipe FaceMesh 计算瞳孔位移(Pupil Displacement)与关键点几何误差(Landmark L2),同时统计推理帧率。
注:以下数据摘自原论文 Table 1。
| 方法 (Method) | FID ↓ | 瞳孔位移误差 Pupil (px) ↓ | 关键点误差 L2 (px) ↓ | 推理速度 FPS ↑ |
|---|---|---|---|---|
| Nano Banana (Gemini 3 Pro) | 0.389 | 2.854 ± 2.387 | 0.699 ± 0.462 | 1.29 |
| Inpaint Anything | 0.391 | 2.259 ± 2.295 | 0.664 ± 0.902 | 1.84 |
| InstructPix2Pix | 1.089 | 5.541 ± 6.522 | 8.038 ± 18.293 | 0.05 |
| LEDITS | 1.953 | 3.905 ± 2.999 | 1.527 ± 2.437 | 0.08 |
| Take-Off-Eyeglasses (TOE) | 3.256 | 2.593 ± 1.696 | 0.877 ± 0.773 | 13.31 |
| IP-FaceDiff | 3.832 | 17.607 ± 8.718 | 21.257 ± 27.171 | 0.04 |
| RAVE | 11.559 | 3.577 ± 2.373 | 2.356 ± 2.773 | 0.16 |
| TokenFlow | 2.430 | 3.689 ± 2.812 | 1.905 ± 1.678 | 0.04 |
| Flow-Guided Transformer (FGT) | 0.569 | 3.078 ± 2.714 | 0.965 ± 0.952 | 1.28 |
| ProPainter | 0.408 | 2.684 ± 2.838 | 0.947 ± 1.095 | 8.77 |
| 本文方法 (Ours) | 0.379 | 2.249 ± 1.957 | 0.632 ± 0.271 | 27.68 |
用户偏好研究¶
在 CelebV-Text 动态视频测试集(60 个片段)与 FFHQ 静态人像(60 张图像)上邀请 37 位受试者进行的盲测打分(摘自原论文 Figure 6)。
| 对比基线 (Baseline) | 视频注视一致性 (%) | 视频时序稳定性 (%) | 视频整体质量 (%) | 图像注视保持 (%) | 图像去除完整性 (%) | 图像身份保持 (%) |
|---|---|---|---|---|---|---|
| vs. Nano Banana | 97% | 100% | 100% | 81% | 42% | 75% |
| vs. Runway Gen-4.5 | 74% | 59% | 75% | N/A | N/A | N/A |
| vs. ProPainter | 76% | 76% | 96% | 84% | 93% | 84% |
| vs. TOE | 91% | 97% | 98% | 85% | 96% | 89% |
| vs. V-LASIK | 88% | 88% | 100% | N/A | N/A | N/A |
| vs. LEDITS | 100% | 100% | 96% | 90% | 85% | 98% |
关键发现¶
- 真实分布逼近度与结构几何保真度第一:本文方法在 FFHQ 上的 FID 达到了 0.379,低于通用大模型 Nano Banana(0.389)与视频修复 SOTA ProPainter(0.408);同时瞳孔平均位移仅 2.249 像素,关键点误差仅 0.632 像素,标准差远低于基线,说明几何形变极度微弱且稳定。
- 消融模块重要性:论文消融实验表明,缺少反射模拟或折射模拟均会导致 FID 明显恶化;而移除 ARAP 网格对齐或数据集 L1 过滤,会导致训练伪影与对齐误差增大;解除 DINOv2 后四层冻结微调带来了明显的恢复质量增益。
- 兼顾极高吞吐效率:相比基于扩散的反转与编辑方法(如 TokenFlow、IP-FaceDiff 的 0.04 FPS),JFSnet 为单阶段全卷积前馈网络,在无需跨帧递归的情况下推理速度达 27.68 FPS,满足准实时视频流处理需求。
亮点与洞察¶
- 将生成先验转化为确定性物理反问题:不盲目依赖大扩散模型进行不可控的黑盒幻觉填补,而是利用大模型低成本生产海量数据,再通过物理光学(Snell 定律与 HDR 反射)构造前向退化过程,让小模型直接学习具有明确几何物理约束的逆变换。
- 平移等变性作为轻量视频时序先验:避开了沉重的 3D 卷积、跨帧时序注意力和密集光流估计,仅在静态训练阶段添加空间随机平移一致性损失,即可大幅消除逐帧处理带来的眼部高频伪影和闪烁,这一设计思想非常适合迁移至各类人脸局部视频编辑任务。
- 三阶段数据硬样本筛选与网格形变配合:直击利用大模型合成成对训练集时最隐蔽的“微表情/姿态漂移”陷阱,通过 ARAP 网格形变将图像对刚性与非刚性位移归零,确保了监督信号的纯净。
局限与展望¶
- 极端大角度侧脸的深度退化:作者指出当头部旋转接近完全正侧面(超过 3/4 视角)时,单目深度估计模型的准确度大幅衰减,物理透镜投影容易出现错位,此时不得不退回到纯生成模型的先验输出。
- 深色太阳镜眼球幻觉局限:物理模拟假设视线后的虹膜与巩膜仍有微弱光线透射;对于完全不透光、深黑色的遮光太阳镜,由于缺乏底层可见纹理信息,模型恢复依赖于先验填补,难以确保瞳孔位置与真实眼球完全吻合。
- 未来方向:可进一步结合多视角动态高斯头部头像(3DGS)或轻量参数化 3D 头部先验,将 2D 物理透镜反转升级为具备 3D 空间一致性的全姿态神经光学渲染。
相关工作与启发¶
- vs. 大规模视频生成与编辑模型 (Runway Gen-4.5 / Nano Banana):大模型虽然图像质感与反光去除完整性极高,但无法避免眼球形状改变、视线漂移和时序不连贯;本文通过物理折射建模与确定性 JFSnet 恢复,在人类评估中以 100% 偏好率超越了 Nano Banana 的时序稳定性。
- vs. 通用视频修复模型 (ProPainter / FGT / STTN):传统修复模型将眼镜视作不透明遮挡物体进行边界像素扩散与光流填充,完全忽略了镜片下原有的眼睛纹理,容易抹平眼部细节;本文将镜片视为透明折射介质予以反卷积反转,有效复原了被缩小的真实眼睛。
- vs. 专用眼镜去除工作 (TOE / V-LASIK):TOE 依赖简单合成数据难以应对强烈高光与近视缩小;V-LASIK 依赖复杂优化容易导致眼部模糊。本文端到端结合物理渲染与 DINOv2 语义特征跳连,在锐度与真实度上均显著领先。
评分¶
- 新颖性: ⭐⭐⭐⭐ [结合生成先验知识蒸馏与物理透镜光学仿真,设计新颖扎实]
- 实验充分度: ⭐⭐⭐⭐⭐ [涵盖 FFHQ 1.2万张图像量化指标、详细消融实验与双重盲测偏好研究]
- 写作质量: ⭐⭐⭐⭐⭐ [逻辑紧凑,从数据清洗、物理退化到网络结构设计层次分明]
- 价值: ⭐⭐⭐⭐⭐ [解决了视频人像属性编辑中顽固的折射与反射难题,且达到 27.68 FPS 准实时速度]