跳转至

Reflection-aware generative novel view synthesis

会议: ECCV 2026
论文: ECCV 原文
项目页: https://kim-geonu.github.io/Ref-GeNVS/
领域: 3D 视觉
关键词: 镜面反射、生成式新视角合成、多视角扩散模型、免训练、跨视角注意力

一句话总结

Ref-GeNVS 是首个面向镜面场景的免训练生成式新视角合成方法,将镜面图像拆解为两个互补视角,结合镜面门控跨视角注意力与潜空间反射注入,在稀疏或单视角输入下实现了反射与三维场景一致的新视角生成。

研究背景与动机

镜面反射极大地扩展了人类的视野范围,使我们能够直接观察到本被遮挡或位于视场之外的三维物理区域。人类在观察包含镜面的画面时,能够自然地将镜面反射区域与普通背景解耦,将镜面视为一个额外的观察视点,并据此对物理环境进行全局几何与纹理推断。这种能力在机器人具身导航(如通过转角反射镜避障)与沉浸式 AR/VR 三维重建中至关重要。然而,当前主流的生成式新视角合成(Generative NVS)模型(如 SEVA、FlexWorld、MVGenMaster)普遍将镜面图像视作普通的单视角观测,无法理解镜面内几何与环境的物理对应关系。这导致生成的未见视角常出现严重的“内容烘烤”(baked reflections,将镜面内容当作平面贴图固定在镜框上)、反射泄露(非镜面像素错误扩散)以及镜面内图像与新视角场景几何严重冲突的失真问题。

直接在含镜面数据上微调大型多视角扩散模型不仅数据采集成本高昂,且反射物理定律本身属于严苛的几何约束,纯数据驱动的微调难以保证模型能隐式学到精准的物理反射约束。此外,现有的隐式几何反射方法(如 Mirror-NeRF、MirrorGaussian 等)高度依赖密集采样的校准视角,且局限于仅重建反射物体本身,无法在极度稀疏输入下“由镜面反推未见三维场景”。

本文的切入角度是:既然多视角扩散模型本身具备极强的多视角联想与跨视角注意力推理能力,我们无需重新训练网络权重,而是应当在输入端明确将镜面反射建立为物理上符合对映关系的“虚拟视点”。核心 idea:将单幅镜面图像显式解耦为真实观测视点与镜像虚拟视点,通过镜面门控注意力切断非镜面区域的伪影污染,并在去噪过程中通过潜空间特征注入与边界平滑自洽恢复镜面外观,实现完全免训练的反射感知新视角生成。

方法详解

整体框架

Ref-GeNVS 建立在支持跨视角自注意力的“N 进 M 出”多视角扩散模型(如 SEVA、MVGenMaster)之上。输入为稀疏或单张包含镜面的图像及相机位姿,目标是生成与镜面物理反射自洽的目标新视角,同时在目标视角的镜面表面正确渲染出反射画面。整体流程分为预处理、阶段一(场景生成)与阶段二(镜面表面修补)三个阶段:首先通过单视角 3D 点云回归与平面拟合估计出镜面平面,利用 Householder 反射变换生成虚拟对称相机位姿及水平翻转的镜像输入;阶段一将输入视角的镜面区域填充纯色进行几何解耦,并利用镜面门控注意力确保只有镜像内的有效像素作为条件引导目标视角的去噪;阶段二使用目标视角的镜像虚拟位姿进行去噪,并通过潜空间反射注入配合 SDEdit 式的边界约束,将镜面反射无缝填补回目标视角的镜面区域。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入图像与相机位姿<br/>Is, Ps"] --> B["镜面平面估计与虚拟视点构造<br/>DAM 分割 + 3D点回归 + Householder变换"]
    B --> C["阶段一:镜面门控注意力场景生成<br/>解耦遮罩 + 限制仅镜内Token参与跨视角注意力"]
    C --> D["阶段二:反射特征注入与边界平滑<br/>Latent_Flip 注入 + SDEdit 边界融合"]
    D --> E["输出反射自洽的目标新视角<br/>Io (含正确镜面与未见场景)"]

关键设计

1. 镜面平面估计与虚拟视点构造:将反射线索显式映射为正交虚拟相机 针对多视角扩散模型无法自发理解镜面成像物理规律的痛点,该设计在预处理阶段将物理镜面显式建模为对映虚拟视点。方法首先使用通用的镜面分割模型 DAM 预测镜面掩码 \(M_s\),然后将掩码区域用纯色遮蔽后输入单目 3D 点云回归模型 Depth Anything 3,在规避镜面虚假深度的同时获得真实表面 3D 点云,并基于 RANSAC 稳健拟合出镜面方程 \(e = [n, d]\)。接着,依据 Householder 变换矩阵将输入相机位姿 \(P_{ms}\) 沿法向量 \(n\) 进行镜像投射:

\[H = I - 2 n n^\top\]

得到镜内虚拟相机的外参 \(P'_{ms}\)。为了保证镜像相机与原始相机具备相同的右手系坐标系惯例,对图像和掩码执行水平翻转,构建出虚拟镜像元组 \((I'_{ms}, P'_{ms}, M'_{ms})\)。由此,单幅包含镜面的图像被物理无损地扩展为一个真实场景视角与一个位于反射对称位置的虚拟补全视角。

2. 阶段一:镜面门控交叉注意力:杜绝非镜面背景对场景生成的干扰 直接将镜像虚拟元组送入多视角扩散模型会导致严重的生成伪影:虽然镜面内部的像素对应着环境未见区域,但镜面外部的像素在被水平翻转后变成了虚假的空间结构,若直接参与跨视角注意力计算,会将大量错误的背景结构扩散到新视角中;同时,直接保留镜面内容会导致模型将反射“烤死”在平面上。

为此,阶段一首先将原输入图像中的镜面区域遮蔽为均匀色,阻断模型误把反射当普通物体的先验偏差。接着,在跨视角自注意力计算中引入镜面门控机制。设目标视角查询向量为 \(Q \in \mathbb{R}^{N_q \times d}\),反射视角的键与值向量为 \(K, V \in \mathbb{R}^{N_k \times d}\)。将下采样对齐的二进制镜面掩码记为 \(m \in \{0, 1\}^{N_k}\),对未归一化的注意力权重打分矩阵 \(S_{ij} = \frac{q_i^\top k_j}{\sqrt{d}}\) 施加门控截断:

\[S'_{ij} = \begin{cases} \frac{q_i^\top k_j}{\sqrt{d}}, & \text{若 } m_j = 1 \\ -\infty, & \text{若 } m_j = 0 \end{cases}\]
\[\mathrm{Attn}_{\text{mirror}}(Q, K, V) = \mathrm{softmax}(S') V\]

通过在 Softmax 之前将镜外 token 的注意力打分赋为 \(-\infty\),使其权重严格归零,彻底消除了镜像外无关像素的泄漏伪影,强迫网络仅从镜面内显露的物理环境中借用语义与几何先验来合成目标视角场景。

3. 阶段二:反射特征注入与 SDEdit 边界平滑:在潜空间重建高保真镜面反射 经过阶段一合成的目标新视角中,镜面表面依然是空白或遮蔽状态。为了让目标视角中的镜面反射与阶段一生成的三维场景全局一致,阶段二设计了一种两步交替的特征注入策略。首先,通过 SAM 2 基于输入源掩码追踪目标视角中的镜面区域 \(M_o\)。在去噪时间步 \(t\),不仅维护目标姿态 \(P_{mo}\) 下的潜变量 \(Z_t^m\),同时在对称虚拟反射姿态 \(P'_{mo}\) 下演化对应的镜像潜变量 \(Z'^m_t\)。通过 Tweedie 公式从 \(Z'^m_t\) 估计无噪潜变量 \(Z'^m_{0|t}\),并利用 VAE 的编解码通道实现跨越特征非等变性的水平对齐翻转,注入到目标镜面内部:

\[\hat{Z}_t^m = \tilde{M}_o^m \odot \mathrm{Latent\_Flip}(Z'^m_t) + (1 - \tilde{M}_o^m) \odot Z_t^m\]
\[\mathrm{Latent\_Flip}(Z'^m_t) = E(\mathrm{Flip}(D(Z'^m_{0|t}))) + \sigma_t \epsilon_t\]

为了消除直接硬拼接潜特征在镜面轮廓边缘造成的结构突变与不连续伪影,模型在去噪前期的 \(t > t_0\) 阶段引入 SDEdit 式的引导锚定:以阶段一输出图像加噪生成的潜特征 \(Z^{\text{init}}_t\) 锁定镜外背景;从 \(t_0\) 步开始逐步激活反射注入。利用扩散模型在去噪后期的平滑先验,使镜框接缝与环境光照自然交融,产出反射真实且几何严丝合缝的最终图像。

损失函数 / 训练策略

Ref-GeNVS 属于纯推理时(Inference-only / Training-free)引导控制算法,无需训练任何网络参数,直接冻结背后的预训练多视角扩散模型(如 MVGenMaster 或 SEVA)以及 SAM 2 / DAM / Depth Anything 3 等现成模型权重。整个两阶段生成过程仅修改扩散采样循环中的注意力 Mask 机制与时间步内部的潜变量替换操作,计算开销可控且可无缝移植到任意支持跨视角交互的多视角扩散骨干网络中。

实验关键数据

主实验

论文在极具挑战性的 6 个合成室内场景(包含物理渲染镜面材质的浴室、起居室)以及真实的 Mirror-NeRF 数据集上进行了评测。在稀疏视角输入设定下,选取只能通过镜面反射观察到的场景轨迹作为测试目标,综合评估高层感知相似度(DreamSim、CLIP)以及三维几何保真度(PSNR、SSIM、LPIPS)。

数据集 算法配置 DreamSim ↓ CLIP 相似度 ↑ PSNR ↑ SSIM ↑ LPIPS ↓
真实数据集 (Real [58]) MVGenMaster 0.361 0.867 12.75 0.413 0.536
真实数据集 (Real [58]) Ours (MVGenMaster) 0.194 0.930 13.67 0.455 0.474
真实数据集 (Real [58]) SEVA 0.275 0.920 12.03 0.394 0.564
真实数据集 (Real [58]) Ours (SEVA) 0.129 0.951 14.19 0.455 0.466
合成数据集 (Synthetic) MVGenMaster 0.222 0.930 16.90 0.735 0.350
合成数据集 (Synthetic) Ours (MVGenMaster) 0.106 0.964 17.95 0.748 0.291
合成数据集 (Synthetic) SEVA 0.264 0.929 13.65 0.623 0.482
合成数据集 (Synthetic) Ours (SEVA) 0.151 0.948 15.51 0.682 0.397

在单图像新视角合成设定(Table 2)中,面对严重的尺度与姿态不确定性,Ref-GeNVS 依然显著优于 VistaDream、FlexWorld 与原生 SEVA:

方法 DreamSim (DS) ↓ CLIP 相似度 ↑
VistaDream 0.569 0.858
FlexWorld 0.364 0.885
SEVA 0.381 0.902
Ours 0.333 0.915

消融实验

基于合成数据集和 SEVA 基线骨干,论文对虚拟视点输入、镜面门控注意力以及两阶段生成流程进行了逐级递进的消融验证(见原论文 Table 3):

虚拟视点 (Virtual View) 镜面门控注意力 (Mirror-gated) 两阶段生成 (Two-step) DreamSim ↓ CLIP ↑ PSNR ↑ SSIM ↑ LPIPS ↓ 说明
0.264 0.929 13.65 0.623 0.482 SEVA 基准模型,无法识别镜面反射
0.236 0.922 13.48 0.647 0.549 引入虚拟相机,但镜外像素导致错误泄漏
0.147 0.954 15.51 0.683 0.390 消除非镜面干扰,感知质量与几何大幅提升
0.151 0.948 15.51 0.682 0.397 完整模型:镜面内外视觉高度协调且反射自洽

关键发现

  • 门控注意力是消除内容泄漏的核心驱动力:从仅注入虚拟视点到加入 Mirror-gated attention,DreamSim 指标在合成场景中从 0.236 大幅优化至 0.147,LPIPS 从 0.549 骤降至 0.390。这表明限制扩散注意力仅接收反射内部 token,是阻止背景伪影污染全局场景的最关键机制。
  • 两阶段生成兼顾了未见空间展开与镜面表面自洽:两阶段生成的加入虽然在像素指标上提升不大(因为镜面区域占全图比例有限),但定性分析证明它彻底修复了传统基线中“镜内画面与新视点物理场景冲突脱节”的问题,使镜面宛如真实的光学反光体。
  • 对下游 3D 重建带来根本性改善:将 Ref-GeNVS 预测的多视角输入送入 Pi³ 进行通用三维重建时,由于消除了镜面几何幻觉,重建网格在镜面反射揭示的原盲区获得了完整致密的点云,而基线模型则出现大面积网格破损与重影。

亮点与洞察

  • 物理约束与生成先验的优雅解耦:论文没有尝试通过昂贵的微调让神经网络暴力“记住”物理反射,而是将刚性反射变换作为显式几何前置操作,利用扩散模型强大的条件泛化力负责纹理补全,实现了高精度的物理自洽。
  • Latent_Flip 的跨模态等变性规避:直接在 Latent 维度做矩阵翻转会破坏预训练 VAE 的空间通道语义,作者借助 Tweedie 估计出无噪图像经由 Decode-Flip-Encode 重新加噪,巧妙解决了潜空间非翻转等变的问题。
  • 向曲面反射的无痛迁移性:针对凸面镜、反光球等非平面反射,方法可通过已知曲面几何将畸变反射先重采样展开为等效平面投影,即可零门槛复用本流水线进行广角视场推理。

局限与展望

  • 假设理想平面镜面与准确的几何估计:当前自动化流水线依赖于 3D 点云回归与 RANSAC 拟合,如果镜面受到极度严重的污损、强漫反射或非规则波状形变,平面法向量估计偏差将传递到虚拟相机的姿态中。
  • 两阶段去噪带来的推理延时:阶段一生成完整场景后,阶段二需要再次执行带反射注入的逆向扩散去噪,推理时间相较单次多视角生成增加约一倍。
  • 未来方向:作者指出,将镜面检测、物理几何对称性显式建模成扩散训练时的隐式偏置,探索端到端可微训练的物理一致多视角生成模型是进一步的研究方向。

相关工作与启发

  • vs Mirror-NeRF / MirrorGaussian: 后者依赖几十上百张密集采样的校准图像,且核心目的是利用光线追踪优化镜面自身的双向反射分布,无法在单张输入下凭空生成视场外的未见物理世界;Ref-GeNVS 则是生成式方法,专攻从稀疏单张镜面反推盲区场景。
  • vs FlexWorld / SEVA / VistaDream: 通用生成式新视角合成网络不具备镜面反射的物理概念,会直接把镜中人事物当成挂在墙上的 2D 贴画,导致视点移动时反射随之平移错位;Ref-GeNVS 通过免训练的输入姿态映射与门控修补,赋予了这些骨干模型反射感知能力。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (巧妙利用对称相机与门控注意力将物理反射转化为免训练的多视角条件生成)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖合成与真实数据集、单视与多视设定,且包含详尽的定量消融与 3D 重建下游评估)
  • 写作质量: ⭐⭐⭐⭐⭐ (架构拆解清晰,两阶段动机明确,图表对比极具说服力)
  • 价值: ⭐⭐⭐⭐☆ (为具身智能死角感知与镜面复杂室内场景的 3D 生成提供了低成本、即插即用的新范式)