跳转至

GO-Renderer: Generative Object Rendering with 3D-aware Controllable Video Diffusion Models

会议: ECCV 2026
论文: ECCV 原文
项目页: https://igl-hkust.github.io/GO-Renderer
领域: 视频生成
关键词: 判别渲染, 3D几何代理, 视频扩散模型, 多视角一致性, 物体重光照

一句话总结

GO-Renderer 提出一种将前向粗糙 3D 几何代理与视频扩散 Transformer(DiT)紧密结合的生成式物体渲染框架,利用以物体为中心的 3D 坐标图和负向旋转位置编码(Negative RoPE Shift),摆脱了对复杂 PBR 材质逆渲染的依赖,实现了任意视角轨迹与任意光照条件下的高保真、多视角一致物体视频渲染。

研究背景与动机

在电影制作、广告宣传与数字孪生等沉浸式内容创作中,将高保真 3D 物体真实感地渲染至任意新环境并支持自由视角漫游,是一项基础而关键的研究课题。传统的“先重建后渲染”管线通常遵循两条路线:其一是利用神经辐射场(NeRF)或 3D 高斯泼溅(3DGS)进行新视角合成,但这些方法不可避免地将输入图像中的原始环境光照“烘焙”(baked)进隐式或显式表征中,想要置换环境必须经历极其脆弱、高度不适定的逆渲染(Inverse Rendering)解耦过程;其二是利用前向 3D 重建网络生成粗几何网格,再多阶段优化基于物理的渲染(PBR)材质贴图,不仅计算开销大,而且极易丢失高频细节与非朗伯体复杂反射。

与之相对,基于参考图的视频扩散基础模型展现出了惊人的泛化光照合成与纹理生成能力,能够在不显式建立物理光照传输模型的情况下,仅凭 2D 条件直接生成逼真的环境融合视频。然而,通用视频生成模型本质上缺乏三维空间确定性与精确的相机位姿控制能力;当仅依赖单视角参考时,不可见视角的纹理合成完全沦为模型的随机脑补(hallucination),一旦相机轨迹发生大幅度旋转或位移,视频就会出现严重的几何畸变、拓扑崩溃以及跨帧不一致。

这种两难局面的本质矛盾在于:显式 3D 表征具备严格的空间几何与视角确定性,但材质外观建模脆弱而失真;2D 视频生成模型具备高超的真实感光照与纹理先验,却缺乏多视角几何锚定与相机轨迹约束。核心 idea:利用前向快速重建出的粗糙 3D 几何代理作为结构锚点,将其投影为以物体为中心的 3D 坐标图输入视频扩散 Transformer,在特征空间搭建稠密空间查找通道,并通过负向旋转位置编码隔离参考帧与生成帧,用生成先验绕过显式物理材质逆渲染。

方法详解

整体框架

GO-Renderer 接收目标物体的少样本多视角参考图像 \(\mathcal{I} = \{I_j\}_{j=1}^N\)、目标相机运动轨迹 \(\mathcal{P}^{\text{target}} = \{P_k^{\text{target}}\}_{k=1}^M\)、描述目标光照与场景的文本提示 \(c\),以及可选的环境外观引导视频 \(A\)。整个流程分为“几何代理构建与空间映射”和“联合参考驱动的视频扩散生成”两个核心阶段。首先,系统通过前向 3D 重建网络(如 ReconViaGen 或 VGGT)在单次前向传播中估计参考相机的相对位姿并提取粗糙 3D 几何体 \(\mathcal{O}_{\text{recon}}\);随后将该粗几何分别向参考视点和目标相机轨迹光栅化,渲染出以物体为中心的稠密 3D 坐标图。最后,在视频 Diffusion Transformer(DiT)中,参考图与参考坐标图沿通道维度拼接作为外观查找源,目标坐标图与目标隐变量噪声拼接作为几何引导,在负向旋转位置编码的隔离保护下,去噪生成与目标轨迹和新光照严格对齐的高清视频。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视角参考图像 I + 目标相机轨迹 P_target + 文本/光照提示 c"] --> B["前向粗糙 3D 重建<br/>快速估计相机位姿并生成网格/点云 O_recon"]
    B --> C["以物体为中心的 3D 坐标图投影<br/>栅格化生成参考坐标图 C_ref 与目标坐标图 C_target"]
    C --> D["联合参考对齐输入<br/>I 与 C_ref 通道拼接 / 目标噪声与 C_target 通道拼接"]
    D --> E["负向旋转位置编码隔离<br/>Negative RoPE Shift 赋予参考帧负向时间偏移 -N*g"]
    E --> F["视频 Diffusion Transformer 去噪<br/>跨注意力与局部空间查找外观纹理"]
    F --> G["VAE 解码输出高保真物体漫游视频"]

关键设计

1. 以物体为中心的 3D 坐标图投影:建立像素级无歧义空间查找桥梁
常规 2D 扩散模型难以精准控制视角,是因为 2D 像素与 3D 物理空间之间缺乏直接的几何映射通道。为了给扩散模型注入显式、连续的几何约束,GO-Renderer 将前向重建出的粗糙 3D 代理网格或点云 \(\mathcal{O}_{\text{recon}}\) 光栅化为归一化坐标图。在前景有效像素区域内,RGB 颜色通道被赋予该点在物体局部坐标系下的三维坐标值 \((x, y, z) \in [-1, 1]^3\)。由于物体局部坐标系具备刚体旋转平移不变性,无论相机位姿如何大角度漂移,物体表面同一个物理微元在参考坐标图 \(C_{\text{ref}}\) 和目标坐标图 \(C_{\text{target}}\) 中都具有完全恒定的三维数值标识。这使得扩散网络的主干注意力无需费力推测隐式 3D 变换,而是像在内存中检索地址一样,通过匹配共享的三维坐标即可直接在多视角参考图间“检索并对齐”真实纹理,从根源上消除了单视角幻觉与视角漂移失真。

2. 联合参考对齐输入:外观先验与空间几何的双通道融合机制
传统受控生成方法常采用 ControlNet 等外挂侧分支注入条件,但分离的特征流容易在深层网络中发生语义衰减或空间对齐模糊。GO-Renderer 采用了紧凑的沿通道级联(Channel-wise Concatenation)方案:在参考侧,将 \(N\) 帧多视角参考图 \(I_j\) 与其对应的参考坐标图 \(C_{\text{ref}, j}\) 在通道维度拼接并压入 VAE 编码器,形成几何与纹理强绑定的参考隐变量;在生成侧,将待去噪的目标视频潜变量序列、目标相机轨迹对应的坐标图序列 \(C_{\text{target}}\) 以及描述环境外观的辅助引导条件 \(A\) 同样沿通道堆叠输入。这种早期密集合并机制迫使 DiT 的自注意力层在浅层即建立起从目标空间坐标到源参考像素的稠密对应关系,既保持了物体微观材质特征的忠实迁移,又赋予了模型依照文本 \(c\) 和背景动态渲染阴影与反光的自适应能力。

3. 负向旋转位置编码隔离:消除时序插值过渡瑕疵与上下文污染
在将静态的多视角参考图作为条件序列与目标生成序列一同送入视频 DiT 时,标准的 3D 旋转位置编码(RoPE)会默认按时序连续分配时间戳索引。如果参考帧直接作为第 \(0\) 帧的前序帧(例如连续索引为 \(-N, \dots, -1, 0, \dots, M-1\)),预训练视频模型会强行将参考帧误判为紧邻的前序动作历史,导致生成视频的第一帧出现严重的画面涂抹与过渡插值畸变(smearing artifacts)。为此,GO-Renderer 设计了离散跳跃的负向时间位置编码规则: $\(t_{\text{ref}, j} = - (N - j + 1) \cdot g, \quad j \in \{1, 2, \dots, N\}\)$ 其中 \(g\) 为预设的时间间隔步长(实验验证 \(g=3\) 最佳),而目标视频帧的时间索引严格保持从 \(0\)\(M-1\) 的正常标定。通过引入显式间隔 \(g\) 并拉开到负时间轴深处,参考帧被明确定义为全局静态的空间条件参考池,而非时间连续的历史流,彻底消除了帧头跳变,同时提升了 DiT 对参考外观特征的解耦与重组精度。

损失函数 / 训练策略

模型基于预训练的 Wan2.2Fun 5B 架构进行微调,使用 AdamW 优化器在 16 张 NVIDIA A800 GPU 上训练 20,000 步,批大小为 32。输入视频统一裁切至 \(480 \times 832\) 分辨率与 81 帧长度。为弥补训练数据匮乏,作者构建了包含 57,000 个视频片段的多源数据集(包含 Blender 合成渲染、OpenVidHD/CO3D 真实物体抠取与位姿追踪,以及 Wan2.2 辅助合成生成)。训练阶段采用三项关键数据增强策略:在 \(3 \sim 8\) 张多视角参考图间随机采样并打乱视角顺序;对 3D 几何代理的坐标图施加轻微的随机缩放与三维空间平移扰动,以迫使扩散模型学会容忍几何粗糙度和微小追踪噪声,避免过拟合于完美的几何对齐。

实验关键数据

主实验

论文在极具挑战性的两类设置下进行了定量评测:一是目标物体置于全新环境光照下的渲染质量与光照一致性(如表 1 所示,包含合成数据物理保真度与真实数据 VBench++ 维度);二是固定在纯白背景下的多视角外观一致性与新视角重建对比(如表 2 所示)。基线方法涵盖两阶段先重建后重光照方案(UniLumos 分别搭配真实几何 GT、生成先验 ReconViaGen 以及显式高斯 AnySplat)和基于 2D 扩散的受控视频模型(Phantom、Wan2.2Fun)。

表 1:渲染质量与光照一致性定量对比 | 方法 (Method) | PSNR ↑ | SSIM ↑ | 文本对齐 (Text Align) ↑ | 运动平滑度 (Motion Smoothness) ↑ | 美学质量 (Aesthetic Quality) ↑ | 成像质量 (Imaging Quality) ↑ | | :--- | :---: | :---: | :---: | :---: | :---: | :---: | | Phantom (Liu et al., 2025) | 11.400 | 0.514 | 24.620 | 0.984 | 0.568 | 0.709 | | UniLumos(GT) (Liu et al., 2025) | 12.060 | 0.585 | 25.630 | 0.978 | 0.569 | 0.669 | | UniLumos(ReconViaGen) | 11.010 | 0.338 | 25.870 | 0.975 | 0.571 | 0.666 | | UniLumos(AnySplat) | 11.160 | 0.362 | 25.930 | 0.975 | 0.557 | 0.624 | | Wan2.2Fun 基线 | 14.300 | 0.641 | 25.250 | 0.984 | 0.530 | 0.601 | | GO-Renderer (本文) | 18.260 | 0.684 | 27.720 | 0.988 | 0.573 | 0.712 |

表 2:多视角一致性与新视角重建定量对比 | 方法 (Method) | CLIP 图像平均相似度 (Img/Avg.) ↑ | CLIP 图像最大相似度 (Img/Max.) ↑ | DINO 平均相似度 (Avg.) ↑ | DINO 最大相似度 (Max.) ↑ | | :--- | :---: | :---: | :---: | :---: | | AnySplat (Jiang et al., 2025) | 0.861 | 0.934 | 0.191 | 0.323 | | ReconViaGen (Chang et al., 2025) | 0.796 | 0.927 | 0.448 | 0.727 | | GO-Renderer (本文) | 0.888 | 0.956 | 0.725 | 0.860 |

消融实验

论文围绕负向 RoPE 时间间隔步长 \(g\) 和模型对几何代理损坏的鲁棒性进行了精细的消融评测。

表 3:时间间隔步长 \(g\) 对渲染保真度的影响 | 时间偏移配置 (Temporal Offset \(g\)) | PSNR ↑ | SSIM ↑ | 画面第一帧质感与过渡表现 | | :--- | :---: | :---: | :--- | | \(g = 0\)(无额外时间缓冲间隔) | 15.63 | 0.6006 | 第一帧严重涂抹,产生强烈的参考图插值过渡伪影 | | \(g = 1\) | 17.89 | 0.6526 | 涂抹明显减弱,空间与外观条件逐步解耦 | | \(g = 3\)(本文选定配置) | 18.27 | 0.6770 | 达到最优综合定量表现,外观特征稳定注入且完全隔离时序干扰 | | \(g = 5\) | 18.09 | 0.6818 | 指标基本持平,保持良好条件隔离 | | \(g = 10\) | 17.99 | 0.6773 | 性能略微波动,过大的位置差使注意力略有发散 |

关键发现

  1. 彻底超越传统逆渲染与两阶段流水线:在光照一致性任务上,GO-Renderer 的 PSNR 达到 18.26 dB,比采用真值几何与高精度反射率贴图的上限基线 UniLumos(GT)(12.06 dB)高出 6.2 dB,证明了直接依靠视频生成模型的内部物理光照先验,其渲染自然度与环境反光融合度远超脆弱的多阶段逆渲染优化。
  2. 几何扰动下的优雅降级(Graceful Degradation):当人为向测试阶段的目标坐标图注入高斯空间位移与畸变噪声时,随着扰动方差增大,PSNR 呈现平缓的逐步下降而非断崖式崩溃,并在一定水平后趋于平稳平台。这表明网络并非机械地死记硬背几何坐标,当 3D 几何代理出现局部残缺时,DiT 会自适应转向调用其强大的 2D 图像/视频生成先验进行合理补全。
  3. 推理成本实用化:在单张消费级 48GB RTX 4090 GPU 上,GO-Renderer 生成一段分辨率为 \(480 \times 832\)、包含 81 帧(约 3.4 秒)的高质量视频仅需 58 秒,显存峰值控制在 31.8 GB,已具备直接嵌入 Blender 插件实现交互式离线渲染预览的工业落地潜力。

亮点与洞察

  • 空间确定性与生成逼真度的优雅结合:长期以来,3D 视觉追求显式几何的绝对多视角保真但受困于 PBR 材质逆解,生成视觉模型长于光影与质感但失控于视角。GO-Renderer 把粗糙 3D 几何仅作为“坐标索引卡”递给 DiT,由生成模型完成着色、高光、阴影与反射计算,走出了一条颠覆传统图形学光栅化与光线追踪的生成式渲染新路。
  • 坐标图作为通用跨视点几何桥梁:将物体三维局部坐标直接归一化并映射至 2D RGB 通道作为引导条件,巧妙规避了高维点云特征提取与多视点极线几何约束的复杂算子,使得 2D/3D 混合架构能够无缝嵌入标准 DiT。
  • RoPE 时间负轴隔离设计简洁有效:通过给参考视图打上独立且带间隔的负向时间索引,仅用极少量的架构改动就解决了困扰自注意力生成模型在多条件注入时的“时序插值污染”痛点。

局限与展望

  • 强拓扑不匹配下的几何外观冲突:虽然模型能容忍粗糙几何与微小追踪抖动,但若输入的 3D 代理与物体真实形状存在根本性冲突(如将杯子的外观强行贴在瓶子或立方体几何代理上),模型在互相矛盾的几何与外观约束下会发生严重崩溃,生成结构破损或畸变画面。
  • 长视频与极复杂动态场景扩展:当前框架主要聚焦于刚体或准刚体物体的孤立多视角渲染(81 帧),当面对具有高自由度非刚性拓扑形变或剧烈自遮挡的大型运动物体时,单次静态粗几何代理将不再适用,未来需引入动态 4D 几何代理进行扩展。

相关工作与启发

GO-Renderer 巧妙吸收了 ViewCrafter、Diffusion as Shader 与 Ominicontrol 的长处,并将其适配至物体级高精度可控渲染领域。这项工作给视频与 3D 领域的启示在于:在追求物理真实感交互渲染时,不必执着于在 3D 空间显式反演完美的 BRDF 材质与环境贴图;只要能为 2D 视频生成基础大模型提供稳固的空间坐标寻址参考,生成模型本身的隐式物理世界常识足以承担高级着色器(Neural Shader)的职能。

评分

  • 新颖性: 4.5 / 5.0
  • 实验充分度: 4.5 / 5.0
  • 写作质量: 4.5 / 5.0
  • 价值: 4.5 / 5.0