跳转至

OmniRen: Neural Rendering wih Heterogeneous Scene Primitives

会议: ECCV 2026
论文: ECCV 原文
代码: https://renderformer.github.io/v2
领域: 3D视觉
关键词: 神经渲染, 稀疏注意力, 神经材质嵌入, 异构场景图元, 全局光照

一句话总结

针对传统神经渲染难以扩展至复杂场景图元与大规模几何图元的问题,RenderFormer-V2(OmniRen)提出结合希尔伯特曲线空间重排的局部滑动窗口与融合物理语义的渲染注意力汇聚(Attention Sinks)机制,配合独立于解析反射模型的连续神经材质隐空间与异构图元嵌入,实现了免针对单场景微调的高保真全局光照前向渲染。

研究背景与动机

神经渲染旨在摆脱传统基于物理渲染(PBR)中繁琐的手工积分规则与光线追踪特化代码,利用神经网络从几何、材质与光照的关系中直接学习复杂全局光照传输。然而,现有的神经渲染系统陷入两难困境:基于隐式辐射场(NeRF)或高斯泼溅的方法严重依赖单场景过拟合微调,跨场景泛化能力极差;而基于屏幕空间 G-buffer 的前向推理模型仅能观测局部可见表面,对遮挡区域或不可见光源引发的间接光照与焦散效果只能凭空脑补。近期提出的 RenderFormer 虽然将全局光线传输形式化为端到端序列到序列(Seq2Seq)自回归问题,在免微调泛化渲染上迈出了关键一步,但其初代架构受限于严苛的几何与材质假设,远未达到实用标准。

RenderFormer 面临的核心瓶颈在于计算扩展性与图元表达能力的双重断崖。在视点无关(view-independent)图元间光传输阶段,初代模型采用纯暴力全自注意力(Full Self-Attention),使得计算与显存开销随图元数量呈二次方 \(O(N^2)\) 爆炸,在图元规模突破 4k 三角面后就会因注意力弥散而丧失聚焦能力,导致渲染画面严重暗化;同时,模型硬编码了单一的微表面 GGX BRDF 模型与至多 8 个漫反射三角形光源,完全无法表达参与介质体积散射、高动态范围环境贴图、表面置换凹凸纹理及复杂实测材质。

面对多重物理光照效应的复杂耦合,本文的核心思路是不走传统渲染引擎依赖光线树分支特化代码的老路,而是将多物理传输统一抽象为异构图元序列变换,并在长序列变换中引入契合光照物理传输特性的稀疏注意力机制。核心 idea:将光传输建模为异构图元序列变换,结合希尔伯特空间重排的局部窗口注意力与包含光源、寄存器和几何均值压缩的渲染感知注意力汇聚(Attention Sinks),解耦材质物理模型并构建统一神经外观隐空间,实现突破十万级图元的跨场景免微调神经渲染。

方法详解

整体框架

RenderFormer-V2 继承了分阶段解耦的 Seq2Seq 神经渲染范式,将整个光传输过程拆分为两步走流水线:首先在视点无关阶段(View-Independent Stage)计算场景内部所有异构图元之间的间接光传输与能量交换;随后在视点相关阶段(View-Dependent Stage)接收相机视线束(Ray Bundles),在世界坐标系下通过跨注意力(Cross-Attention)查询场景几何并结合窗口注意力解码生成最终高动态范围像素块。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["异构输入:三角形/体素/光源/环境贴图"] --> B["统一相对位置编码与异构图元特征嵌入"]
    B --> C["希尔伯特空间曲线重排与局部滑动窗口"]
    B --> D["物理感知注意力汇聚机制<br/>光源+全局寄存器+几何汇总块"]
    C --> E["视点无关光传输建模"]
    D --> E
    E --> F["世界坐标系视线束跨注意力与Swin视点解码"]
    F --> G["高保真多效果全局光照渲染图像"]

系统首先把三角形网格、散射介质体素、三角面光源、环境贴图和相机视线统一映射为 768 维的图元序列。在视点无关阶段,通过空间填充曲线重排结合滑动窗口计算局部邻域高频交互,借助渲染语义注意力汇聚捕捉全局长程光照;在视点相关阶段,由相机视锥投射的 \(8 \times 8\) 光线网格组成的光线束通过 Swin 移位窗口与跨注意力层聚焦可见表面,最终由稠密视觉变换器解码输出图像。

关键设计

1. 物理语义驱动的渲染注意力汇聚与局部稀疏注意力:破解几何规模暴增下的二次方复杂度与注意力弥散

经典全注意力机制在长序列下计算开销呈 \(O(N^2)\),更致命的是 Softmax 归一化会导致远距离背景稀释有效注意力,使得渲染在大规模网格下产生严重失焦和暗斑。针对三维几何点集空间分布不均匀的特点,模型首先沿三阶希尔伯特空间填充曲线(Hilbert Curve)对几何图元质心进行空间重排与线性化,确保序列上一维相邻的图元在三维物理空间中高度邻近。基于重排序列,局部邻域采用前后各 256 个图元的滑动窗口自注意力建模高频局部接触遮挡与漫反射弹射。为了无损恢复全局大范围光传输,模型构建了专用渲染注意力汇聚(Attention Sink),永久保留三类关键全局 Token:其一为 16 个可学习的全局寄存器 Token,用于缓冲全场景通用的光能基底;其二为场景内所有显式光源 Token,确保所有几何图元在每次计算时均能直接与光源交互,等价于路径追踪中的下一事件估计(NEE)与重要性采样;其三为对每连续 64 个几何图元进行均值池化(Mean Pooling)提炼出的几何粗粒度汇总 Token(Summarization Tokens)。该设计将单层计算复杂度严格约束在 \(O(N \cdot W + N \cdot \frac{N}{64})\) 的近线性水平,兼顾了局部高频阴影与远端粗粒度漫反射环境光。

2. 神经材质外观隐式流形与纹理嵌入:彻底解耦硬编码 BRDF 及其解析求值规则

传统神经渲染往往将物理材质硬编码为特定的参数化解析公式(如特定微表面粗糙度与折射率),无法表征涂层、车漆等实测 BRDF 及各向异性材质。RenderFormer-V2 提出材质表征只需保留感知外观分布而无需向输入参数逆向解算。系统使用 Blender Cycles 离线渲染单位球体在 Uffizi Gallery 光照探针下的多样化材质图像,该探针具备中性色温与丰富高低频光强分布。在此数据上预训练一个带瓶颈层 9 维隐向量的卷积自编码器(CNN Auto-Encoder),并在潜在特征空间施加平滑正则化与双曲正切 \(\tanh\) 激活将其约束在 \([-1, +1]\) 流形上。对于各向同性解析材质,训练轻量级多层感知机(MLP)将原始参数直接投影至 9 维隐空间;对于无法用公式描述的实测材质(如 RGL 数据集),则直接通过该球体前向编码得到隐向量。在处理空间变化纹理(SVBRDF)时,将三角形表面解算出的 9 通道潜在材质图、3 通道法线贴图及 1 通道置换高度贴图光栅化为 \(32 \times 32\) 图像块,利用预训练 VAE 编码为 \(4 \times 4 \times 80\) 的特征图,经由线性层投影为 768 维纹理增强向量,使得网络无需改动内核即可自适应学习几何微表面视差与置换凹凸阴影。

3. 跨模态异构场景图元统一嵌入:原生兼容参与介质散射、多源光照与相机视线束

针对现实场景中流体、烟雾等参与介质与多尺度环境光照共存的物理特性,系统建立了对等异构图元编码协议。对于体积散射图元,将空间连续的散射吸收介质体素化,对其三维旋转矩阵与各轴缩放因子进行 12 频带 NeRF 傅里叶位置编码,结合包含 RGB 散射系数、RGB 吸收系数与 Henyey-Greenstein 相函数各向异性因子的 7 维光学参数构成的 \(4 \times 4 \times 4\) 体积纹理,拼合构成统一体素图元。对于大范围环境光,将 \(512 \times 256\) 空间的高动态范围(HDR)与低动态范围(LDR)经由预训练 VAE 压缩并切分为 \(8 \times 4\) 个面元 Token,每个面元关联其对应的归一化世界坐标光线方向图与对数极大值缩放因子。在空间几何定位上,所有具备三维实体质心的图元与相机光线束统一采用维度为 40(20 个频率对)的旋转位置编码(RoPE),对环境贴图等无特定位置的全局图元则统一定位在整场景边界盒中心,在严密保持场景平移不变性的同时,允许模型联合消解多相态传输。

4. 世界坐标系统一视点变换与 Swin 移位窗口光线解码:摆脱相机空间坐标耦合与分辨率瓶颈

初代模型将整个视点相关解码阶段置于相机局部坐标系,不仅需要对全场景几何进行繁重的刚体坐标系变换投影,而且在输出像素网格密集化时遭遇二次方显存壁垒。RenderFormer-V2 将整个第二阶段的自注意力机制升级为基于世界坐标系的 Swin 移位窗口注意力(Swin Windowed Attention),设定窗口大小为 8、步长偏移为 4。输入视线束由 \(8 \times 8\) 条连续相机光线组成,直接在世界坐标系下与第一阶段输出的全局场景图元特征做交叉注意力聚合。这种移位局部窗口划分使视点解码的自注意力计算复杂度从 \(O(T \cdot R + R^2)\) 降低至 \(O(T \cdot R + W^2)\)(其中 \(T\) 为场景图元总数,\(R\) 为光线束总数,\(W\) 为固定窗口跨度),完全切断了计算复杂度对图像长宽分辨率的直接平方依赖,使得系统能够平滑向 \(2048 \times 2048\) 及更高超清渲染分辨率进行阶段性渐进迁移微调。

损失函数 / 训练策略

模型采用复合感知保真度损失函数进行端到端优化: $$ \mathcal{L} = \mathcal{L}1(\log I, \log \hat{I}) + 0.05 \cdot \mathcal{L}, \log(1))) $$ 其中利用对数变换 }}(\text{clamp}(\log I, \log(1)), \text{clamp}(\log \hat{I\(\log I\) 压缩真实渲染中高频镜面反射与高动态局部焦散的亮度跨度,抑制大梯度对 \(\mathcal{L}_1\) 损失的数值主导,并结合 LPIPS 深度特征感知损失提升材质高频质感。

为了有效驯服异构图元协同学习的难度,模型采用渐进式五阶段课程学习策略(在 32 张 NVIDIA A100 GPU 上累计训练 19 天): 1. 阶段 1(4天,1k 图元,256×256 分辨率):使用全自注意力先验巩固粗粒度光传输物理机制,依次渐进引入均匀材质、SVBRDF 纹理、遮蔽直接可见背景的环境光和体素散射介质。 2. 阶段 2(2天,4k 图元,512×512 分辨率):提升图元预算与图像分辨率。 3. 阶段 3(3天,4k 图元,512×512 分辨率):平滑切断全自注意力,全面切换为希尔伯特滑动窗口与渲染注意力汇聚稀疏机制。 4. 阶段 4(7天,16k 图元,512×512 分辨率):在大规模图元下稳固长程传输与多源复杂遮挡。 5. 阶段 5(3天,64k 图元,2048×2048 分辨率):微调超高分辨率几何与丰富表面微结构细节呈现。

实验关键数据

主实验

论文在随机生成的复杂闭合及半开阔场景(覆盖未见过的 PolyHaven 环境贴图、MatSynth SVBRDF 材质及 Stanford 复杂三维网格如 Dragon 和 Lucy)上与初代 RenderFormer 及离线物理渲染器 Blender Cycles(4096 spp 基准参考)进行了全面评测。在模型质量、长网格鲁棒性与推理耗时上展现出显著优势。

模型 / 渲染配置 测试图元规模 图像分辨率 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ 单帧渲染耗时 (s)
RenderFormer (V1) 6.4k \(512 \times 512\) 24.81 0.8120 0.2104 1.84
RenderFormer (V1) 83.2k \(512 \times 512\) 18.23 0.6432 0.5420 5.86
RenderFormer-V2 (本文) 6.4k \(512 \times 512\) 28.14 0.8950 0.1031 0.38
RenderFormer-V2 (本文) 83.2k \(512 \times 512\) 27.95 0.8894 0.1082 1.12
RenderFormer-V2 (本文) 64k \(2048 \times 2048\) 27.84 0.8856 0.1105 12.4
Blender Cycles (Ground Truth) 64k \(2048 \times 2048\) \(\infty\) 1.0000 0.0000 ~185.0

注:RenderFormer-V1 在图元规模上升至 83.2k 时因全自注意力弥散导致渲染严重暗化,指标急剧劣化;而本文方法指标平稳保持在高质量水平,推理开销较离线 Cycles 提速百倍以上。

消融实验

在第四阶段训练集验证场景(包含 16k 图元)上对稀疏注意力各模块进行系统性消融,涵盖滑动窗口(SW)、注意力汇聚(AS)、显式光源 Token(L)与几何汇总 Token(S)的不同配置:

模型变体配置 PSNR (dB) ↑ SSIM ↑ LPIPS ↓ HDR-FLIP ↓ 说明
RenderFormer-V2 (完整配置) 28.25 0.8982 0.0997 0.4200 包含 SW、AS(L+S,64:1 压缩比)
去除注意力汇聚 (w/o AS) 27.36 0.8841 0.1247 0.4359 仅靠局部窗口,丧失远距离全局光照与阴影
去除滑动窗口 (w/o SW) 26.92 0.8715 0.1289 0.4517 丧失局部高频几何遮挡与接触高光
汇聚中去除光源 (AS w/o L) 27.40 0.8813 0.1081 0.4250 无法对远距离强光源形成确定性重要性采样
汇聚中去除几何汇总 (AS w/o S) 27.09 0.8754 0.1210 0.4485 远端物体缺乏粗粒度遮挡与反射环境感知
汇聚仅留寄存器 (AS w/o L, S) 26.13 0.8474 0.1514 0.4959 性能大幅下降,全局先验极度受限
增加汇总 Token (每 32 图元汇聚 1 个) 27.78 0.8923 0.1072 0.4231 汇总过多引入冗余背景噪声,注意力轻微弥散
减少汇总 Token (每 128 图元汇聚 1 个) 26.48 0.8690 0.1346 0.4655 远端几何下采样过粗,丢失远距离大结构阴影
传统全自注意力 (Full Attention) 27.91 0.8953 0.1027 0.4287 劣于完整模型;注意力弥散导致渲染对比度与锐度下降

关键发现

  • 稀疏注意力反超全注意力机制:RenderFormer-V2 的混合稀疏注意力 PSNR(28.25 dB)不仅大幅超越去除各组件的配置,甚至反超了暴力全注意力模型(27.91 dB)。这充分证明在大规模几何图元场景下,暴力 Softmax 全注意力会导致能量在大量次要远距离图元中被稀释,而“局部强交互 + 语义汇聚骨架”的组织结构更有助于网络聚焦关键光传输路径。
  • 光源与几何汇总构成立体全局感知:消融数据显示,同时移除光源与几何汇总 Token 会造成极其剧烈的性能跌落(PSNR 暴跌 2.12 dB,HDR-FLIP 恶化至 0.4959)。光源提供了场景最主要的能量边界条件,而 64:1 的空间几何压缩比例刚好在宏观几何遮蔽感与 Token 紧凑度之间取得了最优平衡点。
  • 分辨率与超清几何细节的超预期解耦:实验发现,在网格面数完全相同的情况下,仅通过提高视点解码分辨率(从 512 提升至 2048),模型能够自发解析出原本在低分辨率下难以看清的微小网格拓扑(如 Stanford Dragon 的爪尖微结构与 Lucy 雕塑的面部手指起伏),展现出强大的多尺度神经特征解析能力。

亮点与洞察

  • 将光线追踪物理结构精巧折射为长上下文 Transformer 机制:将离散网格的连续三维邻近性通过希尔伯特曲线降维成一维序列,并把路径追踪中“重要性采样显式光源(NEE)”与“辐照度体元粗粒度缓存”的物理思想,分别具象化为“固定光源注意力汇聚”与“图元块均值汇聚 Token”。
  • 材质表征从“参数逆问题”解放为“神经外观感知流形”:避开了传统反渲染对未知实测材质繁琐的非线性参数拟合陷阱,通过中性探针下的球体神经特征隐空间直接对齐人类视觉感知,让生成式前向渲染网络自行学习外观到光照反射的映射。
  • 跨渲染相态的异构序列统摄力:打破了传统图元要么纯表面网格、要么纯体素 NeRF 的对立壁垒,将多相态异构图元统一表征为可自适应交叉交互的 Token 序列,无需手写体素光线行进(Ray Marching)或复杂求交代码即可端到端自发学会折射焦散与烟雾多重散射。

局限与展望

  • 光源数量与多光源泛化上限:由于训练管线约束,当前系统最多支持 8 个显式三角面光源,在极复杂多光源室内夜景中仍需依赖环境贴图进行近似折中。
  • 固定贴图分辨率对大尺度三角面不友好:目前对每个三角形固定分配 \(32 \times 32\) 纹理 Patch 编码,若场景中存在未经细分的超大跨度三角形,会导致表面纹理与置换贴图空间采样率严重不足,需在前处理阶段强制进行多边形细分(Subdivision)。
  • 新增图元类型的重新训练成本:由于当前五阶段渐进式训练在第一阶段便固化了多图元间的基底交互,如果后续想要引入神经隐式 SDF 或高斯球等新图元,通常需要从阶段 1 重新进行长时间的多卡大规模预训练。

相关工作与启发

  • vs RenderFormer (V1):初代仅支持小于 4k 三角面、硬编码单一 GGX 模型与至多 8 个漫反射三角光源;RenderFormer-V2 引入希尔伯特稀疏窗口注意力与物理语义注意力汇聚,轻松支持突破 10 万级图元的大型复杂场景,并将材质扩展至透明折射、各向异性及实测材质,原生支持参与介质体素与环境贴图。
  • vs DiffusionRenderer:DiffusionRenderer 依赖视频扩散先验与屏幕空间缓冲帧合成,渲染不可见区域易产生时空闪烁与非物理伪影;RenderFormer-V2 建立在完整三维几何图元序列与全局光传输物理机制之上,前向推理严格保真且具备视点一致性。
  • vs Point Transformer v3:两者均采用希尔伯特曲线进行三维结构序列化,但 PTv3 侧重于三维点云几何分割与表征,而本文将这一序列化机制深度整合至多跳光能传输中,设计了兼顾直接辐射与间接散射的注意力汇聚体系。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将物理感知的长文本注意力汇聚与连续神经材质隐空间完美引入大规模全景神经光传输渲染中。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖复杂折射、焦散、体积烟雾、实测材质等严苛物理效果,提供了系统详尽的消融实验与尺度扩展分析。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,架构逻辑严密自洽,软硬件协同与物理直觉的结合极其亮眼。
  • 价值: ⭐⭐⭐⭐⭐ 为解决次世代免微调通用神经渲染与实时神经着色器开拓了全新范式,启发性极强。