LumiTokens: 3D Relighting via Token-Space Lighting Transformation¶
会议: ECCV 2026
论文: ECCV 原文
项目主页: https://neu-vi.github.io/LumiTokens
领域: 3D视觉
关键词: 3D重光照, 隐式场景Token, 渐进式打光, Plücker光线, 神经渲染
一句话总结¶
LumiTokens 将 3D 重光照重新表述为无显式几何结构与渲染方程的隐式 Token 空间直接变换,通过场景 Token 与普吕克光线 Token 的自注意力交互,实现跨视角一致的高质量重光照与任意光源的渐进式累积编辑。
研究背景与动机¶
多视角 3D 资产重建(如 NeRF 与 3D 高斯泼溅)已在影视制作、游戏开发及电商展示中得到广泛应用。然而,将这些捕获的 3D 资产无缝合成至新环境时,必须根据目标场景的光照条件进行真实重渲染。传统逆向渲染方法依赖显式几何与材质分解(如法线、反照率及粗糙度),再通过渲染方程计算新光照下的外观。这类方法天然具备多视角几何一致性,但通常高度依赖密集的多视角图像捕获与耗时的逐场景优化,且其表达能力严格受限于所假定的物理 BRDF 模型与简化渲染方程,难以拟合次表面散射、高阶互反射等复杂光学物理效应。
生成式与扩散模型重光照范式则利用大规模数据先验,直接在视点空间生成真实感光照效果,但早期的单图重光照缺乏多视角几何一致性约束;即便最新的视频扩散或多视角注意力模型改善了时序一致性,其实质依然是视图空间生成,缺乏可持久驻留并支持复用的场景级全局表征,导致用户每次修改光源都必须重新运行整个扩散去噪流水线。而结合前馈几何重建与扩散外观生成的混合模型(如 RelitLRM、NeAR),虽然摆脱了逐场景优化,却同时受制于显式几何参数的表达上限和外观分支重复生成的计算开销。
针对这三类范式中重光照与场景表征割裂、每次修改光源均需完全重新计算的根本痛点,本文换了一个全新切入点:借鉴近期大视觉模型(如 LVSM、SRT)将多视角图像压缩为紧凑非结构化 1D 隐式场景 Token 的思想,探索在无显式物理语义的潜在空间内直接实现光照操控的可能性。核心 idea:将 3D 重光照表述为隐式场景 Token 空间上的闭环变换,将各类光源统一离散化为普吕克光线 Token,并通过 Transformer 自注意力实现场景与光线的双向交互,使编辑后的场景 Token 原生支持多光源的渐进式连续累加与即时新视角解码。
方法详解¶
整体框架¶
LumiTokens 整体架构由编码器(Encoder \(E\))、场景 Token 编辑器(Scene Token Editor \(T\))以及配备密集预测头(DPT Head)的解码器(Decoder \(D\))三部分构成。编码器首先将输入的稀疏视角图像与对应的普吕克光线嵌入映射为紧凑的非结构化 1D 场景 Token 序列 \(\mathbf{z}\);场景 Token 编辑器接收当前场景 Token 与统一参数化后的目标光线 Token \(\boldsymbol{\ell}\),在隐空间内完成光照条件的属性调制并输出重光照场景 Token \(\mathbf{z}'\);最后,解码器在目标相机光线驱动下将 \(\mathbf{z}'\) 渲染为多视角一致的重光照图像。由于编辑器的输出严格位于原始场景 Token 的潜在流形内,多轮打光编辑可以在 Token 空间直接迭代复合(\(\mathbf{z}^{(s-1)} \to \mathbf{z}^{(s)}\)),解码器仅需在最终预览或特定检查点执行前向推理。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视角输入图像 + 普吕克光线<br/>结合可学习空Token z0"] --> B["场景编码器<br/>聚合空间与测度信息生成场景Token z"]
C["目标光照参数化<br/>环境贴图 / 点光源 / 面光源统一为普吕克光线"] --> D["场景Token编辑器<br/>场景Token与光线Token全局自注意力交互"]
B --> D
D -->|更新光照流形| E["重光照场景Token z'"]
E -->|渐进打光循环 z s-1 到 z s| D
E --> F["多尺度DPT解码器<br/>在目标视线驱动下渲染高质量重光照新视角"]
关键设计¶
1. 统一普吕克光线 Token 化:消除无物理结构隐表征与 3D 空间交互的鸿沟
隐式场景 Token 并不具备预定义的 3D 几何坐标格点或显式表面参数,如何在缺乏显式空间结构的前提下实现原生 3D 用户打光交互(如在三维坐标放置点光源或调节面光源方向)是首要难题。本文将所有形态的光源统一离散化为从光源表面朝向场景包围盒发射的普吕克光线集合 \(\boldsymbol{\ell} = \{\boldsymbol{\ell}_1, \dots, \boldsymbol{\ell}_L\}\)。每个光线 Token 参数化为 \(\boldsymbol{\ell}_i = (\mathbf{r}^\ell_i, \mathbf{c}_i, e_i)\),其中 \(\mathbf{c}_i \in \mathbb{R}^3\) 为光谱辐射颜色,\(e_i\) 为辐射功率,几何轨迹采用六维普吕克坐标 \(\mathbf{r}^\ell_i = (\mathbf{d}_i, \mathbf{m}_i)\),包含单位方向向量 \(\mathbf{d}_i\) 与矩向量 \(\mathbf{m}_i = \mathbf{o}_i \times \mathbf{d}_i\)。对于环境贴图,因视差为零将矩向量置零(\(\mathbf{m}_i = \mathbf{0}\)),退化为远场方向光;对于点光源,光线均汇聚于其 3D 坐标源点,方向与矩向量联合编码了点光源的空间绝对位置;对于面光源,则在发射面几何区域内密集采样光线原点与发射锥。通过这种通用的光线参数化,任何空间打光指令都被转化为一致的 Token 序列,使得无显式几何的隐式模型能够天然对准 3D 空间物理光源。
2. 双向自注意力场景 Token 编辑器:建模几何遮挡与光线交互的隐式传输
若采用常规的交叉注意力(Cross-Attention)将光线注入场景,光线信息仅单向调制场景 Token,场景本身无法反向感知光线在三维几何中的传输遮挡路径。LumiTokens 将 \(K\) 个场景 Token \(\mathbf{z} = \{\mathbf{z}_1, \dots, \mathbf{z}_K\}\) 与 \(L\) 个光线 Token \(\boldsymbol{\ell} = \{\boldsymbol{\ell}_1, \dots, \boldsymbol{\ell}_L\}\) 沿序列维度拼接为单条长序列,送入多层标准 Transformer 块进行全局自注意力运算: $\(\mathbf{z}'_1, \dots, \mathbf{z}'_K, \boldsymbol{\ell}'_1, \dots, \boldsymbol{\ell}'_L = \text{Transformer}(\mathbf{z}_1, \dots, \mathbf{z}_K, \boldsymbol{\ell}_1, \dots, \boldsymbol{\ell}_L)\)$ 自注意力机制使得光线 Token 可以根据场景几何结构自适应调整关注权重,感知阴影投影面与法线朝向,而场景 Token 则根据入射辐照度实时更新高光与明暗分布。计算完成后丢弃临时更新的光线 Token \(\boldsymbol{\ell}'\),仅保留变换后的场景 Token \(\mathbf{z}'\)。
3. 隐空间闭环的渐进式打光机制:杜绝像素重编码带来的多轮累积漂移
在实际交互式布光流程中,艺术家通常逐步添加环境底光、主光、补光与轮廓光。现有的神经渲染与扩散方法若要支持多步打光,必须在每步渲染出全视角像素图像后再次送入编码器进行二次提取,这种编解码往复(Decode-and-Re-encode)会使重建误差迅速累积,导致高频纹理崩塌与几何退化。LumiTokens 强约束编辑函数 \(T\) 在隐空间 \(\mathcal{Z}\) 内部是闭合的,即对于任意有效光照输入 \(\boldsymbol{\ell}^{(s)}\),均有 \(\mathbf{z}^{(s)} = T(\mathbf{z}^{(s-1)}, \boldsymbol{\ell}^{(s)}) \in \mathcal{Z}\)。打光过程纯粹表现为隐空间内的链式状态推演,所有累加编辑完全发生在 Token 序列中,解码器仅充当只读预览器,从而完全规避了像素级损耗。
4. 多尺度 DPT 解码头:利用分层卷积融合恢复高频细节与清晰纹理
基线模型 LVSM 采用独立的逐 Token MLP 预测对应图像 Patch,由于缺乏跨 Patch 的空间上下文整合,容易产生块状伪影并丢失高频镜面高光边缘。本文在解码器 Transformer 输出之后接入稠密预测变换头(Dense Prediction Transformer, DPT),将解码器输出的特征 Token 重新组装为多尺度特征图,利用级联卷积块自底向上融合浅层空间轮廓与深层语义表征,显著恢复了被压缩在 1D Token 内的精细反射纹理与锐利自阴影边界。
损失函数 / 训练策略¶
训练阶段联合优化编码器 \(E\) 与场景 Token 编辑器 \(T\),解码器 \(D\) 保持冻结以固化新视角合成的先验几何分布。总损失函数由两部分构成: $\(\mathcal{L} = \mathcal{L}_{\text{render}} + \alpha \mathcal{L}_{\text{inv}}\)$
- 渲染监督损失 \(\mathcal{L}_{\text{render}}\):为确保多步渐进编辑时不脱离潜空间流形,训练时随机抽取长度为 \(S\) 的连续光源序列 \(\boldsymbol{\ell}^{(1)}, \dots, \boldsymbol{\ell}^{(S)}\) 递归执行 Token 变换,并在每个步骤 \(s\) 计算渲染输出与真值重光照图像 \(I_{\text{gt}}\) 之间的像元 \(\ell_2\) 损失与感知损失: $\(\mathcal{L}_{\text{render}} = \|I_{\text{gt}} - \hat{I}\|_2^2 + \lambda \mathcal{L}_{\text{LPIPS}}(I_{\text{gt}}, \hat{I})\)$
- 光照不变性正则化 \(\mathcal{L}_{\text{inv}}\):针对输入图像包含源环境杂乱光照的问题,将同一场景在两种随机光照 \(L_A\) 和 \(L_B\) 下渲染的多视角图像分别送入编码器,惩罚二者输出的场景 Token 欧氏距离: $\(\mathcal{L}_{\text{inv}} = \|E(\{I_i^A, \mathbf{r}_i\}) - E(\{I_i^B, \mathbf{r}_i\})\|_2^2\)$ 该项驱使编码器自动剥离视角依赖的源光照高光与投射阴影,仅将场景的不变几何与固有材质信息编入 \(\mathbf{z}\),将所有光照响应的调节职能完全剥离并交由编辑器 \(T\) 承担。
实验关键数据¶
主实验¶
论文在多视角重光照(Multi-view Relighting)与新视角重光照(Novel-view Relighting)两个核心任务上开展评测。以下表格汇总了在合成测试集(Objaverse + Polyhaven 独立子集)及真实世界数据集(Objects-with-Lighting、Stanford-ORB)上的主客观量化对比。
表 1:多视角重光照精度对比(输入 4 视角,评估原视角下重光照)
(注:ILR 表示图像级缩放对齐,SLR 表示跨视角全局一致的场景级缩放对齐)
| 方法 | ILR PSNR↑ | ILR SSIM↑ | ILR LPIPS↓ | SLR PSNR↑ | SLR SSIM↑ | SLR LPIPS↓ |
|---|---|---|---|---|---|---|
| LightSwitch (ICCV 2025) | 21.22 | 0.868 | 0.105 | 21.19 | 0.868 | 0.131 |
| Neural Gaffer (NeurIPS 2024) | 28.40 | 0.947 | 0.030 | 28.23 | 0.955 | 0.037 |
| DiffusionRenderer (CVPR 2025) | 26.39 | 0.951 | 0.038 | 26.24 | 0.923 | 0.086 |
| LumiTokens (本文) | 30.48 | 0.954 | 0.045 | 30.36 | 0.917 | 0.086 |
表 2:新视角重光照精度与输入视角数对比(评估未见新视角合成 + 目标光照)
| 方法 | 输入视角数 (#Input) | Synthetic PSNR↑ | Synthetic SSIM↑ | Synthetic LPIPS↓ | Objects-w-Light PSNR↑ | Objects-w-Light SSIM↑ | Stanford-ORB PSNR↑ | Stanford-ORB SSIM↑ |
|---|---|---|---|---|---|---|---|---|
| LightSwitch | 16 | 21.61 | 0.86 | 0.13 | 25.43 | 0.84 | 32.02 | 0.98 |
| NVDiffrecMC | 50 | 22.95 | 0.86 | 0.10 | 20.24 | 0.73 | 31.60 | 0.97 |
| TensoIR | 50 | 26.17 | 0.92 | 0.07 | 26.12 | 0.77 | 25.27 | 0.94 |
| LumiTokens (本文) | 8 | 27.76 | 0.91 | 0.06 | 26.76 | 0.92 | 31.01 | 0.97 |
消融实验¶
表 3:编码器微调与光照不变性正则化策略消融(新视角重光照)
| 配置 | 编码器状态 | 正则化监督方案 | PSNR↑ | SSIM↑ | LPIPS↓ | 说明 |
|---|---|---|---|---|---|---|
| Baseline (LVSM 方案) | 冻结 (Frozen) | 无 (None) | 25.06 | 0.910 | 0.073 | 预训练的新视点表征无法直接兼容光照编辑 |
| Encoder Fine-tuned | 解冻 (Unfrozen) | 无 (None) | 26.12 | 0.927 | 0.046 | 解冻微调带来 1.06 dB 的显著增益 |
| Explicit Supervision | 解冻 (Unfrozen) | 显式反照率辅助预测头 | 27.09 | 0.934 | 0.057 | 引入额外解码头预测 Albedo,需真实标注 |
| Implicit Invariance (本文) | 解冻 (Unfrozen) | 隐式光照不变性损失 \(\mathcal{L}_{\text{inv}}\) | 27.05 | 0.952 | 0.045 | 结构与感知质量最佳,无需任何反照率真值 |
关键发现¶
- 多视角内在解耦能力卓越:在多视角重光照任务中,LumiTokens 在 PSNR 上显著领先 Neural Gaffer 超过 2.0 dB。更关键的是,从单个视角的自由对齐(ILR)过渡到全场景统一尺度的严苛对齐(SLR)时,LumiTokens 的 PSNR 仅微跌 0.12 dB,SSIM 与 LPIPS 保持高度稳定;而作为对比,DiffusionRenderer 在 SLR 下 LPIPS 从 0.038 急剧恶化到 0.086。这表明通过全局场景 Token 交互,模型成功剥离了源光照伪影,保证了严格的全视角一致性。
- 少视角输入下的高几何复原度:在跨视角重光照测试中,传统逆向渲染方法 NVDiffrecMC 和 TensoIR 需要密集布置 50 个观测视角并通过耗时的逐场景优化才能收敛,而 LumiTokens 仅依赖 8 个稀疏视角,前向推理即在合成测试集达到 27.76 dB 的 SOTA PSNR,在真实测试集 Objects-with-Lighting 上取得 0.92 的最高 SSIM。
- 隐式渐进打光完胜像素重编码:在连续 10 步光源累加消融实验中,直接在 Token 空间累积状态的 LumiTokens 始终保持平稳的高 PSNR/SSIM 曲线;相比之下,采用“生成图像-重新编码为 Token-再编辑”的像素重编码基线从第一步起就遭受严重的自累积退化,证明了在潜在流形内维持闭环操作的设计正确性。
亮点与洞察¶
- 将光线几何化为普吕克 Token 融入非空间隐空间:将原本无法对齐 3D 物理语义的抽象场景 Token,通过包含位置与方向的普吕克光线 Token 自注意力进行几何对齐,巧妙解耦了“无显式网格/点云表示”与“3D 空间交互布光”的天然对立。
- 多步打光闭环保持与训练阶段长链蒸馏:通过在训练中引入随机光源序列的递归前向与逐步监督,迫使 Transformer 编辑器学习到隐空间内的自收敛变换,避免了长序列打光过程中的潜在表征发散与语义漂移。
- 无需分解的反照率解耦(Zero-annotation Disentanglement):通过简洁的双光照编码差值正则项 \(\mathcal{L}_{\text{inv}}\),无需收集昂贵的真实反照率或表面法线标签,便迫使编码器只抽取场景固有的内在几何与材质表征。
局限与展望¶
- 极端镜面与复质透明介质的保真度:对于折射指数异常复杂的完全透光玻璃体或高频镜面全反射,1D Token 的有限通道容量可能对局部相位高频光子路径存在压缩损耗。
- 对输入相机位姿误差敏感:模型依赖普吕克光线参数进行严密的几何线索锚定,在真实无标定场景或 SfM 位姿严重抖动的情况下,隐空间的几何对齐质量会受到干扰。
- 未来方向:探索结合自监督预训练的无位姿 Token 编码架构;将流匹配(Flow Matching)等连续轨迹生成技术引入 Token 编辑器以支持更高自由度的局部光照画刷交互。
相关工作与启发¶
- vs. TensoIR / Relightable 3D Gaussians (经典逆向渲染):后者依赖显式几何参数化及简化的物理 BRDF 渲染积分,耗费大量时间进行反向梯度传播优化,且无法刻画非经典材质;LumiTokens 为前向推理模型,彻底摆脱了显式渲染方程与反照率手工分解的束缚。
- vs. Neural Gaffer / LightSwitch (扩散生成式重光照):后者将重光照视作图像或视频层面的二维像素扩散生成,跨视角光照一致性难以通过后验约束完全保证,且缺乏持久化的 3D 资产状态;LumiTokens 将光照修改固化在共享场景 Token 中,每次修改只需执行一次轻量 Transformer 前向计算。
- vs. RelitLRM / NeAR (混合前馈模型):混合架构虽然也是前馈式,但必须将输出解压并绑定至显式 3D 高斯(3DGS),外观仍由扩散模型反复采样;LumiTokens 纯粹在紧凑的 Token 空间内运作,原生支持多光源的渐进式闭环交互叠加。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ (首次实现完全在隐式无结构 Token 空间内执行 3D 场景重光照与渐进编辑)
- 实验充分度: ⭐⭐⭐⭐⭐ (全面涵盖多视角重光照、新视角重光照、多光源渐进消融及真实数据集测试)
- 写作质量: ⭐⭐⭐⭐⭐ (逻辑推演严密清晰,动机剖析深刻,结构设计优雅自洽)
- 价值: ⭐⭐⭐⭐⭐ (为 3D 资产的实时神经编辑、虚拟布光交互与神经渲染管线指引了全新范式)