TriNLOS: Triplane Representations for Neural Non-Line-of-Sight Imaging¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/CIL-Research/TriNLOS
领域: 3D视觉
关键词: 非视域成像, 三平面神经表征, 光锥变换, 神经体积渲染, 瞬态光传输
一句话总结¶
针对非视域(NLOS)成像中直接三维神经体网络计算开销呈三次阶 \(O(N^3)\) 膨胀且易受漫反射背景噪声干扰的难题,TriNLOS 结合可微物理增强光锥变换(ELCT)粗体初始化与正交三平面表征,通过沿共享轴切片交叉注意力与梯度阻断深度渲染头,在 \(O(N^2)\) 计算复杂度与 8.0 GB 显存开销下实现了显著超越传统物理反演与现有深度学习基线的高保真几何与强度重建。
研究背景与动机¶
非视域(NLOS)成像致力于利用中继墙面测量的高时间分辨率多重散射光,重建视线被遮挡区域的三维隐藏场景,在自动驾驶盲区感知、灾难搜救、隐蔽安防与计算光学医疗诊断中具有重大应用价值。在共焦非视域(confocal NLOS)系统中,脉冲激光与单光子雪崩二极管(SPAD)探测器在漫反射墙面上共轴扫描,捕获携带飞行时间信息的三维时空瞬态光信号。经典物理反演方法(如光锥变换 LCT、相量场 Phasor、频率-波数反演 FK)利用光波传播的解析模型实现免训练重建,然而其高度依赖理想散射假设,在真实场景微弱光子计数、传感器抖动和严重漫反射杂波下极易产生伪影与几何畸变。
为弥补物理模型与真实测量间的偏差,近年的深度学习方法尝试通过数据驱动网络直接建立从时空瞬态立方体到三维几何体的映射,或利用密集三维卷积神经网络对物理粗体积进行后处理细化。然而,瞬态时间轴与三维真实空间坐标缺乏直接几何对齐,强制网络从零学习这一映射极其困难;更致命的是,隐蔽场景的有效结构通常仅占据三维体积中极小的空间比例,绝大部分空间被弥散背景和探测器噪声充斥。采用密集三维骨干网络处理整个体积会产生高昂的立方级计算复杂度 \(O(N^3)\) 和巨大显存开销,严重限制了重建分辨率与实际推理速度。
这一瓶颈的切入点在于:现实中的非视域目标以优势视角或前向几何为主,其几何复杂性在很大程度上可以被多视角正交投影充分约束。三平面(Triplane)表征能够将三维体计算降维至三个正交二维特征平面的 \(O(N^2)\) 计算,且沿坐标轴的极大值投影天生能够压制低幅度的漫反射背景噪声、凸显高响应的前景几何骨架。核心 idea:将轻量级可微物理增强光锥变换(ELCT)先验初始化与正交三平面表征相结合,借助轴向极大值投影过滤空间漫反射噪声,利用共享轴切片交叉注意力补偿平面投影丢失的三维几何线索,并配合梯度阻断的双分支渲染头实现低显存、高精度的快速非视域几何与反射率重建。
方法详解¶
整体框架¶
TriNLOS 的整体重建流程包含四大串联阶段:首先,输入的时空瞬态测量张量 \(T \in \mathbb{R}^{\tau \times H \times W}\) 经过浅层去噪卷积与可微增强光锥变换(ELCT),生成物理一致但结构略显模糊的三维粗体积 \(\tilde{V}\);其次,粗体积通过可学习位置编码增强后,沿三轴进行轴向极大值投影,解耦为 \(xy\)、\(xz\) 和 \(yz\) 三个正交二维特征平面,分别由集成 Restormer 跨通道多尺度注意力的 ResConvNeXt 特征编码器并行提炼二维局部与全局上下文;接着,针对投影导致的轴向几何信息丢失,沿成对平面共享的空间坐标轴执行切片级轴向交叉注意力交互,并将更新后的平面特征反向广播与置信度加权融合为三维神经体积;最后,融合体积经由轴向池化送入轻量级二维渲染头,在阻断深度分支梯度的机制下联合解算隐藏场景的二维强度图与高精度表面深度图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["瞬态光测量输入 T<br/>τ × H × W SPAD 信号"] --> B["可微增强光锥变换 ELCT<br/>深度重映射 + 频域锐化"]
B --> C["轴向极大值三平面投影与特征编码<br/>ResConvNeXt + Restormer 提取 2D 特征"]
C --> D["共享轴切片交叉注意力与置信度体融合<br/>共享轴跨平面信息交换与 3D 体重构"]
D --> E["梯度阻断深度分支与联合渲染头<br/>阻断深度梯度至体特征,解耦渲染强度与深度"]
E --> F["输出重建结果<br/>高保真强度图与几何深度图"]
关键设计¶
1. 可微增强光锥变换 ELCT:物理先验粗体初始化 纯神经网络难以自底向上推断无序的时空飞行时间映射,而传统 LCT 算子又存在深度轴非均匀畸变与非共焦截断伪影。ELCT 设计了仅含三个可学习参数 \((\alpha, s, p)\) 的轻量级可微物理反演算子。首先对时间轴应用可学习幂律重映射 \(t' = (t / \tau)^\alpha \tau\) 校正深层回波衰减与光程走时非线性;随后在频域应用高斯-拉普拉斯(LoG)滤波器增强边缘高频,并通过软圆锥掩模抑制光锥外的散射杂波;最后利用可学习深度门控函数 \(\gamma(z) = \frac{1}{1 + (z/s)^p}\) 平滑加权掩模与未掩模成分,结合点扩散函数(PSF)的逆滤波解析生成粗体积 \(V_0 = \text{ELCT}(T)\)。由于瞬态信号在时间(深度)维度采样率远高于空间分辨率(\(\tau=512 \gg 128\)),系统进一步串联最大池化与可学习归一化下采样,得到空间尺度均衡的三维初始体积 \(\tilde{V}\),为后续二维表征提供坚实的物理几何脚手架。
2. 轴向极大值三平面投影与特征编码:将三维计算降至二维 为打破 \(O(N^3)\) 三维卷积对算力与显存的吞噬,系统引入可学习三维位置编码 \(E\) 并通过正交极大值投影将粗体积压缩为三个二维特征平面: $\(M_{ab}(u, v) = \max_{w \in c} \left[ \tilde{V}(u, v, w) + E(u, v, w) \right], \quad (ab, c) \in \{(xy, z), (xz, y), (yz, x)\}\)$ 这一设计的关键几何动机在于:非视域体积中真实物体表面具有局部高反射峰值,而体素空间中大量的弥散背景与泊松噪声其幅度普遍偏低;沿轴向取极大值自然形成了“软阈值过滤”,强力保留前景表面几何并剔除空间悬浮噪点。各平面随后独立送入轻量级二维编码器。编码器采用基于 ConvNeXt 大核残差卷积的 ResConvNeXt 模块捕获局部细节,并在深层接入 Restormer 通道自注意力模块。相比空间注意力 \(O(N^2)\) 的标记复杂度,Restormer 基于通道协方差矩阵计算注意力,其计算复杂度随空间尺寸呈线性 \(O(HW C^2)\),在极低显存开销下实现了跨尺度的特征去噪与远距离结构增强。
3. 共享轴切片交叉注意力与置信度体融合:恢复空间几何与多视互补 正交平面投影不可避免地抹去了沿投影轴的深度遮挡层级,若独立处理则会导致多物体场景中分离度下降。为此,设计了跨平面共享轴切片注意力机制。任意两个正交平面必然共享一个空间轴(例如 \(M_{xy}\) 与 \(M_{xz}\) 共享 \(x\) 轴),将两平面沿该轴切分为一维切片特征集合 \(\{F_i\}\) 与 \(\{G_i\}\),仅在沿共享轴对齐的切片之间执行交叉注意力: $\(F_i \leftarrow F_i + \text{softmax}\left(\frac{(F_i W_Q)(G_i W_K)^\top}{\sqrt{d}}\right) (G_i W_V)\)$ 这种切片级约束将注意力精确限制在具有严密几何对应关系的物理线上,免去了全图二维或密集三维注意力的沉重代价,三平面循环互相交换缺失的纵深与边界线索。特征提炼完成后,各平面沿塌陷维度广播提升至三维空间,由轻量级轴注意力网络动态预测体素级置信度权重 \(W_{xy}, W_{xz}, W_{yz}\) 聚合为三维神经体 \(V_{\text{tri}} = \text{Linear}(W_{xy} F_{bxy} + W_{xz} F_{bxz} + W_{yz} F_{byz})\),并与物理初始体 \(\tilde{V}\) 拼接后经轻量级浅层 3D 卷积输出最终体表示 \(V_{\text{out}}\)。
4. 梯度阻断深度分支与联合渲染头:解耦几何深度与反射强度的协同优化 在最终端到端输出阶段,直接回归密集体素的反射率和法向不仅参数冗余,而且往往与实际 NLOS 下游应用的二维展示需求脱节。网络采用轴向最大值压缩与二维特征拼接抽取紧凑描述符 \(F(x, y) = \phi([\max_z V_{\text{out}}(x, y, z) \parallel F_{xy}^{2D}(x, y)])\),并提取沿光轴的最大响应深度索引 \(g(x, y) = \arg\max_z V_{\text{out}}(x, y, z)\),驱动两个浅层二维卷积头分别渲染强度图 \(\hat{I}\) 与深度图 \(\hat{D}\)。关键机制在于对深度反向传播的梯度截断:直接将深度误差回传穿过三维体积的 \(\arg\max\) 和 \(\max\) 操作会引入剧烈的数值振荡与不稳定梯度,破坏体素特征中精细的反射率对比度并导致强度图像严重平滑模糊。因此,系统严格将深度损失的梯度截断在二维渲染头内部: $\(\frac{\partial \hat{D}}{\partial (\arg\max_z V_{\text{out}})} = 0, \quad \frac{\partial \hat{D}}{\partial (\max_z V_{\text{out}})} = 0\)$ 这一梯度隔离机制确保了体表示能够专注学习空间分布与反射对比度,在不污染体积分支的前提下实现了深度与强度的双重高质量收敛。
损失函数 / 训练策略¶
网络采用强度误差与深度误差的复合 \(L_1\) 损失函数进行端到端优化: $\(\mathcal{L} = \| I - \hat{I} \|_1 + \alpha \| D - \hat{D} \|_1\)$ 实验中深度平衡权重 \(\alpha = 0.1\)。模型使用 AdamW 优化器(权重衰减 \(1 \times 10^{-4}\),排除偏置与归一化层),在单张 NVIDIA RTX PRO 6000 GPU(96 GB VRAM)上以批大小 4 训练 35 个周期。初始学习率设为 \(1 \times 10^{-4}\),并采用余弦退火策略逐步衰减至 \(1 \times 10^{-6}\)。为提升在低光子计数与恶劣探测条件下的泛化能力,训练阶段在线注入高斯噪声与泊松散粒噪声,并引入平面旋转与镜像翻转进行数据增强。
实验关键数据¶
主实验¶
在基于 LFE 渲染器生成的合成瞬态数据集(包含摩托车基准及枪械、战机、汽车等跨类别测试样本)以及物理探测器采集的真实 NLOS 场景上开展全面评测。主实验对比涵盖代表性物理反演算法与前沿深度学习基线,结果如表 1 所示。
| 方法分类 | 方法 | PSNR↑ (Seen) | PSNR↑ (Unseen) | SSIM↑ (Seen) | SSIM↑ (Unseen) | RMSE_Dep↓ (Seen) | RMSE_Dep↓ (Unseen) | MAD_Dep↓ (Seen) | MAD_Dep↓ (Unseen) | 推理时间 (ms) | 显存占用 (GB) |
|---|---|---|---|---|---|---|---|---|---|---|---|
| 物理反演 | LCT [35] | 25.34 | 22.72 | 0.644 | 0.437 | 0.664 | 0.576 | 0.691 | 0.606 | 14.35 | 7.5 |
| 物理反演 | ELCT (本文初始) | 26.82 | 23.63 | 0.618 | 0.496 | 0.680 | 0.593 | 0.700 | 0.614 | 14.80 | 8.6 |
| 物理反演 | Phasor [26] | 26.67 | 25.53 | 0.507 | 0.435 | 0.753 | 0.721 | 0.776 | 0.747 | 29.91 | 10.4 |
| 物理反演 | FK [23] | 26.24 | 24.96 | 0.874 | 0.816 | 0.555 | 0.539 | 0.571 | 0.558 | 22.63 | 9.3 |
| 深度学习 | LFE [6] | 27.42 | 25.43 | 0.894 | 0.827 | 0.066 | 0.086 | 0.019 | 0.034 | 48.80 | 12.2 |
| 深度学习 | NLOST [20] | 28.77 | 25.65 | 0.946 | 0.885 | 0.063 | 0.106 | 0.013 | 0.032 | 165.29 | 12.2 |
| 深度学习 | TriNLOS (本文) | 30.26 | 26.13 | 0.958 | 0.911 | 0.054 | 0.087 | 0.011 | 0.025 | 103.22 | 8.0 |
消融实验¶
针对网络核心架构组件、物理初始化方案、深度梯度流动机制以及三平面投影分支的独立贡献进行系统性消融评测。
| 消融配置 | PSNR_Int ↑ | SSIM_Int ↑ | RMSE_Dep ↓ | MAD_Dep ↓ | 关键说明与影响 |
|---|---|---|---|---|---|
| 完整模型 (Proposed) | 30.20 | 0.958 | 0.054 | 0.011 | 完整模型兼具高保真强度与毫米级深度精确度 |
| 移除 Restormer 跨通道注意力 | 28.44 | 0.944 | 0.063 | 0.014 | 性能下滑最严重(PSNR 降 1.76 dB),多尺度去噪与全局上下文严重退化 |
| 移除共享轴切片交叉注意力 | 29.21 | 0.951 | 0.061 | 0.014 | 跨平面几何线索阻断,投影丢失的三维轴向信息无法恢复,物体分离度受损 |
| 移除 ResConvNeXt 局部残差块 | 29.31 | 0.952 | 0.062 | 0.014 | 定量略有下降,但定性结果显示局部高频纹理破碎,难以抵御高泊松噪声 |
| 允许深度梯度反传至骨干体网络 | 28.47 | 0.946 | 0.058 | 0.012 | 深度反传梯度破坏体素特征对比度,重建强度图产生严重模糊(PSNR 降 1.73 dB) |
| 替换 ELCT 为经典 LCT 初始化 | 29.20 | 0.950 | 0.059 | 0.015 | 初始粗体积缺乏非线性深度矫正与边缘锐化,导致最终重建边界发散 |
| 移除 yz 正交平面投影 | 28.98 | 0.951 | 0.059 | 0.013 | 侧向几何约束缺失,三平面消融中降幅最大(相比之下 xy 面在渲染端被补充受影响较小) |
关键发现¶
- Restormer 与跨轴注意力的协同效应:Restormer 贡献了最大的数值增益,其通道自注意力机制为高噪瞬态信号提供了关键的跨尺度恢复能力;而轴向交叉注意力则精准解决了三平面降维的固有缺陷,在保持极低计算开销的前提下恢复了关键的 3D 纵深边界。
- 显存与精度的优越权衡:TriNLOS 显存仅需 8.0 GB,大幅低于 NLOST 和 LFE 的 12.2 GB(节省超 34%),逼近纯物理算子的轻量水平;同时在推理延迟上比经典密集 3D 神经模型 NLOST 快 37.5%,并取得全面 SOTA 的指标。
- 梯度阻断机制的稳定性价值:消融表明,解除深度梯度限制会使得骨干网体素特征在几何连续性与反射率高动态范围之间产生竞争,导致强度重建 PSNR 骤降 1.73 dB。单向阻断设计从根本上解除了几何监督对纹理表现的抑制。
亮点与洞察¶
- 物理与神经降维的深度融合:利用可微物理先验 ELCT 完成从非直观的四维时空测量到三维几何粗体的“质变”,再由二维正交三平面替代传统粗暴的三维体卷积。这一架构设计既避免了纯深度学习黑盒映射的盲目性,又规避了纯 3D 骨干的高次计算惩罚。
- 轴向极大值投影的物理滤波特性:三维体素在正交投影时采用 \(\max\) 算子而非均值池化,巧妙契合了 NLOS 漫反射噪声普遍弥漫、前景物体反射相对集中的物理分布特性,相当于在网络输入端无痛执行了一次自适应空间滤波。
- 非共焦与复杂场景的强适应性:将该架构拓展至非共焦场景时,仅需将 ELCT 算子替换为中继表面衍射(RSD)物理算子,模型即可在非共焦数据集上以 28.12 dB PSNR 显著超越传统 RSD(25.33 dB),展现了三平面混合架构出色的物理算子插拔泛化能力。
局限与展望¶
- 复杂重度多重遮挡与内凹场景的退化:三平面表征在几何表面上基于正交投影,对于多层重叠遮挡、内部复杂空腔或极端倾斜结构,投影重叠导致的深度歧义仍可能超出交叉注意力的弥补上限。
- 顺序平面推理对实时性的轻微影响:当前三平面网络在部分实现中采用顺序特征抽取,总耗时为 103.22 ms,尽管显著快于密集 3D 卷积基线,但距离单光子雷达 30 FPS 乃至更高帧率的实时在线反演仍有轻量化优化的空间。
- 未来改进路径:探索稀疏体素引导的自适应三平面(Adaptive Triplane)以及将该架构与三维高斯泼溅(3DGS)渲染基元相结合,在进一步降低推理延迟的同时实现更高分辨率的任意视角连续辐射场生成。
相关工作与启发¶
- vs LCT [35] & 传统物理反演:LCT 依赖严格的共焦与均匀平坦墙面假设,对噪声极其脆弱且缺乏语义先验;TriNLOS 将其升级为参数可微自适应学习的 ELCT,并在其后接续三平面神经网络消除残余伪影,PSNR 相比 LCT 跃升近 5 dB。
- vs LFE [6]:LFE 通过密集三维特征嵌入学习物理表征,但显存开销高达 12.2 GB 且重建边缘弥散;TriNLOS 采用正交三平面表征,以近乎折半的特征处理维度和显著更低的显存实现了更为锋利的轮廓恢复。
- vs NLOST [20]:NLOST 采用庞大的三维神经体架构,推理耗时高达 165.29 ms 且边缘外扩伪影严重;TriNLOS 凭借轴向投影去噪与切片交叉注意力,推理提速 37.5%,显存缩减 34.4%,并显著消除了龙尾、四肢等外围微细结构的断裂现象。
评分¶
- 新颖性: ⭐⭐⭐⭐ [首次将三平面正交因子化表征与物理可微光锥变换相结合用于非视域成像,兼具物理可解释性与二维神经网络的高效性。]
- 实验充分度: ⭐⭐⭐⭐⭐ [覆盖合成/真实数据集、共焦/非共焦拓展、详尽的跨类别泛化及五组严密消融实验,数据对比扎实全面。]
- 写作质量: ⭐⭐⭐⭐⭐ [数学推导清晰严密,物理与架构动机阐述透彻,图表呈现精美且逻辑自洽。]
- 价值: ⭐⭐⭐⭐⭐ [成功突破了 NLOS 神经反演长期受制于 \(O(N^3)\) 复杂度与大显存的瓶颈,为高分辨率隐蔽场景感知提供了极具实用价值的范式。]