跳转至

DualResPS: Dual-Resolution Photometric Stereo Using a Frame-Event Hybrid Camera

会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 光度立体视觉, 事件相机, 神经反渲染, 混合相机系统, 表面法向估计

一句话总结

提出首个基于帧-事件混合相机系统的双分辨率光度立体视觉框架 DualResPS,通过连续旋转单光源下的极稀疏长曝光帧与高时间分辨率事件流协同,结合隐式神经反渲染与显式阴影/高光解耦,仅用常规方案 18.1% 的数据带宽即实现了高分辨率、高质量的表面法向重建。

研究背景与动机

传统光度立体视觉(Photometric Stereo, PS)通过采集单一视点在多种不同光照方向下的图像来精确重建高频表面几何细节。然而,经典基于帧相机的算法严重依赖数十张甚至上百张输入图像,这不仅造成捕获耗时长、数据传输与存储开销高昂,更极大限制了光度立体视觉在高速或动态场景中的落地。随着神经形态传感器(事件相机)的发展,已有工作探索了基于事件的光度立体(如 EventPS),利用其超高动态范围、微秒级时间分辨率和稀疏数据流特性大幅压缩了捕获时间与数据量。然而,受限于事件传感器复杂的像素级感光与触发电路,目前商用事件相机的空间分辨率普遍仅在 720p 级别,远低于现代帧相机的 4K 甚至更高清晰度,使得纯事件光度立体在空间精细几何恢复上遭遇根本瓶颈。

将高空间分辨率的传统帧相机与高时间分辨率的事件相机结合构成混合相机系统,成为兼顾空间精细度与时间敏捷性的理想方案。但在光度立体任务中融合这两种异构模态面临三大核心挑战:其一是传统定向光照下图像帧容易产生阴影缺失或镜面高光饱和,造成严重的观测退化;其二是事件传感器的空间分辨率低于目标表面法向、附着阴影和高光的空间频率,低分辨率事件难以直接指导高分辨率几何重建;其三是全局曝光的积分图像帧与异步离散的微秒级事件流在时间域完全未对齐。

本文的切入角度是:利用空间和时间分辨率的互补性重新设计光照与成像模式,不再采集传统静态离散多幅短曝光图像,而是在单光源连续旋转周期内仅采集 3 张长曝光全局帧,同时由共轴光路记录连续事件流。核心 idea:将多方向积分的稀疏长曝光帧等效为聚合定向光源,利用高时间分辨率事件流显式解耦投射阴影并估计镜面反射参数,并以隐式坐标神经网络结合异步重要性采样进行可微渲染,以极低数据带宽达成高分辨率表面法向解算。

方法详解

整体框架

DualResPS 系统的输入由两部分组成:在连续旋转点光源的一个旋转周期 \(T\) 内采集的 3 张高空间分辨率全局长曝光 RGB 图像帧 \(\{A_\text{f}^{(j)}\}_{j=1}^3\),以及通过分光镜(Beam Splitter)共轴同步采集的低空间分辨率异步单色事件流 \(\mathcal{E}\)。整个管线首先在预处理阶段检测连续投射阴影掩膜并建立重要性采样时间戳,随后将空间坐标送入坐标隐式多层感知机(MLP)预测表面法向、漫反射反照率与镜面反射参数,最后经过像素级异步可微物理渲染器重构长曝光图像与事件对数强度变化,通过自监督反渲染损失函数驱动网络优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    In["输入:3张长曝光帧 + 异步事件流"] --> D1["时空双分辨率光照策略<br/>连续旋转光源积分与等效方向光建模"]
    D1 --> D2["非理想阴影与高光解耦补偿<br/>事件区间轮廓检测阴影与BRDF参数约束"]
    D2 --> D3["坐标隐式神经反渲染与重要性采样<br/>物理解耦MLP与异步辐射强度采样反渲染"]
    D3 --> Out["输出:高分辨率表面法向与材质属性"]

关键设计

1. 时空双分辨率光照策略:突破帧率与带宽瓶颈 针对高空间分辨率帧相机采样率低与事件相机空间分辨率不足的矛盾,本文设计了一种时空双分辨率联合采样方案。在点光源绕物体扫掠的周期 \(T\) 内,将曝光划分为三个等长时段 \(t_j - t_{j-1} = T/3\)。根据辐射度积分与点积的线性性质,在理想朗伯体无阴影假设下,长曝光累积光照等效于一个虚拟定向光源 \(\boldsymbol{l}^{*(j)} = \int_{t_{j-1}}^{t_j} \boldsymbol{l}(t) dt\)。3 个互不共面的长曝光时段恰好提供 3 个线性独立的等效光照方向,满足朗伯表面法向与反照率闭式求解的理论最小约束数。该设计避免了传统方法需要频闪高速曝光采集数十张帧图像的巨大带宽开销,将帧采样需求极简压缩至 3 帧。

2. 非理想阴影与高光解耦补偿:消除退化污染 现实物体表面的投射阴影(Cast Shadow)、附着阴影(Attached Shadow)与镜面反射破坏了等效方向光的线性假设。针对投射阴影,由于物体出入遮挡区域时光照在对数域剧烈阶跃,超高时间分辨率的事件流能在微秒级敏锐捕获此跳变。本文基于事件区间轮廓设计了阴影边缘检测指标 \(f_{\boldsymbol{x}}^{(k)} = \frac{p_{\boldsymbol{x}}^{(k)} C}{t_{\boldsymbol{x}}^{(k)} - t_{\boldsymbol{x}}^{(k-1)}}\),提取连续二值遮挡掩膜 \(m_\text{c}(\boldsymbol{x}, t)\),并基于阴影平滑先验将其映射至相邻高分辨率帧像素。对于附着阴影,其掩膜 \(m_\text{a}(\boldsymbol{x}, t; \boldsymbol{n}) = \mathbb{I}(\boldsymbol{l}(t) \cdot \boldsymbol{n} > 0)\) 本质是关于法向的确定性参数函数,等效光变为依赖法向的矢量函数 \(\boldsymbol{l}^*(\boldsymbol{x}; \boldsymbol{n})\)。对于镜面反射,单靠 3 帧图像无法解耦漫反射与高光,但相邻事件超像素的高频瞬时时间响应提供了充足的辐射度变化约束,使系统能够精确拟合包含菲涅尔项 \(F_0\) 与粗糙度 \(r\) 的微表面 BRDF 参数 \(\boldsymbol{\beta}(\boldsymbol{x})\),彻底剥离高光污染。

3. 坐标隐式神经反渲染与重要性采样:高低分辨率自适应桥接 为在不显式进行启发式插值的情况下无缝融合两种分辨率的观测,系统采用基于坐标的神经网络 \(\mathcal{M}(\boldsymbol{x}; \Theta)\) 直接将连续空间坐标映射到法向 \(\boldsymbol{n}(\boldsymbol{x})\)、漫反射反照率 \(\boldsymbol{\rho}_\text{d}(\boldsymbol{x})\) 和高光材质参数 \(\boldsymbol{\beta}(\boldsymbol{x}) = [F_0(\boldsymbol{x}), r(\boldsymbol{x})]\)。神经网络隐式具有平滑性先验与材质稀疏性,使得高频几何与反照率天然对齐高分辨率图像帧,而低频材质与遮挡属性自适应借助事件流进行规则化。在数值渲染计算时,为解决长曝光时间连续积分计算代价高昂的问题,提出了像素级异步重要性采样:在两相邻事件之间根据预估瞬时辐射度进行均匀采样,确定每个区间的离散采样点数量: $\(N_{\boldsymbol{x}, \text{e}}^{(k)} = \left\lceil \mathrm{round}\left( \sigma \sqrt{\Delta \hat{I}_{\boldsymbol{x}}^{(k)} \Delta t_{\boldsymbol{x}}^{(k)}} \right) \right\rceil\)$ 将算力集中分配给强光照瞬态和高动态波动区域,并在暗区噪声严重处自适应下调置信度权重 \(w_{\boldsymbol{x}}^{(k)}\)。

损失函数 / 训练策略

整个反渲染框架采用自监督端到端联合优化,总损失函数定义为长曝光帧重建损失、事件流对数变化重建损失与全变分(TV)平滑正则项的加权和: $\(\mathcal{L} = \lambda_\text{f} \mathcal{L}_\text{f} + \lambda_\text{e} \mathcal{L}_\text{e} + \lambda_\text{tv} \mathcal{L}_\text{tv}\)$ 其中帧重建损失 \(\mathcal{L}_\text{f} = \frac{1}{N_\text{f}} \sum |\tilde{A}_\text{f}^{(j)}(\boldsymbol{x}) - A_\text{f}^{(j)}(\boldsymbol{x})|\) 约束高空间分辨率积分像素强度;事件损失 \(\mathcal{L}_\text{e} = \frac{1}{N_\text{e}} \sum w_{\boldsymbol{x}}^{(k)} \left| \log\left(\frac{\tilde{I}(\boldsymbol{x}, t_{\boldsymbol{x}}^{(k)}) + \epsilon}{\tilde{I}(\boldsymbol{x}, t_{\boldsymbol{x}}^{(k-1)}) + \epsilon}\right) - p_{\boldsymbol{x}}^{(k)} C \right|\) 约束各采样时刻的瞬态辐射度变化。在训练初始阶段引入法向与材质的 TV 正则化 \(\mathcal{L}_\text{tv}\) 进行温启动(Warm-up),优化器迭代 1200 个 epoch 直至收敛。

实验关键数据

主实验

在 DiLiGenT 半真实基准数据集上的量化对比评估(平均角度误差 MAE,单位为度,越低越好),对比了典型有监督 FramePS、自监督 FramePS(LL22a)以及纯事件方法 EventPS。数据带宽比率以单张 24-bit 全局帧为基准(100% 为 23 帧的总量)。

方法 类型 输入模态 Ball Buddha Cat Cow Goblet Harvest Pot1 Pot2 Reader 平均 MAE (°) 数据带宽比
Uni-MS-PS 有监督 4 帧 3.76 7.65 5.53 5.23 6.25 14.71 5.36 4.99 9.05 6.95 17.4%
SDM-UniPS 有监督 4 帧 1.83 7.91 6.60 5.73 6.53 13.29 7.28 5.72 9.29 7.13 17.4%
LINO 有监督 3 帧 2.41 7.58 6.79 6.45 7.97 11.33 6.72 5.69 10.37 7.26 13.0%
LL22a 自监督 23 帧 2.26 9.88 5.16 5.29 6.44 18.54 5.40 5.39 10.95 7.70 100.0%
DualResPS (Ours) 自监督 3 帧 + 事件 2.08 8.64 4.86 4.47 6.88 18.01 5.38 5.31 10.59 7.36 18.1%
EventPS 优化/自监督 纯事件流 11.00 19.96 12.10 26.14 18.94 38.29 11.54 15.79 26.18 19.99 5.0%

真实原型系统与复杂材质测试

在搭建的真实混合相机原型(Hikvision 500 万像素全局曝光工业帧相机 + Prophesee EVK4 HD 事件相机)与 DiLiGenT-Pi 近平面复杂材质数据集上的法向重建 MAE (°) 对比:

数据集 / 测试对象 对象几何与材质特征 DualResPS (Ours) EventPS-OP (纯事件) LL22a (帧基线) 输入条件说明
原型数据: LION 中等复杂度雕塑细节 17.29 25.88 18.66 帧基线输入 8 帧图像
原型数据: KING 近平面高频浮雕结构 22.78 24.90 24.66 帧基线输入 8 帧图像
原型数据: STAR 几何简单但强投射阴影 15.12 28.06 26.70 帧基线输入 8 帧图像
DiLiGenT-Pi: COW 光滑曲面微弱高光 4.47 26.14 5.29 帧基线输入 24 帧图像
DiLiGenT-Pi: READING 丰富凹凸字符与凹陷 10.59 26.18 10.95 帧基线输入 24 帧图像
DiLiGenT-Pi: ASTRO 镜面金属与粗糙交界 6.92 17.50 8.81 帧基线输入 24 帧图像
DiLiGenT-Pi: CLOUD-R 粗糙表面弥散反射 12.17 15.81 13.40 帧基线输入 24 帧图像

关键发现

  • 在 DiLiGenT 基准上,DualResPS 以仅 18.1% 的数据率达到 7.36° 的平均 MAE,显著超越了输入 23 帧的无监督 SOTA 方法 LL22a(7.70°),性能逼近依赖海量先验预训练的有监督 SOTA 算法。
  • 纯事件方法 EventPS 因事件空间分辨率严重不足及对数传感器噪声累积,平均误差高达 19.99°,尤其在阴影和非朗伯高光区域容易优化发散产生伪影;DualResPS 借助 3 张全局帧的基底几何锚定,成功规避了纯事件反演的不稳定性。
  • 真实原型机测试表明,STAR 样本在强烈投射阴影下传统帧方法(26.70°)与事件方法(28.06°)均发生严重畸变,而 DualResPS 凭借高时间精度的事件阴影边缘解耦机制,将误差大幅压缩至 15.12°。

亮点与洞察

  • 长曝光定向光积分等效化:巧妙证明了在连续扫掠点光源下,长曝光积分图像在线性近似下等价于合成一个虚拟等效方向光,将极端稀疏时间采样的帧相机与连续旋转光照物理统一,打破了传统 PS 必须依赖频闪静态成像的思维定势。
  • 异构分辨率的物理分工与神经弥合:深刻洞察到物理场中投射阴影、材质粗糙度在局部呈现低频或平滑连续性,而反照率与微观法向呈现高频性;将低频材质与阴影交由事件时间流解析,高频几何由高分辨率帧主导,通过坐标神经隐式表征无缝自洽融合。
  • 异步重要性采样加速反渲染:基于事件间隔近似辐射度自适应调整可微渲染采样密度,不仅大幅节约了连续时间积分的反向传播计算开销,更自然赋予低照度高噪点事件更低的置信度。

局限与展望

  • 互反射效应未建模:当前物理渲染模型未显式考虑非凸凹陷处的二次或多次光照反弹(Inter-reflection),在深凹槽处重建法向存在系统性偏差,限制了其向复杂大尺度场景的泛化。
  • 标定要求与传感器参数敏感性:自监督反渲染高度依赖精确的光源标定、分光镜外参仿射对齐以及事件相机的触发对比度阈值 \(C\) 与不应期参数,微小的几何或光度失准会传导至法向预测。
  • 未来方向:可进一步探索前向学习型通用先验(End-to-end Feedforward Hybrid PS),利用大规模合成数据端到端学习时空跨模态特征融合,摆脱测试时逐场景反向优化的算力开销。

相关工作与启发

  • vs EventPS [Yu et al., CVPR 2024]: EventPS 首次提出利用连续旋转单光源配合事件相机做实时法向解算,但受限于低传感器分辨率且对强镜面和阴影缺乏精细恢复能力;DualResPS 引入共轴分光混合相机与 3 张长曝光帧,彻底弥补了空间高频信息的缺失。
  • vs LL22a [Li & Li, CVPR 2022]: LL22a 是基于坐标 MLP 和光线步进阴影处理的自监督帧基准,但其依赖多达数十张稠密采样图像且无法感知微秒级瞬态;DualResPS 借助事件流驱动显式阴影与高光剥离,在数据量缩减超过 80% 的同时取得了更高精度的法向重构。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次提出帧-事件混合双分辨率光度立体成像架构,长曝光等效方向光理论与事件非理想因子解耦设计极为精巧。
  • 实验充分度: ⭐⭐⭐⭐⭐ 包含 DiLiGenT、DiLiGenT-Pi 半真实数据集评估与自主搭建的原型机真实环境实测,全方位验证了准确度与带宽优势。
  • 写作质量: ⭐⭐⭐⭐⭐ 物理问题建模数学推导严谨,异构模态互补动机阐述深刻透彻。
  • 价值: ⭐⭐⭐⭐⭐ 为高速低功耗工业 3D 表面检测、具身智能微观触觉/表面感知提供了极具实用价值的跨模态新范式。