Complex-Valued 2D Gaussian Representation for Computer-Generated Holography¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/complight/Complex-Valued_2D_Gaussian_Representation
领域: 3D视觉
关键词: 计算全息, 复数2D高斯, 衍射光传播, 全息图优化, 空间频率不确定度
一句话总结¶
提出基于复数2D高斯基元的紧凑全息图表示与定制化CUDA光栅化传播管线,借助Gabor最小空频不确定度将优化参数空间缩减至1/5,并在两类主流相位全息格式上保持高保真衍射重构。
研究背景与动机¶
计算全息(Computer-Generated Holography, CGH)通过空间光调制器(SLM)调控光波的波前,能够在三维空间中同时重构物体的强度、干涉与衍射信息,是下一代近眼显示与真实三维沉浸式视觉体验的核心技术。然而与自然图像平滑连续的强度变化不同,全息图承载着复杂的波光学衍射场,其微观数值呈现极其密集的高频震荡与伪随机相位分布。传统的全息图生成方案要么采用密集的逐像素(per-pixel)复振幅或相位优化,面临极高的参数维度与缓慢的收敛瓶颈;要么依赖隐式神经表示(INR)或自编码器(Autoencoder)等数据驱动先验,但此类连续网络天然偏向拟合低频信息,难以精确还原全息图中的尖锐干涉条纹。
尽管近年来高斯溅射(Gaussian Splatting)在自然图像压缩与三维辐射场重建中展现出优异的拟合能力与渲染效率,但现有的自然图像2D高斯基元仅处理实数域的像素颜色分布,完全忽略了波前干涉与自由空间光传播的波动光学物理规律。更关键的是,若简单使用两套独立的实数高斯分别拟合复振幅的实部与虚部,不仅参数量激增,更会导致实虚部分离带来的空间错位与局部相位畸变,使得全息图在衍射传播后产生严重的散焦模糊与结构失真。
针对上述挑战,本文将用于多视角全息辐射场建模的复数高斯思想引入单幅全息图优化问题,在全息图平面上构建结构化的复数2D高斯基元。基于Gabor通信理论中关于时空与频率联合不确定度下界的核心推导,高斯函数是唯一达到空间-空间频率最小联合不确定度的解析基元,能够在极大压缩参数维度的同时完整保留波前高频衍射特性。核心 idea:将全息图参数化为紧凑的复数2D高斯基元集合,通过定制的CUDA光栅化与频域光线传播算子实现端到端优化,在降低5:1参数搜索空间的同时充当结构先验,解耦并高质量适配平滑与随机相位全息图。
方法详解¶
整体框架¶
算法的目标是在给定目标RGB图像 \(I_{\text{target}} \in \mathbb{R}^{C \times H \times W}\) 及其深度图 \(D \in \mathbb{R}^{H \times W}\) 的条件下,合成能够精准重构聚焦与散焦深度的复数全息场 \(H \in \mathbb{C}^{C \times H \times W}\)。整体管线主要包含四个阶段:首先将一组可学习的复数2D高斯基元通过定制的CUDA光栅化器累加生成全息平面上的复振幅场;接着将复数场输入带限角谱法(BLASM)光传播核,向光轴方向的不同焦平面传输以计算重构光强;随后结合掩码焦堆的多平面散焦重构损失与结构相似度损失进行端到端参数更新;最后将收敛的复数高斯全息场作为结构先验,分别通过双相位编码或结构引导联合优化转换为主流显示硬件兼容的平滑相位与随机相位全息图。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入RGB目标图与深度图<br/>I_target, D"] --> B["统一复数2D高斯基元<br/>12参数紧凑表示"]
B --> C["CUDA融合光栅化与BLASM传播核<br/>平铺排序光栅化 + 频域带限角谱传播"]
C --> D["深度可微光线传播与焦堆监督<br/>多平面掩码散焦损失 L_recon + L_SSIM"]
D --> E["多格式全息图解耦转换<br/>DPAC平滑全息 / 结构引导随机全息"]
E --> F["输出硬件兼容全息图<br/>Smooth POH / Random POH"]
关键设计¶
1. 统一复数2D高斯基元:以最小空频不确定度大幅削减参数搜索空间
常规图像处理方法若迁移到复数域,通常需要为实部与虚部分别分配独立的实数高斯,不仅带来每对基元18个参数的冗余开销,还会因双通路独立漂移引发局部相位失配。本文设计了统一的复数2D高斯基元 \(G_n = \{\tilde{\mathbf{x}}_n, \tilde{\mathbf{s}}_n, \theta_n, \mathbf{c}_n, \tilde{\alpha}_n, \boldsymbol{\varphi}_n\}\),总计仅需12个可学习参数。其中 \(\mathbf{x}_n \in \mathbb{R}^2\) 为中心位置,\(\mathbf{s}_n \in \mathbb{R}^2\) 与旋转角 \(\theta_n \in \mathbb{R}\) 确定空间协方差矩阵 \(\boldsymbol{\Sigma}_n = R(\theta_n) \text{diag}(\mathbf{s}_n)^2 R(\theta_n)^\top\);每个基元同时携带振幅色彩因子 \(\mathbf{c}_n \in \mathbb{R}^C\)、不透明度 \(\alpha_n \in \mathbb{R}\) 与通道相位 \(\boldsymbol{\varphi}_n \in \mathbb{R}^C\)。在像素坐标 \(\mathbf{p}\) 处的复振幅贡献解析定义为: $\(H_n(\mathbf{p}) = \alpha_n \mathbf{c}_n \exp\left(-\frac{1}{2}(\mathbf{p}-\mathbf{x}_n)^\top \boldsymbol{\Sigma}_n^{-1} (\mathbf{p}-\mathbf{x}_n)\right) \exp(j \boldsymbol{\varphi}_n)\)$ 根据Gabor理论,高斯窗函数在空间与空间频率的测不准乘积达到理论绝对下界 \(\Delta x \Delta f_x = \frac{1}{2}\)。全息成像需要在控制光场发射位置(空间)的同时调控光线衍射方向(频率),复数高斯基元利用该最优不确定度特性,使得全息场在低基元数量下仍能保持极高的空频重构分辨率,将传统逐像素优化的参数搜索维度直接压缩了5倍。
2. 深度可微光线传播与焦堆监督:联合强度与多平面散焦约束
如果仅在全息平面直接监督复振幅,模型将失去物理传播约束。为此,管线引入标量衍射理论中的自由空间光传播算子,沿光轴设置 \(L\) 个平行焦平面 \(\Pi_l\)(中心距离 \(d_0\),间距 \(\Delta z\))。通过带限角谱法(BLASM)将全息场传播到目标深度 \(d_l\): $\(U(d_l) = \mathcal{F}^{-1} \left\{ H_{\text{BLASM}}^{d_l}(f_x, f_y) \cdot \mathcal{F}\{H\} \right\}\)$ 在各个深度平面上获得模拟重建强度 \(I_l = |U(d_l)|^2\)。针对目标图像的离焦区域,利用量化深度图生成的各焦平面二值掩码 \(M_l\),施加联合全图与前景聚焦区域的重构损失函数,并辅以多尺度结构相似度约束: $\(\mathcal{L}_{\text{recon}} = \frac{1}{L} \sum_{l=1}^L \left( \|I_l - \hat{I}_l\|_2^2 + \|I_l \odot M_l - \hat{I}_l \odot M_l\|_2^2 + \|I_l \odot \hat{I}_l - \hat{I}_l \odot \hat{I}_l\|_2^2 \right)\)$ 这种监督方式促使高斯基元的空间位置、尺度与复数相位协同演化,既保证合焦点边缘的高对比度,又正确模拟了光场随深度的连续弥散。
3. 多格式全息图解耦转换:结构引导下的平滑与随机相位调制生成
由于商用空间光调制器多数为纯相位液晶器件,无法直接加载复振幅全息场,本文将优化得到的复数高斯场作为通用的中间结构先验,提出解耦的双重转换路径。对于平滑相位全息图(Smooth POH),采用双相位振幅编码(DPAC)棋盘格交织策略,在相邻像素上将振幅调制映射为相位差,即偶数位置加载振幅衍生相位、奇数位置加载原生相位;对于随机相位全息图(Random POH),直接优化全分辨率随机相位参数空间容易陷入局部极小与斑点噪声,本文将学习好的复数高斯场与待优化的纯相位场 \(H_{\text{rand}} = \exp(j \boldsymbol{\varphi}_{\text{rand}})\) 并行传播至焦平面,引入复数场一阶范数匹配项 \(\lambda_{\text{field}} \|U(d_l) - U_{\text{rand}}(d_l)\|_{1, \mathbb{C}}\) 与强度一致性项,将高斯场蕴含的空间正则化信息注入随机相位优化中,不仅提升了重构清晰度,还显著抑制了背景颗粒伪影。
4. CUDA融合光栅化与BLASM传播核:常量显存与高效频域滤波
标准深度学习框架在进行傅里叶变换与密集复数高斯渲染时存在频繁的显存重分配与自动求导显存膨胀。本文开发了专用的底层CUDA计算核。在光栅化阶段,采用 \(16 \times 16\) 平铺块(tile-based)与双键基数排序机制,正向传播将高斯展开为三角正余弦实虚两路累加,显存中仅持久化像素级不透明度,在反向传播时通过局部分块重构中间变量,实现常数级显存占用;在光传播阶段,定制化的BLASM频域算子通过合并只读缓存(coalesced cache)并行计算带限掩码与传递函数,反向传播直接应用共轭带限核。该优化使整体显存占用降低约30%,并将单步优化耗时减半。
损失函数 / 训练策略¶
网络的训练目标函数综合了焦堆聚焦散焦重构损失与结构相似度损失: $\(\mathcal{L} = \mathcal{L}_{\text{recon}} + \lambda_1 \mathcal{L}_{\text{SSIM}}\)$ 其中平衡超参数 \(\lambda_1 = 0.005\)。模型采用 Adan 优化器训练 2000 步,通常在 1000 步左右达到收敛。初始高斯位置在图像平面均匀采样并通过 \(\text{atanh}\) 映射至无界空间,尺度初始化为 \([1.5, 5.0]\) 像素,初始相位设为零,不透明度预激活值设为 \(-0.5\)(激活后约 \(0.38\))。对各参数配置针对性学习率:位置学习率为 \(10^{-2}\)(配合余弦退火至 \(10^{-3}\)),尺度为 \(5 \times 10^{-3}\),振幅与相位为 \(2.5 \times 10^{-3}\),不透明度为 \(2.5 \times 10^{-2}\),旋转角为 \(10^{-3}\)。实验设置波长分别为 639 nm(红)、532 nm(绿)和 473 nm(蓝),像素微间距为 \(3.74\ \mu\text{m}\),光学衍射传输基准距离为 3 mm。
实验关键数据¶
主实验¶
实验在 DIV2K 数据集前 50 张图像上进行测试,统一在 \(3 \times 1024 \times 640\) 分辨率及 \(L=2\) 焦平面设定下评估平均 PSNR、SSIM、LPIPS、显存占用与优化耗时。
表1:与基础图像表示及高斯表示方法的定量对比
| 方法 | PSNR ↑ (dB) | SSIM ↑ | LPIPS ↓ | 显存占用 (VRAM) | 参数量 (Params) | 优化时间 (min) |
|---|---|---|---|---|---|---|
| TAESD (预训练自编码器) | 11.6 | 0.09 | 0.79 | 2.7 G | 2.5 M | - |
| MLP (隐式神经表示) | 7.5 | 0.04 | 0.85 | 9.9 G | 1.0 M | 6.9 |
| SIREN (周期激活INR) | 7.6 | 0.05 | 0.84 | 13.1 G | 1.0 M | 7.8 |
| Image-GS (自然图像2DGS) | 17.2 | 0.29 | 0.70 | 1.3 G | 2.4 M | 1.6 |
| GI (GaussianImage) | 22.6 | 0.49 | 0.59 | 1.1 G | 2.4 M | 0.8 |
| Instant-GI | 23.5 | 0.56 | 0.56 | 3.4 G | 2.8 M | 0.9 |
| 本文方法 (Ours, 5:1压缩) | 30.7 | 0.86 | 0.33 | 2.2 G | 0.8 M | 1.4 |
表2:与经典及前沿CGH方法的定量对比(Smooth POH与Random POH)
| 类别 / 方法 | PSNR ↑ (dB) | SSIM ↑ | LPIPS ↓ | 显存占用 (VRAM) | 参数量 (Params) | 优化时间 (min) | 渲染延迟 (ms) |
|---|---|---|---|---|---|---|---|
| Smooth POH | |||||||
| NH3D (神经网络CGH) | 28.3 | 0.92 | 0.31 | 7.1 G | 3.9 M | 90 | 31.0 |
| TensorV2 | 27.1 | 0.94 | 0.29 | 8.7 G | 0.1 M | 80 | 48.0 |
| GWS (高斯波前溅射) | 28.2 | 0.76 | 0.41 | 2.5 G | 1.1 M | 5.1 | 6840.0 |
| U-Net | 27.2 | 0.91 | 0.35 | 6.3 G | 2.2 M | 100 | 18.0 |
| Multi-color | 27.9 | 0.74 | 0.40 | 3.2 G | 4.0 M | 5.3 | - |
| 本文方法 (Ours) | 29.0 | 0.81 | 0.38 | 2.4 G | 0.8 M | 1.4 | 2.13 |
| Random POH | |||||||
| Naive Opt (直接相位优化) | 19.8 | 0.33 | 0.60 | 2.9 G | 2.0 M | 2.9 | - |
| Wirtinger (Wirtinger全息) | 25.3 | 0.47 | 0.48 | 3.5 G | 2.0 M | 2.8 | - |
| Multi-color | 20.3 | 0.35 | 0.64 | 3.1 G | 4.0 M | 3.0 | - |
| 本文方法 (Ours) | 29.4 | 0.81 | 0.34 | 3.4 G | 2.0 M | 3.8 | - |
消融实验¶
表3:不同参数压缩比对重构质量与渲染速度的影响
| 参数削减比例 | 参数量 (Params) | PSNR ↑ (dB) | SSIM ↑ | LPIPS ↓ | 渲染时间 (ms) |
|---|---|---|---|---|---|
| Dense Per-pixel (基线全像素) | 4.0 M | 32.3 | 0.893 | 0.29 | 4.02 |
| 2:1 | 2.0 M | 31.9 | 0.891 | 0.30 | 2.58 |
| 3:1 | 1.3 M | 31.5 | 0.885 | 0.31 | 2.33 |
| 5:1 (本文默认配置) | 0.8 M | 30.7 | 0.863 | 0.33 | 2.13 |
| 7:1 | 0.6 M | 30.3 | 0.856 | 0.34 | 1.90 |
| 10:1 (极限压缩上限) | 0.4 M | 29.4 | 0.835 | 0.37 | 1.72 |
表4:POH转换引导与高斯基元设计的消融验证
| 实验类型 | 模型变体 / 设计配置 | PSNR ↑ (dB) | SSIM ↑ | LPIPS ↓ | 参数量 (Params) | 渲染延迟 (ms) |
|---|---|---|---|---|---|---|
| Random POH | 无结构引导 (w/o guidance) | 19.1 | 0.37 | 0.52 | 2.0 M | - |
| Random POH | 带高斯结构引导 (Ours) | 30.6 | 0.88 | 0.22 | 2.0 M | - |
| 复数表示机制 | 独立配对实数高斯 (Naive Paired) | 25.5 | 0.74 | 0.47 | 1.2 M | 20.1 |
| 复数表示机制 | 统一复数2D高斯 (Ours) | 31.8 | 0.89 | 0.31 | 0.8 M | 2.13 |
关键发现¶
- 结构引导对随机相位优化的决定性提升:消融实验表明,在缺少复数高斯结构引导时,直接对随机全息图优化只能得到 19.1 dB 的 PSNR;引入结构引导后重构质量大幅跃升至 30.6 dB(提升达 +11.5 dB),证明紧凑的高斯空间先验有效约束了病态逆问题解空间。
- 统一基元完胜配对实数高斯:将实部与虚部分开用两组实数高斯拟合不仅增加 33% 参数(18 vs 12),而且因两组基元中心和旋转轴在梯度反向传播中的不一致性破坏了波前相位连续性,导致重构 PSNR 暴跌 6.3 dB,且因双通路光栅化使渲染耗时增加近 10 倍(20.1 ms vs 2.13 ms)。
- 参数收缩下的优雅退化:与 Gabor 测不准原理的理论预期高度吻合,随着参数压缩比从 2:1 提升至 10:1,PSNR 仅从 31.9 dB 缓降至 29.4 dB,在 5:1 压缩下以仅 0.8M 参数即达到 30.7 dB,兼顾极高画质与轻量化开销。
- 算子级优化的显存与吞吐飞跃:定制的 CUDA 光栅化与 BLASM 频域滤波在不同分辨率下均实现 29%–36% 的显存节约与 40%–50% 的单步优化提速,使得单卡(RTX 3090)在 \(L=3\) 时能够平稳扩展至 \(3200 \times 1800\)(5.8M 像素)高分辨率全息图优化而无 OOM 风险。
亮点与洞察¶
- 跨域物理理论的巧妙映射:首次将 Gabor 1946 年提出的通信理论中空频联合不确定度极小定理与计算机全息图的高频表征需求绑定,指明高斯分布是压缩全息优化自由度同时保真波前衍射特性的最佳数学基元。
- 解耦硬件的通用中间件设计:避免了针对特定 SLM 物理格式硬编码训练管线的局限,通过单一复数高斯场作为通用中介,向下游平滑全息(DPAC)与随机全息(引导优化)双路派发,大幅增强了全息管线的适配弹性。
- 算子级常数显存回溯机制:光栅化过程中不在前向保留所有像素级高斯权重,仅暂存累积不透明度并在反向求导时解析恢复,克服了复数全息多深度传播下的显存爆炸难题。
局限与展望¶
- 硬件捕捉下的对比度缩水:作者在真实光学平台上(LASOS 激光器 + Jasper SLM + Point Grey 传感器)验证发现,光学实测画质提升幅度小于仿真结果。主要受制于激光散斑相干噪声、SLM 8-bit 相位量化误差及光学镜组装配像差。
- 两阶段转换的间接性:当前生成随机相位全息仍需先优化复数高斯再执行结构引导优化,属于两阶段流程,未来若能实现复数2D高斯直接端到端离散光栅化渲染纯相位全息将更为优雅。
- 单视角视差视盒限制:目前重点解决单幅静态全息图的紧凑表示与多焦面聚焦,尚未内建大角度动态视点扩展(eyebox expansion),未来可探索与时间复用或超表面时空调制技术结合实现实时全息动态视频生成。
相关工作与启发¶
- vs GWS (Choi et al., SIGGRAPH 2025): GWS 依赖多视角输入针对 3D 场景做 novel view 全息波前溅射,重构延迟高达 6840 ms;本文专注于单幅全息图自身的紧凑参数化表示与快速优化,渲染延迟降至 2.13 ms(约 3200× 提速),显存更友好。
- vs Complex-valued Radience Fields (Zhan et al., TOG 2026): 该工作在三维体空间定义复数 3D 高斯;本文将其精炼并重构为全息图平面上的复数 2D 高斯,结合 Gabor 测不准定理系统分析了参数空间压缩机理,并解决了平滑/随机相位全息的后处理适配问题。
- vs Wirtinger Holography (Chakravarthula et al., SIGGRAPH 2019): Wirtinger 全息直接在全息像素域使用 Wirtinger 导数迭代求解相位,易陷入高频斑点噪声;本文借助复数高斯赋予的平滑空间拓扑先验进行引导,随机相位全息 PSNR 提升达 4.1 dB。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将复数2D高斯基元及Gabor测不准理论系统化引入单全息图紧凑优化与多格式生成。
- 实验充分度: ⭐⭐⭐⭐⭐ 包含数值仿真、严谨的多基线对比、参数压缩极限消融以及真实物理SLM光路实测。
- 写作质量: ⭐⭐⭐⭐⭐ 物理机制剖析透彻,理论证明与工程算子实现自洽,图表完备详实。
- 价值: ⭐⭐⭐⭐⭐ 为下一代轻量化、高保真计算全息近眼显示系统提供了强有力的紧凑表示新范式。