Recurrent Sinusoidal INRs for Efficient High-Fidelity Representation¶
会议: ECCV 2026
论文: ECCV 2026
项目: Project Page
领域: 3D 视觉
关键词: 隐式神经表征, 正弦循环展开, 谐波线谱, 双极性码空间, 格雷码
一句话总结¶
论文揭示了正弦激活函数诱导谐波线谱扩展的数学本质,提出权重共享的无偏置正弦循环架构与双极性格雷码对齐监督,在不增加模型参数量的前提下成倍扩增有效频域支撑,实现了低计算预算下的高保真乃至无损离散信号重建。
研究背景与动机¶
隐式神经表征(INRs)利用以坐标为输入的多层感知机将连续信号参数化为神经函数,凭借连续采样、几何分辨率无关与解析可微等优势,已成为三维重建、神经辐射场(NeRF)以及高保真图像建模的核心工具。然而,标准坐标感知机在优化过程中普遍受制于谱偏差(Spectral Bias),网络倾向于优先拟合低频轮廓而难以捕捉精细高频细节。为了突破这一瓶颈,现有方法通常聚焦于激活函数设计(如周期性正弦函数 SIREN、自适应周期函数 FINER 或复数小波 WIRE)、输入坐标多频映射(如随机傅里叶特征 RFF 或多分辨率哈希网格 Instant-NGP),或者通过加深前馈隐藏变换层来扩充模型容量。
然而,传统的深层前馈设计依赖于堆叠独立的参数化网络层,直接导致参数量激增和计算存储开销飙升;而平衡网络架构(如 iSIREN)虽然借助隐式不动点方程实现了反向传播常数级显存占用,但其设计初衷主要聚焦于稳态收敛与平摊求解,不动点表征呈现静态谱分布,无法解析迭代变换如何逐步富集隐藏特征的高频频域结构。这便引出了一个核心矛盾:能否在严格受限的参数预算下,使网络潜在变换层具备持续解析高频微观结构的能力,同时显式揭示迭代计算对特征频谱的富集机制?
本文的切入视角在于将正弦非线性变换与循环展开机制相结合,建立正弦循环展开与谐波谱阶数倍增之间的理论桥梁。通过 Jacobi-Anger 恒等式严格推导,研究证明每次经过共享正弦模块均会催生已有基频的整数线性组合谐波,从而在参数固定的前提下成倍扩增有效频谱支撑。核心 idea:采用权重共享的有限步无偏置正弦循环展开(Weight-Tied Sinusoidal Recurrence)实现谐波谱阶数的逐层递增,并结合双极性格雷码空间对齐监督,以极少的参数与优化步数实现高保真乃至无损离散信号重建。
方法详解¶
整体框架¶
整体架构将坐标映射过程解构为输入嵌入、循环潜在精炼与输出对齐三个连续阶段。给定离散空间坐标 \(\mathbf{x} \in \mathbb{R}^d\),首先通过可学习的正弦投影层将其映射至初始潜在空间特征 \(\mathbf{h}^{(0)}\);随后,将该潜在特征送入一个权重共享且不含偏置的正弦循环块中,迭代展开 \(R\) 步以实现多阶谐波富集;最后,通过线性输出投影与平滑饱和函数预测出连续码字向量,并与目标双极性格雷码进行余弦相似度对齐优化。在测试阶段,通过符号截断与逆格雷映射即可无损恢复出量化离散像素值。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入空间坐标 x"] --> B["正弦输入投影<br/>可学习傅里叶特征嵌入"]
B --> C["无偏置正弦循环展开<br/>共享权重迭代 R 步 + Jacobi-Anger 谐波谱扩展"]
C --> D["线性输出映射与饱和激活<br/>预测连续码向量 c_hat"]
D --> E["双极性格雷码对齐监督<br/>格雷码转 {-1, +1}^B + 恒模余弦相似度优化"]
E --> F["失真感知的位平面重加权<br/>按解码灰度影响分配权重,优先收敛高位平面"]
F --> G["无损离散信号重建与几何渲染<br/>图像拟合 / 超分辨率 / NeRF / SDF"]
关键设计¶
1. 无偏置正弦循环展开:以权重共享实现谐波谱扩展并阻断相位漂移累积 针对深层前馈模型参数冗余以及循环网络中偏置项累积失真的痛点,该设计复用单层共享权重 \(W^{(\mathrm{rec})}\) 实施 \(R\) 步无偏置展开:\(\mathbf{h}^{(r)} = \sin(\omega W^{(\mathrm{rec})} \mathbf{h}^{(r-1)})\)。从谱分析角度看,正弦输入嵌入层将坐标转换为基底音调集合 \([\mathbf{h}_0(\mathbf{x})]_i = \sin(\mathbf{\Omega}_i^\top \mathbf{x} + \phi_i)\);当隐藏层前激活为这些基调的线性组合 \(u_j(\mathbf{x}) = \sum_{i=1}^m \alpha_{j,i} \sin(\theta_i(\mathbf{x}))\) 时,应用欧拉公式与多重 Jacobi-Anger 展开可精确推导出输出谱结构: $\(\sin(u_j(\mathbf{x})) = \sum_{\mathbf{k} \in \mathbb{Z}^m} \Big(\prod_{i=1}^m J_{k_i}(\alpha_{j,i})\Big) \sin\Big(\sum_{i=1}^m k_i \theta_i(\mathbf{x})\Big)\)$ 该解析式表明,正弦非线性作用并非简单重加权已有频率,而是在基频的任意整数线性组合位置 \(\mathbf{\Omega} = \sum_{i=1}^m k_i \mathbf{\Omega}_i\) 激发全新的谐波谱线。这意味着每执行一次循环迭代,特征谱支撑便发生闭包扩张 \(\mathbf{\Omega}^{(r+1)} \subseteq \mathrm{span}_{\mathbb{Z}}(\mathbf{\Omega}^{(r)})\)。尤为关键的是,循环层严格剔除了偏置项 \(b_{\mathrm{rec}}\)。若引入偏置,由和角公式可知每次展开均会引入恒定相移 \(\boldsymbol{\beta} = \omega b_{\mathrm{rec}}\),导致反向传播时的雅可比门控矩阵变为 \(\operatorname{diag}(\cos(\mathbf{z}^{(r)} + \boldsymbol{\beta})) \omega W_{\mathrm{rec}}\)。随着展开步数增加,相移失真将在递归路径中非线性累积,引发高频梯度剧烈震荡并导致拟合性能断崖式下跌。去偏置设计确保了导数门控的对称性与数值稳定性。
2. 双极性格雷码对齐监督:以恒模余弦相似度与单比特翻转约束离散重建 连续实值回归(如常规 MSE 损失)在处理离散量化信号时极易产生高频振铃与边缘模糊,且对预测幅值尺度极度敏感。本方法将目标量化值 \(y_p \in \{0, \dots, 2^B-1\}\) 转换为 \(B\) 位格雷码 \(\Gamma(y_p)\),进而构造零中心对称的双极性编码目标 \(\mathbf{c}_p = 2\Gamma(y_p) - 1 \in \{-1, +1\}^B\)。由于双极性码字具备恒定 \(L_2\) 范数 \(\|\mathbf{c}_p\|_2^2 = B\),展开欧氏距离可得: $\(\|\hat{\mathbf{c}}_p - \mathbf{c}_p\|_2^2 = \|\hat{\mathbf{c}}_p\|_2^2 + B - 2\hat{\mathbf{c}}_p^\top \mathbf{c}_p\)$ 这意味着在模长规整的前提下,误差完全由预测向量 \(\hat{\mathbf{c}}_p\) 与目标码字 \(\mathbf{c}_p\) 的空间夹角决定。因此,采用余弦相似度最大化目标: $\(\mathcal{L}_{\mathrm{align}} = \frac{1}{|\mathcal{P}|}\sum_{p \in \mathcal{P}} \frac{\hat{\mathbf{c}}_p^\top \mathbf{c}_p}{\|\hat{\mathbf{c}}_p\|_2 \|\mathbf{c}_p\|_2}\)$ 能够天然规避幅度尺度敏感性。更重要的是,相比自然二进制编码(NBC)在相邻量化级间可能产生最多 \(n\) 位突变的汉明峭壁(局部码空间敏感度高达 \(L_{\mathrm{NBC}}^{\mathrm{local}} = n/\delta\)),格雷码相邻级之间仅翻转 1 个比特,其局部敏感度恒为 \(L_{\mathrm{GC}}^{\mathrm{local}} = 1/\delta\)。这种严格的拓扑邻近性将局部码空间灵敏度降低了 \(n\) 倍,有效平滑了网络优化曲面。
3. 失真感知的位平面重加权:在非精确拟合区间按解码影响重分配优化预算 当模型参数容量受限或训练步数极少、无法达到零误码率时,各比特平面的预测错误对解码后图像强度造成的视觉与数值损伤存在几何级差异。高有效位(MSB)出现比特翻转会导致大范围的灰度台阶与严重斑块,而低有效位(LSB)的翻转仅引入轻微高频微噪。为此,针对未收敛或容量受限工况,提出了基于解码失真感知的位平面加权损失: $\(\mathcal{L}_{\mathrm{w}} = \sum_{i=0}^{B-1} w_i \mathcal{L}^{(i)}, \quad w_i = \begin{cases} 2^{-(8-i)}, & i \in \{0, 1, 2\} \\ 1, & \text{其他} \end{cases}\)$ 其中 \(i=0\) 代表最低有效位平面。通过主动压低最低 3 个位平面的梯度权重,引导网络优先将有限的拟合预算分配给对重构质量起决定性作用的高阶位平面,从而在低容量和少样本优化下显著抑制结构性伪影并提升峰值信噪比。
损失函数 / 训练策略¶
模型输出端采用平滑饱和激活函数 \(G(z) = \sin(\arctan z) = z / \sqrt{1 + z^2}\) 将网络预测限制在 \([-1, 1]\) 内,既能与双极性码空间完美契合,又在零点附近保持线性响应。训练过程全程端到端可微,优化器选用 AdamW,初始学习率固定为 \(1.5 \times 10^{-4}\),无需学习率衰减调度。离散量化截断算子 \(T(\cdot) = \operatorname{sign}(\cdot)\) 与逆格雷解码变换 \(B^{-1}\) 仅在推断评估阶段执行。
实验关键数据¶
主实验¶
在 Set5、Kodak24、DIV2K-100 与 FFHQ-600 四个基准图像数据集上,与标准前馈 INR、频带限制模型及可学习频域基线进行了系统性对比。基准模型在 791K 参数量下训练 1000 步,而本文模型在更小的 609K 参数量下,仅需 100 步即可大幅超越全部基线 1000 步的拟合质量;随着步数放宽至自适应收敛,模型均能达到零比特误码的绝对无损拟合(PSNR 达到 \(\infty\))。
| 方法 | 参数量 | 迭代步数 | Set5 (PSNR / SSIM / Bit err) | Kodak24 (PSNR / SSIM / Bit err) | DIV2K-100 (PSNR / SSIM / Bit err) | FFHQ-600 (PSNR / SSIM / Bit err) |
|---|---|---|---|---|---|---|
| WIRE | 791K | 1000 | 26.91 / .6637 / 544.52K | 26.83 / .6583 / 566.38K | 26.65 / .7620 / 555.53K | 26.43 / .5971 / 561.66K |
| Gauss | 791K | 1000 | 33.97 / .8802 / 453.77K | 34.18 / .8867 / 460.84K | 34.06 / .9211 / 456.13K | 34.01 / .8647 / 458.33K |
| SIREN | 791K | 1000 | 38.54 / .9629 / 350.11K | 35.01 / .9404 / 395.26K | 32.81 / .9535 / 430.17K | 37.68 / .9630 / 351.22K |
| FINER | 791K | 1000 | 41.78 / .9775 / 309.20K | 42.15 / .9803 / 305.60K | 40.81 / .9876 / 325.74K | 41.08 / .9796 / 312.68K |
| BACON | 791K | 1000 | 33.71 / .9488 / 390.47K | 31.93 / .9194 / 429.31K | 29.73 / .9177 / 462.32K | 33.15 / .9414 / 390.39K |
| FourierNet | 791K | 1000 | 45.67 / .9924 / 242.83K | 41.77 / .9882 / 293.41K | 39.31 / .9883 / 334.63K | 42.64 / .9898 / 266.08K |
| GaborNet | 791K | 1000 | 50.31 / .9970 / 190.86K | 51.38 / .9975 / 180.71K | 49.51 / .9976 / 206.54K | 49.54 / .9962 / 193.25K |
| iSIREN | 791K | 1000 | 51.80 / .9976 / 172.55K | 52.67 / .9981 / 167.44K | 51.43 / .9983 / 183.92K | 50.90 / .9971 / 173.83K |
| Ours (#iter=100) | 609K | 100 | 58.16 / .9997 / 0.78K | 53.20 / .9989 / 2.51K | 46.28 / .9973 / 5.66K | 61.39 / .9998 / 0.62K |
| Ours (自适应步数) | 609K | \(\le\)1000 | \(\infty\) (322 步收敛) | \(\infty\) (447 步收敛) | \(\infty\) (537 步收敛) | \(\infty\) (440 步收敛) |
消融实验¶
消融实验聚焦于循环展开步数、循环偏置对优化的累积影响,以及三维神经辐射场重建性能。表 2A 验证了在 Kodak24 数据集上不同循环展开次数 \(R\) 下开启与禁用偏置(Bias ON vs OFF)的峰值信噪比表现(792K 参数量,1K 步)。表 2B 展示了将该循环解码器迁移至 NeRF(LLFF 数据集前向场景,600K 参数量)的视点合成渲染增益。
表 2A:循环展开步数与循环偏置消融实验(Kodak24,PSNR dB)
| 循环偏置配置 | \(R=1\) (前馈单次) | \(R=2\) | \(R=3\) | \(R=4\) | \(R=5\) |
|---|---|---|---|---|---|
| Bias ON(开启偏置) | 51.16 | 60.35 | 51.97 | 63.57 | 78.10 |
| Bias OFF(禁用偏置,本文) | 51.41 | 83.49 | 87.54 | 89.59 | 90.28 |
| 增益 (\(\Delta\)PSNR) | +0.25 | +23.14 | +35.57 | +26.02 | +12.18 |
表 2B:三维神经辐射场(NeRF)新视角合成性能对比(LLFF 数据集,600K 参数预算)
| 场景 | 基线 NeRF (PSNR ↑ / SSIM ↑ / LPIPS ↓) | Ours 解码器 (PSNR ↑ / SSIM ↑ / LPIPS ↓) | 质量提升幅度 (\(\Delta\)PSNR / \(\Delta\)LPIPS) |
|---|---|---|---|
| Flower | 23.71 / 0.6316 / 0.4145 | 24.54 / 0.7138 / 0.2934 | +0.83 dB / -0.1211 |
| Orchids | 17.85 / 0.4198 / 0.5172 | 18.79 / 0.5313 / 0.3797 | +0.94 dB / -0.1375 |
| Fern | 21.06 / 0.5640 / 0.4943 | 21.60 / 0.6500 / 0.3704 | +0.54 dB / -0.1239 |
| Fortress | 26.10 / 0.5987 / 0.4423 | 26.36 / 0.7189 / 0.3206 | +0.26 dB / -0.1217 |
关键发现¶
- 无偏置设计的决定性作用:当展开步数 \(R \ge 2\) 时,保留循环偏置会使 PSNR 骤降 12~35 dB。这证实了恒定相移在递归复用中会严重扰乱导数门控,破坏网络的高频拟合动态。
- 正弦循环独有的谱扩展能力:非正弦循环结构(如高斯激活或带位置编码的 MLP)在循环展开时频谱支撑迅速塌陷至 0(表 3c),PSNR 甚至发生灾难性退化(高斯循环从 60.31 dB 崩塌至 12.02 dB);而正弦结构(SIREN / FINER)展现出单调扩增的谱支撑与显著的拟合增益。
- 解耦分析明确各模块功劳:根据表 12,相较于前馈基准(42.15 dB),单纯引入无偏置循环展开即可将 PSNR 提升至 64.19 dB;进一步引入双极性格雷码监督后,残余失真被彻底消除,达成完全精确的离散量化重构(\(\infty\) dB,0 误码)。
亮点与洞察¶
- 将正弦激活的非线性特性提炼为可解释的谐波阶数递增器:利用 Jacobi-Anger 恒等式为隐式网络的深度与循环展开提供了严格的频域解析支撑,从数学上理清了“为何深层正弦网络能拟合超高频”。
- 揭示循环架构中偏置项对梯度传播的破坏机制:敏锐指出共享层中的偏置项会在循环求导中引发相位漂移累积效应,去除偏置使网络在数步循环内即可获得数十分贝的增益。
- 构建了离散量化世界与连续神经隐式表达的高效几何桥梁:将格雷码单比特变动特性与双极性零中心恒模流形巧妙耦合,兼顾了连续梯度优化的平滑性与数字存储的无损精确性。
局限与展望¶
- 作者承认的局限性:虽然该方法在中等和较大参数规模(\(\ge 400\text{K}\))下展现出压倒性优势,但在极端低参数约束(如 \(\le 100\text{K}\))下,循环复用受限于共享权重的基础表征容量,增益可能不再显著。
- 实验与机制局限:循环展开机制在测试推断时需要执行多步前向计算,尽管训练收敛速度(物理时间)因步数缩减而显著加快,但在推断端每次坐标采样的浮点计算量(FLOPs)会随 \(R\) 线性增长。
- 未来探索方向:探索动态自适应的循环展开步数机制(依据局部空间复杂度动态调节每处坐标的迭代轮数),以及将该正弦循环块进一步集成至三维高斯泼溅(3DGS)属性字段或神经音频压缩管线中。
相关工作与启发¶
- vs SIREN / FINER: 传统正弦网络通过层层堆叠独立参数化层来构建高阶非线性,参数利用率低且深层易产生优化不稳定性;本文复用单个正弦块并在理论层面揭示了频域级联机理,以更少参数达到更高拟合度。
- vs iSIREN (DEQ): iSIREN 聚焦于不动点平衡态计算与常数级反向传播显存,但其频域结构在平衡状态下趋向静态;本文采用有限显式展开,有效捕捉并利用了递归过程中的阶数扩张动态。
- vs BACON / FourierNet: BACON 采用频带限制的人工多尺度设计,FourierNet 依赖显式傅里叶滤波器;本文在极简结构下仅通过权重共享的正弦复用即可实现自适应的丰富谱线激增。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 巧妙运用 Jacobi-Anger 恒等式解析正弦循环展开的谐波谱阶数生成,理论推导严密且具高度启发性。
- 实验充分度: ⭐⭐⭐⭐⭐ 从二维图像离散重建、超分辨率到三维 NeRF 与 SDF 任务全覆盖,频域分析、消融对比与误码指标详实完备。
- 写作质量: ⭐⭐⭐⭐⭐ 论证脉络清晰,数学形式化优美,图文呼应紧密,洞察深刻直击痛点。
- 价值: ⭐⭐⭐⭐⭐ 为解决隐式表征的谱偏差与参数爆炸问题提供了兼具理论自洽性与极高工程实用性的通用模块。