跳转至

Closing the Capacity–Convergence Gap: Globally Optimal Configuration of Implicit Neural Representations

会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/Sippengg/OptiINR
领域: 3D视觉
关键词: 隐式神经表示, 贝叶斯优化, 激活函数选择, 架构配置, 容量-收敛差距

一句话总结

将隐式神经表示(INR)的层级激活函数、初始化尺度及学习率联合配置重构为混合变量全局优化问题,利用混合核高斯过程与经验期望提升进行贝叶斯搜索,有效弥合了容量与收敛的权衡鸿沟。

研究背景与动机

隐式神经表示(INR,或坐标 MLP)将图像、3D 几何、音频和辐射场等复杂连续信号参数化为神经网络权重,在分辨率无关性和内存紧凑度上显著超越了传统离散网格。为了克服标准 MLP 在梯度下降训练中的谱偏差(倾向于先拟合低频分量而丢失高频边缘与微细瞬态),领域内相继提出了正弦波激活(SIREN)、Gabor 小波激活(WIRE)、高斯激活以及变周期激活(FINER/FINER++)等高容量非线性函数。然而,这些强表现力激活函数的高频表达能力高度依赖于极度敏感且相互耦合的初始化策略与超参数。

这种相互依赖直接导致了显著的“容量-收敛差距(capacity–convergence gap)”:理论上具有极强拟合能力的架构,在面对极度非凸的优化曲面时极易陷入次优局部解或发散;而在实践中,微小的层级超参数漂移就可能导致最终信号重建质量发生超过 10 dB PSNR 的剧烈波动。现有主流做法普遍停留在人工启发式试错、经验参数复用或粗粒度网格搜索上;即便是近期的自动化工作(如 MIRE)也仅仅采用贪心逐层构建策略,从理论上无法保障跨层强耦合下的全局最优配置。

要彻底弥合这一差距,必须将激活函数选取、初始化范围和逐层学习率脱离割裂的局部试错,纳入统一的全局优化框架中。核心 idea:将 INR 的层级激活函数家族选择与连续超参数联合形式化为混合变量黑盒全局优化问题,提出 OptiINR 框架,设计连续与分类解耦的乘积核高斯过程代理模型,并结合基于 Matheron 规则的高效蒙特卡洛经验期望提升(EEI)算法,实现端到端跨模态的最优配置自适应搜索。

方法详解

整体框架

OptiINR 将 \(L\) 层坐标 MLP 的配置映射为一个高维混合变量全局向量 \(\Lambda_{\text{network}} = (\lambda_1, \lambda_2, \dots, \lambda_L) \in \mathcal{L}\),其中每一层元组包含离散激活族标识、初始化方案开关,以及条件连续超参数(频率 \(\omega_0\)、尺度 \(s_0\)、权重初始方差及逐层学习率)。优化流程将“端到端训练 INR 并在验证集评估重建质量(如 PSNR / IoU)”视为昂贵的黑盒评价函数 \(f(\Lambda)\)。整体系统采用贝叶斯优化迭代驱动,维护混合变量高斯过程(GP)代理模型,并在每一轮利用蒙特卡洛采样的经验期望提升(Empirical Expected Improvement, EEI)指导下一组全局配置的评估,其自适应探索与收敛流程如下图所示:

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入目标信号与任务定义<br/>音频/图像/3D占用/PDE/NeRF"] --> B["拉丁超立方采样初始化<br/>生成基线观测样本集"]
    B --> C["混合变量乘积核高斯过程拟合<br/>连续 Matérn 核 × 独热 ARD 分类核"]
    C --> D["Matheron 规则快速后验采样<br/>矩阵逆计算仅需一次"]
    D --> E["经验期望提升 EEI 采集优化<br/>平衡高不确定性探索与高均值利用"]
    E --> F["端到端训练选定配置 INR<br/>获取真实目标评估指标"]
    F -->|更新样本集迭代循环| C
    F -->|达到预算退出| G["输出全局最优配置与重构模型"]

关键设计

1. 结构化混合变量全局配置空间:打破贪心逐层搜索的次优局限

传统自动化方法(如 MIRE)采用自底向上的逐层贪心贪婪搜索,但由于前序层的谱滤波响应与后序层的非线性映射强力耦合,局部最优的层级激活无法组合出全局最优网络。OptiINR 构建了覆盖全网所有层的联合配置空间 \(\Lambda = (\lambda_1, \dots, \lambda_L)\),并在网络入口处设置全局傅里叶特征位置编码(PE)的二元开关与尺度参数。对于每个隐层 \(l\),离散变量 \(\sigma_l\) 从候选激活族(如 SIREN、WIRE、FINER、FINER++、Gauss)中挑选,布尔变量 \(I_l \in \{0, 1\}\) 控制是否启用尺度保持型 SIREN 初始化,连续向量 \(p_l\) 动态绑定该激活特有的超参数(如正弦基础频率 \(\omega_0\)、小波尺度 \(s_0\))以及独立的逐层学习率 \(\alpha_l\),使网络浅层与深层能根据信号动力学解耦自适应步长。

2. 混合变量解耦乘积核代理模型:严谨刻画离散激活与连续参数的非平稳联合分布

由于搜索空间同时包含离散族选择和条件连续参数,标准欧氏距离核无法有效度量配置间的先验相似性。OptiINR 设计了结构解耦的乘积协方差核:

\[k(\Lambda, \Lambda') = k_{\text{cont}}(\Lambda_c, \Lambda'_c) \times k_{\text{cat}}(\Lambda_{\text{cat}}, \Lambda'_{\text{cat}})\]

连续部分采用 Matérn 协方差核 \(k_{\text{cont}}\),通过可调平滑度参数 \(\nu\) 适应黑盒函数可能出现的非光滑急剧响应面,并通过边际似然最大化拟合长度尺度;分类部分首先将具 \(M\) 个类别的离散激活映射为独热编码,再接入配备自动相关性判定(ARD)的平方指数核 \(k_{\text{cat}}\),为每个离散维度赋予独立的特征尺度 \(\ell_j\)。该混合核从理论上保障了高斯过程后验方差随着评价样本量的扩充渐进收缩到真值曲面。

3. Matheron 规则与经验期望提升(EEI):支撑批次扩展与低开销后验采样

在黑盒优化阶段,传统解析型期望提升(EI)难以扩展至批次评估且对代理模型设定漂移脆弱。OptiINR 引入蒙特卡洛经验期望提升 \(\widehat{\text{EI}}(\lambda) = \frac{1}{S} \sum_{s=1}^S \max(0, f^{(s)}(\lambda) - f_{\text{best}})\)。直接对高斯后验进行 \(S\) 次独立路径抽样需要计算规模为 \(n \times n\) 的协方差矩阵 Cholesky 分解,产生不可承受的 \(\mathcal{O}(Sn^3)\) 计算复杂度。OptiINR 采用基于高斯条件模拟的 Matheron 规则:

\[f_{\text{post}}(\cdot) \stackrel{d}{=} f_{\text{prior}}(\cdot) + k(\cdot, X)[K + \sigma_n^2 I]^{-1}(y - f_{\text{prior}}(X))\]

只需对核矩阵逆 \([K + \sigma_n^2 I]^{-1}\) 计算一次分解(复杂度 \(\mathcal{O}(n^3)\)),即可在 \(\mathcal{O}(Sn^2)\) 内生成 \(S\) 个精确后验轨迹,不仅避免了稀疏高斯过程或随机特征诱发的近似截断误差,更使采集函数优化过程能够在 GPU 上高度并行化,将搜索算法本身的运行开销降至整个 INR 训练周期的忽略不计水平。

损失函数 / 训练策略

在黑盒评估环节,每个候选配置下的 INR 均使用 AdamW 优化器,以各层自主搜索的层级学习率 \(\alpha_l\) 训练 10,000 次迭代。贝叶斯优化流程首先通过空间填充的拉丁超立方抽样(Latin Hypercube Sampling, LHS)初始化 30 个基准评估点,构建先验样本集 \(\mathcal{D}_{N_{\text{init}}}\),随后开展 100 轮贝叶斯自适应迭代,在全局空间内动态平衡高方差区域的探索与高期望提升区域的利用,最终导出全局最佳性能对应的架构超参数组合。

实验关键数据

主实验

论文在 1D 音频、2D 图像、3D 占用网格以及 NeRF 新视点合成四大模态下全面对比了经典和最新 INR 方案,统一采用 4 层、每层 256 单元的 MLP 骨干以剥离架构容量干扰。

任务 / 数据集 指标 OptiINR (本文) 最佳基线 提升幅度 次优基准方法详情
图像:Kodak (24图均值) PSNR (dB) ↑ 41.38 ± 3.05 40.24 ± 3.23 +1.14 dB FINER (40.24), SIREN (38.47), WIRE (38.69)
图像:DIV2K (16图均值) PSNR (dB) ↑ 46.24 ± 3.49 45.56 ± 3.84 +0.68 dB FINER (45.56), SIREN (42.75), IGA (41.77)
音频:Bach PSNR (dB) ↑ 60.84 54.94 +5.90 dB FR (54.94), SIREN (52.59), IGA (52.35)
音频:Counting PSNR (dB) ↑ 49.60 39.35 +10.25 dB FINER (39.35), FR (36.93), SIREN (34.39)
音频:Two Speakers PSNR (dB) ↑ 68.39 56.36 +12.03 dB FR (56.36), IGA (42.39), FINER (42.27)
3D 占用:Dragon (\(512^3\)) IoU ↑ 0.9936 0.9934 +0.0002 Gauss (0.9934), WIRE (0.9924), FR (0.9919)
3D 占用:Thai Statue (\(512^3\)) IoU ↑ 0.9884 0.9871 +0.0013 Gauss (0.9871), IGA (0.9834), WIRE (0.9861)
新视角合成:NeRF Lego PSNR (dB) ↑ 25.63 25.05 +0.58 dB ReLU+PE (25.05), WIRE (24.63), FINER (24.25)

消融实验

为了严格分离“结构化配置空间设计”与“贝叶斯优化算法”对性能的具体贡献,在 Kodak 数据集上采用完全相同的评估预算进行了优化策略与空间设定的消融对比:

搜索策略 / 方法 Kodak 平均 PSNR (dB) 相对基准增益 说明
OptiINR (完整框架: 空间 + BO) 41.38 混合核 GP + Matheron 规则 EEI 优化
Random Search (在 OptiINR 空间内) 41.23 -0.15 dB 证明精心构建的混合配置空间本身贡献主要性能红利
Grid Search (在 OptiINR 空间内) 41.02 -0.36 dB 粗粒度网格在连续超参数连续域上采样受限
FreSh (频率平移 baseline) 37.41 -3.97 dB 现有固定范式在未精细配置时表现受限
SPDER (半周期阻尼 baseline) 35.03 -6.35 dB 缺乏对激活-初始化耦合的针对性联合配置

关键发现

  • 任务自适应的混合激活规律:在图像拟合中,对于平滑低频图像,OptiINR 倾向于在浅层选取高斯或 FINER++ 激活以确保连续插值,而在深层转用正弦(SIREN)拟合残差高频;对于纹理密集和边缘丰富的图像,全网更倾向于一致采用小波(WIRE)激活。
  • 空间结构贡献居首,BO 精细收敛:同等预算下,在 OptiINR 空间中仅运行随机搜索即可达到 41.23 dB,显著击败现存自动化方案,证实将激活族、初始化及层级学习率纳入联合空间具有根本性增益;而 BO 进一步挖掘出了 0.15~0.36 dB 的极限性能提升。
  • NeRF 中的反直觉解耦与层级学习率:在 NeRF 任务中,OptiINR 发现浅层更适合平滑非周期激活以保证全局粗糙几何体稳定性,深层使用高频周期激活捕获视点依赖高频;同时浅层配置较大初始学习率以加速粗几何对齐,深层配置较小步长以稳定纹理微调。

亮点与洞察

  • 将 INR 配置确立为严谨的全局黑盒优化问题:改变了学术界依赖“单一激活函数通吃全部网络层”的陈旧思维定式,证实不同网络层承担差异化频段表征,异质激活组合能带来显著收益。
  • Matheron 规则极速采样解耦计算瓶颈:通过将昂贵的核矩阵求逆降维为单次操作,把原本不可行的精确蒙特卡洛经验期望提升(EEI)落地为轻量调度模块,BO 耗时较网络训练完全可忽略。
  • 可复用的跨任务层级学习率启示:浅层大步长锁定拓扑轮廓、深层小步长雕琢细微特征的自适应分布,可广泛迁移至 3D 高斯泼溅与隐式表面重构等其他连续神经场建模任务。

局限与展望

  • 单信号针对性优化的单次搜索代价:每次面对全新的输入信号均需启动 130 次完整的端到端训练与评估,对于急需即时渲染或实时流式传输的下游场景而言冷启动计算预算较高。
  • 离散层级与网络宽度未纳入弹性搜索:当前实验固定了网络深度为 4 层(NeRF 为 8 层)及 256 隐藏通道,未实现层数与通道维度的联合超网蒸馏或弹性扩展。
  • 未来改进路径:将 OptiINR 的混合优化框架与 Meta-learning(如 MetaSDF 类型的元初始化学习)深度结合,利用元先验高斯过程在数次采样内快速命中全局最优超参数,兼顾极限性能与收敛速度。

相关工作与启发

  • vs SIREN / WIRE / FINER: 该类工作专注于手工推导并全网部署单一特化激活函数及固定初始化;OptiINR 揭示出单一激活无法兼顾网络浅深各层的差异化频谱表征需求,全局混合搭配显著优于单一激活手工方案。
  • vs MIRE (CVPR 2025): MIRE 通过贪婪逐层字典学习选择激活函数,因忽视了层间强耦合性而陷入局部次优;OptiINR 采用全局联合向量形式化与贝叶斯优化,理论与实验上均证明了打破逐层贪心局限的必要性。
  • vs MetaSDF / Meta-SparseINR: 元学习旨在从信号分布中学习可快速微调的权重初值权重空间;OptiINR 则专注于架构与超参数空间的全局拓扑配置,两者属于互补维度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将激活族、初始化和层级超参数全维度形式化为混合变量贝叶斯优化问题并打破逐层贪婪限制。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 1D/2D/3D/PDE/NeRF 五大连续信号模态,消融实验严格剥离了空间与搜索算法的贡献。
  • 写作质量: ⭐⭐⭐⭐⭐ 数学推导严谨自洽,对 Matheron 规则与 EEI 的理论分析与实验设计条理极为清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为解决连续坐标网络长久以来的容量-收敛折中瓶颈提供了极具可复用性的范式工具与开源框架。