跳转至

CARA: Collision-Aware Resolution Adaptation for Multiresolution Hash Encoding Based Image Fitting

会议: ECCV 2026
论文: ECCV 原文
代码: 见论文补充材料
领域: 模型压缩
关键词: 隐式神经表示 (INR)、多分辨率哈希编码、信息均衡化、哈希碰撞、Pixel-Shuffle

一句话总结

针对 Instant-NGP 固定分辨率调度与哈希碰撞导致的参数冗余及容量瓶颈,CARA 通过频带经验熵与碰撞衰减因子量化有效信息量,利用动态规划求解极小化极大信息负载的分辨率方案,并结合可逆 Pixel-Shuffle 降低负载因子,以仅 27.76% 的参数量达到同等保真度,同等参数下提升高达 6.11 dB PSNR。

研究背景与动机

隐式神经表示(INRs)通过连续坐标到信号属性的函数映射重塑了视觉信号处理与表达范式。尽管以 Instant-NGP 为代表的混合网格架构引入了多分辨率哈希编码与轻量级 MLP 解码器,在保持亚毫秒级查询速度的同时大幅加速了收敛过程,但其内在结构依旧沿用了一种与数据完全解耦的静态几何级数分辨率调度。现有多分辨率哈希网格通常从预设的最小与最大分辨率出发,按固定几何比例递增构建层级网格,且为每一层赋予完全相同容量的哈希表。

这种数据不可知(data-agnostic)的分配策略忽略了自然图像在不同频带之间极其不均的信息分布特性。视觉信号在高频与低频区间的信息密度存在巨大的个体差异,有的图像纹理密集、高频熵增显著,有的图像则平滑平缓、能量高度集中于中低频。固定的分辨率级数无法动态匹配图像真实的频谱分布,导致在信息匮乏的频段浪费了大量的哈希槽位,而在信息密集的频段又由于网格点急剧膨胀(\(N_\ell^2 \gg T\))产生严重的哈希碰撞冲突,诱发难以逆转的高频细节退化。

更加关键的结构性矛盾在于:现行方案将分辨率调度设计与底层哈希碰撞现象割裂开来,未能在分配分辨率的同时将碰撞导致的有效表征容量衰减纳入考量。当高分辨率层发生严重槽位竞争时,网格顶点的有效检索容量会呈指数级下滑,迫使轻量 MLP 承担过重的残差补偿任务,最终卡死整体重建质量的上限。核心 idea:将多分辨率网格的分辨率分配重构为频带信息均衡化问题,引入均匀哈希碰撞衰减因子量化每层的实际可用信息量,利用动态规划求解极小化极大(min-max)频带有效负载的分辨率调度,并辅以可逆 Pixel-Shuffle 空间重排压低碰撞负载因子,在不扩大哈希表的前提下彻底解除容量瓶颈。

方法详解

整体框架

CARA 建立在 Instant-NGP 的采样与插值信号处理视角之上。对于每个候选分辨率 \(N_f\),其对应的奈奎斯特截止频率为 \(f_{\text{Nyq}} = N_f / (2W)\)。CARA 的核心处理管线包含三个紧密协作的阶段:首先,通过对输入图像施加连续低通滤波并量化残差,计算各频带的经验 Shannon 熵增量,并乘以空间采样数得到频带信息密度 \(\mathfrak{I}(f)\);其次,推导均匀哈希下的有效容量折减因子 \(w^{\mathrm{hash}}\),将二者相乘构建单层有效信息量,通过动态规划以 min-max 准则选出使各层有效信息负载最均衡的网格分辨率序列 \(\{N_\ell\}_{\ell=1}^L\);最后,在模型输入输出端引入可逆的 Pixel-Shuffle 变换,通过降低空间坐标密度将负载因子压缩 \(s^2\) 倍,显著提升高频网格的碰撞效率。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["输入目标图像 Y"] --> B["阶段 1:频带有效信息量量化与碰撞建模<br/>低通滤波测算经验熵增 + 理论推导哈希衰减因子"]
    B --> C["阶段 2:基于 Min-Max 均衡的动态规划求解<br/>最优化频带划分以均衡各哈希层有效信息负载"]
    C --> D["阶段 3:降低负载因子的可逆 Pixel-Shuffle 空间重排<br/>空间压为通道以降低顶点总数与哈希负载因子"]
    D --> E["多分辨率自适应哈希网格与轻量 MLP 解码"]
    E --> F["逆 Pixel-Shuffle 恢复全分辨率高保真图像"]

关键设计

1. 频带有效信息量量化与碰撞建模:量化频谱信息需求并耦合哈希退化

为了告别启发式的几何分辨率设置,必须首先量化不同频带到底承载了多少需要被该层哈希网格表征的“信息量”。对于截止频率为 \(f\) 的低通滤波图像 \(\mathbf{Y}_{\le f}\),CARA 定义带宽增量 \(\Delta f\) 内的频带信息密度为:

\[\mathfrak{I}(f) = H\left(\mathbf{Y}_{\le f + \Delta f} - \mathbf{Y}_{\le f}\right) \cdot N_f^2\]

其中 \(H(\cdot)\) 是对有符号 9-bit 残差信号直方图计算得到的经验 Shannon 熵,代表单位空间样本的新增不确定性(比特/样本),\(N_f^2\) 则为该分辨率下的空间网格样本总数,二者乘积准确充当了该频带的信息预算代理。然而,在哈希表中,当顶点数 \(n_\ell = N_\ell^2\) 超过哈希表物理容量 \(T\) 时,哈希碰撞会导致实际可检索信息量大打折扣。论文在均匀哈希假设下推导出了有效碰撞效率因子:

\[w_\ell^{\mathrm{hash}} = \frac{1 - e^{-\alpha_\ell}}{\alpha_\ell}, \quad \text{其中 } \alpha_\ell = \frac{N_\ell^2}{T}\]

因此,第 \(\ell\) 层哈希网格真正能够被模型利用并解码的有效信息量被严密定义为物理信息与碰撞效率的乘积:\(\mathcal{I}_{\text{eff}, \ell} = \sum_{f \in \mathcal{F}_\ell} \mathfrak{I}(f) \cdot w_{k_\ell}^{\mathrm{hash}}\)。这一设计将图像本身的频谱信息分布与底层硬件哈希表的物理冲突机制建立起数学耦合,为后续的自适应分配奠定了理论基石。

2. 基于 Min-Max 均衡的目标与动态规划求解:规避单频带过载瓶颈

各层哈希网格具有恒定的物理表征上限,由于各层特征通常专门捕获特定频带的信号,整体重建质量往往受到负载最沉重的那一个频带所制约——若某频带的信息量远超该层网格的容纳能力,轻量级解码器便无法完全吸收溢出的残差误差;相反,为低信息量频带分配过高分辨率则白白空耗参数。CARA 将分辨率选择表述为在离散单调候选网格集合 \(\{N^{(k)}\}_{k=1}^K\) 中寻找分割点 \(0 = k_0 < k_1 < \dots < k_L = K\) 的 Min-Max 优化问题:

\[\min_{0 < k_1 < \dots < k_{L-1} < K} \max_{\ell \in [L]} \mathcal{I}_\ell\]

该目标追求每层有效负载的全局最小上界,确保没有任何一层网格被严重挤压过载。由于单调区间的分割天然具备最优子结构性质,CARA 借助动态规划(DP)在 \(O(L K^2)\) 的多项式时间复杂度内求得全局精确最优解。在超大图像(如 10 亿像素级图像 Pluto)上,该预处理求解过程仅需 0.7 秒,几乎不增加整体训练耗时,却让各分辨率层彻底摆脱了盲目调度的低效。

3. 降低负载因子的可逆 Pixel-Shuffle 空间重排:免加表容量下的碰撞抑制

尽管自适应调度优化了各层之间的相对分辨率分配,但在极高分辨率场景下,顶层的网格点数目依然可能远超哈希表大小 \(T\),导致 \(w^{\mathrm{hash}}\) 下降。单纯增大表容量 \(T\) 会带来参数量和显存占用的线性飞涨。CARA 巧妙引入了可逆的 Pixel-Shuffle 变换 \(\mathcal{S}_s\)。给定缩放因子 \(s\),将空间图像 \(\mathbf{Y} \in \mathbb{R}^{h \times w \times c}\) 重新排布为低分辨率、多通道的张量 \(\tilde{\mathbf{Y}} \in \mathbb{R}^{\frac{h}{s} \times \frac{w}{s} \times (cs^2)}\)

经过重排后,INR 模型的坐标输入域在空间两轴均缩减为原来的 \(1/s\),空间顶点数从 \(N_\ell^2\) 大幅降至 \((N_\ell / s)^2\)。在固定哈希表尺寸 \(T\) 的条件下,有效负载因子变为:

\[\alpha'_\ell = \frac{(N_\ell / s)^2}{T} = \frac{\alpha_\ell}{s^2}\]

负载因子降低为原本的 \(1/s^2\),使得原本受制于严重冲突的高分辨率网格的碰撞效率因子 \(w^{\mathrm{hash}}\) 得到指数级的回升。预测完成后,只需施加无损的逆变换 \(\mathcal{S}_s^{-1}\) 即可完美重建全尺寸图像。该模块零参数引入、数学完全可逆,从根本上为高分辨率哈希编码卸去了碰撞负担。

损失函数 / 训练策略

模型采用端到端方式训练,以坐标或 Pixel-Shuffle 后的低分辨率坐标为输入,经自适应分辨率哈希网格查询与双线性插值获得多层拼接特征,输入轻量 MLP 解码。使用 Adam 优化器,超参数设置为 \((\beta_1, \beta_2, \epsilon) = (0.9, 0.99, 10^{-15})\),学习率采用余弦退火(Cosine Annealing)衰减策略。图像拟合的整体优化目标为标准的 \(\ell_2\) 重建均方误差损失:

\[\mathcal{L}_{\text{recon}} = \frac{1}{M} \sum_{m=1}^M \|\mathfrak{f}_\theta(\mathbf{x}_m) - \mathbf{y}_m\|_2^2\]

在候选分辨率池设置上,Kodak 数据集取频域均匀划分的 \(K=30\);十亿像素(Gigapixel)图像与全视野切片图像(WSI)则取 \(K=500\)。低通滤波过程统一采用抗锯齿重采样(Anti-aliased resizing)实现。

实验关键数据

主实验

论文在 Kodak 数据集(24 张 \(768 \times 512\) 图像)、十亿像素级自然图像(Girl、Tokyo、Pluto)以及收集的超高分辨率未压缩病理全切片图像(WSI)上进行了广泛评测。

在 Kodak 数据集(约 207K 参数量)上的主实验结果如下表所示:

方法 表征类型 参数量 (K) PSNR (dB) ↑ SSIM ↑
WIRE [32] 纯隐式 373 37.59 0.9596
SIREN [39] 纯隐式 207 38.70 0.9512
SCONE [22] 纯隐式 207 39.72 0.9662
Instant-NGP [28] 混合哈希 206 37.06 0.9386
NFFB [48] 混合网格 208 38.77 0.9537
NeuRBF [6] 混合网格 207 38.70 0.9488
MetricGrid [46] 混合网格 207 39.73 0.9568
CARA (本文) 混合哈希 205 40.03 0.9714

在超大十亿像素图像(以 Girl 为例,分辨率 \(20000 \times 23466\))拟合中,CARA 更是展现出极强的扩展性与参数效率优势:

方法 参数量 regime 1 PSNR / SSIM 参数量 regime 2 PSNR / SSIM 参数量 regime 3 PSNR / SSIM
Instant-NGP [28] 8.01 M 21.51 / 0.579 32.01 M 27.30 / 0.896 412.8 M 33.05 / 0.959
MetricGrid [46] 8.02 M 27.03 / 0.817 32.02 M 29.70 / 0.957 412.8 M 37.06 / 0.994
CARA (本文) 8.02 M 27.53 / 0.897 114.6 M 37.07 / 0.998 418.5 M 43.37 / 0.999

注:CARA 仅需 114.6 M 参数(即 MetricGrid 412.8 M 设置的 27.76%)便达到了 37.07 dB,在 418.5 M 参数下更以 43.37 dB 超出 MetricGrid 6.11 dB。

消融实验

1. 哈希碰撞衰减因子 \(w^{\mathrm{hash}}\) 的作用消融(Kodak 数据集)

配置 参数量 (K) PSNR (dB) ↑ SSIM ↑ 说明
W.O. Collision Factor (\(w^{\mathrm{hash}} \equiv 1\)) 374 40.32 0.9674 忽略碰撞,仅按纯熵分配分辨率
W.O. Collision Factor (\(w^{\mathrm{hash}} \equiv 1\)) 403 43.97 0.9973 中等容量下出现明显的效率折损
W.O. Collision Factor (\(w^{\mathrm{hash}} \equiv 1\)) 484 47.97 0.9979 需消耗更多参数才能逼近高保真
W. Collision Factor (CARA 完整模型) 205 41.03 0.9714 较无碰撞模型节省近半参数且 PSNR 更高
W. Collision Factor (CARA 完整模型) 341 46.24 0.9906 341K 即超越无碰撞模型 403K 表现 (+2.27 dB)
W. Collision Factor (CARA 完整模型) 471 48.00 0.9987 更低参数下达成最佳保真度

2. 频带信息代理指标(Information Proxy)选择消融(Kodak 数据集)

信息代理选择 低参数规模 (K) PSNR / SSIM 中参数规模 (K) PSNR / SSIM 说明
Instant-NGP 基线 206 37.06 / 0.9386 300 43.88 / 0.9964 启发式固定几何级数调度
MetricGrid 基线 207 39.73 / 0.9568 335 44.51 / 0.9978 经典混合网格基准
CARA + \(\ell_2\) 能量代理 214 38.52 / 0.9504 334 43.60 / 0.9913 能量仅反映平均功率,对信号分布不敏感
CARA + 方差 (Variance) 代理 211 38.74 / 0.9560 331 44.94 / 0.9893 方差无法度量真实的信息编码不确定度
CARA + 经验 Shannon 熵代理 205 41.03 / 0.9714 332 46.63 / 0.9982 严谨刻画码率不确定度,效果最为显著

关键发现

  • 碰撞建模是自适应调度的灵魂:消融表 5 证实,若仅按频带熵增做分辨率划分而忽略 \(w^{\mathrm{hash}}\)(即将碰撞因子强制置为 1),模型在高分辨率端依旧会因严重的槽位重叠而使参数效率大打折扣。加入 \(w^{\mathrm{hash}}\) 后,仅需 205K 参数便击败了无碰撞建模下的 374K 配置,实现了真正的容量自适应。
  • 信息论代理显著优于启发式统计量:消融表 6 显示,将信息代理替换为传统的 \(\ell_2\) 能量或方差会导致 PSNR 下降 1.7 ~ 2.5 dB。这是因为 \(\ell_2\) 能量仅能捕捉像素幅值的二阶统计量,无法反映残差信号的实际信息量(压缩率极限);而经验 Shannon 熵直接度量了最优编码下的平均比特率,与网格参数的表征能力天然对应。
  • 超高分辨率下收益呈放大趋势:在常规 200K Kodak 小图上,CARA 带来约 0.3 ~ 3.0 dB 提升;而在 10 亿像素(Gigapixel)图像与病理切片(WSI)上,CARA 在同等大模型规模下比 MetricGrid 拔高了整整 6.11 dB,并且用 27.76% 的参数即打平 SOTA。这表明分辨率越高,碰撞与信息失衡的毒副作用越强,CARA 的信息平衡机制越发具有不可替代性。

亮点与洞察

  • 信息论与哈希表物理机制的精妙闭环:CARA 没有停留在简单的频域滤波分析,而是从均匀哈希的概率论推导入手,推导出简洁优雅的 \(w^{\mathrm{hash}} = \frac{1 - e^{-\alpha}}{\alpha}\)。将图像内部的信息密度与哈希表的物理负载因子做代数相乘,理论自洽且极具解释力。
  • 零开销的 Pixel-Shuffle 负载重整:利用可逆 Pixel-Shuffle 将空间坐标维度降解为通道维度,直接从物理上令网格顶点数降低 \(s^2\) 倍。不修改模型核心结构、不增加哈希表显存,便将负载因子削减为原本的 \(1/s^2\),这一即插即用(plug-and-play)的思路对各类基于网格的表征(如 3D Gaussian Splatting、NeRF)均有直接的借鉴意义。
  • 构建首个公开无压缩 WSI 基准:敏锐指出既有病理图像基准严重依赖 JPEG 有损压缩、导致高频伪影扭曲高阶表征评测的痛点,开源了首个全尺寸无压缩超高分辨率 WSI 评测集,为超大尺度连续信号表征研究填补了关键空白。

局限与展望

  • 频域滤波的图像全局平稳性假设:当前 CARA 在整张图像上统计全局频带经验熵并统一决定全局各层分辨率,对于“局部极度平滑、局部极其复杂”的强非平稳场景,全局单一的分辨率调度仍可能在不同空间区域引发局部容量浪费或局部碰撞。
  • 三维场景表征的泛化迁移:目前论文的验证集中在二维静态图像拟合与超高分辨率切片上。尽管理论同样适用于 3D 神经辐射场(NeRF)和动态时空信号,但三维空间的视锥采样密度随深度剧烈变化,三维频带滤波与信息熵增的测量需要重新设计高效的投影或体素统计算法。
  • 动态场景下的自适应探索:在视频拟合或实时流式信号下,时序帧间频繁重算 DP 求解调度可能引入计算延迟,未来可研究基于轻量元网络(meta-network)快速预测分辨率调度的加速方案。

相关工作与启发

  • vs Instant-NGP [28]: Instant-NGP 采用与数据解耦的固定几何级数调度,各层哈希表均等分配,导致不同图像在不同频带严重欠拟合或容量冗余。CARA 引入以经验熵为基础的信息均衡准则和 Min-Max 动态规划,使分辨率配置完全自适应于具体输入的频谱分布,在同等参数下显著改善细节恢复。
  • vs MetricGrid [46]: MetricGrid 试图通过自适应度量张量优化非线性网格逼近,但其在超大图像(如 Gigapixel 和 WSI)上面临高昂的参数开销。CARA 证明了只要理顺信息分配与哈希碰撞衰减,无需改变哈希网格结构本身,仅需优化调度与借助 Pixel-Shuffle,就能以 27.76% 的参数打平其最高画质。
  • vs 2D Gaussian Splatting / GaussianImage [58]: 显式高斯图元在较小参数规模下受限于图元密集分裂导致的显存开销,而在超高分辨率下难以兼顾高保真与轻量化。CARA 在混合网格范式内深挖参数极限,471K 参数下的拟合画质即可大幅超越数兆参数的高斯泼溅。

评分

  • 新颖性: ⭐⭐⭐⭐☆ 首次将多分辨率哈希网格的分辨率选取形式化为频带有效信息量均衡的数学问题,碰撞建模与 Pixel-Shuffle 的结合优雅巧妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 Kodak、Gigapixel 自然图以及首创的无压缩病理全切片图像,对比了纯隐式、混合网格、高斯图元等各流派代表作,消融严谨。
  • 写作质量: ⭐⭐⭐⭐⭐ 理论推导清晰完备,从奈奎斯特采样到经验 Shannon 熵再到动态规划与负载因子优化,逻辑环环相扣,实验图表表现力强。
  • 价值: ⭐⭐⭐⭐☆ 为多分辨率哈希编码的参数配置提供了坚实的信息论指导原则,对大尺度视觉信号压缩、NeRF 与连续场表征落地具有重要参考价值。