跳转至

GaussianLens: Localized High-Resolution Reconstruction via On-Demand Gaussian Densification

会议: ECCV2026
论文: ECCV 2026
领域: 3D视觉
关键词: 3D高斯泼溅, 可泛化三维重建, 按需高斯加密, 局部高分辨率重建, 投影式跨注意力

一句话总结

GaussianLens 以低分辨率图像前馈重建出的全局 3DGS 为骨架,对用户用 2D 掩码框选的兴趣区域额外输入该区域的稀疏高分辨率图像,用一个跨模态网络预测区域内高斯的残差式更新、并按高分辨率像素逐点撒下"像素引导高斯",把局部高清重建从"全局抬高分辨率"变成一次按需前馈——在 RE10K 256→512 与 DL3DV 256→1024 上分别达到 28.54 / 23.74 dB PSNR,比同等条件下的基线高 1 dB 以上,高斯数仅为全局高分辨率方案的 40%。

研究背景与动机

可泛化 3D 高斯预测这两三年把稀疏视图重建做得又快又稳:pixelSplat、MVSplat、DepthSplat 这类方法一次前馈就能从几张图预测出整场景的高斯。但它们的高斯是"结构化"的——通常与输入像素对齐或与体素对齐——结构化方便学习,代价是分辨率均匀:每个像素或体素分到同样多的高斯,想看清细节就只能全局抬高重建分辨率,算力与显存随之爆炸。论文给的两个证据很直观:DL3DV 里的原始视频有 3840×2160,可现有新视图合成工作最多用到 960×540,很多直接默认 256×256;把 DepthSplat 放到 1024×1024 输入上训练,80GB 的 H100 都装不下。另一条路是逐场景优化,原版 3DGS 用 Adaptive Density Control 在高斯欠重建的区域启发式加密,天然得到空间上非均匀的细节,可惜它依赖稠密观测与漫长的离线优化,在快速、可交互的场景里用不上。

而"整场景统一高分辨率"本身往往就是浪费。人的感知是主动聚焦的:在交互式房间扫描里,用户可能只想确认书脊上的书名能不能看清,对地板上有几道小坑并不在意。于是一组错配出现了——一边是全局高分辨率重建无法承受的开销与大量冗余,另一边是用户对少数局部区域细节的真实需求。合理的做法应当让重建在空间上具有不同的细节程度,关键区域花更多高斯,且这些细节最好随用户注意力的转移"按需"补出来,而不是一次算完整场景的高分辨率。

本文因此提出一个新的问题设定:给定一个已由低分辨率图像前馈重建好的全局 3DGS,再给出用户在当前视角用 2D 掩码框出的兴趣区域(region of interest, RoI)以及该区域的一组稀疏高分辨率图像,目标是学一个可泛化的网络把 RoI 内的高斯加密、把细节重建出来,评测只在高分辨率新视图的 RoI 掩码内进行。核心 idea:把逐场景 3DGS 里"克隆加密 + 后续优化"这套启发式过程学成一步前馈的跨模态预测——网络直接回归每个高斯参数该往哪漂,同时把高分辨率像素反投影成"像素引导高斯"预先铺进场景,让网络有真正能承载细节的基元可用。

方法详解

整体框架

输入分两部分:一是低分辨率全局捕获经前馈 3DGS(论文用 DepthSplat)得到的初始高斯重建,二是高分辨率图像以及用户框选的 RoI 在每张输入视图上的 2D 二值掩码。方法先把掩码内的初始高斯(\(\mathcal{G}_{\text{RoI}}\))与一组"像素引导高斯"(\(\mathcal{G}_{\text{pixel}}\))并起来作为待加密对象,为它们构造融合了高斯参数、渲染梯度、渲染残差与多视图图像特征的多模态特征,经一个基于 PTv3 的编码器(其中插入面向图像的投影式跨注意力)编码,最后由 MLP 解码器输出每个高斯参数的残差;更新后的高斯与 RoI 之外的背景高斯取并集,即 \(\mathcal{G}_{\text{final}} = \mathcal{G}_{\text{den}} \cup \mathcal{G}_{\text{bg}}\),得到既有全局结构、又在局部拥有高分辨细节的重建。整条链路只走一遍前馈,不对场景做任何逐场景优化。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["低分辨率图像<br/>+ 已知相机"] --> B["初始 3DGS 重建"]
    C["高分辨率 RoI 图像<br/>+ 2D 掩码"] --> D["像素引导高斯加密"]
    B --> D
    D --> E["多模态残差特征初始化<br/>参数 + 梯度 + 残差 + 投影"]
    E --> F["投影式多尺度跨注意力<br/>图像金字塔逐级融合"]
    F --> G["残差式加密解码器<br/>输出漂移式高斯参数"]
    G --> H["与背景高斯合并<br/>局部高分辨率重建"]

关键设计

1. 像素引导高斯加密:让高分辨率像素直接变成细节的载体

GaussianLens 概念上就是"学出来的克隆 + 精修",可是当放大倍率变大时,只克隆已有高斯远远不够:4× 放大意味着一个初始高斯要独自负责 4×4 个像素的区域,把这么多信息聚合到它身上再映射成高斯参数,是个很难学的任务。消融里也验证了这一点——只加密 RoI 内的输入高斯(input, K×)时,把加密倍率 \(K\) 从 4 提到 16,PSNR 反而从 23.27 微降到 23.25,说明瓶颈不在"克隆多少个",而在"克隆的是谁"。

于是论文直接往场景里注入高分辨率证据:对每张输入视图,凡是落在该视图 RoI 掩码 \(M_i\) 内的像素 \(p_{i,xy}\),都新生成一个高斯 \(G_{i,xy}\)。它的颜色直接初始化为对应像素颜色 \(I_{i,xy}\);3D 位置由该像素的相机射线反投影到"粗重建渲染出的深度"上确定;不透明度与尺度取很小的常数。之后待加密集合变为 \(\mathcal{G}_{\text{init}} \leftarrow \mathcal{G}_{\text{RoI}} \cup \mathcal{G}_{\text{pixel}}\),两者一起送进网络。这样做的意义在于把"稠密外观"变成了可直接优化的基元:网络不必再从少数几个粗高斯里硬挤细节,只需要在此基础上精修与取舍。代价是高斯数量上升(131K → 214K/220K),但相对全局高分辨率方案的 524K 仍然便宜得多;论文还提到可以可选地预测一个存在性掩码来做选择性加密(补充材料 Sec. A.3)。

2. 多模态残差特征初始化:让每个高斯知道自己"渲染错在哪"

网络要预测的是高斯参数该怎么改,那么特征就必须把"当前错在哪"和"图像上哪块信息能纠正它"同时说清楚。每个高斯的初始特征由三部分拼成:高斯参数本身(位置、尺度、旋转、不透明度、颜色);渲染损失对参数的梯度 \(\nabla_{G_j} L\)——它把残差信号直接挂在高斯上,这一思路与 G3R 一致;以及该高斯中心投影到各视图后双线性插值到的图像特征,用来建立 3D 点与 2D 证据的对应。图像侧同样拼了三样:原图 \(I_i\)、预训练多视图特征提取器给出的稠密多视图特征 \(H^{\text{mv}}_i\),以及最关键的重建残差特征——先把初始高斯在输入视图上渲染出 RGB、深度与不透明度 \((\hat{I}_i, \hat{D}_i, \hat{A}_i)\),再与真值图像逐像素作差得到 \(E_i = I_i - \hat{I}_i\),把渲染结果与残差一起拼成 \(H^{\text{recon}}_i = (\hat{I}_i, \hat{D}_i, \hat{A}_i, E_i)\)

这里的取舍是"显式关联"而不是"让网络自己猜":把高斯渲染出来、和图像比、把差值当特征喂回去,等价于给网络提供了一份标注好的空间误差图。消融里这条线也最硬——去掉 \(H^{\text{recon}}\) 后 PSNR 增益从 +1.43 掉到 +1.00,是三类特征里损失最大的一项;去掉梯度特征与多视图特征则分别掉到 +1.27 与 +1.22。

3. 投影式多尺度跨注意力:把局部图像证据按需喂给高斯

要把 2D 图像信息灌进高斯特征,最朴素的做法是全局跨注意力,但它的复杂度对高斯数 × 图像 token 数是平方级,只好退而在瓶颈层对下采样后的 token 做——这恰好丢掉了本方法最想保住的高频细节。论文改用投影式跨注意力(ProjCrossAttn):把高斯 \(G_j\) 的中心 \(p_j\) 投影到每个视图 \(i\),在图像特征上双线性插值取出该点的特征 \(h_{i,j} = H_i[\pi_{P_i}(p_j)]\),再以高斯特征 \(f_j\) 为 query、以 \(\{h_{i,j}\}_{i=1}^{N}\) 为 key/value 做标准交叉注意力:

\[\texttt{ProjCrossAttn}\big((p_j, f_j), \{H_i, \mathbf{P}_i\}_{i=1}^{N}\big) = \texttt{CrossAttn}\big(\{f_j\}, \{h_{i,j}\}_{i=1}^{N}\big)\]

它的好处是只建立"局部对应"——每个高斯只从自己投影到的那些像素取信息——复杂度随高斯数线性增长,因此可以放在高分辨率、未下采样的层上做。为了兼顾不同尺度,方法还构造了 \((H, H^{\frac{1}{2}}, H^{\frac{1}{4}})\) 三级图像特征金字塔,把低分辨率图像特征与下采样后的低分辨率高斯、高分辨率图像特征与全分辨率高斯两两配对,施加在 PTv3 解码器的最后三个 block 上。消融很能说明问题:完全不做跨注意力只有 +0.34,而全局跨注意力更差、仅 +0.33——瓶颈层的全局注意力既丢了分辨率又更贵;单尺度的投影式注意力就已经有 +1.28,多尺度再补到 +1.43。

4. 残差式加密解码器:把"克隆 + 精修"学成一次前馈

拿到最终特征后,每个初始高斯 \(G_j\) 经一个 MLP 解码器 \(\phi_{\text{dec}}\) 映射成 \(K\) 个新高斯,并且全部表达为相对原高斯参数的残差——位置、不透明度、协方差、颜色的漂移量:

\[\hat{G}^k_j = G_j + \Delta\hat{G}^k_j, \quad \{\Delta\hat{G}^k_j\}_{k=1}^{K} = \{(\Delta\mu^k_j, \Delta\alpha^k_j, \Delta\Sigma^k_j, \Delta c^k_j)\}_{k=1}^{K} = \phi_{\text{dec}}(f_j)\]

用残差而不是直接回归绝对参数,等价于让网络只负责"修正量",输出的尺度更可控,也天然贴合"在已有重建上继续优化"的语义。在完整模型中加密因子 \(K=1\) 就够用:因为数量上的缺口已经由像素引导高斯补上了,解码器只需承担精修职责。整个框架因此可以读作逐场景 3DGS 中 "densify-by-clone + 后续优化" 的可学习版本——克隆交给像素引导加密,优化交给残差预测。

一个完整示例

以 DL3DV 的 256→1024(4×)设定走一遍。输入是一组 256×256 的低分辨率全局视图,DepthSplat 前馈预测出约 131K 个高斯,构成初始重建。用户在某一帧上框出一小块区域(比如一扇窗的窗棂),这一笔 2D 选择被反投影回 3D,得到 RoI 掩码与归属 RoI 的那部分高斯 \(\mathcal{G}_{\text{RoI}}\),其余高斯留作背景。同一批视角另有 1024×1024 的高分辨率版本,但只取包住 RoI 的 256×256 裁剪窗使用。对掩码内每个高分辨率像素,方法沿相机射线找到它落在粗重建渲染深度上的 3D 点,放一个新的高斯,颜色取该像素颜色,不透明度与尺度设成小常数——这就是 \(\mathcal{G}_{\text{pixel}}\)\(\mathcal{G}_{\text{RoI}} \cup \mathcal{G}_{\text{pixel}}\) 一起进入 GaussianLens:先为每个高斯拼出多模态特征(参数、渲染梯度、各视图上的投影图像特征;图像侧是原图、多视图特征与渲染残差),PTv3 编码器在三级金字塔上做投影式跨注意力,解码器输出每个高斯的参数漂移。更新后的高斯与背景取并集,最终约 220K 个高斯(相对初始的 131K 只多出约 89K),在 4 倍分辨率的新视图上渲染,RoI 掩码内 PSNR 从 22.31 提到 23.74。对照之下,想在全尺寸 1024×1024 上直接做同样事情的 DepthSplat high-res full 连训练都起不来(80GB H100 显存不足)。

损失函数 / 训练策略

监督信号只有一项:让预测高斯在 \(N'\) 个新目标视图上渲染出的图像与真值一致,且只统计 RoI 掩码内的像素,用掩码像素数归一化:

\[L_{\text{MSE}} = \sum_{i=1}^{N'} \text{sum}\big(M_i \cdot \lVert I^i_{\text{pred}} - I^i_{\text{GT}} \rVert_2^2\big) \Big/ \sum_{i=1}^{N'} \text{sum}(M_i)\]

也就是说,掩码之外的重建完全不被监督,模型被明确地训练成"只在被指定的区域里把细节做出来"。超参方面正文只给出可训练参数量 43M、完整模型加密因子 \(K=1\),其余训练细节(网络结构、优化器、多视图特征提取器的具体来源等)论文声明见补充材料 Sec. B.1,本笔记不臆测。效率测量统一在 NVIDIA A6000、batch size 1 下进行:RE10K 设定每步 1.74s / 13.27G 显存,DL3DV 设定 1.67s / 9.46G。值得强调的是训练数据只用 DepthSplat low-res full 预测出的高斯;由于输入只用到高斯参数、不依赖源模型的内部特征,模型可以零样本迁移到其他来源的高斯(见下表)。

实验关键数据

主实验

论文基于 RealEstate10K(RE10K)与 DL3DV 自建了 RoI 新视图合成基准:低分辨率输入统一为 256×256 的全尺寸图像,RoI 的高分辨率图像在 RE10K 上用 512×512、在 DL3DV 上用 1024×1024,实际只取包住 RoI 的 256×256 裁剪;两个设定因此记作 "RE10K, 256→512 (2×)" 与 "DL3DV, 256→1024 (4×)"。指标为 RoI 掩码内的 PSNR / SSIM / LPIPS。

数据集 / 设定 方法 PSNR↑ SSIM↑ LPIPS↓ 可训练参数 训练时间 显存 高斯数
RE10K 256→512 (2×) pixelSplat low-res full 25.94 0.820 0.128 118M 0.89s 14.32G 393K
MVSplat low-res full 26.08 0.832 0.089 12M 0.49s 8.27G 131K
DepthSplat low-res full 27.28 0.852 0.101 120M 0.66s 8.90G 131K
MVSplat high-res full* 27.12 0.862 0.085 12M 1.15s 25.91G 524K
DepthSplat high-res full* 28.26 0.875 0.085 120M 2.03s 32.66G 524K
DepthSplat high-res crop 24.38 0.759 0.161 120M 0.78s 8.90G 131K
Ours 28.54 0.876 0.084 43M 1.74s 13.27G 214K
DL3DV 256→1024 (4×) DepthSplat low-res full 22.31 0.652 0.286 120M 0.91s 8.15G 131K
DepthSplat high-res full* 80GB H100 亦 OOM 120M
DepthSplat high-res crop 19.51 0.571 0.352 120M 0.87s 8.10G 131K
Ours 23.74 0.721 0.225 43M 1.67s 9.46G 220K

带 * 的 high-res full 变体额外使用了全尺寸高分辨率上下文图像,属于信息特权,不与本文严格可比。时间与显存为 batch size 1 在 NVIDIA A6000 上的单步训练开销,不是推理延迟。

零样本泛化(模型只见过 DepthSplat 预测的高斯,直接喂其他来源):

数据集 输入高斯来源 输入 PSNR / SSIM / LPIPS 加密后 PSNR↑ SSIM↑ LPIPS↓
RE10K 256→512 DepthSplat low-res full 27.28 / 0.852 / 0.101 28.54 (+1.26) 0.876 (+0.024) 0.084 (-0.017)
pixelSplat low-res full 25.94 / 0.820 / 0.128 27.09 (+1.15) 0.844 (+0.024) 0.108 (-0.020)
MVSplat low-res full 26.08 / 0.832 / 0.089 27.32 (+1.24) 0.853 (+0.021) 0.087 (-0.002)
DL3DV 256→1024 DepthSplat low-res full 22.31 / 0.652 / 0.286 23.74 (+1.43) 0.721 (+0.069) 0.225 (-0.061)
per-scene optim. 22.34 / 0.659 / 0.291 24.46 (+2.12) 0.742 (+0.083) 0.225 (-0.066)

消融实验

全部在 DL3DV 256→1024 设定下训练与评测,括号内为相对该设定初始高斯(PSNR 22.31)的增益。

组别 配置 PSNR↑ SSIM↑ LPIPS↓ 说明
加密来源 input, 4× 23.27 (+0.96) 0.695 0.260 只加密 RoI 内输入高斯,\(K=4\)
input, 16× 23.25 (+0.94) 0.697 0.260 \(K\) 提到 16 不再有增益
pixel 22.97 (+0.66) 0.694 0.248 只加密像素引导高斯
Ours (both) 23.74 (+1.43) 0.721 0.225 两类高斯一起加密
初始特征 no gradient 23.58 (+1.27) 0.713 0.233 去掉梯度特征 \(\nabla L\)
no recon. 23.31 (+1.00) 0.705 0.238 去掉渲染重建残差特征
no multi-view 23.53 (+1.22) 0.710 0.235 去掉多视图特征
跨注意力 no attention 22.65 (+0.34) 0.664 0.273 完全不做图像跨注意力
global 22.64 (+0.33) 0.663 0.274 全局跨注意力(瓶颈层)
last block 23.59 (+1.28) 0.716 0.230 仅最后一个 block 做投影式注意力

关键发现

  • 相对初始低分辨率高斯稳定涨 1 dB 以上:RE10K 上 +1.26 dB(27.28→28.54),DL3DV 上 +1.43 dB(22.31→23.74),说明高分辨率观测确实被有效利用了,而不是被均匀分辨率架构浪费掉。
  • 和不公平基线也能打平甚至反超:RE10K 上 DepthSplat high-res full 享有全尺寸 512×512 上下文图像,PSNR 28.26 仍略低于本文的 28.54,而本文只用了 40% 的高斯预算(214K vs 524K)、约 1/3 的可训练参数(43M vs 120M)、更短的训练步时(1.74s vs 2.03s)与不到一半的显存(13.27G vs 32.66G)。DL3DV 4× 设定下该基线直接 OOM,均匀分辨率路线的可扩展性问题被摆到台面上。
  • "裁剪 + 高分辨率输入"不是可行的替代high-res crop 在每个数据集上都最差,DL3DV 上 19.51 甚至比低分辨率基线 22.31 还低 2.8 dB。原因是局部裁剪之间重叠小、内容偏心,单靠它们学不出可靠的多视图几何;初始高斯提供的粗糙 3D 骨架才是把信息聚合起来的关键。
  • 像素引导与输入高斯是互补而非替代:只加密输入高斯 +0.96、只加密像素引导高斯 +0.66,两者合起来 +1.43;而且 K 从 4 加到 16 没有收益(23.27→23.25),说明继续克隆同一批粗高斯是死路。可视化也显示,更新后的输入高斯更多充当粗糙背景,锐利细节主要由像素引导高斯渲染出来。
  • 显式渲染残差是最值钱的一类特征:三类初始特征里,去掉重建残差特征损失最大(+1.00),明显大于梯度特征(+1.27)与多视图特征(+1.22)。这与"先渲染、再与图像比对、把差异当输入"的设计意图一致——有效残差学习的前提是先把高斯和图像显式关联起来。
  • 跨注意力的形式比"有没有"更重要:不做注意力 +0.34,做全局注意力 +0.33,几乎一样差;只有投影式(局部)注意力才把增益拉到 +1.28,多尺度再补到 +1.43。
  • 初始化越好,收益越大:在 DL3DV 上把输入换成逐场景优化得到的高斯,本文的增益从 +1.43 扩大到 +2.12(22.34→24.46),说明方法是"放大器"而非"修复器"。

亮点与洞察

  • 把"高分辨率"从一个全局预算问题改写成一次局部按需操作:以往要在高分辨率下重建就得全局承担代价,本文让用户用一笔 2D 掩码决定"哪里值得花算力",这在交互式捕捉、电商商品查看、文档/标牌识别等场景里是很自然的交互原语。问题设定本身比方法更具启发性。
  • 源无关(source-agnostic)是关键工程优势:Generative Densification 一类方法必须消费基础前馈模型的 latent 特征并与之联合微调,本文只吃高斯参数本身,因此能直接套在 pixelSplat / MVSplat 甚至逐场景优化产出的高斯上(后者还能把增益放大到 +2.12)。这种"不假设上游是谁"的设计让方法更容易被实际系统插进去。
  • 像素引导高斯的初始化几乎零成本却很有效:颜色直接取像素色,位置用相机射线与粗渲染深度的交点反投影,不透明度与尺度取小常数——三步就构造出成千上万个带稠密外观的基元,把"细节从哪来"这个难题从网络转移到了数据上。它同时也解释了为什么 \(K=1\) 够用:数量由像素补齐,网络只需修正。
  • "把渲染残差当特征"是个可复用的 trick:在增量式/编辑式重建里(先有粗结果,再局部升级),"渲染出来 → 与观测作差 → 把差值编码回网络"比让网络从零推断误差更稳,这一点与 G3R 用渲染梯度的思路同源,但本文把它和多视图图像特征拼在了一起。
  • 可迁移的方向:同一套"低分辨率骨架 + 局部高分辨率证据 + 残差式前馈加密"的思路可以搬到在线/流式重建(用户边看边指定区域升级)、大场景城市级重建的按需细化、以及编辑场景后的局部重渲染。

局限与展望

  • 作者承认的局限:模型被设计为在粗糙初始重建的基础上增强细节,不负责修复初始重建里已经存在的灾难性几何错误。作者提出的未来方向是:从高分辨率观测中提取新的几何线索,反过来救回低分辨率阶段的重建失败——这实际上是要求模型同时具备"纠错"能力,而不仅是"加密"。
  • 评测只覆盖两个放大倍率:RE10K 是 2×、DL3DV 是 4×,中间与更高倍率(如 8×)没有数据;而像素引导高斯的数量随倍率平方增长,更高倍率下的高斯预算与显存开销会怎样,论文没有给。
  • RoI 的生成方式与真实用户交互有差距:论文的 3D RoI 是从上下文视图采样 2D 裁剪再反投影得到的(细节见补充材料 B.4),并不等价于用户在任意当前视角上自由框选;掩码边界与 RoI 尺度对结果的影响没有单独消融。
  • 高分辨率图像是"同一场景的成对捕获":数据集里的高分辨率与低分辨率观测来自同一次拍摄,视角、曝光、光照一致。真实使用中用户为了看清细节往往要走近再拍一张,会带来视角分布、运动模糊与曝光差异,论文没有评测这种域差。
  • 收益依赖初始质量:零样本迁移时,在 pixelSplat / MVSplat 上的增益(+1.15 / +1.24)低于在原生 DepthSplat 上(+1.26),而逐场景优化初始化能带来 +2.12——这说明方法的收益上限受制于初始重建,若初始几何整体偏掉,局部加密也救不回来(与作者承认的局限一致)。
  • 训练开销并非免费:单步训练 1.67–1.74s、9.5–13.3G 显存,比低分辨率基线(0.49–0.91s)高,因为要处理高分辨率输入。相对"全局高分辨率重建"仍然是划算的,但相对"只做低分辨率"就是额外成本,是否划算取决于应用是否需要局部细节。

相关工作与启发

  • vs DepthSplat / pixelSplat / MVSplat:它们都是单遍、均匀分辨率、像素或体素对齐的高斯预测器,想提升细节只能全局抬高分辨率。本文不改动它们,而是把它们的输出当作骨架,在其上做局部加密,因此能利用高达 1024×1024 的观测——这是这些模型自身扩展不上去的。
  • vs Generative Densification (GD):GD 是最接近的工作,同样想解决均匀分辨率的问题,但它必须消费基础前馈模型的 latent 特征、针对基础模型定制并联合微调,输出仍是整场景的单遍 image-to-Gaussian 预测。本文直接以高斯为输入、不假设来源,并且能只在指定局部区域内加密。
  • vs 3DGS 的 Adaptive Density Control:两者都在"欠重建区域加密"这一直觉上,但 ADC 是启发式规则(梯度阈值 + 分裂/克隆),需要稠密观测和逐场景离线优化;本文把它学成一个一步前馈的预测,并额外用像素引导高斯解决了大倍率下"克隆谁"的问题。
  • vs 多尺度 / 层次化 3DGS(层次化 3DGS、Octree-GS、FLOD 等):它们也在做空间变化的细节程度,但 LOD 的选择发生在渲染阶段,训练时仍要离线优化并存储完整的层级高斯。本文把 LOD 前移到重建阶段,按需生成,不存储整棵层级。
  • vs 超分 / 近景新视图合成(SuperGaussian、Close-up-GS、SRGS 等):这些方法多依赖蒸馏 2D 超分模型并逐场景优化;本文一次前馈完成,代价是不具备生成式的先验补全能力。
  • vs LookCloser:目标最接近——同样想利用局部高分辨率观测同时保留全局结构,但 LookCloser 是指频域感知的辐射场 + 逐场景优化,本文走可泛化高斯路线,速度快但受限于初始重建质量。

评分

  • 新颖性: ⭐⭐⭐⭐ 问题设定(按需局部加密)是新的,且切中均匀分辨率架构的真实瓶颈;方法组件多为已有思路的组合与改造,但像素引导加密这一处是实打实的原创机制。
  • 实验充分度: ⭐⭐⭐⭐ 两个数据集、公平与特权基线的完整对比、三组消融(加密来源 / 初始特征 / 注意力形式)加零样本跨源泛化,证据链完整;不足是只有 2× 与 4× 两个倍率,且 RoI 生成与真实交互存在分布差。
  • 写作质量: ⭐⭐⭐⭐ 问题动机(人的主动聚焦)讲得清楚,方法各模块的动机与消融一一对应,公式克制;主要缺陷是关键实现细节推到补充材料,正文难以完全复现。
  • 价值: ⭐⭐⭐⭐ 对"高分辨率重建太贵"这一现实痛点给出了可落地的替代范式,源无关的设计使其容易被现有前馈重建系统采纳;受限之处是它增强而不修复,收益上限绑定初始重建质量。