跳转至

Generalizable Neural Reconstruction of High-Fidelity Surfaces via Sparse Volumetric Representations

会议: ECCV 2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 泛化式神经表面重建, 稀疏体素表示, 占用预测, 体积渲染, 稀疏视图重建

一句话总结

SVRecon 用一个「低分辨率占用预测 + 高分辨率稀疏特征体」的两阶段嵌套结构替换泛化式神经表面重建里昂贵的稠密特征体,在 32GB 显存内把前馈重建的分辨率从 128³ 推到 512³,在 DTU 稀疏视图上给出最平滑、法向一致性最好的表面。

研究背景与动机

以 NeRF、NeuS、VolSDF、Neuralangelo 为代表的神经隐式表示把多视图重建的质量推到了新高度,它们用标定好的图像优化一个 SDF 场并最小化体积渲染损失;3D Gaussian Splatting 一系的 2DGS、Gaussian Opacity Fields 也遵循同样的范式。但这套范式有个绕不开的代价:每换一组视图,整套优化就得从零重跑一遍,既慢又对视图数量敏感——视图一少,精度就明显下滑。泛化式神经表面重建(generalizable neural surface reconstruction, GNSR)正是为消除这个代价而生:VolRecon、ReTR、C2F2NeuS、UFORecon 一类方法在大量场景上预训练之后,面对新场景只需一次前馈推理就能得到场景表示,不再需要任何逐场景优化。它们共享的技术路线是让网络直接从输入图像预测一个稠密的 3D 特征体,再在这个特征体上做体积渲染与回归。

问题恰恰出在这个「稠密」上。稠密特征体的显存开销随分辨率呈立方增长,而表面重建的精度又极其依赖采样分辨率。实测下来,训练时在 batch size 为 1、每条图像采 1024 条光线的相同设置下,VolRecon 和 ReTR 只能跑到 128³,SparseNeuS 勉强到 192³,再往上就直接在 32GB 显卡上爆显存。也就是说,泛化式方法虽然省掉了优化时间,却把代价转移成了「分辨率天花板」,而分辨率天花板直接等于细节天花板。

稀疏化看起来是天然的答案:表面在 3D 空间里是测度为零的集合,真正含表面的体素只占全部体素的百分之几,绝大部分空间是空的。但把表示稀疏化会连带摧毁体积渲染所依赖的一整套稠密假设——光线采样默认沿光线均匀撒点,特征查询默认「给定任意连续坐标就能在规整网格上三线性插值」,特征聚合默认邻居体素按固定偏移排布。已有的稀疏化尝试(SparseNeuS、SuRF)为了绕开这些麻烦,先用一个笨重的前置渲染过程(pre-rendering)估计稀疏性,再在最终的精细渲染阶段把特征体重新稠密化,稀疏化省下的显存又原样还了回去。真正的矛盾是:要高分辨率就必须稀疏,可稀疏表示又没法直接套用现成的稠密渲染流程,于是只能二选一。

本文的切入角度是把稀疏化前移并且做实。既然「体素是否含表面」本身就是一个可以从图像特征预测的二分类问题,那就先在一个便宜的 128³ 稠密网格上把它前馈地预测出来,再只在被判定为占用的体素内部做细分,把分辨率抬到 512³ 并且只在这些位置计算高维特征,最后针对这个不规则表示把光线采样、特征查询和体积渲染三件事逐一重写。核心 idea:用「低分辨率占用预测 + 占用体内超采样」的两阶段嵌套结构,把泛化式重建的显存从与分辨率立方成正比改写成近似与表面面积成正比,从而在普通 32GB 显卡上把前馈表面重建的分辨率推到 512³。

方法详解

整体框架

输入是 M 张已标定位姿的图像,输出是每条光线的颜色与深度,表面则由预测深度图经 TSDF 融合与 Marching Cubes 提取得到——本文不回归 SDF 场,也不直接回归网格,稀疏体素只是承载特征的中间表示,最终几何来自深度图。方法的核心是把原 GNSR 中的场景表示函数 \(F\) 换成一个两阶段的稀疏表示 \(S\)。第一阶段在 \(K=128\) 的稠密体素网格上,为每个体素中心投影取多视图图像特征,用 3D U-Net 预测该体素的占用概率,得到一个只保留约 1.9% 体素的稀疏占用场;第二阶段把每个被占用的粗体素细分成 \(s\times s\times s\) 个小格子(正文取 \(s=4\),整体分辨率即 512³),只在这些小格子上构造高维特征并用稀疏 3D U-Net 聚合,得到稀疏场景表示 \(S\);随后的稀疏体积渲染先让光线只与占用体素求交、只在交点区间内采样,再用预计算的查找表把任意连续查询点映射到对应小体块内做三线性插值,最后用一个 Transformer 沿光线把采样点特征聚合起来回归颜色与深度。作者特别说明不考虑八叉树:变分辨率结构会让体积渲染更复杂,而收益并不明显——单尺度的占用场配合定制的稀疏算子已经够用。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多视图图像 + 相机位姿"] --> B["占用预测网络<br/>128³ 网格上预测表面体素"]
    B --> C["超采样稀疏特征体<br/>占用体素 4×4×4 细分至 512³"]
    C --> D["稀疏体积渲染<br/>稀疏采样 + 查表插值 + 注意力聚合"]
    D --> E["逐光线深度 / 颜色<br/>TSDF 融合 + Marching Cubes 出网格"]

关键设计

1. 占用预测网络:用一次前馈分类提前扔掉 98% 的空体素

第一阶段要回答的问题是「哪些体素可能含表面」,这件事必须在低分辨率上做,因为它决定了后面所有高分辨率计算的开销。给定场景包围盒,先按 \(K=128\) 把它体素化,对每个体素中心 \(\mathbf{x}\)\(M\) 张视图的投影矩阵将其投到各图像上,双线性插值取出 FPN 特征,再把多视图特征按通道求均值与方差并拼接,作为该体素的原始特征:

\[\mathbf{V}(\mathbf{x}) = \operatorname{MeanVar}\big(\{\mathbf{f}_{I_i}(\pi_i(\mathbf{x}))\}_{i=1}^{M}\big)\]

这一步之所以用均值-方差拼接而不是简单的均值池化,是因为方差通道显式编码了多视图之间的一致性——一个真正落在表面上的体素,其各视图特征应当彼此接近,方差偏小;而纯遮挡或背景区域的视图间分歧会体现为大方差。所有体素特征堆成稠密特征体 \(\mathbf{V}_d\) 后,送进 3D U-Net \(\Psi\) 加一个线性回归头 \(U\) 得到逐体素的占用预测 \(\mathbf{O}\)

监督信号的构造有个容易被忽略的细节:作者不用场景自带的 GT 点云生成占用标签,而是把各输入视图的 GT 深度图融合成点云再用它来标注。原因是原始点云里包含在输入视图中被遮挡的点,这些点从给定图像出发根本不可能被预测出来,把它们当作正样本只会逼网络去拟合不可观测的信息、白白拉低召回。由于空体素占压倒性多数,训练用 \(\gamma=2\) 的 focal loss 来对抗极端的类别不平衡:

\[\mathcal{L}_{fc} = -\sum_{i,j,k} (1-p_{ijk})^{\gamma}\log(p_{ijk})\]

推理时则用一个相当激进的取舍:阈值取 \(\tau=0.1\)(远低于 0.5),再对预测出的占用体素做 \(3\times3\times3\) 的立方膨胀。这么做的理由是两类错误的代价完全不对等——漏掉一个真表面体素会让该处的几何永久丢失且无法在第二阶段补救,而多留一个空体素只是多花一点显存。实验数据显示这个取舍换来了 96.8% 的平均召回,代价是精确率只有 23.0%,即被保留的体素里有四分之三是假的,但这仍然只占全部体素的 1.89%。

2. 超采样稀疏特征体:只在占用体素内部把分辨率抬到 512³

拿到低分辨率占用场 \(\tilde{\mathbf{O}}\in\mathbb{R}^{K^3}\) 之后,本文并不去构造任何高分辨率的稠密网格,而是对每个被判为占用的粗体素在其内部放置 \(s\times s\times s\) 的规整网格采样点,把分辨率从 \(K^3\) 提升到 \((sK)^3\);空体素被整个跳过,不产生任何存储和计算。取 \(s=4\)\(K=128\) 即得 512³,而参与计算的体素数量仍只有粗网格上的那 1.9% 左右。每个细分后的小格子沿用与第一阶段完全相同的特征构造方式(多视图投影 + 均值方差),得到一个 \(s\times s\times s\) 的特征块,作者称之为 mini-volume;所有被占用体素的 mini-volume 堆叠成原始稀疏特征体 \(\mathbf{V}_s\in\mathbb{R}^{N\times C\times s^3}\)\(N\) 为占用体素个数。

真正让这套表示可用的是它的数据结构选择:稀疏体被组织成「一组互不相邻的规整小体块」,而不是一个通用的稀疏张量。这个看似朴素的约定是后面所有稀疏算子的前提——它保留了「体块内部是规整立方体」这一性质,于是块内查询永远可以做标准三线性插值,不规则性被完全隔离在块与块之间的索引层面。特征聚合用稀疏卷积库 torchsparse 的 SparseUNet 完成,它只在占用体素之间传播信息,得到最终的稀疏场景表示 \(S = \Psi_{sp}(\mathbf{V}_s)\)。这样做的收益很直接:显存占用从「分辨率的三次方」变成了「近似与表面面积成正比」,同样的 32GB 显卡因此可以承载高两个数量级的采样分辨率。

3. 稀疏体积渲染:为不规则表示重写光线采样与特征查询

渲染器必须回答两个稠密网格上理所当然、稀疏体上却棘手的问题:光线往哪儿采样,以及任意连续坐标上的特征从哪儿取。第一个问题靠稀疏光线采样解决:由于只有占用体素内的采样点有意义,算法先求光线与所有占用体素的交集,把采样限制在这些交点区间构成的「光线片段」内,而不是像稠密方法那样在整条光线上均匀撒点。这既避免了在空区域内浪费采样预算,也让同样的光线数能覆盖更多有效区域。

第二个问题靠一张查找表解决。稀疏体在内存中的排布是不规则的,直接按坐标随机访问无从下手;本文预计算一个稠密查找表 \(H\in\mathbb{R}^{K^3}\),把每个粗体素的编号映射到它对应 mini-volume 在内存中的存放顺序。查询一个连续点 \(\mathbf{x}\) 时,先找到包围它的 8 个角点(在 \(512^3\) 的全局坐标下),把每个角点的坐标分解为「\(128^3\) 上的粗体素编号」加上「体素内部 \(s^3\) 尺度的局部偏移」,再用 \(S[H[v^{o}], v^{l}, :]\) 一次性把 8 个角点特征从内存里取出来,最后在角点特征上做标准三线性插值得到 \(\mathbf{f}_{vol}\)。查找表把「不规则稀疏存储」和「规整插值」这两件事解耦:前者的复杂度被压进一次 \(O(1)\) 的表查询,后者则完整保留了稠密网格上的成熟做法。

采样点的特征最后被拼成 \(\mathbf{f}^{r}_i = \mathrm{cat}(\mathbf{f}_{vol}, \mathbf{f}_{proj}, \beta)\),其中 \(\mathbf{f}_{proj}\) 是各视图投影特征的 Transformer 聚合结果,\(\beta\) 是位置编码。渲染函数沿用 ReTR 提出的注意力式体积渲染:引入一个可学习的 token \(\mathbf{f}^{tok}\) 作为 query,光线上的每个采样点特征作为 key/value,注意力权重为 softmax 归一化后的缩放点积,颜色与深度都是这些采样点的加权和。

⚠️ 缓存文本中原文式 (10) 在 PDF 抽取时严重损坏(颜色式与深度式的下标混在一起),上式按论文文字描述还原,具体下标对应关系以原文为准。

一个完整示例

假设某场景的包围盒被体素化为 128³,其中某个粗体素真正含表面,其余大部分为空。

  1. 占用预测:该体素中心投到 3 张输入视图(测试设置)上取 FPN 特征,按通道求均值方差拼成 32 维向量;3D U-Net 给出比如 0.7 的占用概率,大于阈值 0.1,再经 3×3×3 膨胀确认,该体素进入占用集合。
  2. 超采样:该体素被切成 4×4×4 = 64 个小格子,全局分辨率从 128³ 变成 512³。只有这 64 个格子会计算特征,全场景平均只有约 1.9% 的体素进入这一步。
  3. 特征聚合:这 64 个格子以 mini-volume(4×4×4×C)为单位进入 torchsparse 的 SparseUNet,特征只在占用体素之间传播,输出稀疏场景表示 \(S\)
  4. 采样与查询:一条光线先与占用体素求交,只在一段光线片段内撒点。某个采样点 \(\mathbf{x}\) 落在上面那个体素里,算法把它周围的 8 个角点从 512³ 坐标换算成「128³ 体素编号 + 体素内 4³ 局部偏移」,用查找表 \(H\) 取出 8 个角点特征并做三线性插值,得到 \(\mathbf{f}_{vol}\)
  5. 回归与出网格\(\mathbf{f}_{vol}\) 与该点的投影特征、位置编码拼接后送进渲染 Transformer,用可学习 token 做注意力聚合,MLP 回归出这条光线的颜色与深度。所有 15 个 DTU 测试场景的预测深度图做完 TSDF 融合 + Marching Cubes,就得到用于计算 Chamfer Distance 与法向一致性的网格。

损失函数 / 训练策略

占用预测与渲染网络分开训练。占用头用上面的 focal loss(\(\gamma=2\)),标签来自各输入视图 GT 深度图融合出的点云;推理时取 \(\tau=0.1\) 阈值加 3×3×3 膨胀,明确以召回优先。渲染部分沿用泛化式 NeRF 的标准监督,即预测颜色与 GT 颜色、预测深度与 GT 深度的 L1 损失加权求和,\(\alpha\) 为平衡系数,只有存在有效 GT 深度的光线才计入深度项。整体训练用 M=4 视图、640×512 分辨率,测试用 M=3 视图、800×600 分辨率;体素特征通道数 \(C_f = 32\),Adam 优化器训练 16 个 epoch,学习率 \(10^{-4}\)

显存是这套设计的核心约束也是核心证据:第二阶段训练时在 batch size 1、1024 条采样光线、32 个特征通道的设置下占用约 30GB,推理时降到约 12GB。作者指出第一阶段可以完全独立地事先跑完,开销很小,因此显存预算实际上全留给了高分辨率的稀疏特征体——这也解释了为什么 512³ 已经接近这套配置的上限。

实验关键数据

主实验

DTU 数据集上的稀疏视图表面重建(15 个测试场景,每个场景 3 张输入视图,Chamfer Distance 单位与官方一致)。实现细节上 VolRecon、ReTR、UFORecon 用官方代码复现,其余数字取自各自论文:

方法 类别 Chamfer Distance ↓ (mean) Normal Consistency ↑ (AUC@15°)
COLMAP 多视图立体 1.52
TransMVSNet 多视图立体 1.35 9.2
VolSDF 逐场景优化 3.41
NeuS 逐场景优化 4.00
SparseCraft 逐场景优化 1.04 19.1
PixelNeRF 泛化渲染 6.18
IBRNet 泛化渲染 2.32
MVSNeRF 泛化渲染 2.09 11.4
SparseNeuS 泛化表面重建 1.96 12.1
VolRecon 泛化表面重建 1.38 8.4
ReTR 泛化表面重建 1.17 16.3
C2F2NeuS 泛化表面重建 1.11
SuRF 泛化表面重建 1.05 18.9
UFORecon 泛化表面重建 1.00 11.8
SVRecon(本文) 泛化表面重建 1.00 21.0

跨数据集泛化(在 DTU + BlendedMVS 上联合训练,在未见过的 Co3D 上取 10 个场景评测,指标为阈值 0.05 下的 AUC,越大越好):

方法 10 个 Co3D 场景的 [email protected](mean)
MVSFormer++ 0.60
SVRecon(本文) 0.72

另外,训练阶段各方法能承受的分辨率上限(32GB 显存、batch size 1、1024 条光线)为:SparseNeuS 支持 128³ 与 192³,VolRecon 与 ReTR 只支持 128³,本文 128³/192³/256³/512³ 全部支持。

消融实验

在 DTU 上用同一套占用预测结果,改变第二阶段的设置(Chamfer Distance,越小越好):

配置 CD ↓ (mean) 说明
分辨率 @ 128³(1× 超采样) 1.27 相比完整模型掉 0.27
分辨率 @ 256³(2× 超采样) 1.04 相比完整模型掉 0.04
输入视图数 @ 5 0.96 视图更多,优于完整模型
输入视图数 @ 4 0.99 与 3 视图基本持平
基础特征通道 @ 16 1.15 相比 32 通道掉 0.15
完整模型(512³ / 3 视图 / 32 通道) 1.00

关键发现

  • 分辨率是这套方法最大的单一杠杆,但边际收益在递减。从 128³ 提到 256³,Chamfer Distance 从 1.27 直接掉到 1.04(改善约 18%),而从 256³ 到 512³ 只再改善 0.04。这条曲线的形状恰好解释了为什么此前 128³ 的泛化式方法普遍做不出平滑表面——它们卡在曲线最陡的那一段前面。
  • Chamfer Distance 单独用会误导结论。本文与 UFORecon 的 CD 完全打平(都是 1.00),但法向一致性差距巨大(21.0 对 11.8),定性图上 UFORecon 的表面明显更粗糙。CD 对局部几何和点密度不敏感,只看它会把一个表面质量明显更差的方法判成同等水平;本文因此把法向一致性(在 TSDF + Marching Cubes 重建出的网格上算最近顶点法向夹角、统计 15° 以内的 AUC)作为并列的主指标,在这个指标上本文超过了包括逐场景优化方法 SparseCraft 在内的所有对手。
  • 与最近的基线 ReTR 相比,本文在全部指标和全部场景上都更好(CD 1.17→1.00,NC 16.3→21.0),而 ReTR 正是本文渲染部分的基础,这说明提升确实来自稀疏高分辨率表示本身,而不是换了渲染损失或训练策略。
  • 输入视图数越多越好,但收益温和。3→4 视图几乎没变化(1.00→0.99),4→5 视图才降到 0.96。方法在训练时只见过 4 视图,却对 3 视图和 5 视图都工作,这归功于均值-方差式的特征构造天然对视图数不敏感。
  • 特征通道数与显存正相关,缩到 16 通道会掉 0.15 CD,说明 3D 特征的表达能力在这一档还没有饱和,但作者为了给高分辨率腾显存只能停在 32。
  • 占用预测的代价结构很清楚:平均召回 96.8%(几何基本保住),精确率仅 23.0%,约 1.89% 的体素被保留,是理想空间占用率 0.45% 的 4.2 倍。漏检主要出现在场景中无纹理的桌面上——这部分本来就不参与标准评测。换句话说,多花的那 4 倍空间换来的是「几乎不丢表面」这一性质,对于以几何完整性为目标的重建任务是划算的。

亮点与洞察

  • 把「便宜的分辨率」和「昂贵的分辨率」分开:占用预测跑在 128³ 上,网络容量和计算都便宜,甚至可以离线预跑;高分辨率只花在真正需要的地方。这个「粗网格做决策、细网格只在决策为真的地方展开」的分工可以迁移到任何「高分辨率代价高但空间大部分为空」的任务上,比如稀疏体素目标检测、大规模点云补全、城市级场景重建。
  • 用数据结构换算法复杂度:把稀疏体组织成「一组规整小体块 + 一张稠密查找表」,而不是通用稀疏张量,是整篇论文最巧的一处。它让不规则的稀疏存储和规整的三线性插值解耦——一次 \(O(1)\) 表查询之后,块内插值完全复用稠密网格的成熟做法。这比「为稀疏性重新设计一套插值算子」要省力得多,也更容易做对。
  • 两阶段之间的取舍是不对称的,所以阈值应该激进而不是中庸:占用预测的漏检不可恢复、误检只是浪费显存,因此 \(\tau=0.1\) 加膨胀这种「宁可错留一千」的策略在数学上就是对的。把这种代价不对称显式写进推理策略,比调一个 0.5 的默认阈值要清醒得多;多数两阶段管线都值得做一次这样的分析。
  • 法向一致性是稀疏视图重建不可省略的第二指标:CD 打平、NC 差近一倍,这个对比本身就是一条可复用的评测教训——任何以「表面平滑度」为卖点的重建方法都应该报告法向类指标,否则 CD 会把粗糙但点云距离近的结果判成优等。

局限与展望

  • 作者承认的首要局限是对占用预测精度的强依赖:如果占用网格预测错了,后续无论多高分辨率都救不回来,几何会直接缺失或错误。实验中占用网络在大面积无纹理区域和细结构上会失手,根源在于这些区域的 2D 图像特征本身就不可靠,而 3D 表示完全由 2D 特征构造而来。作者认为靠更强的图像特征表示可以缓解。
  • 泛化能力受训练数据分布限制:虽然在未见过的 Co3D 上表现优于同数据训练的 MVSFormer++,甚至在 BlendedMVS 的非物体居中场景上也能工作,但如果输入视图来自相距很远的视点,性能就会下降。作者的建议是增加训练数据的多样性。
  • 背景不被建模:由于稀疏表示只覆盖占用体素,新视图合成结果里没有背景,只能在物体上做渲染。这限制了方法在无界场景上的直接可用性,作者把「泛化到真实无界场景与任意视图数」列为未来工作。
  • 我自己观察到的一点:512³ 是显存上限而不是方法上限。消融已经表明分辨率每提高一档性能都还在涨(尽管边际递减),而作者明确说无法继续提高只是因为显存。同时占用头的精确率只有 23%,意味着 77% 被保留的体素是假的、第二阶段为此付出 4.2 倍于理想的空间开销——占用头的精度甚至比第二阶段的分辨率更有提升余地,而它的提升会直接转化为可承受的更高分辨率。
  • 可改进的方向:把单尺度占用预测换成从粗到细的多尺度预测,减少必须用膨胀来兜底的假阴性;用第二阶段的重建损失回传微调占用头,让「哪些体素值得保留」按重建质量而不是按二分类准确率来优化;以及在工程上引入分块渲染或更省显存的稀疏算子,把 512³ 这个天花板继续往上推。

相关工作与启发

  • vs ReTR:ReTR 是本文方法论上最近的基线,本文的渲染函数(注意力式体积渲染)直接沿用自它。区别在于 ReTR 在 128³ 的稠密特征体上做渲染,而本文用「占用预测 + 超采样」把它换成了 512³ 的稀疏特征体。结果是本文在所有指标、所有场景上都优于 ReTR(CD 1.17→1.00,NC 16.3→21.0),这也说明性能提升来自表示本身而非渲染公式。
  • vs SparseNeuS / SuRF:这两者同样试图往 GNSR 里引入稀疏性,但路线不同——它们需要先用一个笨重的前置渲染过程推断稀疏性,而且在最终的精细渲染阶段仍然使用稠密化的特征体,稀疏化省下的显存大部分又被还了回去,分辨率因此上不去(SparseNeuS 到 192³ 为止)。本文的稀疏性来自一次简单的前馈占用预测,并且从构造到渲染全程保持稀疏。
  • vs UFORecon:在 Chamfer Distance 上两者完全打平(均为 1.00),但 UFORecon 的表面明显更粗糙,法向一致性只有 11.8 对本文的 21.0。这是个典型的「一个指标看不出差别」的案例:UFORecon 在特征表示上做了改进,而本文在采样分辨率上做文章,只有把几何平滑度纳入评测才能区分两者。
  • vs C2F2NeuS:C2F2NeuS 用级联代价视锥融合来兼顾高保真与泛化,CD 1.11、NC 未在本文表格中报告;本文在 CD 上更好(1.00),且支持的分辨率上限高得多。
  • vs MVSFormer++:跨数据集泛化的主要对手,同样是前馈的、在相同数据集上训练。本文在 Co3D 上以 0.72 对 0.60 的 [email protected] 胜出。需要说明的是两者并非同一类任务——MVSFormer++ 输出深度图、不做渲染,比较的是下游几何质量,数字高低受各自深度图后处理流程的影响。
  • vs 逐场景优化方法(NeuS / VolSDF / SparseCraft):NeuS 与 VolSDF 每场景独立优化,CD 分别是 4.00 与 3.41,在稀疏视图下远逊于本文;SparseCraft 用立体视觉线索正则化把 CD 压到 1.04、NC 19.1,是逐场景优化里最强的,但本文在 NC 上仍超过它(21.0),且完全不需要逐场景优化——这正是泛化式路线想要证明的事情。

评分

  • 新颖性: ⭐⭐⭐⭐ 稀疏表示本身不算新(SparseNeuS、SuRF 都做过),但「前馈占用预测 + 占用体内超采样 + 定制稀疏算子」这条路线更干净,也确实第一次把泛化式重建的分辨率真正吃到了 512³。
  • 实验充分度: ⭐⭐⭐⭐ DTU 上 CD 与 NC 双指标、占用预测的精度/空间占用诊断、Co3D 跨数据集泛化、分辨率与视图数与通道数三项消融都比较完整;不足是缺少与稀疏化基线的显存/耗时对比曲线,也没有对膨胀核大小、阈值 \(\tau\) 这类关键超参做敏感性分析。
  • 写作质量: ⭐⭐⭐⭐ 两阶段结构和「为什么这样稀疏」的动机讲得很清楚,取舍分析(召回优先、不用八叉树)都有交代;但 PDF 里公式排版较密,抽取后部分式子有损坏,需要对照原文才能确认细节。
  • 价值: ⭐⭐⭐⭐ 在 32GB 单卡上即可复现的 512³ 前馈重建,加上一套可复用的稀疏渲染算子与「粗网格决策 + 细网格展开」的设计范式,对后续的高分辨率泛化式重建工作有明确的参考价值。