Sparse auto-regressive modeling for scene generation from multi-view images¶
会议: ECCV 2026
论文: ECCV 原文
领域: 3D视觉
关键词: 3D场景生成, 自回归模型, 3D高斯泼溅, 稀疏体素隐空间, 掩码预测
一句话总结¶
针对极稀疏、大视差且无约束多视角图像下的完整 3D 场景补全难题,SPAR3S 提出了一种无需真实 3D 监督的稀疏体素对齐 3D 隐式自回归生成模型,结合可微 3D 高斯泼溅渲染与掩码扩散生成,实现了高质量的新视角合成与未观测区域几何外推。
研究背景与动机¶
近年来以 3D 高斯泼溅(3DGS)与前馈多视角立体几何回归为代表的方法,使极少视角下的实时照片级 3D 重建成为可能。然而,现有基于像素对齐的高斯前馈回归方案(如 PixelSplat、DepthSplat)本质上受限于输入图像的可见视锥范围,面对极端视差或严重自遮挡时无法外推未观测内容。另一类尝试引入 2D 多视角扩散模型辅助补全的方法,往往陷入“先验视角依赖”与“几何一致性缺失”的两难困境——在未知场景全局结构前很难预先采样合理的相机轨迹,而 2D 独立生成又缺乏显式 3D 几何约束,导致渲染视角切换时出现严重漂移和闪烁。
直接在 3D 空间进行生成式建模理论上能天然保证多视角多几何一致性,但这一路径长期面临两大核心技术瓶颈:一是密集 3D 体积表征(如密集体素网格)的计算复杂度与显存开销随分辨率呈三次方立方级爆炸,无法扩展到高分辨率大场景;二是真实世界中大规模、高质量的完整 3D 室内外场景真值网格极度稀缺,传统依赖 3D ground truth 监督的生成范式难以泛化。
本文的切入角度是:真实 3D 场景在空间中具有高度稀疏性,且 3D 高斯泼溅具备优秀的可微渲染投影能力。因此,完全可以在仅保留占据体素的紧凑 3D 隐空间中建模场景,并直接利用多视角图像的光度重建误差进行端到端无 3D 真值监督的学习。核心 idea:构建稀疏体素对齐的 3D 隐空间,仅对占据体素编码表征并用可微 3DGS 解码,在此紧凑隐空间上训练结合 Token 级扩散头的掩码自回归 Transformer,以 BFS 区域生长顺序联合预测未观测体素的占据状态与隐式特征,实现自监督的端到端 3D 场景外推生成。
方法详解¶
整体框架¶
SPAR3S 的整体流程分为两个核心阶段:第一阶段是稀疏体素对齐 3D 隐式编解码器(\(E_\theta, D_\phi\)),通过点云初始化过滤空体素,利用几何引导双向交叉注意力抽取紧凑 3D 隐变量,再经上采样与体素级 3D 高斯解码器重建输入视图,全程由可微高斯泼溅的光度误差反传优化;第二阶段是空间稀疏掩码自回归生成模型(\(H_\psi\)),以密集输入编码作为未观测区域真值目标,以极稀疏输入编码作为条件,利用轻量级扩散去噪头与二值交叉熵头,联合推断未知体素的占据概率与连续特征分布。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["极稀疏输入视角图像 + 点图估计"] --> B["稀疏体素隐空间构建<br/>点图空间变换与空体素过滤"]
B --> C["双向交叉注意力编码器<br/>几何引导注意力注入投影匹配"]
C --> D["层次化下采样与紧凑瓶颈<br/>KL散度约束生成连续隐分布"]
D --> E["上采样与高斯解码器<br/>注入假阳性噪声保持稀疏性"]
E -->|可微 3DGS 渲染| F["多视角光度重投影监督<br/>无真实 3D 几何真值参与"]
D -.->|提供条件隐变量| G["掩码自回归扩散生成模型<br/>联合预测占据状态与隐特征"]
G --> H["BFS 区域生长自回归推断<br/>k-NN 拓扑驱动逐层场景补全"]
H --> E
关键设计¶
1. 稀疏体素对齐 3D 隐空间与光度自监督:规避立方计算量与 3D 真值依赖
传统稠密 3D 网格在计算空间上的立方级膨胀是限制 3D 生成分辨率的核心障碍。SPAR3S 从输入点图(由 MASt3R-SfM 估计或深度图反投影得到)提取占据先验,将点图联合平移缩放至归一化体积 \([0, 1]^3\) 内,仅对包含点云的体素实例化查询向量 \(z_{\text{3D}}^0\),而直接抛弃无实体的空体素。为强化 2D 图像特征向 3D 体素的聚合,模型在双向交叉注意力块中引入几何引导注意力: $\(A^{\text{guided}}_{v, p} = \alpha \cdot \sigma(A^{\text{learned}}_{v, :})_p + (1 - \alpha) \cdot \sigma(A^{\text{bincount}}_{v, :})_p\)$ 其中 \(A^{\text{bincount}}_{v, p}\) 统计 3D 体素 \(v\) 在 2D Patch \(p\) 上的投影频次,强行引导注意力聚焦在具有几何关联的物理区域。最关键的是,整个隐空间无需任何点云或 SDF 几何真值监督,解码后的 \(M\) 个高斯基元(默认每个体素分配 \(M=63\) 个高斯)直接经可微渲染器 \(\mathcal{R}\) 投射到输入相机视锥中,通过图像 \(L_2\) 光度重建误差与低权重 KL 散度进行端到端优化。这使得模型既拥有紧凑且几何对齐的 3D 隐表征,又打破了 3D 标注数据的稀缺壁垒。
2. 联合占据预测与 Token 级扩散去噪的掩码自回归:攻克未知拓扑与连续特征建模
在非结构化 3D 场景补全中,未观测区域的序列长度未知且几何拓扑多变,直接使用离散量化(如 VQ-VAE)容易丢失高频视觉细节,而常规自回归模型又无法处理动态空缺空间。SPAR3S 将场景体积划分为占据区 \(\mathcal{F}\)、已知空置区 \(\mathcal{E}\) 以及未观测区 \(\mathcal{U}\),在掩码自回归框架下引入双头架构:Occupancy Head 基于二值交叉熵损失 \(\mathcal{L}_{\text{occ}} = \text{BCE}(\hat{o}_{\mathcal{T}}, o_{\mathcal{T}})\) 判断候选体素是否物理存在;同时,针对连续值 3D 隐向量的分布拟合,设计了轻量级 Token 级扩散去噪网络 \(h_\epsilon\),在去噪步长 \(t\) 和加噪向量 \(z_{\text{mask}}\) 下通过 DDPM 形式的扩散损失进行优化:
$\(\mathcal{L}_{\text{diff}} = \mathbb{E}_{\epsilon \sim \mathcal{N}(0, I), t} \left\| \epsilon - h_\epsilon(z^t_{\text{mask}}, t) \right\|_2^2\)$
此外,模型还引入了带有 stopgrad 的条件特征微调头,使模型在补全不可见区域的同时能够消除极稀疏观测视角自身的残余不确定性,在极低显存代价下大幅增强了连续隐特征的平滑度与真实感。
3. 基于 k-NN 图与 BFS 区域生长的自回归序列优化:保障空间拓扑连贯性
标准的自回归模型通常采用光栅扫描(Raster-scan)等预设线性顺序,这种人为规定的 1D 顺序严重违背 3D 物理场景的连续几何结构,容易在空间边界产生累积误差与结构错位。SPAR3S 提出以已知观测体素为种子节点,基于 3D 欧氏距离构建对称稀疏 \(k\)-NN 邻近图,利用广度优先搜索(BFS)算法计算所有候选体素到已知种子的最短拓扑距离,并以此分配深度层级 \(l(v)\)。推断时,自回归过程沿着图结构由近及远分层展开: $\(P(\mathbf{z}) = \prod_{l=1}^{\max_v l(v)} P\left(\mathbf{z}_{\{l(v)=l\}} \mid \mathbf{z}_{\{l(v)<l\}}\right)\)$ 每一轮迭代先由占据分类头评估当前层级的体素,仅将置信度高于阈值 \(\tau\) 的有效体素加入已观测集合,并对其执行扩散采样生成连续隐特征,空体素则直接剪除。这种由内向外扩散的区域生长机制,既大幅压缩了推断步数,又在局部与全局尺度上最大程度维持了物理实体的几何连通性与纹理一致性。
4. 层次化粗到细上采样与假阳性噪声注入:解决推断误分类与累积误差
在从紧凑瓶颈隐空间恢复高分辨率场景的过程中,解码器需要执行多阶段上采样。如果上采样仅依赖硬分类掩码,一旦前级分类错误将导致信息永久丢失且产生空洞。SPAR3S 在训练上采样阶段引入假阳性噪声注入策略(False Positive Noise Injection):人为引入采样概率 \(\epsilon_{\text{FP}} \approx 25\%\) 的误报噪声,强迫模型在含有虚假体素的输入下仍能恢复准确几何与特征,从而有效对抗测试阶段的阈值误差。同时,在自回归阶段可级联采用粗到细的层次化推断,先在低分辨率网格用高召回率过滤粗几何,再在局部高分辨率网格以高精度阈值提炼细节,实现了生成效率与重构精度的兼顾。
损失函数 / 训练策略¶
第一阶段编解码器训练时,总优化目标为光度重建损失与连续隐空间 KL 散度约束的加权和: $\(\mathcal{L}_{\text{AE}} = \frac{1}{|\mathcal{I}|} \sum_{i=1}^{|\mathcal{I}|} \left\| I_i - \mathcal{R}\left(D_\phi\left(E_\theta(I_i, P_i)\right), C_i\right) \right\|_2^2 + \beta \mathcal{L}_{\text{KL}}\left(\mathcal{N}(\mu_z, \sigma_z) \parallel \mathcal{N}(0, I)\right)\)$ 其中 \(\beta = 0.1\),隐变量通道数定为 32。第二阶段生成模型优化目标则由体素占据分类损失与 Token 扩散损失构成: $\(\mathcal{L}_{\text{GEN}} = \mathcal{L}_{\text{occ}} + \mathcal{L}_{\text{diff}} = \text{BCE}(\hat{o}_{\mathcal{T}}, o_{\mathcal{T}}) + \mathbb{E}_{\epsilon, t} \left\| \epsilon - h_\epsilon(z^t_{\text{target}}, t) \right\|_2^2\)$ 在训练自回归模型时,训练集包含 4 个条件视角与 12 个目标视角,体素掩码率在 \([0.5, 1.0]\) 间随机采样。两阶段模型均可在单张 A100 GPU 上从头训练完成(各约耗时 4 天)。
实验关键数据¶
主实验¶
在极具挑战性的 2 视角无约束宽基线新视角合成评估中(分辨率 \(224 \times 224\)),对比合成室内场景数据集 3DFront 及真实世界数据集 RealEstate10k:
| 数据集 | 方法类别 | 方法 | FID ↓ | PSNR ↑ | SSIM ↑ | LPIPS ↓ |
|---|---|---|---|---|---|---|
| 3DFront | 重建基线 | 3DGS [Kerbl et al.] | 260 | 8.65 | 0.14 | 0.79 |
| 3DFront | 重建基线 | PixelSplat [Charatan et al.] | 165 | 9.07 | 0.18 | 0.67 |
| 3DFront | 重建基线 | DepthSplat [Xu et al.] | 110 | 13.76 | 0.49 | 0.55 |
| 3DFront | 生成基线 | DiffusioNeRF [Wynn et al.] | 229 | 12.80 | 0.19 | 0.73 |
| 3DFront | 生成基线 | MVSplat360 [Chen et al.] | 111 | 9.72 | 0.35 | 0.70 |
| 3DFront | 生成基线 | LatentSplat [Wimbauer et al.] | 180 | 13.92 | 0.33 | 0.61 |
| 3DFront | 本文方法 | SPAR3S (Ours) | 59 | 15.18 | 0.62 | 0.50 |
| RealEstate10k | 重建基线 | 3DGS | 271 | 7.92 | 0.12 | 0.79 |
| RealEstate10k | 重建基线 | PixelSplat | 155 | 13.73 | 0.41 | 0.50 |
| RealEstate10k | 重建基线 | DepthSplat | 82 | 13.25 | 0.46 | 0.41 |
| RealEstate10k | 生成基线 | MVSplat360 | 66 | 15.40 | 0.49 | 0.40 |
| RealEstate10k | 生成基线 | LatentSplat | 53 | 16.09 | 0.48 | 0.39 |
| RealEstate10k | 本文方法 | SPAR3S (Ours) | 41 | 16.72 | 0.57 | 0.36 |
消融实验¶
在 3DFront 数据集上使用 4 个条件视角评估自回归扩散模型中各核心模块的贡献(Tab. 2):
| 配置 | PSNR ↑ | SSIM ↑ | LPIPS ↓ | 说明 |
|---|---|---|---|---|
| SPAR3S (完整模型) | 15.18 | 0.62 | 0.50 | 包含扩散头、3D RPE 与 BFS 区域生长顺序 |
| w/o diff. (去扩散头) | 13.90 | 0.53 | 0.54 | 替换为传统线性分类/回归头,多峰连续分布捕捉能力剧降 |
| w/o 3D RPE (去相对位置编码) | 13.74 | 0.49 | 0.58 | 移除自注意力层中 3D 相对位置编码,空间几何推理退化严重 |
| w/o BFS ordering (随机顺序) | 14.81 | 0.59 | 0.53 | 采用无序或随机自回归预测,破坏了由内向外的拓扑连贯性 |
| w/o occ. refinement (去占用微调) | 14.48 | 0.56 | 0.56 | 移除推断时的分层占用精炼,导致外推边缘产生浮岛或噪点 |
| SPAR3S w/ gt. occ. (Oracle 变体) | 17.90 | 0.68 | 0.45 | 输入完美占据网格,表明几何占据预测是当前最核心提升空间 |
关键发现¶
- 生成式扩散头的决定性作用:将隐变量解码替换为确定性线性回归头(w/o diff.)会导致 PSNR 暴跌 1.28 dB、SSIM 从 0.62 跌至 0.53。这证明在未知不可见区域,由于物理实体具有内在的多解不确定性,扩散去噪机制对于采样合理且高清晰度的连续纹理至关重要。
- 空间结构编码的必要性:移除 3D 相对位置编码(w/o 3D RPE)引起了最严重的指标滑坡(PSNR 下降 1.44 dB,LPIPS 恶化 0.08),证明在稀疏无序点云/体素中显式注入三维相对几何位置先验是 Transformer 理解空间布局的核心基石。
- 占据真值 Oracle 的性能鸿沟:使用真值占据(gt. occ.)时 PSNR 跃升至 17.90 dB,SSIM 达 0.68。这清晰地表明当前瓶颈主要集中在空缺区域的“几何占用存在性判断”,而非隐变量自身的“外观纹理合成”。
- 误报噪声与超参数敏感度:在上采样过程中注入约 25% 的假阳性噪声注入是保证鲁棒性的最优拐点;每个体素分配 \(M=63\) 个高斯基元即可达到收敛边际效益;同时,较紧的瓶颈维度(\(\text{dim}(z)=32, \beta=0.1\))在保留足够表征力的同时提供了最佳的生成正则化。
亮点与洞察¶
- 3D 隐空间与光度端到端自闭环:该设计巧妙绕过了 3D 生成对真值网格(Mesh / Point Cloud)的刚性依赖,利用 3DGS 优异的可微光度投影,仅从 2D 多视角图片就自监督训练出了结构紧凑、具有物理意义的 3D 隐空间。
- 稀疏拓扑与生成算力的解耦:彻底摒弃立方级复杂度的稠密 3D 网格,通过点图过滤只物化并处理占据体素,让自回归与扩散 Transformer 能够在真正的大尺度连续 3D 空间中轻量化运行。
- BFS 拓扑区域生长的自回归设计:将自然语言或 2D 图像中人为强加的栅格扫描顺序,优雅替换为基于拓扑连通性的空间由近及远扩展,契合了 3D 物理世界“实体在空间上连续延伸”的先验规律。
局限与展望¶
- 对初始点图质量的前置依赖:算法初始化严重依赖外部几何估计器(如 MASt3R-SfM)给出的初始点图。在弱纹理大白墙、透明反光材质或极端弱光条件下,初始空体素过滤可能引入误删或粗糙偏差。
- 复杂大场景长距离依赖衰减:在极端大尺度建筑室内遍历时,BFS 区域生长自回归的累积误差依然存在,尚未引入全局拓扑闭环检测机制。
- 多物体交互与高动态场景支持缺失:当前模型针对静态刚性室内场景设计,无法拓展至包含运动物体的动态视差或非刚性变形环境。
相关工作与启发¶
- vs PixelSplat / DepthSplat: 确定性前馈 3DGS 方法在视锥重叠区域具有优秀重建能力,但完全不具备未观测死角的幻觉补全能力;SPAR3S 结合了前馈的高效性与生成式自回归外推能力,2 视角宽基线下的 FID 从 110-165 大幅降至 59。
- vs MVSplat360 / LatentSplat: MVSplat360 在 2D 投影与多视角视频扩散间循环,存在严重的视角不连续与几何漂移;LatentSplat 受制于对极几何编码器,无法应对无重叠视角的极端旋转。SPAR3S 全程在显式 3D 稀疏空间中运行,天然保持了全局几何刚性与相机轨迹任意性。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将掩码自回归与 Token 级扩散成功融合于无需 3D 真值的稀疏体素 3DGS 隐空间中,拓扑区域生长设计极具启发性。
- 实验充分度: ⭐⭐⭐⭐☆ 详尽对比了重建类与生成类 SOTA,并在合成与真实数据集上给出了完整的指标与消融分析;若能补充超大尺度开放室外场景更佳。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,图文对应清晰,架构图与关键消融实验论证充分。
- 价值: ⭐⭐⭐⭐⭐ 为无约束视角、极稀疏条件下的全场景 3D 生成与神经渲染开辟了高实用性、可扩展的新范式。