跳转至

Video Generative Models as Geometry Learner

会议: ECCV2026
论文: ECCV 原文
领域: 3D 视觉
关键词: 单目几何估计、深度与法线联合预测、视频扩散先验、图像重建、零样本泛化

一句话总结

GeoNeXt 把单张 RGB 图像的深度和法线当作视频模型的后续“帧”,同步重建图像与几何,仅用 59K 合成训练样本便在 KITTI 上将统一生成基线 GeoWizard 的深度 AbsRel 从 14.4 降至 8.2,但并非所有指标都优于专用模型。

研究背景与动机

从一张照片恢复几何,需要同时理解物体之间的远近关系和局部表面的朝向。 深度图描述场景沿观察方向的布局,法线图描述每个位置表面的方向,两者相关,却不是可以直接互换的输出。 判别式基础模型通过扩大训练数据和伪标签覆盖面提升跨场景泛化,但精细边界仍可能丢失,而且数据与计算成本较高。 另一条路线是把几何图视作特殊图像,利用已有图像扩散模型的视觉先验,在少量几何标注上微调。 Marigold、Lotus 等路线说明生成先验对稠密预测有用,不过为深度和法线各维护一个模型,会错过联合建模机会。

统一模型也不是简单共享参数就足够:若为了跨任务通信而明显改造图像生成骨干,微调任务与原始预训练的距离可能增大。 GeoWizard 和 Orchid 是作者讨论的联合生成参照,论文将额外结构或更广泛重训练视为迁移成本的重要来源。 GeoNeXt 的切入点不是再加一个专用几何解码器,而是寻找原本就具有跨槽位交互能力的预训练架构。 视频扩散模型已经学过在多个帧之间传播内容与结构,其时间注意力可以被重新用来连接 RGB、深度和法线。 这里的“时间”是可复用的架构关系,不意味着三种模态真的是同一场景在三个时刻的观测。

作者进一步提出,只给几何提供 RGB 条件还不够,也应让网络沿同一去噪轨迹重建 RGB。 这样,图像细节不只是外部提示,也成为模型在联合输出空间中必须保留的内容。 这是一个可由去掉图像重建分支的实验检验的设计假设,而不是已被严格证明的几何定律。 核心 idea:将 RGB、深度、法线组织成联合去噪序列,复用视频模型的跨帧先验,让图像重建帮助几何预测保留细节与跨模态一致性。

方法详解

整体框架

GeoNeXt 的输入是一张 RGB 图像,最终输出为对应的深度图和表面法线图。 训练时还需要配对的深度和法线真值;测试时不需要这些真值,也不需要输入视频。 系统依次采用“几何序列化”“潜空间条件适配”和“图像几何同步重建”。 基础模型是 Stable Video Diffusion(SVD),图像 VAE 保持冻结,只微调去噪 U-Net。 固定的 RGB 潜变量提供条件,另一份待去噪的图像潜变量则和深度、法线一起参与重建。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
        INPUT["单张 RGB"] --> SEQUENCE["几何序列化"]
        SEQUENCE --> ADAPT["潜空间条件适配"]
        ADAPT --> JOINT["图像几何同步重建"]
        TRUTH["配对 RGB / 深度 / 法线"] -.->|仅训练监督| JOINT
        JOINT --> OUTPUT["解码深度与法线<br/>丢弃生成图像"]

图中顺序表示数据组织与计算流程,不表示先训练一个模块、再独立训练下一个模块。 训练真值经冻结 VAE 编码并加噪,成为去噪输入及对应重建目标;推理改为从随机噪声开始。 所谓后续帧预测也不是先完整生成深度、再将深度喂给法线模型,而是同一序列内的同步去噪。

关键设计

1. 几何序列化:用已有帧槽承载相关几何模态

传统单任务扩散深度估计只需学习“给定图像,生成深度”,法线则另建模型。 GeoNeXt 将干净目标组织为图像、深度、法线三个槽,使同一去噪网络同时看到它们的相关结构。 第一个槽重建输入图像,后续槽承载深度与法线,因此沿用的是图像到视频的序列组织方式。 这种组织保留视频模型现有的跨帧通信路径,不需要把不同几何目标交给互不相通的生成器。 时间注意力在这里承担跨模态信息传递,让物体边界、表面朝向和远近布局在共享表示中相互约束。 这种约束来自学习到的表示与联合目标,并没有显式求解深度梯度和法线之间的解析关系。

槽位次序并不应被误读成物理因果关系,论文也专门交换了深度和法线的位置。 表 4 中两种顺序整体接近,例如 ETH3D AbsRel 为 5.5 与 5.6,而非所有数值完全相同。 NYUv2 深度 AbsRel 则为 5.7 与 5.3,说明“顺序灵活”仍带有一定指标变化。 因此较稳妥的理解是,网络不强依赖某一种深度与法线排序,但训练和推理仍需遵循所选配置。 这不支持任意改变槽位数量或随意添加新模态;这些扩展需要另行训练与验证。 单任务消融进一步检验共享是否有益,而不是仅凭三槽设计就假定多任务必然提升性能。

2. 潜空间条件适配:保留空间对齐的 RGB 条件,去掉 CLIP 分支

RGB、深度和法线都由冻结的图像 VAE 编码,联合扩散发生在压缩潜空间,而非原始像素空间。 深度本来是单通道,因此先复制为三通道以适配 RGB 编码器,解码后再对三个输出通道取平均。 正文说明对深度值进行归一化,并通过线性映射将输入调整到 VAE 的范围。 将归一化标量记为 \(u\),这一步的关系为:

\[ u_{\mathrm{VAE}}=2u-1,\qquad u\in[0,1]. \]

法线同样以图像形式进入 VAE,但缓存没有清晰交代全部坐标约定和归一化细节,不能据此补出完整复现协议。 这种统一编码便于复用生成器,同时也意味着几何细节必须通过原本为图像训练的压缩表示。

在条件侧,输入 RGB 的干净潜变量被复制到各个槽位,并与待去噪潜变量沿通道拼接。 它在整个去噪过程中保持固定,提供逐位置对应的外观结构,而不只是全局语义提示。 原始 SVD 还可通过 CLIP 图像嵌入和交叉注意力提供条件,GeoNeXt 禁用了这一路。 作者的理由是 CLIP 输入所需的缩放可能破坏几何结构,不利于细致的深度和法线预测。 表 3 的改动收益较小,因此证据支持“在该配置下不需要 CLIP 条件”,不能推出所有语义条件都会损害几何估计。 保留下来的时间注意力仍负责跨槽交互,去掉的是 CLIP 条件路径,而不是所有注意力机制。

3. 图像几何同步重建:让外观与几何沿共享轨迹去噪

如果第一槽仅作为固定条件,网络只需生成几何,就失去了直接重建输入细节的任务压力。 GeoNeXt 额外让图像槽也带噪,并与深度、法线槽一起由 U-Net 预测干净潜变量。 因此系统同时存在“固定的 RGB 条件”和“需要恢复的 RGB 输出”,两者职责不同,不能混为一谈。 图 2 将监督画为图像、深度和法线潜变量各自的重建误差,三种输出共享生成过程。 训练采用 SVD 的 EDM 预条件化去噪方式,而不是增加一个独立训练的几何一致性判别器。 由于缓存中的若干公式损坏,此处不猜写完整 EDM 权重、预条件化系数或精确总损失。

测试时,图像、深度、法线三个待生成潜变量都从标准高斯噪声初始化。 输入 RGB 只编码一次作为固定条件,各步去噪同时更新三个输出槽,直到得到最终潜变量。 随后丢弃生成图像,只解码并返回几何结果;重建图像是帮助预测的辅助输出,而不是需要交付给用户的新照片。 默认用 5 个去噪步骤,并对 5 个不同随机种子的预测进行集成。 不同种子及集成意味着推理成本不等同于单次前向传播,文中的单步结果属于另一种成本配置。 去掉图像重建后,NYUv2 深度和法线同时变差,是支持该联合生成设计的最直接消融证据。

一个完整示例

以一张包含椅子与墙面的室内 RGB 图像为例,以下是依据方法组织的说明性流程,不是额外实验。 训练时,图像、深度真值和法线真值被分别编码,组成三个带噪目标槽。 同一 RGB 的干净潜变量复制为条件,帮助模型定位椅背边缘和墙面区域。 网络既要恢复这些区域的颜色结构,也要在几何槽恢复远近关系与表面方向。 测试时没有几何真值,三个输出槽全部换成随机噪声,固定 RGB 条件仍来自原图。 经过 5 步联合去噪并完成 5 次随机种子预测的集成,模型交付深度与法线,生成图像不作为最终结果。 这个例子说明辅助图像重建为何仍发生在推理中,而不是训练结束后就删掉该槽。

损失函数 / 训练策略

训练仅更新去噪 U-Net,冻结 VAE,采用 Adam,学习率为 \(5\times10^{-6}\),并使用随机水平翻转。 Hypersim 从约 54K 官方训练样本中筛除不完整数据,保留约 39K,输入尺寸为 \(576\times768\)。 Virtual KITTI 2 使用五个城市场景中的四个,约 20K 样本,裁剪为 \(352\times1216\),远平面深度限制为 80 m。 两者合计约 59K,但训练批次以 9:1 选择数据源,即 Hypersim 概率为 90%,Virtual KITTI 为 10%。 这种采样与数据集原始样本数占比不同,训练分布明显偏向室内数据。 深度实现实际工作在视差空间,正文采用的关系为:

\[ d=1/d'. \]

其中 \(d\) 是预测视差,\(d'\) 是对应深度;论文评估的是仿射不变深度,而不是无标定的绝对米制深度。 正文将噪声采样写作 \(p(\sigma)=\mathcal{N}(0.7,1.6)\),但未清楚说明是否指对数噪声变量,不能直接当作可执行采样说明。 主文没有给出足够明确的训练总步数、批大小及全部几何预处理细节,完整复现仍需实现或补充材料。

实验关键数据

主实验

所有测试数据集均未参与本文的几何微调;“零样本”指跨数据集评估,不是完全没有几何监督训练。 下表摘自原文表 1,第 9 页,评估单目仿射不变深度。 AbsRel 是平均绝对相对误差,保留原表百分数尺度,越低越好;\(\delta_1\) 是预测与真值比值误差小于 \(1.25\) 的像素比例,越高越好。 各单元格依次为 AbsRel / \(\delta_1\),两项均按百分数展示;GeoWizard 的星号表示作者复现。

数据集 GeoWizard*,208K Lotus-G*,59K GeoNeXt,59K
NYUv2 5.6 / 96.3 5.4 / 96.6 5.3 / 96.8
KITTI 14.4 / 82.0 8.5 / 92.2 8.2 / 92.6
ETH3D 6.8 / 95.8 5.9 / 97.0 5.6 / 97.2
ScanNet 6.4 / 95.2 5.9 / 95.6 5.9 / 95.8
DIODE 33.0 / 73.5 23.0 / 73.0 22.6 / 74.3

第二张表摘自原文表 2,第 12 页,评估零样本表面法线。 每格为平均角误差(度,越低越好)/ 角误差低于 \(11.25^\circ\) 的像素比例(%,越高越好)。 Lotus-G 此处是法线专用模型,不是上一张表的深度模型;两套专用权重不能视作一个联合模型。

数据集 GeoWizard*,208K Lotus-G*,59K GeoNeXt,59K
NYUv2 18.9 / 50.1 16.6 / 59.4 16.7 / 60.0
ScanNet 17.2 / 53.8 15.1 / 63.8 16.0 / 62.8
iBims-1 19.4 / 62.8 17.2 / 66.3 16.4 / 69.2
Sintel 40.3 / 12.8 33.6 / 21.0 33.0 / 21.5
OASIS 25.0 / 23.7 22.9 / 29.3 22.8 / 30.8

消融实验

下表摘自原文表 3,第 13 页;深度列为 AbsRel(%,越低越好),法线列为平均角误差(度,越低越好)。 统一配置同时预测两类几何,单任务配置只训练对应目标;原表使用 iBims-N 名称,保留不擅自替换。

配置 NYUv2 深度 ETH3D 深度 NYUv2 法线 iBims-N 法线
去掉图像重建 6.5 6.7 17.9 18.5
加入 CLIP 嵌入 5.6 5.8 16.9 16.5
完整模型 5.3 5.6 16.7 16.4
仅深度 5.9 6.4 不适用 不适用
仅法线 不适用 不适用 17.2 17.3

关键发现

相对 GeoWizard,GeoNeXt 在 KITTI 的 AbsRel 降低 6.2 个百分点,\(\delta_1\) 从 82.0% 升到 92.6%,实际差为 10.6 个百分点。 第 11 页正文将后一项提升写成 9.4,与表 1 不一致;这里保留原表并明确指出差异。 图像重建消融使 NYUv2 AbsRel 从 5.3 升至 6.5,法线平均角误差从 16.7 升至 17.9,说明两类目标都受影响。 CLIP 与单任务消融支持所选配置,但没有单独控制预训练规模,不能把全部提升归因于时间注意力。 表 5(第 14 页)在单张 NVIDIA A5000、\(768\times768\) 输入下报告:GeoNeXt 的 \(1\times1\) 配置耗时 1.0 s,\(5\times5\) 配置耗时 10.0 s,参数量均为 1.5B。 两种配置的 ETH3D AbsRel 分别为 5.8 和 5.6;额外采样提高精度,但不能把主结果的质量与单步延迟合并宣传。 NFEs 定义为去噪步数乘以集成次数;报告的时间不含独立模型切换所需的 I/O 开销。

亮点与洞察

复用“帧”作为模态容器比另造几何分支更贴近视频预训练结构,体现的是输入输出组织方式的迁移。 RGB 重建让输入外观进入联合预测目标,表 3 提供了对应证据,而不是仅依赖视觉示例说服读者。 推理中保留辅助槽提醒人们:某个输出即使最终被丢弃,也可能参与生成其他输出所需的中间计算。 联合训练的价值同时体现在误差与模型管理上,但共享一个模型不自动意味着推理最快。

局限与展望

数据效率只针对几何微调:59K 不包含 SVD 已消耗的大规模视频和图像预训练数据,不能理解为总训练成本很低。 表 1 的 DA/DA-V2 数据量为 62.6M,第 10 页正文却写 63.5M,且“近 100 倍”不符合这些数字与 59K 的直接比值;本笔记不沿用该倍数结论。 法线主结果并非全面领先,例如 ScanNet 的 Lotus-G 为 15.1 度,而 GeoNeXt 为 16.0 度;表 2 的 E2E-FT 还达到 14.7 度。 表 2 的 NYUv2 法线阈值比例为 60.0%,表 3 与表 4 的完整配置为 60.2%,原文未解释差异,本笔记分别保留其来源。 缓存若干数学表达式损坏,且未包含文中提及的 WAN/DiT 补充实验,因此无法核验跨骨干结论或完整噪声参数化。 读者可进一步检验显式深度与法线一致性约束能否带来收益,但这是后续研究方向,不是本文已经实现的模块。 绝对尺度恢复、不同相机内参下的稳定性,以及更低采样预算下的精细结构保持,都需要额外评估。

相关工作与启发

Marigold / Lotus:从图像扩散先验迁移到几何预测;GeoNeXt 的区别是联合使用视频帧槽,并将 RGB 也纳入去噪目标。 GeoWizard / Orchid:同样关注联合几何或外观几何生成;本文强调减小架构改动,但主表没有提供与 Orchid 的直接定量比较。 DepthCrafter / Geo4D:利用视频生成先验处理时间一致性或几何重建;GeoNeXt 主要评估单图的跨模态联合预测,不能据此宣称长视频一致性领先。 Depth Anything / DSINE:代表判别式深度或法线模型;比较有助于定位精度,但其训练规模、任务设置和预训练来源并不相同。 可迁移启发是先寻找预训练模型已有的信息交换维度,再将相关稠密目标映射进去,并用消融检查共享是否真正有益。 从实际任务看,本论文更适合归入 3D 视觉,而不是图像生成;生成模型是实现手段,深度与法线是主要交付物。

评分

  • 新颖性: 4/5。把视频槽位改作单图几何模态,并保留图像联合重建,任务重述清晰。
  • 实验充分度: 4/5。覆盖两类任务与多个跨域数据集,也有关键消融,但预训练规模归因与补充结果仍有核验缺口。
  • 写作质量: 3/5。总体流程易理解,但指标提升、训练数据量和部分参数表述存在不一致。
  • 价值: 4/5。为低几何标注预算下的统一稠密预测提供可复用设计,部署仍应权衡采样成本。