Diversity-Aware View Partitioning for Scalable VGGT¶
会议: ECCV 2026
论文: ECCV 原文
项目: https://jspark1213.github.io/DA-VGGT
领域: 3D视觉
关键词: 视觉几何Transformer、多视角几何、视角划分、可扩展3D重建、图优化
一句话总结¶
针对视觉几何Transformer在长输入序列中因视点冗余导致注意力稀释与显存爆炸的瓶颈,提出一种免训练的即插即用视角划分框架,通过视觉相异度与软位姿传播驱动的均衡图优化构建高多样性子块,使1000帧超长序列在单卡A100上实现显存下降3.8倍、推理加速6.3倍且重建精度更优。
研究背景与动机¶
多视角视觉几何Transformer(如 VGGT)凭借跨视角全局自注意力机制,能够在一个前向传播中联合回归相机位姿、多视角深度图以及稠密3D点云,打破了传统运动恢复结构(SfM)依赖特征匹配与复杂非线性平差优化的范式。然而,全局注意力机制随着输入帧数 \(N\) 呈二次方复杂度增长(\(\mathcal{O}(N^2)\)),导致模型通常只能在单张80GB GPU上容纳约300帧。针对这一计算瓶颈,现有方案大多采用token剪枝、块稀疏注意力或沿时间戳切片串行推理;但单纯沿时间滑动窗口不仅依赖时间序与闭环检测,还忽略了密集采样序列内在的视点分布特性。
更为致命的现象在于:在实际密集采集场景中,单纯增加输入帧数甚至会导致VGGT的重建质量发生显著劣化。传统SfM中近似重复视角主要带来小基线导致的三角化数值不稳定,而在纯基于注意力机制的VGGT中,视觉冗余帧会引入大量高度相近的token,导致跨视角注意力分布的熵大幅升高,原本用于捕获视差、遮挡与外极几何约束的判别性注意力权重被严重稀释。实验表明,重建失败区域往往集中在视点重复度高的区间,而在视点发散、基线充裕的区域模型表现尤为稳健。
这一现象揭示了扩展几何Transformer的关键并不在于机械地塞入更多图像,而在于如何高效组织与调度视角输入。本文的切入视角是摒弃抛弃或融合token的有损压缩思路,将长序列重构为一个视点互补的子块集合。核心 idea:将视角组织形式化为基于视觉相异度与软位姿空间分散度的组合图划分问题,把全序列划分为视点高度多样化且容量均衡的子块,结合共享锚帧实现免训练、全局一致的高精度可扩展重建。
方法详解¶
整体框架¶
该方法是一个完全免训练、即插即用的推理期框架。整个流程分为初始视觉划分、软位姿传播与视空精炼、独立子块推理以及全局锚帧对齐四个阶段。首先,输入 \(N\) 帧图像由冻结的 DINOv2 特征提取器生成全局视觉描述符,并基于余弦相异度构建初始的多样性得分图,利用局部交换算法将图像分配为 \(K\) 个容量均衡的初始块;接着,选取首块作为参考子块由 VGGT 计算参考相机位姿,并通过视觉相似度加权将几何位姿软传播至其余全部未测帧,计算空间分散度矩阵;随后,将空间分散度与视觉相异度融合,固定参考块并对剩余子块进行图交换精炼;最后,在每个子块前部拼接共享锚帧输入 VGGT 独立推理,通过锚帧的 \(\mathrm{SE}(3)\) 刚体变换将各子块输出拼合至统一的世界坐标系下。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入未排序图像序列<br/>N 帧 RGB 图像集合"] --> B["基于视觉相异度的均衡图划分<br/>DINOv2池化特征 + KL局部交换优化"]
B --> C["基于软位姿传播的空间分散度估计<br/>单块前向锚定 + 跨视角相似度Softmax传播"]
C --> D["联合视空重划分与共享锚帧无缝对齐<br/>综合相异度精炼 + 锚帧SE3闭式坐标对齐"]
D --> E["输出全局一致几何输出<br/>统一相机位姿、多视角深度与稠密点云"]
关键设计¶
1. 基于视觉相异度的均衡图划分:最大化块内视角差异 为了打破密集采集导致的局部冗余并消除二次方注意力开销,算法首先在无位姿先验的情况下依据外观差异重组视角。利用 VGGT 内置的冻结 DINOv2 编码器提取每帧的 \(M\) 个 patch token 并执行均值池化,得到帧级描述符 \(\mathbf{z}_i = \frac{1}{M}\sum_{m=1}^M \mathbf{f}_{i,m}\)。两帧之间的视觉相异度定义为 \(\delta_{ij} = 1 - s_{ij}\),其中 \(s_{ij} = \frac{\mathbf{z}_i^\top \mathbf{z}_j}{\|\mathbf{z}_i\| \|\mathbf{z}_j\|}\) 为余弦相似度。为了将 \(N\) 帧划分至 \(K = \lceil N/c \rceil\) 个最大容量为 \(c\) 的均衡子块中,论文将目标形式化为最大化全量子块内视点相异度总和: $$ \max_{{\mathcal{C}k}} \sum}^K \sum_{i,j \in \mathcal{Ck, i < j} U}, \quad \text{s.t.} \quad |\mathcal{Ck| \le c, \quad \mathcal{C}_k \cap \mathcal{C} = \emptyset $$ 此处初始权重矩阵设为 \(U = \delta\)。求解该 NP-hard 组合优化时,直接求解或添加软惩罚项难以严格维持子块负载均衡。算法采用受 Kernighan-Lin (KL) 算法启发的 2-opt 局部交换策略:从随机均衡划分出发,在成对子块 \((\mathcal{C}_{k_1}, \mathcal{C}_{k_2})\) 之间寻找能够获得最大正增益 \(\Delta_{ij} = (u_{k_2}(i) - u_{k_1}(i)) + (u_{k_1}(j) - u_{k_2}(j)) - 2 U_{ij}\) 的样本对 \((i^*, j^*)\) 进行交换(其中 \(u_k(i) = \sum_{m \in \mathcal{C}_k} U_{im}\))。该交换天然保持各子块尺寸严格相等,且通过贪心交换逐步平抑各块间的多样性落差,使得块内视角基线被最大化拉开。
2. 基于软位姿传播的空间分散度估计:无真值位姿下的空间先验构建 纯视觉相异度无法完全等同于3D空间中的真实视差,在回环或重访场景中,空间位置相近但朝向不同、或外观差异大但处于同一局部的视点往往容易误分。然而在初始化阶段直接计算全部帧的位姿代价过高。为此,算法选取初始划分出的第一个子块 \(\mathcal{C}_1\) 作为参考种子块 \(\mathcal{C}_r\),仅对其调用一次 VGGT 前向传播,获得参考帧的高精度相机位姿 \(\mathbf{p}_i = (\mathbf{R}_i, \mathbf{t}_i)\)。对于所有未进入参考块的帧 \(l \notin \mathcal{C}_r\),利用其与参考块内各帧的高维视觉相似度,通过温度系数归一化的 Softmax 权重进行软位姿插值: $$ \hat{\mathbf{t}}l = \sumr} w} \mathbf{ti, \quad w} = \frac{\exp(s_{li}/\gamma)}{\sum_{j \in \mathcal{Cr} \exp(s $$ 消融实验证实,仅传播相机中心平移向量 }/\gamma)\(\mathbf{t}\) 相比引入旋转能提供更稳定且尺度明确的空间分散度。基于估计出的伪位置 \(\hat{\mathbf{t}}\),构造跨帧空间分散度矩阵 \(\rho_{ij} = 1 - \exp\left(-\frac{\|\hat{\mathbf{t}}_i - \hat{\mathbf{t}}_j\|}{\tau}\right)\),其中 \(\tau\) 为所有样本对欧式距离的中位数,以实现场景尺度的自适应归一化。
3. 联合视空重划分与共享锚帧无缝对齐:免训练全局一致性组装 获得空间分散度先验后,综合视空多样性得分矩阵更新为 \(\hat{U}_{ij} = \delta_{ij} + \epsilon \rho_{ij}\),其中超参数 \(\epsilon\) 权衡外观差异与物理基距。在此基础上,保持已完成位姿预测的参考块 \(\mathcal{C}_r\) 冻结不变,将其余 \(K-1\) 个子块重新通过局部交换优化,使最终生成的每个子块兼具宽广的物理视线基线与丰富的表面纹理互补性。在推断阶段,为每个子块的首位插入一个全局共享的锚帧 \(a\)(默认取帧 0),各个子块独立送入 VGGT 前向推理。由于首帧位姿定义了该子块的局部世界坐标系,第 \(k\) 个子块与参考块 \(\mathcal{C}_r\) 的刚体坐标变换关系可由锚帧位姿直接闭式解析: $$ T_{\text{align}}^{(k)} = \hat{\mathbf{p}}_a^{(r)} \cdot (\hat{\mathbf{p}}_a^{(k)})^{-1} \in \mathrm{SE}(3) $$ 子块内其余所有预测位姿 \(\hat{\mathbf{p}}_i^{(k)}\) 仅需左乘该变换矩阵 \(\tilde{\mathbf{p}}_i^{(k)} = T_{\text{align}}^{(k)} \cdot \hat{\mathbf{p}}_i^{(k)}\),连带将点云与深度图映射至统一坐标系中。全流程无需昂贵的全局光束法平差(Bundle Adjustment),以亚秒级的图计算开销完成无缝拼装。
实验关键数据¶
主实验¶
在 7Scenes 数据集上针对长序列位姿估计的定量评测表明,该方法在大幅降低显存和延迟的同时,保持并提升了相机定位精度。特别是在 1000 帧极端场景下,原始 FasterVGGT 发生显存溢出(OOM),而装配该划分框架后所有模型均能顺利完成推理。
| 输入帧数 | 模型架构 | AUC@3° ↑ | AUC@15° ↑ | AUC@30° ↑ | 显存占用 (GB) ↓ | 推理延迟 (s) ↓ |
|---|---|---|---|---|---|---|
| 300 帧 | VGGT* | 0.2412 | 0.6980 | 0.8269 | 18.76 | 54.16 |
| 300 帧 | VGGT* + Ours | 0.2481 | 0.7020 | 0.8292 | 12.68 | 27.65 |
| 300 帧 | FasterVGGT | 0.1662 | 0.6504 | 0.7992 | 25.18 | 38.87 |
| 300 帧 | FasterVGGT + Ours | 0.1760 | 0.6559 | 0.8024 | 12.98 | 25.99 |
| 300 帧 | LiteVGGT | 0.2234 | 0.6816 | 0.8165 | 16.43 | 15.35 |
| 300 帧 | LiteVGGT + Ours | 0.2068 | 0.6698 | 0.8086 | 10.04 | 9.84 |
| 500 帧 | VGGT* | 0.2359 | 0.6942 | 0.8244 | 28.41 | 149.68 |
| 500 帧 | VGGT* + Ours | 0.2486 | 0.7013 | 0.8286 | 16.99 | 49.09 |
| 500 帧 | FasterVGGT | 0.1628 | 0.6462 | 0.7960 | 40.90 | 93.94 |
| 500 帧 | FasterVGGT + Ours | 0.1758 | 0.6546 | 0.8009 | 15.65 | 42.60 |
| 500 帧 | LiteVGGT | 0.2089 | 0.6691 | 0.8071 | 25.94 | 33.51 |
| 500 帧 | LiteVGGT + Ours | 0.2117 | 0.6736 | 0.8108 | 11.91 | 15.97 |
| 1000 帧 | VGGT* | 0.2201 | 0.6853 | 0.8183 | 69.56 | 584.72 |
| 1000 帧 | VGGT* + Ours | 0.2467 | 0.6998 | 0.8274 | 18.32 | 87.32 |
| 1000 帧 | FasterVGGT | OOM | OOM | OOM | OOM | OOM |
| 1000 帧 | FasterVGGT + Ours | 0.1750 | 0.6534 | 0.7998 | 18.31 | 83.84 |
| 1000 帧 | LiteVGGT | 0.1877 | 0.6198 | 0.7610 | 48.62 | 95.11 |
| 1000 帧 | LiteVGGT + Ours | 0.2083 | 0.6707 | 0.8087 | 13.98 | 31.68 |
消融实验¶
在 NRGBD 数据集上对视角划分策略与多样性线索进行消融分析。结果显示,常规的时间序连续分块或 K-means 聚类导致同块内聚集了高度冗余图像,性能发生雪崩;而基于图优化的视空联合多样性划分显著超越了随机分配与单模态线索。
| 消融维度 | 具体配置方案 | AUC@3° ↑ | AUC@15° ↑ | AUC@30° ↑ | 相对提升 (+Δ) |
|---|---|---|---|---|---|
| 划分策略对比 | 顺序分块 (Sequential) | 0.3524 | 0.6559 | 0.7640 | 基线严重退化 |
| K-means 聚类分块 | 0.3557 | 0.6644 | 0.7733 | 块内同质化严重 | |
| 随机均衡划分 (Random) | 0.6819 | 0.8955 | 0.9412 | 打破局部冗余 | |
| 本文图优化划分 (Ours) | 0.7844 | 0.9411 | 0.9691 | 最优视角组织 | |
| 多样性线索消融 | 随机初始化起点 (Random Init.) | 0.6819 | - | - | 基准起点 |
| 仅引入空间分散度 (\(\rho\)) | 0.7787 | - | - | +9.68 | |
| 仅引入视觉相异度 (\(\delta\)) | 0.7821 | - | - | +10.02 | |
| 视空联合驱动 (\(\delta + \epsilon \rho\)) | 0.7844 | - | - | +10.25 |
关键发现¶
- 视角组织决定有效容量:顺序切片与 K-means 分块之所以失败(AUC@3° 仅约 0.35),是因为它们将外观极度相似的连续帧强行聚在同一个 Transformer 上下文中,直接放大了注意力稀释效应;随机划分打破了连续帧冗余提升至 0.68,而显式多样性图优化进一步跃升至 0.7844。
- 计算时间极度轻量:在 7Scenes RedKitchen 场景中,即使处理 1000 帧序列,相似度计算(0.0098s)、图划分交换(0.3426s)与全局锚帧坐标对齐(0.0286s)加起来不足 0.4 秒,相比 Transformer 前向推理时间(91.7s)几乎可以忽略不计。
- 架构普适性与防退化:在 TUM-RGBD SLAM 评估中,VGGT + 本方法将绝对轨迹误差(ATE)压低至 3.94 cm,相比长序列方案 VGGT-Long(13.44 cm)误差降低 3.4 倍。应用到置换等变架构 \(\pi^3\) 上时,显存从 28.96GB 缩减至 7.95GB 且完全无损 AUC@30° 精度,证明了输入层视角调度的通用价值。
亮点与洞察¶
- 洞察到 Transformer 几何注意力与经典 SfM 数值稳定性的本质差异:传统 SfM 怕短基线带来的矩阵病态,而 VGGT 怕冗余视觉 token 带来的注意力熵发散与梯度信号淹没。
- 采用极简的软位姿传播机制绕过“先有鸡还是先有蛋”的先验困局,无需真值或反复前向,仅用一个种子块的低成本推理即构建出高精度的全局空间分散度指导。
- 架构正交性极佳:完全位于模型外部,不仅能与 LiteVGGT 等模型内 token 合并技术无缝叠加,还能直接赋能 \(\pi^3\) 等其他前向几何大模型。
局限与展望¶
- 作者指出的局限:首块参考帧的选择目前直接取初始划分的第一块,若参考块内部存在剧烈运动模糊或特征退化,可能会影响软位姿插值的准确度。
- 进一步观察到的局限:对大范围极端无重叠轨迹或大尺度动态物体场景,单一共享锚帧可能无法在所有子块中均具有足够的几何重叠区域,可能需要多锚帧或局部回路闭环约束。
- 未来改进思路:可引入主动式参考块置信度评估机制,自适应选取高质量关键帧作为全局锚点集合,并与分层神经隐式表示进一步结合实现超大规模场景构建。
相关工作与启发¶
- vs VGGT / FastVGGT: 原生模型将所有输入帧强制塞入单一长序列,遇到 500+ 帧时显存爆发且精度明显掉点;本文在外部将输入组织为高多样性均衡子块,性能反超全序列。
- vs LiteVGGT / FasterVGGT: 后两者通过网络内部的 token 剪枝或稀疏注意力换取效率,但在长序列上依然面临视角同质化困境;本文从输入侧解耦,与其叠加时显存进一步降至 1/3。
- vs VGGT-Long: VGGT-Long 必须依赖时序滑窗与闭环匹配,无法应对无序图像集;本文采用图论组合优化,支持完全无序的图像集合并获得更低的绝对轨迹误差。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次揭示并严谨分析了冗余视角对几何Transformer注意力稀释的破坏机理,以视空组合图划分重构多视角组织。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 6 个基准数据集、4 大核心几何任务,提供了从 300 到 1000 帧详尽的显存、延迟、消融与多模型跨架构泛化验证。
- 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,由表及里层层递进,方法机制与数学公式严谨自洽,图表信息表达极佳。
- 价值: ⭐⭐⭐⭐⭐ 即插即用且完全免训练,为前向多视角大模型向千帧级大规模长序列真实落地铺平了道路。