MV2GF: Multi-view Pedestrian Detection with a Visual Geometric Foundation Model¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://mv2gf.github.io
领域: 自动驾驶
关键词: 多视角行人检测, 视觉几何基座模型, 鸟瞰图, 点云投影, 跨相机泛化
一句话总结¶
针对传统多视角行人检测在未知相机配置下几何感知失效与透视畸变过拟合的瓶颈,MV2GF 引入前馈视觉几何基座模型 Depth Anything 3,通过任务-几何特征金字塔融合与基于度量级 3D 点图的体素特征聚合,消除了阴影式投影畸变并实现了卓越的跨相机泛化能力。
研究背景与动机¶
多视角行人检测(MVPD)致力于从重叠视角的多个摄像头图像中估计鸟瞰图(BEV)下的行人占据图,在智能安防、自动驾驶以及具身机器人导航等高密集遮挡场景中扮演着关键角色。目前主流的深度学习多视角检测范式均遵循自底向上的投影聚合流派:先利用单视角编码器提取 2D 图像特征,借助标定的相机内外参将其投影至 3D 世界空间,再汇聚为统一的 BEV 特征图并预测行人坐标。然而,这类方法高度依赖特定的相机布局先验,当部署到训练集未涵盖的全新相机位姿、拍摄高度或传感器类型时,检测性能往往发生剧烈滑坡。
跨相机泛化受阻的根源包含两个紧密耦合的技术瓶颈。首先是跨视角几何关联的捕捉能力不足:传统方法依赖参数量有限的单视角骨干网络(如 ResNet 或单帧 FPN),仅能从极少数标注场景的相机配置中隐式学习 2D 到 3D 的几何对应关系,一旦相机几何发生显著外推,多视角关联便完全失准。其次是投影机制固有的伪影畸变依赖:现有方法普遍采用单平面透视变换(如 MVDet)或多层单应性变换(如 SHOT),强制将整幅图像的所有像素打到固定的水平切片上,导致行人特征沿着投影光线拉伸出严重的“阴影状”拖尾畸变。以往模型通常利用后续 CNN 强行过拟合这些特定视角下的畸变纹理来定位行人脚底,一旦测试环境的相机配置改变,形变模式彻底偏移,检测网络便彻底失效。
虽然自动驾驶领域的时空 Transformer 能够缓解投影畸变,但它们通常假设相机配置与 BEV 栅格尺度在训练和测试阶段保持严格固定,无法适应拓扑动态变化的监控或路侧场景。本文的切入视角是借力近期在大规模多视角数据上预训练的前馈视觉几何基座模型。核心 idea:利用具备真实尺度度量能力的视觉几何基座模型提取广义跨视角几何表征与逐像素 3D 点图,通过 TGF 模块融合行人语义与几何先验,并利用 FPA 模块将像素特征精准散布到 3D 体素空间,彻底摆脱阴影状透视畸变并实现鲁棒的跨相机泛化。
方法详解¶
整体框架¶
MV2GF 接收多视角 RGB 图像与相机内外参作为输入,输出地面 BEV 行人占据概率图与亚像素偏移量。整个系统由两个核心模块串联驱动:任务特异性与几何信息融合模块(TGF)负责将可学习 ResNet 提取的行人判别性特征与冻结的几何基座模型(DA3)跨视角特征逐层融合;特征点图聚合模块(FPA)则依据 DA3 预测的精确 3D 绝对坐标,将多视角图像特征投影进 3D 体素栅格中进行无畸变最大池化聚合,随后通过卷积头压缩高度维度并输出最终的检测结果。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["多视角图像与相机参数"] --> B["阶段 1:任务特异性与几何信息融合<br/>ResNet 行人语义 + DA3 广义几何表征经 FPN 融合"]
A --> C["基座模型几何预测<br/>DA3 冻结输出度量级 3D 点图"]
B --> D["阶段 2:特征点图聚合<br/>依据 3D 点图将像素散射至体素网格并最大池化"]
C --> D
D --> E["垂直维度压缩与检测头"]
E --> F["输出 BEV 行人占据图与坐标偏移量"]
关键设计¶
1. 任务特异性与几何信息融合(TGF):兼顾前景行人判别与广义几何关联 传统方法仅在各视角独立运行通用 CNN 骨干,无法在特征提取早期建立跨视角的几何对应;若直接微调大型几何基座模型,不仅计算代价不可承受,还会破坏其原本在千万级多视角数据上获得的泛化先验,且基座模型输出缺乏针对行人群体的语义判别力。TGF 模块将几何基座模型(DA3 Giant)保持参数冻结,利用其第 20、28、34、40 层 Transformer 模块提取的跨视角聚合特征 \(\{E_l^n\}_{l \in \{20,28,34,40\}}\)(通道数 \(C_D=1536\))。与此同时,引入一个可训练的 ResNet-18 针对多视角检测任务端到端提取多尺度特征 \(\{F_2^n, F_3^n, F_4^n, F_5^n\}\),专门负责激活行人前景。双路特征在对应的分辨率尺度上通过双线性插值对齐并沿通道拼接:
随后通过自顶向下的特征金字塔网络(FPN)逐级交互,输出融合了细粒度行人局部辨识特征与广义三维几何特征的高分辨率表征 \(F'^n \in \mathbb{R}^{C \times \frac{H}{4} \times \frac{W}{4}}\)(\(C=256\))。这一设计使得网络即便面对全新未见的相机焦距和外参,依然能借助 DA3 的注意力模式保持跨视角特征的几何对齐。
2. 特征点图聚合(FPA):基于 3D 空间散射杜绝阴影状投影畸变 传统透视单应性变换(Homography)的最大缺陷是将整幅图像的所有像素强行压在特定假定高度的地平面上,天空、墙面以及行人上半身像素均会沿射角向外散成巨大的阴影拖尾,使得模型极易过拟合特定相机的几何假象。FPA 模块彻底舍弃了基于平面单应性的透视投影,转而直接借助 DA3 预测的绝对度量 3D 点图 \(P^n \in \mathbb{R}^{3 \times H_D \times W_D}\)。对于多视角图像中的每一个像素位置 \((u, v)\),点图给出了其在世界坐标系下的真实空间坐标 \(P^n(u, v) = (X, Y, Z)\)。
具体实现中,FPA 将 TGF 提取的图像特征 \(F'^n\) 上采样至与点图相同尺寸,并将全视角的所有像素及其对应的 3D 坐标展平组合为特征池 \(\dot{F} \in \mathbb{R}^{C \times (N \cdot H_D \cdot W_D)}\) 与坐标点云 \(\dot{P} \in \mathbb{R}^{3 \times (N \cdot H_D \cdot W_D)}\)。设定水平分辨率为 \(\theta_x = \theta_y = 10\text{ cm}\)、垂直分辨率为 \(\theta_z = 50\text{ cm}\) 且坚直高度切分为 \(Z=4\) 层的三维体素网格 \(V\)(覆盖地面上方 0 至 2.0 米的人体高度区间)。对于落入体素网格 \((x, y, z)\) 范围内的所有特征采样点集合 \(S(x, y, z)\),执行通道级最大池化:
最后将高维体素重排为 \(\dot{V} \in \mathbb{R}^{(C \cdot Z) \times \frac{X}{4} \times \frac{Y}{4}}\),经由小型 CNN 卷积块压缩高度通道,生成高质量无拉伸畸变的 BEV 紧凑特征 \(B \in \mathbb{R}^{C \times \frac{X}{4} \times \frac{Y}{4}}\)。由于每个像素均精准落入其在三维空间中的真实物理位置,非地面背景不会散落在地面网格中,彻底切断了模型对特定相机视角投影阴影的过拟合依赖。
损失函数 / 训练策略¶
网络预测的 BEV 占据概率图记为 \(M \in \mathbb{R}^{1 \times \frac{X}{4} \times \frac{Y}{4}}\),亚像素偏移回归图记为 \(O \in \mathbb{R}^{2 \times \frac{X}{4} \times \frac{Y}{4}}\)。总优化损失由主检测损失与多视角辅助损失构成:
其中 \(\mathcal{L}_{\text{det}} = \text{FocalLoss}(M, \bar{M})\) 监督地面占据热图(以高斯核平滑真实真值),\(\mathcal{L}_{\text{off}} = \text{L1Loss}(O, \bar{O})\) 监督局部网格坐标偏移。此外,为引导可训练 ResNet 更快聚焦于前景人体,利用单视角特征 \(F'^n\) 分别预测第 \(n\) 个视角下行人的头部与足部占据图,构建视角辅助损失:
训练采用 Adam 优化器,学习率设为 \(1.0 \times 10^{-3}\) 并通过余弦衰减调度器降至 \(1.0 \times 10^{-6}\)。全局有效批大小通过梯度累积设为 16。
实验关键数据¶
主实验¶
为了验证跨相机配置的泛化能力,所有模型在多场景、多相机配置的大规模合成数据集 GMVD 的 GMVD-D 分割(训练集包含 6 个场景及 11 种相机配置)上训练,直接在未见过的相机场景 GMVD-D 测试集(1 场景 2 种配置)以及两个完全独立的基准数据集 MVPerception 和真实场景 Wildtrack 上进行跨场景/跨相机 zero-shot 泛化测试。评估指标以多目标检测精度(MODA)为主,辅以 MODP、准确率(Prec.)和召回率(Rec.),真阳性阈值设为 0.5 米。
| 训练集 | 测试数据集 | 指标 | MV2GF (本文) | 次优 SOTA (MSMVD) | 提升幅度 |
|---|---|---|---|---|---|
| GMVD-D | GMVD-D (未见相机) | MODA / MODP | 84.8 / 83.1 | 80.2 / 81.3 | +4.6 / +1.8 |
| GMVD-D | GMVD-D (未见相机) | Prec. / Rec. | 96.8 / 87.7 | 95.7 / 83.9 | +1.1 / +3.8 |
| GMVD-D | MVPerception (未见相机) | MODA / MODP | 86.5 / 80.6 | 81.8 / 79.4 | +4.7 / +1.2 |
| GMVD-D | MVPerception (未见相机) | Prec. / Rec. | 98.5 / 87.8 | 94.2 / 87.2 | +4.3 / +0.6 |
| GMVD-D | Wildtrack (真实场景迁移) | MODA / MODP | 87.9 / 79.6 | 85.7 / 79.3 | +2.2 / +0.3 |
| GMVD-D | Wildtrack (真实场景迁移) | Prec. / Rec. | 94.7 / 93.2 | 92.2 / 93.6 | +2.5 / -0.4 |
在同相机配置常规设定下(GMVD-S / MVPerception / Wildtrack 各自同域测试),MV2GF 的 MODA 分别达到 91.3、96.5 和 94.7,全面达到或超越了现有专为特定场景优化的前沿算法(如 MSMVD 的 91.1、96.4、94.6)。
消融实验¶
消融实验均在 GMVD-D 训练分割上训练并在 GMVD-D 未见相机测试集上评估。通过系统性剥离核心组件,验证各模块与超参数对几何泛化的独立贡献:
| 实验组别 | 评估配置 | MODA (%) | MODP (%) | Prec. (%) | Rec. (%) | 说明 |
|---|---|---|---|---|---|---|
| 模块递增 (Tab. 3a) | Baseline (MVDet + ResNet18) | 73.4 | 78.5 | 93.2 | 79.1 | 纯透视变换基线 |
| 模块递增 (Tab. 3a) | + TGF (引入 DA3 跨视角几何特征) | 77.8 | 79.5 | 93.8 | 83.3 | 相比基线提升 +4.4 MODA |
| 模块递增 (Tab. 3a) | + FPA (引入 DA3 点图体素投影) | 81.3 | 82.6 | 95.5 | 85.4 | 相比基线提升 +7.9 MODA |
| 模块递增 (Tab. 3a) | Full MV2GF (TGF + FPA) | 84.8 | 83.1 | 96.8 | 87.7 | 相比基线累计提升 +11.4 MODA |
| 特征源构成 (Tab. 3b) | 仅 ResNet 特征 | 81.3 | 82.6 | 95.5 | 85.4 | 缺少几何基座特征指导 |
| 特征源构成 (Tab. 3b) | 仅 DA3 特征 | 77.5 | 77.9 | 95.1 | 81.7 | 缺乏针对行人的任务判别性 |
| 特征源构成 (Tab. 3b) | ResNet + DA3 (TGF) | 84.8 | 83.1 | 96.8 | 87.7 | 互补融合效果最优 |
| 体素高度层级 (Tab. 3d) | \(\theta_z = 200\text{ cm}\) (单层) | 83.7 | 82.9 | 96.1 | 87.3 | 竖直方向过度挤压 |
| 体素高度层级 (Tab. 3d) | \(\theta_z = 50\text{ cm}\) (\(Z=4\), 默认) | 84.8 | 83.1 | 96.8 | 87.7 | 空间分辨率与特征密度平衡 |
| 体素高度层级 (Tab. 3d) | \(\theta_z = 12.5\text{ cm}\) (\(Z=16\)) | 81.6 | 81.7 | 96.3 | 84.8 | 网格过细导致空体素严重退化 |
| 几何基座对比 (Tab. 3f) | MapAnything | 83.0 | 82.3 | 96.5 | 86.2 | 亦大幅优于传统 SOTA (80.2) |
| 几何基座对比 (Tab. 3f) | Pi3X | 82.3 | 82.6 | 96.4 | 85.5 | 验证机制对基座选择的普适性 |
| 几何基座对比 (Tab. 3f) | Depth Anything 3 (DA3) | 84.8 | 83.1 | 96.8 | 87.7 | 度量几何精度最高,表现最佳 |
关键发现¶
- FPA 投影对泛化的贡献显著高于特征增强:仅替换透视投影为点图体素聚合(FPA),MODA 跃升 +7.9 点,表明透视畸变引发的投影过拟合是制约跨相机泛化的首要病灶;TGF 进一步通过多尺度语义特征互补带来 +3.5 点提升,二者相辅相成达成 +11.4 点增益。
- 视觉几何基座明显胜过普通视觉预训练:将 TGF 中的 DA3 替换为相同参数量级的 2D 视觉大模型 DINOv2(82.9 MODA)或 DINOv3(83.2 MODA),性能均明显落后于具备真实度量几何能力的 DA3(84.8 MODA),证明提升来源于几何多视角感知而非仅是海量图像预训练带来的泛化表征。
- 视角退化条件下的卓越鲁棒性:当可用相机视角数量从 6 个逐步削减至 2 个时,强基线 MSMVD 的 MODA 从 82.7 断崖式暴跌至 34.0(跌落 48.7 点);而 MV2GF 依然能保持 57.6 MODA(跌落仅 28.3 点),体现出基座几何特征在极端遮挡与稀疏视角下的极高弹性。
亮点与洞察¶
- 从假定平面投影迈向真实 3D 度量投影:传统 MVPD 长期被透视单应性产生的“阴影伪影”困扰,本文首次将前馈度量级三维几何大模型引入该领域,用点图散射替代固定平面变换,从物理机理上拔除了投影畸变的根源。
- 任务判别力与广义几何解耦的优雅架构设计:基座模型负责提取无视视角的绝对几何关系,而轻量 ResNet 则在冻结大模型的保护下专门激活行人语义,双轨 FPN 拼接既避免了微调大模型带来的灾难性遗忘与算力消耗,又补充了零样本几何模型对微小行人判别的不足。
- 可迁移至全景多视角下游任务:利用单次前馈 3D 基座预测的度量点图作为任意跨视角特征聚合的中介桥梁(FPA 机制),完全可以平替自动驾驶多相机 BEV 感知中繁重的预设网格采样与时空注意力先验,拓展至多相机 3D 目标检测、车辆重叠定位与密集占用网格构建。
局限与展望¶
- 推理帧率存在一定时延开销:由于需要运行 40 层 Transformer 的 DA3 Giant 基座提取四层几何特征与点图,MV2GF 在 A100 GPU 上的推理速度为 3.3 FPS,稍慢于传统 CNN/透视方法(4.5~5.2 FPS);后续工作可通过基座知识蒸馏或轻量级量化技术进行加速。
- 对几何基座的深度绝对误差敏感:若场景中出现大面积镜面反射、极暗无纹理区域,导致 DA3 预测的 3D 点图发生系统性偏移,FPA 可能会将特征投送至错误的体素网格,需引入几何不确定度估计作为体素聚合权重。
- 同域极致精度的细微差距:在相机完全固定的严苛同域测试下,本方法在 MODP(定位精准度)上略微落后于采用多尺度 BEV 特征的 MSMVD,未来可将多尺度 BEV 网格与度量点图聚合进一步融合。
相关工作与启发¶
- vs MVDet / SHOT / MVDeTr: 传统方法依赖透视变换或多层重叠单应性切片将 2D 特征映射到地平面,必然引发沿投影方向拉伸的阴影伪影,使网络强行拟合特定相机的伪影模式;MV2GF 通过 DA3 预测的真实 3D 点图散射,消除了投影拉伸,在未知相机位姿下 MODA 提升超 10~15 点。
- vs MSMVD: MSMVD 依靠多尺度图像与多尺度 BEV 特征在固定相机下取得了极高的定位精度(MODP),但其底层依旧依赖单应性变换,在 GMVD-D 未见相机设定下仅为 80.2 MODA;MV2GF 以 84.8 MODA 取得实质性超越,且在稀疏视角(2视角)下超出 MSMVD 23.6 点。
- vs BEVFormer / SurroundOcc 等自动驾驶 Transformer 投影: 自动驾驶主流方法需要预先设定固定形状与内参的查询网格(Queries),在监控、路侧或动态布设的多视角行人检测中无法泛化;MV2GF 无需固定查询先验,直接以相机参数注入几何大模型,实现对任意拓扑相机阵列的即插即用。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次将视觉几何基座模型(DA3)引入多视角行人检测,从根本上重塑了特征投影机制并解决了困扰该领域多年的跨相机泛化痛点。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 GMVD 跨场景、MVPerception 跨域及真实 Wildtrack 场景,提供了详实的消融(组件、特征源、层数、体素高度、基座对比、视角敏感性与推理时延)。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑线极其严密自洽,从痛点剖析、架构推导到实验论证步步推进,公式简练承载核心机制。
- 价值: ⭐⭐⭐⭐⭐ 为多视角视觉系统在非固定、易变动的实际安防监控与自动驾驶车路协同落地扫清了关键的几何泛化障碍。