跳转至

Trajectory-aware Cross-view Geo-Localization with Sequential Observations

会议: ECCV 2026
论文: CVF Open Access
代码: https://humblegamer.github.io/trajloc/
领域: 自动驾驶
关键词: 跨视角地理定位, 时序观测, 轨迹感知调制, 路线文本描述, 多模态检索

一句话总结

针对传统跨视角地理定位忽视路线语言描述且缺乏空间几何布局感知的问题,本文构建了首个包含 3.9 万对时序视频-路线文本-卫星图的 SeqGeo-VL 基准,并提出 TrajLoc 框架,通过两阶段课程学习与轻量级轨迹调制模块 TrajMod,显著提升了视频和文本检索卫星图的定位精度。

研究背景与动机

在城市峡谷、高楼林立与茂密植被覆盖的复杂都市环境中,GNSS 全球导航卫星信号极易发生多径干扰甚至完全遮挡,使得自动驾驶车辆、具身四足机器人等智能体难以依赖 GPS 维持可靠的全局定位。跨视角地理定位技术通过将地面视角的实测观测与带有地理坐标标签的高分辨率卫星图库进行跨模态检索匹配,为无 GPS 场景提供了一种覆盖广、存储开销低的全局定位新范式。早期方法主要依赖单张地面街景全景图进行检索,但在现代城市规则化街区与重复纹理立面中,单帧图像极易陷入感知混淆,导致灾难性的检索错误。

为此,近期研究逐渐转向基于连续帧序列的时序观测,利用车辆行驶轨迹中的动态视角变化与时空连续性来破除感知歧义。然而,现有视频检索方案仅聚焦于底层稠密视觉信息,完全忽视了高层抽象的自然语言路线描述。在人车协作或自动叫车等实际落地场景中,人类用户往往仅能提供「沿主干道前行、在十字路口右转并停在红砖建筑旁」这类包含丰富时空拓扑的口头导航指令;而当车载摄像头发生污损、遮挡或传感器失效时,语言描述更是唯一的定位线索。此外,现有视觉与语言大模型多偏向词袋语义匹配,普遍缺乏将以自我为中心的地面观测转化为以地理为中心的俯视空间布局的能力。

本文的切入角度是打破视频与文本在时序定位中的孤立状态,将连续物理轨迹的几何先验显式引入跨模态表征学习中。核心 idea:构建视频-路线描述-卫星图像三元组基准,并设计统一框架 TrajLoc,通过两阶段课程学习解决跨模态优化冲突,结合基于航向角与起止方位的轻量级轨迹调制模块 TrajMod,为视听语言表征注入空间几何显式先验。

方法详解

整体框架

TrajLoc 旨在支持以地面视频序列或高层自然语言路线描述作为时序查询,从海量带地理标签的卫星图库中精确检索目标位置。系统包含三个基于 CLIP ViT-L/14 初始化的特征编码器:视频编码器、文本编码器与卫星图像编码器。针对视频与文本对齐卫星图难度迥异导致的优化震荡,训练过程采用两阶段课程学习范式;在推理阶段,所有编码器冻结,由轻量级的轨迹几何调制模块 TrajMod 接收惯导轨迹元数据,生成仿射缩放与偏置参数,自适应调整查询特征以获得精确的空间布局感知能力。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    InV["时序视频序列<br/>N 帧地面图像"] --> EncV["视频编码器<br/>ViT-L/14 + 时序均值池化"]
    InT["路线文本描述<br/>自然语言导航轨迹"] --> EncT["文本编码器<br/>线性插值扩充位置编码"]
    InS["卫星图库<br/>俯视正射遥感图"] --> EncS["卫星编码器<br/>ViT-L/14 共享跨模态锚点"]

    EncV --> S1["两阶段课程学习<br/>Stage 1: 视频-卫星对比预训练"]
    EncS --> S1
    S1 --> S2["特征锚定正则化<br/>Stage 2: 冻结视频分支,引入余弦漂移约束对齐文本"]
    EncT --> S2

    Meta["轨迹元数据<br/>航向角序列 + 起止方位角"] --> TM1["轨迹几何傅里叶编码<br/>多尺度高频谐波映射"]
    TM1 --> TM2["跨模态特征仿射调制<br/>TrajMod 预测缩放与偏置参数"]

    S2 --> TM2
    TM2 --> Out["几何对齐查询表征<br/>计算与卫星库余弦相似度检索匹配"]

关键设计

1. 两阶段课程学习与锚定正则化:化解视听语义与俯视像素的多模态对齐鸿沟

将高度抽象的路线文本描述直接与卫星正射影像对齐,其难度远高于图对图的地面视频与俯视卫星对齐。若直接进行混合联合训练,梯度反传的不平衡极易破坏共享卫星编码器的特征空间稳定性。为此,TrajLoc 引入了两阶段课程学习策略:第一阶段首先在视频与卫星图像间优化对称 InfoNCE 对比损失,使卫星编码器在相对稠密的视觉监督下快速建立对地表物理实体(建筑轮廓、路网结构)的语义表征;第二阶段完全冻结视频编码器,以卫星编码器作为软锚点(Soft Anchor)来优化文本分支,使长文本描述对齐至已有视觉空间。为了防止第二阶段文本反向传播使卫星编码器发生灾难性漂移,方法在卫星分支上施加了余弦相似度正则化损失 \(\mathcal{L}_{\text{reg}}\):

\[\mathcal{L}_{\text{reg}} = 1 - \text{sim}(\mathbf{f}_s^{\text{stage1}}, \mathbf{f}_s^{\text{stage2}})\]

这一正则化项严格限制了阶段二卫星表征与阶段一最优视觉锚点之间的角度偏转,既保证了抽象文本语义的顺畅映射,又完整保留了强大的视频-卫星检索辨识度。

2. 轨迹几何傅里叶编码:提取无尺度依赖的高频朝向先验

标准的视觉与语言骨干网络多缺乏严格的各向异性空间朝向建模能力。针对现代车辆及智能终端普遍具备廉价 IMU 和电子罗盘的现实,TrajLoc 提取了两组互补的时空几何信号:反映局部转弯机动的各航路点航向角序列 \(\mathbf{h} = \{h_1, \dots, h_T\}\),以及表征全局宏观行进趋势的起点到终点(OD)方位角 \(\theta_{\text{OD}}\)。所有角度均以真北方向为基准归一化至 \([0, 2\pi)\)。为了使神经网络有效捕获连续角度中的周期性并学习高频方位几何特征,系统对任意角度 \(\alpha \in \mathbf{h} \cup \{\theta_{\text{OD}}\}\) 采用多尺度正余弦傅里叶基函数变换:

\[\Phi(\alpha) = \left[ \sin(2^0 \pi \alpha), \cos(2^0 \pi \alpha), \dots, \sin(2^{K-1}\pi\alpha), \cos(2^{K-1}\pi\alpha) \right]\]

将航向序列与 OD 方位的傅里叶特征沿通道维度拼接后,构成紧凑且具备旋转周期不变性的轨迹几何嵌入向量 \(\mathbf{z}_{\text{traj}}\)。该设计完全规避了高精度公制坐标(metric coordinates)或高精地图依赖,极大提升了工程鲁棒性。

3. 跨模态特征仿射调制与双路正则:轻量级注入自中心到地理中心空间布局

为了将 \(\mathbf{z}_{\text{traj}}\) 所携带的物理轨迹空间布局无缝注入查询表征,TrajMod 借鉴特征特征仿射调制思想,构建了两个模态解耦的多层感知机 \(\text{MLP}_v\) 与 \(\text{MLP}_t\)。对于视频均值池化特征 \(\mathbf{f}_v\) 或长文本特征 \(\mathbf{f}_t\)(通过线性插值位置编码支持 129 个 token 的长上下文),TrajMod 预测出维度一致的缩放向量 \(\boldsymbol{\gamma}_m\) 与偏置向量 \(\boldsymbol{\beta}_m\):

\[\boldsymbol{\gamma}_m, \boldsymbol{\beta}_m = \text{MLP}_m(\mathbf{z}_{\text{traj}}), \quad \mathbf{f}'_m = \boldsymbol{\gamma}_m \odot \mathbf{f}_m + \boldsymbol{\beta}_m \quad (m \in \{v, t\})\]

在训练 TrajMod 时,三个主干编码器参数均保持冻结,仅优化轻量级 MLP 参数。为了防止双模态独立调制引入与空间几何无关的过拟合噪声,TrajMod 在视频-卫星、文本-卫星对比损失之外,额外引入了文本-视频跨模态对齐对比损失作为辅助正则化约束。由于视频和文本共享同一套 \(\mathbf{z}_{\text{traj}}\) 物理几何,该正则项强制两路调制后的表征 \(\mathbf{f}'_v\) 与 \(\mathbf{f}'_t\) 紧密围绕轨迹核心拓扑对齐,抑制了模态特异性伪特征,促使表征专注于物理布局一致性。

损失函数 / 训练策略

第一阶段与第二阶段的跨模态匹配均基于对称式 InfoNCE 目标:

\[\mathcal{L}_{\text{ctr}} = \frac{1}{2N} \sum_{i=1}^N \left[ \ell(q_i, k_i) + \ell(k_i, q_i) \right]\]

其中 \((q_i, k_i)\) 为批大小为 \(N\) 的匹配样本对(视频-卫星或文本-卫星),\(\ell(\cdot, \cdot)\) 采用可学习温度参数的余弦相似度交叉熵。第二阶段总损失函数为 \(\mathcal{L}_{\text{stage2}} = \mathcal{L}_{\text{ctr}}(T, S) + \lambda \mathcal{L}_{\text{reg}}\)。在 TrajMod 优化阶段,总损失由视频-卫星、文本-卫星以及视频-文本三路 InfoNCE 对比损失联合构成。全流程采用 Adam 优化器,主干微调学习率为 \(1 \times 10^{-5}\),各阶段训练 40 个 epoch,TrajMod 训练 20 个 epoch。

实验关键数据

主实验

实验基于 SeqGeo-VL 评测基准(80:20 划分,共 38,863 个时序轨迹三元组),分别对比了跨视角视频检索与跨视角文本检索两个任务。主要评估指标为不同候选召回范围的召回率 Recall@K(R@1, R@5, R@10 及 top 1% 召回率 R@1%)。

跨视角视频地理定位对比(表 1):

方法 骨干网络 (Backbone) R@1 (%) R@5 (%) R@10 (%) R@1% (%)
SeqGeo (WACV 2023) VGG16 1.80 6.45 10.36 34.38
SeqGeo† (重实现基线) ViT-L/14 8.14 24.42 34.02 66.17
GARet (ECCV 2024) DeiT-m 3.34 11.19 17.18 44.39
FlexGeo (ISPRS 2026) ConvNext-B 3.51 14.22 20.77 48.53
Qwen3-VL-Embedding* (LoRA) Qwen3-VL-2B 5.44 19.21 28.15 61.16
TrajLoc (本文) ViT-L/14 12.09 35.77 47.68 80.21

跨视角文本地理定位对比(表 2):

方法 骨干网络 (Backbone) R@1 (%) R@5 (%) R@10 (%) R@1% (%)
CLIP ViT-B/16 0.53 1.58 3.33 15.94
CLIP ViT-L/14 0.80 3.32 6.01 22.99
EVA2-CLIP ViT-B/16 0.63 2.20 3.98 17.59
EVA2-CLIP ViT-L/14@336 0.89 3.78 6.70 26.99
SigLIP ViT-SO400M/14 0.80 2.92 5.24 21.86
Perception Encoder ViT-L/14@336 0.66 2.08 3.80 15.17
Qwen3-VL-Embedding* (LoRA) Qwen3-VL-2B 0.93 3.38 5.55 20.91
CrossText2Loc (ICCV 2025) ViT-L/14@336 0.98 4.08 7.08 25.45
TrajLoc (本文) ViT-L/14 2.52 9.82 16.11 45.48

消融实验

消融实验深入验证了 TrajMod 模块设计、两阶段协同训练以及课程学习机制的有效性(表 3):

实验组别 / 配置 视频 R@1 (%) 视频 R@10 (%) 视频 R@1% (%) 文本 R@1 (%) 文本 R@10 (%) 文本 R@1% (%) 说明
Full model (完整 TrajLoc) 12.09 47.68 80.21 2.52 16.11 45.48 完整模型
w/o Txt2Vid 对比损失 10.23 41.21 74.20 2.17 14.19 42.22 去除跨模态正则化项
w/o TrajMod 调制模块 7.27 30.92 63.47 0.98 7.21 26.15 移除几何调制模块
Vid2Sat 单独训练 (w/ TrajMod) 9.69 40.30 73.60 — — — 无文本协同训练
Txt2Sat 单独训练 (w/ TrajMod) — — — 1.90 15.57 47.25 无视频协同训练
Vid2Sat 单独训练 (w/o TrajMod) 6.87 31.60 64.09 — — — 基础单模态基准
Txt2Sat 单独训练 (w/o TrajMod) — — — 0.80 6.01 22.99 基础单模态基准
w/o 课程学习 (端到端直接训练) 5.01 27.25 61.81 0.86 6.52 24.40 优化冲突导致两端恶化

关键发现

  • TrajMod 带来质的飞跃:去掉 TrajMod 后,视频 R@1 从 12.09% 骤降至 7.27%(相对暴跌 40%),文本 R@1 从 2.52% 下降至 0.98%(相对暴跌 61%)。这充分证明通用的 CLIP 或多模态表征无法自主建立自中心到卫星俯视的空间几何映射,外挂显式轨迹几何是破解该瓶颈的核心。
  • 协同训练与几何调制的正向放大效应:在缺乏 TrajMod 时,视频与文本联合协同训练仅带来微弱提升(视频 R@1 从 6.87% 升至 7.27%);但加入 TrajMod 后,协同训练的增益被急剧放大(视频 R@1 从 9.69% 升至 12.09%,文本 R@1 从 1.90% 升至 2.52%),证明 TrajMod 成功充当了跨模态对齐的几何纽带。
  • 时序长度的边际收益:帧数从 1 帧扩充至 6 帧时,检索精度持续提升,且带有 TrajMod 的模型优势随着时序变长进一步扩大(R@1 差距从单帧的 2.6% 持续拉大到 6 帧的 5.6%),表明轨迹越长,几何调制对视觉特征平滑与感知混淆的解耦作用越明显。

亮点与洞察

  • 显式几何调制优于纯文本 Prompt:对比直接在大型多模态模型(Qwen3-VL)中输入轨迹文本 Prompt,TrajMod 仿射调制带来了 +19.33% 的 R@1% 巨幅提升,而 Prompt 仅提升 +1.34%,揭示了空间几何更适合通过连续特征变换注入而非离散词符输入。
  • 极简池化超越复杂时序 Transformer:仅使用简单的平均池化(Mean Pooling)融合视频帧特征,配合两阶段课程训练与 TrajMod,效果即大幅领先使用多层自回归 Transformer 复杂聚合的 GARet 和 SeqGeo,表明跨视角检索的核心瓶颈在于几何映射而非时序注意力堆叠。
  • 可复用的跨模态协同训练正则方案:在存在显著模态难度不对称的跨模态检索系统(如视频/文本对齐正射卫星遥感)中,利用高密度模态预热共享编码器并施加软锚点余弦相似度漂移约束,具有高度通用性。

局限与展望

  • 卫星图尺度与视角的单一性:当前基准仅采用 Level 20 固定层级的正射卫星遥感图,未能覆盖因季节交替、光照剧变或建筑更新带来的大幅度域漂移。
  • 轨迹连续性强假设:TrajMod 严重依赖连续航向角 \(\mathbf{h}\) 与起止方位角 \(\theta_{\text{OD}}\)。若车辆行驶中遇到极端剧烈颠簸、IMU 发生积分发散漂移或掉帧断连,调制参数可能输出错误几何偏置。
  • 未来方向:探索在无连续传感器信号下的鲁棒性估计,引入拓扑地图先验以进一步实现从粗粒度卫星图像块检索到精细米级绝对坐标回归。

相关工作与启发

  • vs SeqGeo / GARet / FlexGeo: 以往时序跨视角定位工作将重点放在时序 Transformer 或帧间图聚合等复杂的时空建模机制上,却仅支持视频单模态,且完全忽视了物理航向与路线几何;本文证明通过轻量级 TrajMod 注入傅里叶几何调制,即使使用极其简单的均值池化,也能实现显著的性能超越。
  • vs CrossText2Loc: 该方法首次提出了基于文本描述的跨视角定位,但仅受限于单张孤立街景的简短描述;本文将文本定位拓展到时序轨迹级别,并构建了高质量的视频-文本-卫星三元组数据集 SeqGeo-VL。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将路线文本时序描述引入跨视角地理定位,提出利用显式轨迹几何解耦空间布局的 TrajMod 模块。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖视频与文本双任务多模型对比、详尽的跨模态消融、时序长度变化分析以及候选库先验实验。
  • 写作质量: ⭐⭐⭐⭐⭐ 动机阐述深刻,方法数学定义简洁清晰,图文呼应连贯。
  • 价值: ⭐⭐⭐⭐⭐ 为无 GPS 恶劣环境下的具身智能体导航、人机协同指引与多模态无人配送提供了扎实完备的基准与技术范式。