跳转至

Segmentation-Guided Homography Estimation for Long-Term Planar Tracking

会议: ECCV 2026
论文: ECCV 2026 Poster
代码: https://github.com/serycjon/WOFTSAM
领域: 语义分割
关键词: 平面目标跟踪, 单应性估计, 分割引导, SAM 2, 霍夫变换

一句话总结

本文提出免训练的单应性估计流程 SAM-H,利用通用视频分割模型 SAM 2 的边缘轮廓与霍夫变换几何拟合恢复四边形 8-DoF 姿态,并与光流对应点跟踪结合构建级联跟踪器 WOFTSAM,在 PlanarTrack 与 POT-210 基准上刷新 SOTA。

研究背景与动机

平面目标跟踪旨在视频序列中恢复平面目标跨帧的完整 8 自由度(8-DoF)单应性矩阵变换,是增强现实、影视后期特效制作以及视觉伺服等高精度几何任务的基础支撑。传统平面跟踪范式主要依赖于基于模板的强度配准或基于特征对应点(如 SIFT、RAFT 光流等)的单应性拟合。然而,在真实开放场景下,目标常面临剧烈透视形变、大范围旋转、运动模糊、无纹理弱纹理表面、强反射镜面,乃至透明材质与外观动态变化等复合挑战。基于对应点的方法严重依赖于局部纹理的稳定匹配,一旦发生短暂全遮挡、大幅度运动模糊或移出视野,跟踪器极易累积误差并导致不可逆的跟踪丢失,难以在长时视频中重新找回目标。

与此同时,通用视频目标分割领域在以 SAM 2 为代表的基础模型推动下取得了突破性进展,具备极强的开集泛化能力与长时鲁棒性,能够在弱纹理和严重外观剧变下稳定维持目标掩膜。然而,视频分割模型输出的仅为区域级二值掩膜,完全缺乏平面跟踪所必需的 8-DoF 刚性几何结构参数。此外,直接从分割掩膜推断单应性存在严重的几何退化与对称性多义性问题——对于平面四边形目标,四个顶点的任意循环排列均对应完全相同的掩膜边界,仅凭空间二值掩膜根本无法确定唯一的单应性映射。

为了弥合高鲁棒性区域分割与高精度 8-DoF 几何位姿之间的鸿沟,本文的核心切入点在于:将分割掩膜作为长时跟踪的鲁棒重检测信标,通过经典几何约束提取四边形轮廓交点,并结合运动连续性与自监督特征进行对称性消歧。核心 idea:提出免训练的分割导向单应性估计范式 SAM-H,通过霍夫变换提取分割掩膜轮廓交点并结合 DINOv2 特征消除对称性多义性;进一步将其作为鲁棒重检测器与高精度光流对应点拟合级联构成 WOFTSAM,兼顾光流的高精度与分割的长时重检测鲁棒性。

方法详解

整体框架

算法接收视频序列与首帧指定的四边形目标控制点,目标是在后续各帧输出精确的 8-DoF 单应性矩阵 \(H_t\)。整个系统包含两个核心创新层次:其一是基础的掩膜到单应性估计流程 SAM-H,利用修改版 SAM 2 输出二值掩膜,通过霍夫变换拟合四边形四条边缘并求交得到角点,再通过时序运动模型与 DINOv2 特征相似度匹配解决角点循环排列的对称性多义性;其二是融合高精度光流与重检测能力的级联跟踪框架 WOFTSAM,优先采用密集光流预弯折(pre-warping)进行微调估计,一旦内点率不足即触发 SAM-H 重检测与退避机制。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["当前输入帧与历史状态"] --> B["阶段1:光流预弯折跟踪<br/>WFH dense optical flow"]
    B -->|内点率 >= 20%| C["高精度单应性输出"]
    B -->|内点率 < 20% 判定丢失| D["阶段2:SAM-H 掩膜单应性重检测<br/>SAM 2 掩膜 + 霍夫线交点 + DINOv2 消歧"]
    D --> E["基于 HSAM 再次执行 WFH 预弯折精细化"]
    E -->|精细化内点率达标| C
    E -->|精细化依然失败| F["阶段3:退避回退机制<br/>直接输出 HSAM 兜底"]
    F --> C

关键设计

1. 霍夫变换边缘提取与角点相交定位:从二值掩膜到无训练四边形恢复 通用视频分割模型虽然能稳定追踪目标区域,但直接在离散像素掩膜上寻找几何四边形角点极易受到边缘毛刺、非刚性膨胀或局部凹坑的干扰。针对这一痛点,SAM-H 采用经典的霍夫变换在目标掩膜的轮廓上检测 4 条最显著的连续主直线,通过求取这 4 条空间直线的两两交点获得候选角点集合。系统会自动滤除远离掩膜实体的伪交点,仅保留贴近掩膜轮廓的 4 个真实多边形交点。这一设计不依赖任何特定任务的神经网络回归,具备天然的尺度与透视不变性,能在掩膜边缘存在轻度漏分或溢出时依然拟合出平直的四边形几何边界。

2. 混合对称性消歧机制:结合帧间运动先验与 DINOv2 自监督特征 由于平面四边形在几何轮廓上对于顶点的循环轮换具备 4 重对称不变性,掩膜交点集合无法直接映射到首帧控制点的绝对次序。在连续平滑跟踪阶段,帧率通常较高(\(\ge 25\) fps),帧间几何位移极小,算法直接选取与上一帧角点位移欧氏距离最小的循环排列作为有效对应。然而,一旦目标经历遮挡、剧烈运动模糊或视野移出导致跟踪中断,历史运动先验彻底失效。此时算法切换为基于外观的全局消歧机制:提取目标在各种循环候选次序下逆透视弯折的外观区域,并提取 DINOv2 自监督特征图,计算其与参考模板特征图的余弦相似度点积。由于 DINOv2 具备极强的光照、模糊与透视鲁棒性,能够稳健选出正确的拓扑排列。为了防止在目标半遮挡或外观模糊过渡帧产生抖动,算法引入了多帧一致性约束,要求外观消歧结果必须在连续 \(\Theta_r = 5\) 帧保持一致才执行硬切换。

3. 部分可见性退化处理:动态相似性与平移变换自适应插补 在复杂场景中,目标常被前景障碍物局部遮挡,导致霍夫变换只能稳定检出 1 条或 2-3 条边缘直线,不足以直接求出全部 4 个角点。针对全自由度单应性无法闭式求解的问题,SAM-H 设计了自适应低自由度姿态插补:当检测到全部 4 个角点时,直接根据对应点求解完整的 8-DoF 单应性矩阵 \(H_t\);当仅有 2 或 3 个角点稳定可见时,单应性被分解为上一帧单应性与残差变换的复合,其中残差 \(\Delta H_{t-1 \to t}\) 被约束为包含平移、旋转与单一尺度的 4-DoF 相似变换(Similarity Transform);当仅有单个角点可见时,残差变换进一步退化为 2-DoF 的纯空间平移变换。这种多级退化设计保证了在严重局部遮挡期间姿态估计依然不会发散。

4. WOFTSAM 三级级联跟踪范式:高精度光流与强鲁棒分割的优势互补 单纯依赖分割掩膜边缘提取单应性的 SAM-H 虽然鲁棒,但受限于掩膜边缘像素量化误差,在高质量静态纹理表面的对齐精度(如 5 px 阈值)上略逊于密集光流匹配;而现有的密集光流跟踪器(如 WOFT)在持续可见时精度极高,但对跟踪中断完全缺乏自我恢复能力。WOFTSAM 将二者结合为三级级联流水线:首先利用上一帧位姿预弯折当前帧,执行基于 RAFT 的加权光流单应性(WFH)估计;通过评估光流内点率是否低于设定阈值 \(\Theta_i = 20\%\) 来作为跟踪失败的诊断判据;一旦判断丢失,立即执行重检测步骤,改用 SAM-H 提供的粗糙但强韧的单应性 \(H_{\text{SAM}}\) 对当前帧进行预弯折再微调;若微调依然无法找到足够的稠密内点,系统则最终退避回退至直接输出 \(H_{\text{SAM}}\)。

损失函数 / 训练策略

SAM-H 核心的几何交点提取与对称性消歧完全基于免训练(Training-free)机制,无需针对平面跟踪任务微调或重新训练参数。底层视觉组件全部复用高泛化能力的预训练模型:视频分割采用 SAM 2.1 Hiera-Tiny 架构,并集成 DAM4SAM 的轻量改进(将时序记忆步长设为 5,并在目标不可见时冻结记忆库更新以防特征污染);外观消歧使用预训练好的 DINOv2 ViT-S/14 注册版模型提取 384 维归一化特征;密集光流单应性估计则直接复用 WOFT 预训练的 RAFT 权重。在单 GPU(NVIDIA RTX A5000)上,WOFTSAM 的运行速度约为 2.4 FPS,GPU 显存占用仅 4.5 GB。

实验关键数据

主实验

论文在平面跟踪领域公认的基准数据集 POT-210 以及目前最具挑战性的大规模基准 PlanarTrack 测试集(PTTST)上进行了全面测试。评价指标采用几何对齐误差(Alignment Error)在 5 像素与 15 像素阈值下的精确率指标 \(p@5\) 与 \(p@15\)。在 PlanarTrack 上,作者还针对原始真值标注误差进行了精确重新标注(PTTST re-annot)。

数据集 指标 WOFTSAM (本文) SAM-H (本文) WOFT (之前SOTA) HVC-Net SIFT
POT-210 \(p@5\) (%) 91.9 64.4 90.0 91.4 65.8
POT-210 \(p@15\) (%) 97.5 89.0 95.4 95.8 69.6
PTTST (原始GT) \(p@5\) (%) 51.5 62.0 43.6 42.0 17.6
PTTST (原始GT) \(p@15\) (%) 77.2 80.0 64.8 63.1 26.7
PTTST (重标注GT) \(p@5\) (%) 57.4 62.0 48.9 48.8 –
PTTST (重标注GT) \(p@15\) (%) 77.6 80.1 65.9 64.3 –

消融实验

消融实验深入验证了底层分割模型结构选择、对称性消歧的多帧一致性参数 \(\Theta_r\) 以及 WOFTSAM 失败检测内点率阈值 \(\Theta_i\) 的影响。

实验切片 配置 / 变体 PTTST \(p@5\) (%) PTTST \(p@15\) (%) 说明
分割模块选型 原生 SAM 2 59.6 77.2 基准视频分割跟踪器
分割模块选型 DAM4SAM 完整版 58.6 77.7 引入额外干扰物判别导致过拟合
分割模块选型 SAM2+ (本文采用) 62.0 80.0 仅保留步长为5与目标消失不更新记忆
消歧连续帧阈值 \(\Theta_r = 0\) (单帧立即切换) 58.9 76.6 无时序滤波导致半遮挡/模糊下频繁抖动
消歧连续帧阈值 \(\Theta_r = 2\) 61.5 79.6 平滑过渡,消除偶发角点翻转
消歧连续帧阈值 \(\Theta_r = 5\) (默认) 62.0 80.0 稳定性与恢复响应达到最佳均衡
消歧连续帧阈值 \(\Theta_r = 8\) 62.0 80.1 进一步增大阈值收益趋于饱和
级联内点阈值 \(\Theta_i = 10\%\) 50.2 75.0 容忍过多漂移误差,降低重检测触发率
级联内点阈值 \(\Theta_i = 20\%\) (默认) 51.5 77.2 兼顾光流稳定跟踪与适时激活重检测
级联内点阈值 \(\Theta_i = 30\%\) 52.0 77.6 激进触发重检测,在复杂序列上略微改善

关键发现

  • 在无约束难例集 PlanarTrack 上,SAM-H 实现了断层式领先,相比此前最强方法 WOFT 在 \(p@5\) 和 \(p@15\) 上分别大幅提升了 +18.4 个百分点与 +15.2 个百分点,表明长时鲁棒重检测是当前复杂平面跟踪性能的核心瓶颈。
  • 在 POT-210 高精度基准上,WOFTSAM 凭借光流对应点的高精度与 SAM-H 的重检测补足,将 \(15\text{ px}\) 误差失败率近乎减半(\(p@15\) 达到 97.5%),尤其在运动模糊、遮挡与无约束复合挑战场景提升极其明显。
  • 级联各阶段的触发频率统计显示:阶段①光流平稳跟踪占比 85.3%,阶段②重检测触发占比 3.7%,阶段③直接退避回退占比 11.0%。重检测拯救率(即触发重检测且对齐误差改善 \(\ge 15\text{ px}\) 的比例)高达 69.8%,证明级联设计极大降低了灾难性丢失。
  • 序列级 Oracle 实验表明:约一半序列由 SAM-H 占优,另一半由 WOFTSAM 占优,理想切换上限可达 86.9% \(p@15\)(比 SAM-H 单模型再高 6.9 个百分点),确认了分割引导与密集光流之间的深刻互补性。
  • 作者发现 PlanarTrack 首帧标注存在微小偏差(均值仅 1.9 px),但由于后续目标尺寸常放大(59% 的帧大于首帧),该误差会等比例放大成当前帧的几何偏差。首帧精确重标注后,WOFTSAM 的 \(p@5\) 从 51.5% 跃升至 57.4%,证明了其真实高精跟踪能力被粗糙真值低估。

亮点与洞察

  • 将分割掩膜视为几何投影基底:跳出深度网络直接回归角点位姿黑盒的思路,巧妙利用霍夫变换在掩膜上做几何直线相交求解,以无训练经典算法盘活了基础分割大模型在几何位姿领域的潜能。
  • 外观驱动的 4 重对称循环消歧:利用自监督视觉大模型 DINOv2 在剧烈光照、模糊和透视畸变下的高层语义特征不变性,有效解决了传统四边形角点循环匹配无解的问题。
  • 多阶段自诊断退避级联结构:采用“精细光流 \(\to\) 粗粒度分割重检测再精化 \(\to\) 纯几何回退兜底”的三层自适应容错调度机制,在保证常规场景像素级精度的同时杜绝长序列永久丢帧。

局限与展望

  • 四边形几何先验依赖:SAM-H 的霍夫变换假设目标具有平直的 4 条外边缘,在遇到非四边形异形平面、复杂圆角弧形轮廓或局部边界严重凹凸变形时无法正常提取角点。
  • 掩膜溢出与误分割风险:当平面目标仅为复杂 3D 实体的一个表面、且初始帧未完全展示整体时,SAM 2 容易将分割范围蔓延扩散至整个 3D 物体表面,导致四边形边界失真。
  • 直边缘遮挡导致几何虚假重构:若遮挡物自身带有笔直边缘,掩膜分割可能将其与目标边缘组合成新的假四边形,使 SAM-H 误把部分可见的局部区域当成完整物体求解单应性。

相关工作与启发

  • vs WOFT (Serých & Matas, WACV 2023):WOFT 依靠 RAFT 光流预弯折进行加权单应性拟合,短时精度极高但在遮挡和模糊丢失后无法自愈。本文在此基础上将 SAM-H 作为重检测器接入,形成 WOFTSAM,在维持高精度的同时攻克长时重定位。
  • vs HVC-Net (Zhang & Ling, CVPR 2022):HVC-Net 通过深度网络端到端回归 4 个控制点并预测置信度,但在大幅度透视形变与复杂多变纹理下的泛化能力受到训练集分布限制。本文利用 SAM 2 和 DINOv2 的大模型零样本先验,展现出更强的跨场景泛化力。
  • vs PRTrack (Zhang et al., ICCV 2023):PRTrack 同时预测角点热图与掩膜以支持多目标平面跟踪,但在复杂遮挡下易出现角点错配。本文在 MPOT-3K 基准的一对一评测中在 \(p@50\) 指标上取得 95.1%,大幅超越 PRTrack 的 92.85%。

评分

  • 新颖性: ⭐⭐⭐⭐☆ (将基础分割大模型掩膜通过霍夫变换几何求交和自监督消歧转化为 8-DoF 位姿,思路精巧自然)
  • 实验充分度: ⭐⭐⭐⭐⭐ (覆盖 POT-210、PlanarTrack 和 MPOT-3K 三大基准,并深入剖析标注误差并发布高精度重标注数据)
  • 写作质量: ⭐⭐⭐⭐⭐ (逻辑推进环环相扣,图表清晰,对模型互补性与失败模式的剖析坦诚透彻)
  • 价值: ⭐⭐⭐⭐⭐ (为长时平面跟踪确立了崭新的 SOTA 基准,开源代码并推动了高精度跟踪评测标准的演进)