Where and What: Long-Term Object Tracking in Egocentric Videos¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://jacobchalk.github.io/Whareformer/
领域: 视频理解
关键词: 第一人称视频、长时3D目标跟踪、物体恒存性、Transformer关联、多模态时空记忆
一句话总结¶
Whareformer 提出了首个针对第一人称视频“离线不离心”(OSNOM)长时目标跟踪任务的可学习方案,将观测与轨迹间的外观与 3D 相对距离联合映射为轨迹似然,并引入显式 New Track 词元进行全局前馈匹配,在 EPIC-KITCHENS-100 上取得 72.2% mPCL 和 84.0% IDF1,显著刷新 SOTA。
研究背景与动机¶
人类在日常活动中能够毫不费力地在脑海中维持周围物理环境的心理地图,即使钥匙放在柜台、手机丢在茶几、水杯被身体完全遮挡或暂时移出视线,也能清楚记得“什么物体在什么位置”(what is where)。第一人称视角(egocentric video)由于穿戴者剧烈的头部晃动、频繁进出视野、剧烈光照视角变化以及高频的人手交互,对实现具备人类同等空间认知与物体恒存性(object permanence)的具身智能体构成了严峻挑战。近期建立的“离线不离心”(Out of Sight, Not Out of Mind, OSNOM)基准正是为了形式化评测模型在物体离开视野或长时间遮挡时在线持续召回其 3D 位置并维持实例身份一致性的能力。
然而,现有的长时第一人称 3D 目标跟踪方案(如 LMK、IT3DEgo)高度依赖基于人工预设硬阈值的启发式关联规则与匈牙利匹配算法。这类启发式方法存在本质缺陷:当空间邻近存在多个物体交互、物体被移入或移出原本静止的位置、或者出现视角剧烈变化时,固定阈值无法自适应权衡外观(what)与 3D 空间距离(where)的置信度,极易引发轨迹误匹配。更严重的是,现有方法将“创建新轨迹”仅视为所有既有轨迹匹配代价均超过固定阈值时的兜底失败分支,缺乏主动判断新物体出现的全局决策能力。
本文认为,解决长时第一人称追踪的核心在于摆脱脆弱的启发式规则,构建端到端的数据驱动关联与记忆机制。核心 idea:将观测与已有轨迹的 2D 外观及 3D 空间距离联合映射为可学习的轨迹分配似然,并引入显式的 New Track 词元使新轨迹创建成为可竞争的全局决策,通过 Transformer 前馈注意力实现外观演化与 3D 位置联合推理。
方法详解¶
整体框架¶
Whareformer 采用在线前馈处理架构,输入为当前帧 \(t\) 的物体分割掩码导出的观测 \(o_n^t = (a_n^t, l_n^t)\),其中 \(a_n^t\) 为经 PCA 降维与 \(\ell_2\) 归一化的 DINOv2 外观特征向量,\(l_n^t\) 为通过单目深度对齐反投影提升到世界坐标系下的 3D 中心位置。系统维护一个由 \(T\) 条已有轨迹构成的动态轨迹记忆池 \(\mathcal{T} = \{T_1, \dots, T_T\}\)。对于每个观测,系统首先计算其与所有已有轨迹在外观聚类与近期位置缓冲区上的相对欧氏距离,经过可学习投影层映射为似然嵌入向量;随后将一个显式的 NT(New Track)词元与这 \(T\) 个轨迹候选向量拼接为无序序列,送入单层 Transformer 编码器进行自注意力交互,最终由分类头统一预测归属于既有轨迹还是新建轨迹的概率分布,并在匹配后自适应更新轨迹记忆。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["当前帧观测<br/>DINOv2外观 + 3D世界坐标"] --> B["相对距离提取<br/>min外观距离 + min空间距离"]
M["动态轨迹记忆池<br/>DenStream聚类 + 1秒空间缓冲"] --> B
B --> C["可学习投影与似然嵌入<br/>特征无关距离映射"]
C --> D["New Track词元拼接<br/>[NT, e_1, ..., e_T] 无序序列"]
D --> E["Transformer关联编码器<br/>全词元前馈自注意力交互"]
E --> F["置信度冲突消解与轨迹分配<br/>贪心最高置信度分配"]
F --> G["轨迹记忆自适应更新<br/>DenStream流式更新 + 缓冲压入"]
关键设计¶
1. 相对距离提取与特征无关似然嵌入:解耦场景泛化与特征偏置
传统跟踪器直接将高维外观特征或全局坐标拼接送入分类器,容易对训练集中的特定物体类别或特定厨房场景产生过拟合。Whareformer 将跨时序匹配问题抽象为相对距离评估:对于当前观测 \(o_n\) 与已有轨迹 \(T_k\),分别提取外观距离 \(c_{n,k}^A\) 与空间距离 \(c_{n,k}^L\)。其中外观距离取当前特征与该轨迹外观记忆中所有聚类中心的最小平方欧氏距离,空间距离取当前 3D 坐标与轨迹滑动窗口内所有历史坐标的最小欧氏距离:
$\(c_{n,k}^A = \min_{a' \in \mathcal{A}(T_k, t)} \text{dist}(a_n, a')^2, \quad c_{n,k}^L = \min_{l' \in \mathcal{L}(T_k, t)} \text{dist}(l_n, l')\)$
将两维标量拼接后,通过可学习线性投影层 \(g: \mathbb{R}^2 \to \mathbb{R}^d\) 映射为紧凑的似然嵌入向量 \(e_{n,k} = g([c_{n,k}^A, c_{n,k}^L])\)。这种设计不直接依赖绝对特征与绝对空间网格,而是让网络学习外观距离与空间距离之间的非线性权衡曲面,赋予了模型极强的跨数据集与跨场景泛化能力。
2. 显式 New Track 词元与置换不变 Transformer:将新轨迹创建提升为一等公民
启发式方法仅在所有候选匹配得分低于预设阈值时才被动创建新轨迹,在遇到遮挡再现或视角大范围突变时容易误将新物体归入旧轨迹。Whareformer 设计了一个可学习的专属词元 \(\mathrm{NT} \in \mathbb{R}^d\),并将其置于输入序列首位,构成无序候选集:
$\(\mathbf{S}_n = [\mathrm{NT}, e_{n,1}, e_{n,2}, \dots, e_{n,T}] \in \mathbb{R}^{(T+1) \times d}\)$
由于已有轨迹集天然具有无序性,序列中不添加任何位置编码以保证置换不变性(permutation invariance)。通过单层 Transformer Encoder 的自注意力机制,\(\mathrm{NT}\) 词元能够同所有候选轨迹的相对似然进行充分的信息对齐与竞争。线性分类头 \(h\) 输出长度为 \(T+1\) 的概率分布 \(\hat{y}_n = \text{softmax}(h(\mathbf{Z}_n))\),使“新建轨迹”成为与“分配给已有轨迹”地位完全平等的正向预测选项。在同一帧存在多个观测时,采用基于置信度排序的贪心迭代消解,各观测仅需单次复核,运行效率远高于传统匈牙利算法。
3. 动静解耦的双轨轨迹记忆管理:兼顾长时演化与空间局部性
物体在第一人称交互过程中会经历持续的形态变化(如旋转、切开、遮挡)与大范围空间位移。若仅保留最近几帧观测,则完全无法处理长达数分钟的“离线”重新进入;若保留全量历史点,内存与检索开销随视频时长线性爆炸。Whareformer 创新地采用了异构的双轨记忆策略:
- 外观记忆 \(\mathcal{A}(T_k, t)\):引入在线流式密度聚类算法 DenStream,将外观特征流解构为持久核心聚类(persistent clusters)与短期瞬态聚类(transient clusters)。前者固化物体长期稳态外观,后者自适应吸收操作中的暂时形变与光影变化,在常数级内存(全长视频仅占约 220 MB)与极高吞吐(322 FPS)下实现了对无限外观流的近乎无损逼近。
- 位置记忆 \(\mathcal{L}(T_k, t)\):与外观相反,物体在空间中的历史轨迹如果无限保留,会导致不同物体穿行轨迹重叠交织。因此空间位置采用长度固定约为 1 秒(\(W\) 帧)的时间滑动缓冲区,仅记录物体近期静止或运动的局部微空间锚点,精准兼顾测量噪声平滑与位置判别性。
损失函数 / 训练策略¶
模型采用 Teacher Forcing 机制,在带有真值物体轨迹 ID 的连续视频序列中训练。每个训练样本由当前时刻的观测与真值构建的历史轨迹记忆组成,使用标准交叉熵损失监督分类预测: $\(\mathcal{L} = -\sum_{c=0}^{T} y_c \log(\hat{y}_{n, c})\)$ 其中索引 0 对应 \(\mathrm{NT}\) 词元。由于推理阶段轨迹依赖模型自身历史预测并存在分布漂移,作者进一步引入 DAgger 风格的数据聚合策略:每 30 个 epoch 利用当前模型预测重新生成训练样本,并以递增概率混入真实与预测轨迹数据,显著增强了跨域测试时的鲁棒性。
实验关键数据¶
主实验¶
在由 110 段长视频(平均长度约 12-13 分钟)构成的 EPIC-KITCHENS 评测基准上,以及跨域数据集 IT3DEgo 和 HD-EPIC 上,采用完全相同的在 EPIC-KITCHENS 上训练的模型进行零样本跨域评测。空间定位采用 30cm 阈值下的 mPCL(平均正确位置百分比),身份连续性采用 IDF1 衡量(见原论文 Table 1)。
| 数据集 | 指标 | Whareformer (本文) | LMK (之前SOTA) [26] | LMK-Inf (无限记忆基线) | 绝对提升 (vs LMK) |
|---|---|---|---|---|---|
| EPIC-KITCHENS | mPCL (%) | 72.2 | 53.0 | 60.9 | +19.2% |
| IDF1 (%) | 84.0 | 70.0 | 76.6 | +14.0% | |
| IT3DEgo | mPCL (%) | 58.1 | 31.0 | 40.8 | +27.1% |
| IDF1 (%) | 87.9 | 69.2 | 75.5 | +18.7% | |
| HD-EPIC | mPCL (%) | 41.6 | 34.5 | 36.5 | +7.1% |
| IDF1 (%) | 51.6 | 28.0 | 31.9 | +23.6% |
消融实验¶
在 EPIC-KITCHENS 测试集上对核心架构设计(原论文 Table 2)以及记忆表征机制(原论文 Table 3)进行的系统消融:
| 配置 / 消融项 | mPCL (%) | IDF1 (%) | 显存/内存 (MB) | 速度 (FPS) | 机制说明 |
|---|---|---|---|---|---|
| Whareformer (完整模型) | 72.2 | 84.0 | 220.7 | 322 | 双模态 + 可学习 NT + DenStream 外观 + 1s 空间缓冲 |
| 仅空间位置 (L-Only, 去除外观 A) | 34.0 | 50.5 | - | - | 外观缺失导致密集交互与空间替换时完全崩溃 (-38.2% mPCL) |
| 仅外观 (A-Only, 去除位置 L) | 62.6 | 79.5 | - | - | 缺乏 3D 几何约束,无法区分同类复数物体 (-9.6% mPCL) |
| 去除 NT 词元 (改用启发式阈值 0.25) | 53.0 | 69.7 | - | - | 退化为固定启发式阈值创建新轨迹,性能大幅滑坡 (-19.2% mPCL) |
| 固定随机 NT 词元 (非学习) | 72.0 | 83.9 | - | - | 架构提供独立竞争位起主要作用,可学习权重带来微弱增益 |
| 外观改用 1 秒滑动窗口 | 59.4 | 74.7 | 76.7 | 603 | 缺乏长时记忆,物体离开几分钟重现后发生身份断裂 |
| 外观改用无限历史全量缓存 | 70.6 | 83.2 | 1843.8 | 50 | 内存消耗暴增 8.4 倍且易受离群点噪声干扰,性能反不及 DenStream |
关键发现¶
- 显式 NT 词元是打破启发式瓶颈的胜负手:去除 NT 词元后,mPCL 直接暴跌 19.2%(72.2% \(\to\) 53.0%),IDF1 暴跌 14.3%(84.0% \(\to\) 69.7%),说明将新轨迹判定纳入 Transformer 全局注意力竞争对长时交互至关重要。
- DenStream 在效率与精度上超越无限记忆:DenStream 相比全量缓存将内存消耗从 1843.8 MB 压缩到 220.7 MB,推理速度从 50 FPS 提升至 322 FPS,且由于持久/瞬态分层聚类过滤了交互噪声,mPCL 相比无限记忆反而提升了 1.6%(72.2% vs 70.6%)。
- 极小规模训练实现强悍的零样本泛化:虽然模型仅在 56 段第一人称厨房视频上训练,但在 HoloLens2 录制、包含车库与办公室等全新场景的 IT3DEgo 上,mPCL 相对 SOTA 狂揽 +27.1% 的提升,证明基于相对距离的几何与外观映射具有极高的数据泛化效率。
亮点与洞察¶
- 将轨迹起始建模为主动注意力的词元竞争:以往 MOT 跟踪器多将新物体生成视为阈值过滤失败的残差分支,Whareformer 借鉴 UnweaveNet 的设计将 New Track 建模为专用词元,使网络能够自适应平衡“加入已有轨迹”与“开启新轨迹”的边际效益。
- 基于相对距离的高阶映射摆脱了域偏差绑定:模型不直接吃大模型提取的原始向量做注意力,而是将观测与轨迹记忆的最近邻距离标量映射为嵌入;这使得即使换到完全未见过的物体类别与空间尺度,模型依然能稳定工作。
- 流式聚类破局第一人称长时物体演化:DenStream 将流式数据聚类引入交互轨迹记忆,用持久与瞬态两套微聚类以优雅的常数开销解决了长视频记忆遗忘与计算爆炸的两难困境。
局限与展望¶
- 依赖上游 2D 分割与 3D 点提升质量:Whareformer 自身不直接输出 mask 或 3D bounding box,而是依赖 SAM 等 2D 分割器以及基于单目 SLAM/深度的几何提升;上游几何对齐严重漂移时系统仍面临跟踪偏差。
- 缺少对物体拓扑状态突变的因果物理建模:对于厨房场景中物体的物理形态剧烈改变(例如将整颗洋葱切成碎末、面包涂抹果酱),外观与形态的不可逆破坏可能超出平滑聚类的建模范畴,需要更细粒度的部件级或状态感知记忆。
- 未来方向:探索端到端的 3D 具身场景图(Embodied 3D Scene Graph)构建,将物体跟踪与第一人称人手交互意图、空间 affordance 推理深度融合。
相关工作与启发¶
- vs LMK (3DV 2025):LMK 采用手工加权的启发式距离公式与匈牙利匹配,并设定硬阈值建立新轨迹;Whareformer 提出了完全可学习的双模态距离映射与 Transformer 前馈关联,在多数据集上全方位超越 LMK,且推理速度更快。
- vs IT3DEgo (CVPR 2024):IT3DEgo 假设已知目标物体的先验数量且在首帧注册模板,借助卡尔曼滤波在 3D 空间进行追踪;Whareformer 面向更加现实且具有挑战性的未知物体在线发现与长时跟踪,无需任何特权物体数量先验即取得显著更优的表现。
- vs ByteTrack 等 2D 追踪器:ByteTrack 在第一人称视频中面临剧烈视点变换与出画时定位完全失效(EPIC-KITCHENS 上仅 12.3% mPCL);Whareformer 通过融入显式 3D 几何与世界坐标记忆,彻底解决了物体出画后的恒存性召回问题。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ (首个将可学习 Transformer 与 NT 词元成功引入 OSNOM 任务的架构,相对距离映射与流式聚类结合精妙)
- 实验充分度: ⭐⭐⭐⭐⭐ (横跨 EPIC-KITCHENS-100、IT3DEgo、HD-EPIC 三大主流数据集,包含极其完备的消融、显存时延对比与时序曲线)
- 写作质量: ⭐⭐⭐⭐⭐ (问题定义清晰,架构与记忆更新机制层层递进,动机叙述极具说服力)
- 价值: ⭐⭐⭐⭐⭐ (为第一人称具身智能、空间记忆构建与长时人机协作提供了至关重要的基石方案)