跳转至

Thermo-JEPA: Learning a Geometry-Grounded Thermal World Model via Cross-Modal Privileged Masking

会议: ECCV 2026
论文: ECCV 原文
代码: https://eccv.ecva.net/virtual/2026/poster/3162
领域: 3D视觉
关键词: 世界模型, 热红外视觉, 自监督学习, 跨模态对齐, 零样本迁移

一句话总结

针对热红外视频中物体因热平衡导致的“帧内空间均质化”难题,Thermo-JEPA 提出特权信息学习范式,利用配对 RGB 提取置信度门控的空间拓扑作为软先验注入教师自注意力机制,在杜绝模态污染的同时实现了纯热成像下的高质量世界模型动态预测。

研究背景与动机

世界模型作为物理感知和动态预测的核心底座,在具身智能、机器人导航以及自动驾驶等任务中取得了突破性进展。然而,当前主流的世界模型(如基于 V-JEPA 等联合嵌入预测架构)几乎完全建立在可见光(RGB)数据之上。RGB 传感器在暗光、强眩光、浓雾或雨雪等恶劣全天候环境下极易失效,而热红外(IR)传感器通过捕获物体辐射的热量而非反射光线,天然具备全天候工作能力。将生成式世界模型拓展至热红外领域,是构建全天候鲁棒物理感知系统的必由之路。

然而,将标准的时空掩码建模直接套用到热红外视频时,模型表征会出现严重的坍塌。这一现象背后的核心物理根源在于“帧内空间均质化(intra-frame spatial homogenization)”:在现实物理场景中,相邻但类别不同的物理实体(例如桌上的咖啡机、纸杯和零食包装盒)往往处于热平衡状态,彼此之间的像素级温度梯度趋近于零。在缺乏高频纹理变化的单模态热图像中,标准的无约束自注意力机制会将这些平缓区域视为同质区域,进而模糊物理边界并破坏物体的几何拓扑。丧失了清晰的几何结构先验,模型在预测物体运动轨迹和时间演化时便会发生严重的表征坍塌。

以往的多模态对比学习或早期融合方案,通常强制热红外潜在表征去拟合 RGB 的稠密特征分布。这种直接对齐的硬性约束会引发严重的“模态污染(modal pollution)”,迫使热红外网络凭空幻觉出热谱中物理不存在的高频纹理,不仅扭曲了热力学特有的运动学表征,还剥夺了系统在纯红外环境下的独立部署能力。针对这一矛盾,本文提出特权信息学习(LUPI)范式,仅在预训练阶段将 RGB 作为提取几何边界的特权线索。核心 idea:从配对 RGB 数据中提取纯帧内空间拓扑邻接先验,经特征方差置信度门控后以加性软约束注入 EMA 教师网络的自注意力矩阵,显式解耦物体语义边界并完全阻断梯度反向传播,实现高保真、无模态污染的纯热成像世界模型学习。

方法详解

整体框架

Thermo-JEPA 的整体流程遵循教师-学生掩码预测架构,分为特权空间拓扑提取、置信度门控注意力调制、以及掩码时空预测三大阶段。在输入端,模型接收严格时空对齐的配对视频(热红外序列 \(X_{\text{IR}}\) 与可见光序列 \(X_{\text{RGB}}\))。为杜绝时间维度的信息泄漏,拓扑提取仅严格在独立帧的空间维度进行:首先利用预训练冻结的 DINOv2 提取单帧特征并计算 Patch 间的余弦相似度邻接矩阵,同时依据通道特征方差生成空间置信度图;随后将置信度加权的空间拓扑组装成块对角矩阵,以可学习缩放因子注入 EMA 教师网络的自注意力计算中;最后,学生网络仅接收热红外被掩码序列,在潜空间预测对应被掩码 Patch 的特征,通过阻断梯度的 \(L_1\) 损失完成端到端预训练。推理阶段完全剥离 RGB 分支,仅输入纯热红外数据。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["配对 RGB-T 视频输入<br/>X_IR 与 X_RGB 时空对齐"] --> B["帧内特权空间拓扑提取<br/>DINOv2 计算 Patch 相似度与置信度"]
    B --> C["置信度门控注意力调制<br/>块对角矩阵注入教师网络自注意力"]
    C --> D["梯度阻断与时空因果隔离<br/>学生网络掩码预测对齐教师目标"]
    D --> E["纯热红外下游推理<br/>零样本动作预测与未来轨迹外推"]

关键设计

1. 帧内特权空间拓扑提取:从可见光先验中解耦纯几何边界

传统跨模态蒸馏直接逼近 RGB 稠密特征,导致网络产生虚假纹理幻觉并引发模态污染。本文针对热平衡导致的边界模糊,提出仅将可见光视为特权信息(LUPI)来提取抽象几何拓扑。具体而言,冻结的 RGB 基础模型(DINOv2 ViT-L)在独立二维空间对每帧图像提取特征 \(F_{\text{RGB}}^{4D} \in \mathbb{R}^{B \times T \times N \times d}\)。在任意给定时间切片 \(t\) 内,通过计算 Patch 之间的成对余弦相似度构建空间拓扑邻接矩阵 \(S[b, t, i, j]\)

\[S[b, t, i, j] = \frac{\langle F_{\text{RGB}}^{4D}[b, t, i, :], F_{\text{RGB}}^{4D}[b, t, j, :] \rangle}{\| F_{\text{RGB}}^{4D}[b, t, i, :] \|_2 \| F_{\text{RGB}}^{4D}[b, t, j, :] \|_2}\]

这一设计仅保留实体之间的相对亲和度与结构边界,完全滤除了 RGB 的具体颜色与表面高频材质细节。由于操作严格限制在单帧内部(折叠时间维度),拓扑提取不会在时间步之间发生因果泄漏,为世界模型奠定了合法的时序建模基础。

2. 置信度门控注意力调制:在维持热自律性的同时抑制低照度噪声

若直接无条件地将 RGB 拓扑强加给热红外模型,在夜间或极暗环境下 RGB 自身产生的噪声拓扑会反向破坏热红外特征。为此,本文设计了基于局部特征方差的自适应空间置信度门控。通过计算 DINOv2 嵌入在通道维度上的局部方差并经过 Sigmoid 激活,生成置信度向量 \(c_{b,t} \in \mathbb{R}^N\)。高置信度代表光照充分且结构显著,低置信度代表可见光退化。在此基础上,先验矩阵经成对外积置信度加权为 \(\hat{S}_{b,t} = (c_{b,t} c_{b,t}^T) \odot S[b, t]\)。为了适配多头自注意力机制(MHSA),模型将各帧先验组装为全序列长度的块对角矩阵 \(M_{\text{prior}}^{(b)}\)

\[M_{\text{prior}}^{(b)} = \lambda \cdot \text{BlockDiag}(\hat{S}_{b,1}, \hat{S}_{b,2}, \dots, \hat{S}_{b,T})\]

式中 \(\lambda\) 为初始化为 0 的可学习标量标量。非同帧(\(t_i \neq t_j\))之间的偏置严格置零。该矩阵以加性偏置的方式参与教师网络的注意力计算 \(\text{Softmax}\left(\frac{Q_{\text{IR}} K_{\text{IR}}^T}{\sqrt{d}} + M_{\text{prior}}\right) V_{\text{IR}}\)。当热红外自身具有显著温差时,热注意力天然主导计算;当可见光严重失效时,门控机制将偏置自动衰减为零,使模型平滑回退为纯红外自注意力,充分保障了热成像的物理自律性。

3. 梯度阻断与时空因果隔离:防止模态污染并保障世界模型动态推理

在多模态联合优化中,如果反向传播梯度流经特权先验分支,学生网络将倾向于通过捷径学习可见光纹理,从而在测试阶段无法仅凭热红外特征完成动态推理。Thermo-JEPA 规定学生编码器 \(E_\theta\) 仅输入经时空掩码的热红外 token,结合可学习 mask token 和 3D-RoPE 经预测器 \(P_\phi\) 输出掩码块表征 \(Z_{\text{pred}}\)。教师网络 \(E_\xi\) 则采用指数移动平均(EMA,动量设为 0.999)进行慢速更新。损失函数通过 Gather 算子抽取对应掩码位置的教师目标并施加梯度截断(\(\text{sg}\)):

\[\mathcal{L}_{\text{align}} = \frac{1}{B \cdot M} \sum_{b=1}^B \sum_{m=1}^M \| Z_{\text{pred}}[b, m] - \text{sg}(\text{Gather}(Z_{\text{seq}}^{\text{EMA}}, \mathcal{M})[b, m]) \|_1\]

通过对教师输出实施绝对的梯度阻断,可见光模态信息被牢牢锁死在 EMA 教师的软约束之中,杜绝向学生网络的参数泄漏。学生网络被迫在隐空间中纯粹利用未掩码热红外信息去预测具备几何边界规整性的目标表示,从而在冻结骨干网络的前提下获得纯热红外下的优异动态外推能力。

损失函数 / 训练策略

模型预训练完全依托提出的 RGBT-World 视频数据集(训练集包含 15 小时严格时空对齐视频),骨干网络采用 ViT-L/16(300M 参数),管状 patch 分块大小为 \(16 \times 16 \times 2\)。优化器采用 AdamW,峰值学习率为 \(1\times 10^{-4}\) 并配合余弦退火衰减,权重衰减系数为 0.04。掩码策略采用动态时空掩码比例(30% 至 80%),强迫网络进行深层语义推断而非浅层局部像素插值。模型在 4 块 NVIDIA A6000 GPU 上完成预训练,所有下游评测均严格冻结预训练骨干网络,仅训练轻量任务头。

实验关键数据

主实验

评估体系包含两个核心维度:一是留出测试集上的零样本动作预测(Zero-Shot Action Anticipation),衡量潜在空间在无动作微调下的运动学建模质量;二是空间与运动学完整性探测(Diagnostic Probing),包括单层卷积预测框评估的当前定位能力(Spatial mIoU)以及单层 Transformer 预测未来 8 帧轨迹的位移误差(ADE/FDE)。所有对比方案在下游评估时均接收完全相同的纯红外输入。

方法 预训练参数 预训练数据 动作预测 Top-1 Acc (%) 动作预测 Recall@5 空间 mIoU (↑) 轨迹 ADE (↓) 轨迹 FDE (↓)
DINOv2 (Frozen) 1.1B LVD-142M 21.4 34.2 48.2 15.6 21.3
SigLIP 2 1.2B WebLI 23.8 36.1 - - -
InternVideo2 6B 内部数据 29.6 41.3 - - -
VideoPrism 1B VP-Corpus 31.2 43.5 - - -
Cosmos-World 7B Cosmos-Data 33.5 46.8 - - -
VideoMAE v2 (IR-Supervised) - - - - 55.4 12.3 17.8
Vanilla V-JEPA2 (IR-Only) 300M RGBT-World 18.6 28.4 32.1 28.5 39.4
Contrastive-IR (Early Fusion) 300M RGBT-World 24.2 35.5 - - -
Thermo-JEPA (本文) 300M RGBT-World 45.8 62.1 68.7 8.4 11.2

消融实验

消融实验在 RGBT-World 上统一预训练 50 个 epoch,评估先验来源、置信度门控机制以及梯度隔离对特征质量的影响。

变体配置 先验来源 置信度门控 (\(C\)) 梯度反向传播 空间 mIoU (↑) 零样本 Acc (%) 说明
(a) Vanilla V-JEPA2 无先验 不适用 32.1 18.6 纯 IR 预训练发生空间均质化坍塌
(b) Random Topology 均匀噪声 阻断 (Stopped) 15.2 12.4 随机噪声先验严重扰乱表征几何
(c) Edge-based Prior Sobel 滤波 阻断 (Stopped) 41.5 28.7 低阶边缘缺乏高层语义且对模糊敏感
(d) Un-gated Soft Attention DINOv2 阻断 (Stopped) 61.2 38.5 缺乏门控导致暗光下注入错误偏置
(e) End-to-End Leakage DINOv2 允许 (Allowed) 54.8 31.2 梯度泄漏引发模态污染与表征坍塌
(f) Thermo-JEPA (完整模型) DINOv2 (方差) 阻断 (Stopped) 68.7 45.8 最优组合,几何约束与热自律性平衡

关键发现

  • 均质化坍塌是根本症结:仅依靠纯红外训练的 Vanilla V-JEPA2 精度仅为 18.6%,甚至远低于通用的图像基础模型。PCA 特征分解表明其深层特征完全坍缩至第一主成分(PC1,仅反映全局平均温度),而 Thermo-JEPA 在 PC1 和 PC2 上均维持高方差分布,证明了几何先验成功阻止了潜空间维度的病态收缩。
  • 置信度门控提供自适应容错兜底:缺少置信度门控时(变体 d),零样本动作准确率骤降 7.3%(从 45.8% 跌至 38.5%)。这证实了在可见光退化区域强制注入未经校验的几何先验具有危害性,而基于方差的置信度门控能够优雅平滑地退化为红外自注意力。
  • 梯度阻断杜绝模态污染:一旦允许梯度向目标分支反向传播(变体 e),模型准确率大幅下跌 14.6%(31.2% vs. 45.8%),证明端到端梯度会强迫网络走捷径去解码不存在的 RGB 纹理,唯有严格截断梯度才能确保纯红外潜空间的运动学本征学习。

亮点与洞察

  • 特权信息解耦设计:不同于常规的跨模态特征蒸馏或对比对齐,Thermo-JEPA 仅将可见光降维提取为无色彩、无纹理的纯拓扑图,并作为注意力偏置注入。这种软约束在物理上巧妙保护了红外微观热梯度的独立性。
  • 因果隔离的块对角结构:先验矩阵在时间维度上严格分块对角化,非同帧注意力偏置强行置零。这种数学构造确保了几何引导仅作用于空间,完全避免了世界模型最忌讳的未来时间因果泄漏。
  • 高价值基准 RGBT-World 构建:汇总了 10 个公开基准并补充自研高分辨率无人机数据(最高 2700×2160 RGB / 640×512 IR),提供长达 500 秒的连续视频序列,彻底填补了生成式热红外世界模型缺乏高质量连续对齐视频的行业空白。

局限与展望

  • 依赖预训练时空严格对齐数据:预训练阶段必须输入空间同轴且时间严格同步的 RGB-T 视频对,在跨传感器标定误差或剧烈动态视差下,拓扑注入可能存在局部空间错位。
  • 静态先验对热态突变物体的适应性:当前空间拓扑完全从可见光提取,若某些物体在可见光中外观高度一致但在红外下存在显著温度差(例如发热故障元器件),拓扑先验可能会施加不必要的聚合倾向。
  • 未来方向:探索弱对齐或非成对 RGB-T 数据下的鲁棒拓扑对齐机制,并结合物理渲染引擎扩展具备物理温升规律推演的热红外交互式动作世界模型。

相关工作与启发

  • vs V-JEPA / V-JEPA 2: V-JEPA 针对可见光视频设计,在热红外领域会因热平衡面临严重的帧内空间均质化坍塌;Thermo-JEPA 继承了其高效的潜空间掩码预测优势,通过置信度门控特权拓扑注入解决了红外域的拓扑崩溃。
  • vs MultiMAE / OmniMAE: 这类多模态早期融合框架要求在掩码重建中跨模态条件输入,测试时难以彻底摆脱对多模态输入的依赖且易产生纹理幻觉;Thermo-JEPA 采用特权学习范式,测试期完全不依赖 RGB,保障了纯红外系统的独立部署。
  • vs ImageBind / VideoCLIP: 基于 [CLS] 向量对比学习的方法会迫使红外潜空间拟合可见光语义分布而忽略红外运动细节;Thermo-JEPA 拒绝特征层面的强行匹配,仅借力空间拓扑软约束,保持了运动学预测的高保真度。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次系统性揭示热红外世界模型中的帧内空间均质化问题,并提出基于 LUPI 的拓扑软约束注意力机制,构思新颖巧妙。
  • 实验充分度: ⭐⭐⭐⭐⭐ 建立了包含 175 万对同步帧的大规模 RGBT-World 基准,评测涵盖零样本预测、探测诊断、PCA维度分析及丰富消融,证据确凿。
  • 写作质量: ⭐⭐⭐⭐⭐ 论文物理直觉清晰,问题形式化严谨,数学公式与图表设计精美、逻辑环环相扣。
  • 价值: ⭐⭐⭐⭐⭐ 为全天候恶劣环境下的具身智能与物理世界模型开辟了全新路径,开源基准与架构具备深远的实用价值。