跳转至

MJEPA: A Simple and Scalable Joint-Embedding Predictive Architecture for Audio-Visual Learning

会议: ECCV 2026
论文: ECCV 2026 Poster
全文: ECCV Open Access
领域: 音频/语音
关键词: 自监督学习, 音视频表征学习, 联合嵌入预测架构, 跨模态对齐, 冻结特征评测

一句话总结

MJEPA 提出了一种极简且可扩展的音视频自监督联合嵌入预测架构,通过单一共享 ViT 编码器与纯粹的隐空间预测目标,结合模态内多层级预测与跨模态双向预测对齐,在无需复杂对比损失、像素/频谱重构与重度数据增强的前提下,刷新了多项音视频基准的冻结特征评估记录。

研究背景与动机

在大规模无标注视频数据上进行自监督表征学习,已成为计算机视觉与多模态智能的核心基石。由于视频中的音频流与视觉画面在物理世界中天然协同发生,利用两者固有的时空对应关系共同学习音视频表征显得尤为自然。然而,现有的音视频自监督学习方法(如 CAV-MAE、EquiAV、MAViL 等)普遍依赖高度复杂的混合系统:它们通常为音频和视频分别设计独立的单模态编码器,并交织使用对比学习损失、掩码像素/频谱重建、跨模态知识蒸馏以及精巧定制的数据增强策略。这种结构上的割裂与目标函数的繁复,不仅极大地限制了多模态之间的协同潜力,也构成了向超大规模模型与异构非配对数据扩展的严重瓶颈。

更为关键的矛盾在于,若直接将单模态预训练中行之有效的参数共享策略简单照搬到多模态场景,往往会适得其反。先前多项研究(如 VATT、XKD、AVSiam)均观察到:简单地将双塔架构替换为一个单一共享编码器后,编码器权重会同时被异质的音频频谱模式与视频视觉纹理拉扯,导致其单模态表征能力严重退化,甚至大幅落后于独立的单模态基准模型。联合嵌入预测架构(JEPA)通过在隐空间预测被掩码区域的抽象语义表征,虽然在图像(I-JEPA)、视频(V-JEPA)和音频(A-JEPA)等单模态任务中展现出无需低级重构的优雅泛化性,但此前尚未成功拓展至统一的多模态学习范式中。

本文的切入视角在于:既然不同模态在足够高阶的语义空间中具有向柏拉图表征假说(Platonic Representation Hypothesis)收敛的趋势,那么单一共享编码器不仅是可行的,而且必须通过一种轻量的跨模态预测目标来显式约束高层语义一致性,从而化解参数竞争。本文的核心 idea 是:完全摒弃对比损失与像素级重构,构建一个基于单一共享编码器的统一音视频 JEPA 框架;通过在模态内实施多层级掩码特征预测以捕获结构细节,并在模态间通过全局汇聚特征的双向互预测实现高阶语义对齐,不仅彻底解决了参数共享导致的单模态退化,更促成了跨模态正向迁移与向 10 亿参数大模型及异质视频数据的平滑扩展。

方法详解

整体框架

MJEPA 的整体框架追求极致的简洁性与统一性。输入音频(对齐至 10 秒并转为 log-mel 声谱图)与视频片段首先分别通过极薄的模态特异性浅层卷积投影层(音频为 2D 卷积,视频为 3D 卷积)进行 Patch/Tubelet 标记化,并叠加模态嵌入与时空绝对位置编码,映射到统一的隐藏维度中。模型支持三种输入模式:纯音频(a)、纯视频(v)以及拼接的音视频混合序列(av)。随后,统一的上下文编码器 \(E_\theta\) 处理可见标记序列,而其指数移动平均(EMA)更新的目标编码器 \(E_{\bar{\theta}}\) 则处理未经掩码的完整序列,为预测器提供稳定的目标表征。

该框架的核心训练动力来源于两套互补的预测任务:一是模态内联合嵌入预测,由一个轻量级 Transformer 预测器 \(P_\phi\) 接收上下文编码器的多层中间特征与可学习掩码标记,预测目标在掩码位置的多层特征;二是跨模态双向联合嵌入预测,由六个极简的 3 层 MLP 跨模态预测器 \(C^{m_1 \to m_2}_\psi\) 接收源模态被掩码输入编码后的顶层全局均值汇聚向量,直接回归目标模态完整输入编码后的顶层全局均值汇聚向量。整个系统仅最小化平滑的 \(L_1\) 距离,无负样本对比、无频谱回归,且所有任务全程共享底座编码器及其 EMA 副本的权重。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    A["多模态连续输入<br/>音频声谱图 / 视频片段 / 音视频对"] --> B["模态特定标记化与单一共享编码器<br/>2D/3D Conv投影 + 时空Pos/Mod嵌入 + 统一ViT"]
    B --> C["多层次模态内隐空间特征预测<br/>抽取多层中间特征拼接过MLP + 掩码Token恢复"]
    B --> D["全局汇聚跨模态双向预测对齐<br/>顶层Mean-Pooling + 3层轻量MLP预测跨模态全局表征"]
    C --> E["联合优化与多源异构扩展<br/>9项L1预测目标端到端反传 + 计算分流并行扩展"]
    D --> E
    E --> F["下游多场景冻结表征评测<br/>单一冻结ViT输出 + 4层Transformer Attentive Probe"]

关键设计

1. 模态特定标记化与单一共享编码器:统一多模态特征载体 针对传统方法构建多套独立网络导致参数冗余且难以共享通用表征的痛点,MJEPA 坚持使用单个 Vision Transformer 作为唯一的特征提取主干。音频被预处理为 \(1024 \times 128\) 的 log-mel 声谱图,采用 2D 卷积划分成 patches;视频帧则采用 3D 卷积划分为 spatio-temporal tubelets。为了在保持主干完全共享的同时保留各自独特的几何与时序拓扑,音频输入添加 2D sincos 绝对位置编码(时间-频率),视频输入添加 3D sincos 绝对位置编码(时间-高度-宽度),并各自叠加一个可学习的模态类型嵌入向量。无论是单模态输入还是拼接后的音视频双模态输入,均进入同一个上下文编码器 \(E_\theta\) 中进行自注意力建模。这种极简设计不仅将模型参数压缩为单一实体,更使网络在结构层面具备了处理任意单模态、混合模态输入的通用能力。

2. 多层次模态内隐空间特征预测:多级特征层级联合表征 在确定单一编码器后,若仅在顶层实施掩码特征预测,模型容易忽视中底层的时空局部几何与声学细节。MJEPA 引入了多层次(multi-level)模态内预测机制,分别对纯音频(\(a \to a\))、纯视频(\(v \to v\))以及拼接音视频(\(av \to av\))应用统一的隐空间掩码预测。具体而言,对于 ViT-L 模型提取第 \(\{5, 11, 17, 23\}\) 层,对于 ViT-g 模型提取第 \(\{9, 19, 29, 39\}\) 层的中间特征,将这些多层特征沿通道维度拼接后通过一个 2 层 MLP 投影回模型的隐藏维度,输入到一个轻量级 Transformer 预测器 \(P_\phi\)(隐藏维度仅 384)。目标分支由停止梯度(stop-gradient)的 EMA 目标编码器 \(E_{\bar{\theta}}\) 抽取未掩码输入对应的多层特征:

\[ \mathcal{L}_{m \to m} = \frac{1}{|M|} \sum_{i \in M} \| P_\phi(E_\theta(x_m^{\text{vis}}), \Delta_m)_i - \text{sg}(E_{\bar{\theta}}(x_m))_i \|_1 \]

其中 \(M\) 为被掩码的标记索引集合,\(\Delta_m\) 为携带目标位置的可学习掩码标记,\(\text{sg}(\cdot)\) 表示停止梯度操作。通过在隐空间预测多层级表征,编码器既保留了底层的局部细节,又抽象了高层结构,避免了像素级重建陷入高频噪声的弊端。

3. 全局汇聚跨模态双向预测对齐:破除模态冲突与建立语义纽带 消融实验证实,单一共享编码器若仅进行模态内预测,其单模态性能会因参数竞争而全面崩塌(音频与视频得分均显著倒退)。然而,音视频之间缺乏空间与时序上的逐标记严格对齐,强制进行局部 token 级跨模态匹配极易引入严重伪相关。MJEPA 设计了基于全局均值汇聚的跨模态预测目标,仅在顶层特征上通过极轻量的 3 层 MLP 进行对齐预测。具体包含六项双向跨模态预测损失(\(a \leftrightarrow v\)、\(a \leftrightarrow av\)、\(v \leftrightarrow av\)):

\[ \mathcal{L}_{m_1 \to m_2} = \| C_\psi^{m_1 \to m_2}(\text{pool}(E_\theta(x_{m_1}^{\text{vis}}))) - \text{sg}(\text{pool}(E_{\bar{\theta}}(x_{m_2}))) \|_1 \]

其中 \(\text{pool}(\cdot)\) 为跨标记的均值汇聚操作,\(C_\psi^{m_1 \to m_2}\) 为跨模态预测器。该设计的精妙之处在于:低层特征保留各自模态专有的频谱或纹理特性,而顶层全局特征则被引导至跨模态共享的语义流形上。这一目标成功将原本导致参数冲突的负向干扰转变为双向语义增强,甚至使模型在完全没有对比负样本的情况下自发涌现出极高精度的跨模态检索能力。

4. 异构多源数据混合训练与模型扩展:从海量非配对视频中正向迁移 现实中成对的高质量音视频数据有限,而无声视频或未配对视频规模庞大。得益于单一共享编码器的统一接口,MJEPA 可以无缝接入异构非配对数据,无需对网络架构做任何修改。在规模化实验中,模型在音视频对数据集 AS2M(约 180 万段 10 秒音视频对)的基础上,直接融入纯视频数据集 VM2M(约 200 万段纯视频,来自 HowTo100M、Kinetics-710 和 SSv2)。在分布式训练时,一部分 GPU 专职消费音视频对并计算全部 9 项损失,另一部分 GPU 仅消费纯视频并计算纯视频模态内损失 \(\mathcal{L}_{v \to v}\),并在梯度同步时为纯视频损失乘以 5.0 的缩放权重以平衡梯度范数。得益于跨模态预测建立的强语义桥梁,单纯追加纯视频数据不仅大幅推高了视频指标,亦显著增强了音频特征质量,展现出极强的正向跨模态迁移能力,并平滑扩展至 10 亿参数的 ViT-g 架构。

损失函数 / 训练策略

MJEPA 的最终预训练损失函数极其简洁,为三项模态内多层预测损失与六项跨模态顶层预测损失的未加权直接求和:

\[ \mathcal{L}_{\text{total}} = \underbrace{\mathcal{L}_{a \to a} + \mathcal{L}_{v \to v} + \mathcal{L}_{av \to av}}_{\text{模态内多层预测}} + \underbrace{\mathcal{L}_{a \to v} + \mathcal{L}_{v \to a} + \mathcal{L}_{a \to av} + \mathcal{L}_{av \to a} + \mathcal{L}_{v \to av} + \mathcal{L}_{av \to v}}_{\text{跨模态顶层对齐预测}} \]

模型采用 AdamW 优化器(\(\beta_1=0.9, \beta_2=0.995\)),以 bfloat16 混合精度训练 150k steps。对于基础 ViT-L,音频掩码率设为 75%–80%,视频采用沿时间轴贯穿的 8 个小掩码块(占比 15%);在 scaled ViT-L 和 ViT-g 上,视频掩码进一步升级为包含 8 个小块与 2 个大块(占比 70%)的多块掩码策略,并在预训练后追加 12k 步、输入提升至 64 帧的高分辨率退火微调(Cooldown)。下游任务评测一律遵循严格的冻结协议,通过 1 个可学习 Query 与 4 层 Transformer 组成的 Attentive Probe 评估表征质量。

实验关键数据

主实验

在 AudioSet-20K 音视频基准与纯音频基准上,MJEPA 与现有顶尖自监督及全参数微调方法进行了全面对比。评测均采用 Attentive Probing 协议;如下表所示,MJEPA 在冻结评估中刷新所有指标,甚至超越了大量全参数微调基线。

模型 参数量 预训练数据 评测设置 AS20K (A) mAP AS20K (V) mAP AS20K (A-V) mAP ESC-50 Acc (%) FSD50K mAP
CAV-MAE 170M IN+AS 冻结特征 19.38 18.14 34.59 77.5 46.1
MAViL 170M IN+AS 冻结特征 30.00 – – 90.8 –
EquiAV 170M IN+AS / AS 冻结特征 34.25 18.60 38.60 93.2 57.9
CAV-MAE Sync 170M AS 冻结特征 21.66 16.20 28.50 89.2 55.5
MJEPA ViT-L (本文) 300M AS 冻结特征 38.89 25.38 42.90 95.2 63.9
MJEPA ViT-L + 数据扩展 (本文) 300M AS+VM2M 冻结特征 40.00 29.63 45.31 96.8 65.5
MJEPA ViT-g + 数据扩展 (本文) 1B AS+VM2M 冻结特征 40.97 29.82 45.44 96.9 65.8
CAV-MAE (全微调报导) 170M IN+AS 全参数微调 37.70 19.80 42.00 – –
MAViL (全微调报导) 170M IN+AS 全参数微调 41.80 24.80 44.90 94.4 –
EquiAV (全微调报导) 170M AS 全参数微调 42.40 25.70 46.60 96.0 62.6

注:全微调基线数据摘自其原始论文;AS 表示 AudioSet-2M,IN 表示 ImageNet-1K,VM2M 表示约 200 万视频的非配对混合数据集。

消融实验

为了彻底解耦架构中各组件的贡献,作者在 AudioSet-20K 上进行了渐进式消融研究,清晰展示了从单模态、未对齐共享到跨模态对齐、双模态联合编码与规模化扩展的性能轨迹。此外,在纯视频动作识别(Kinetics-400 / SSv2)及跨模态检索实验中进一步证实了跨模态对齐的关键作用。

配置阶段 架构与目标说明 AS20K (A) AS20K (V) AS20K (AV) 核心观察与结论
1. 单模态独立基线 独立音频编码器 (\(L_{a \to a}\)) 与独立视频编码器 (\(L_{v \to v}\)) 30.87 19.84 – 模态各自为战,无跨模态信息交互
2. 朴素共享编码器 单一 ViT 编码器,仅保留 \(L_{a \to a}\) 与 \(L_{v \to v}\),无对齐 28.70 17.90 32.38 两模态均发生严重退化 (A -2.17, V -1.94),参数存在破坏性竞争
3. + 跨模态对齐 共享编码器引入 \(L_{a \leftrightarrow v}\) 顶层双向均值对齐预测 33.52 19.58 36.34 立刻解除退化危机,音频甚至大幅反超单模态基准 (+2.65)
4. + 音视频联合编码 (Full MJEPA) 编码器支持拼接输入,引入 \(L_{av \to av}\) 及 \(L_{a/v \leftrightarrow av}\) (共9项Loss) 38.89 25.38 42.90 模态协同全面爆发,相比单模态基准 A 提升 +8.02,V 提升 +5.54
5. + 数据规模扩展 ViT-L 在 AS2M 基础上引入纯视频 VM2M 异构训练 40.00 29.63 45.31 纯视频数据显著反哺音频表征 (A 从 38.89 升至 40.00)
6. + 模型规模扩展 参数量扩展至 ViT-g (1B) 并配合高分辨率 Cooldown 40.97 29.82 45.44 冻结特征表现继续稳步提升,逼近甚至反超全微调基线

在视频理解基准上,MJEPA ViT-L (AS+VM2M) 在 K400 达到 84.7% Top-1 准确率,在 SSv2 达到 73.3%,几乎追平了在 10 倍以上视频数据(VM22M)上训练的专门视频模型 V-JEPA 2 ViT-L(85.1% / 73.7%)。而在无任何对比对比损失约束的跨模态检索实验中,MJEPA 在 AudioSet 检索测试集上实现 Audio\(\to\)Video R@1 为 29.3%(R@5 为 53.7%),Video\(\to\)Audio R@1 为 30.6%(R@5 为 53.4%),完全持平甚至微幅超越了基于强对比学习的 EquiAV(29.6% / 30.1%)。

关键发现

  • 跨模态预测是共享编码器的救命稻草:单一 ViT 编码器若仅跑模态内目标,必然导致参数恶性竞争与特征退化;一旦施加全局跨模态预测目标,不仅彻底化解了梯度冲突,还实现了强力的双向语义正向迁移。
  • 视频数据能够直接反哺音频表征:由于建立了跨模态语义映射,在预训练中仅仅注入纯视频无标注数据(VM2M),就能使冻结音频表征在 AS20K、ESC-50 和 FSD50K 上全部实现单调递增,证明了跨模态协同对单模态泛化能力的深层增益。
  • 纯预测性目标足以胜任跨模态检索:传统认知认为 cross-modal retrieval 必须依赖明确推开负样本的 InfoNCE 对比损失;MJEPA 证明纯粹在隐空间通过 \(L_1\) 距离对齐两模态全局表征,同样能收敛出高度判别性的跨模态共享空间。

亮点与洞察

  • 极简的架构美学与统一目标:通篇不含对比学习负样本队列、不需要复杂的像素/频谱 Patch 回归解码器、无重度几何数据增强。整个系统仅由单一 ViT 编码器与纯 \(L_1\) 隐空间预测驱动,设计极其优雅且易于工程扩展。
  • 多层局部预测与顶层全局对齐的精妙分工:在模态内,提取多层级特征进行空间/频域掩码预测,迫使网络学习细粒度的局部物理结构;在模态间,放弃无法精确匹配的 token 级对齐,仅对顶层经过 mean-pooling 的全局表征施加轻量预测,恰好切中高阶语义收敛的本质。
  • 优雅的异构多源数据接入能力:单一共享编码器天然兼容纯音频、纯视频与音视频对,在分布式集群上只需通过简单的任务分流与梯度加权(weight 5.0),即可将海量单模态视频沉淀为多模态共享资产,为未来多模态大模型预训练提供了极具通用性的范式。

局限与展望

  • 跨模态预测机制仍显质朴:当前跨模态预测仅使用简单的 3 层 MLP 和全局均值池化,忽略了音视频中局部的时空动态交互(如发声物体的位置与运动节拍),未来可探索基于轻量交叉注意力或可变形注意力的局部-全局自适应跨模态预测器。
  • 缺乏语言与文本维度的协同:MJEPA 目前专注于音视频物理信号的联合建模,尚未引入文本数据。如何将其无缝拓展为 Audio-Visual-Language 的三模态统一 JEPA,是迈向具身智能与大一统世界模型的关键一步。
  • 算力与训练开销依旧偏大:虽然避免了重构像素的高计算量,但 9 项预测损失以及 1B 参数模型的多阶段训练与高分辨率退火依然依赖大规模 GPU 集群支撑。

相关工作与启发

  • vs CAV-MAE / MAViL: CAV-MAE 与 MAViL 依赖双塔编码器配合对比学习与掩码自编码重构(MAE),结构繁复且高度依赖 ImageNet 预训练初始化;MJEPA 采用单一共享编码器从零开始自监督训练,完全在隐表征空间预测,冻结表征质量显著超越对手。
  • vs EquiAV: EquiAV 依赖精细设计的数据等变性增强与对比学习来保留变换信息;MJEPA 无需任何复杂数据增强,仅凭自然的音视频对应与 JEPA 预测即可达到甚至超越其性能。
  • vs V-JEPA / A-JEPA: V-JEPA 与 A-JEPA 仅局限于单模态视域;MJEPA 是首个将 JEPA 范式成功拓展至音视频双模态统一共享编码器的开创性工作,并证明了跨模态预测对打破模态退化的核心决定性作用。

评分

  • 新颖性: ⭐⭐⭐⭐⭐ 首次将 JEPA 统一于单编码器音视频学习,用纯预测目标化解参数退化矛盾,极具启发性。
  • 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 7 个音视频与单模态基准,渐进式消融设计严谨扎实,横跨 1B 参数与大规模异构扩展。
  • 写作质量: ⭐⭐⭐⭐⭐ 逻辑层层推进,图表直观精炼,问题定义与机理解释非常清晰。
  • 价值: ⭐⭐⭐⭐⭐ 为多模态自监督表征学习提供了一条不依赖复杂工程技巧的极简、可扩展的全新道路。