V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning¶
会议: ECCV2026
论文: ECCV 原文
领域: 自监督/表示学习
关键词: 密集特征、深层自监督、视频表示学习、联合嵌入预测、世界模型
一句话总结¶
V-JEPA 2.1 把视频潜空间预测的监督扩展到可见位置和多个网络深度,在增强局部时空结构的同时恢复全局语义能力,其 ViT-G 在冻结特征评测中达到 NYUv2 深度 RMSE 0.307 和 SSv2 动作识别准确率 77.7%。
研究背景与动机¶
视频表示不仅要识别“发生了什么”,还要保留“物体在哪里、如何移动、何时发生接触”。 V-JEPA 2 已能从无标签视频中学习较强的动作与动态语义,但它的训练损失只考核被遮挡位置的预测。 可见位置虽然参与预测,却不必在自己的输出中保留对应局部区域的信息。 它们可以把信息汇集成有助于补全遮挡区域的全局摘要,而不是形成适合逐位置读取的特征。 这解释了为什么较好的动作分类能力不必然意味着较好的深度估计或语义分割能力。 作为对照,DINO 系列具有较强的图像密集特征,却不直接通过视频训练学习时间动态。
直接给可见位置也加监督并不能一次解决问题。 原文表 1 中,加入上下文损失后 ADE20K mIoU 从 22.2 上升至 33.8,但 SSv2 准确率从 72.8% 降至 62.5%。 局部信息得到保护的同时,全局理解出现了明显代价。 因此本文真正研究的是如何让同一个表示同时服务于局部结构和全局动态,而不只是让可视化更平滑。 作者进一步把监督延伸至编码器中间层,使不同深度的信息共同参与潜空间预测。
在此基础上,图像与视频的数据比例、输入分词方式及模型容量成为继续提升表示的条件。 图像提供多样的外观,视频提供运动与时序,二者共享编码器但不应被强制编码成相同的静态视频形式。 核心 idea:在空间上监督可见与遮挡位置,在网络深度上监督多层表示,再用原生图像视频输入和规模扩展兼顾密集结构与全局理解。
方法详解¶
整体框架¶
输入是一张图像或一段视频,输出是保留空间位置、并对视频保留时间结构的特征序列。 原生图像视频分词把输入转换成 token,再将同一输入分为可见分支和完整目标分支。 可见分支的 x-encoder 只处理没有被随机丢弃的 token;y-encoder 处理完整输入,提供停止梯度的目标表示。 深层自监督汇集多个编码器层的信息,由预测器对可见及遮挡位置生成分层预测。 密集预测损失将这些预测与 y-encoder 的对应位置、对应层目标对齐。 数据与模型扩展随后提升同一训练方案的规模和分辨率,而不是在推理时追加一个图像生成器。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
Input["图像或视频"] --> Tokenizer["原生图像视频分词"]
Tokenizer -->|丢弃遮挡位置| Student["可见分支 x-encoder"]
Tokenizer -->|完整输入| Teacher["目标分支 y-encoder"]
Student --> Deep["深层自监督<br/>多层融合与预测"]
Deep --> Dense["密集预测损失"]
Teacher -.->|多层目标,停止梯度| Dense
Student -.->|EMA 参数更新| Teacher
Dense --> Scale["数据与模型扩展<br/>高分辨率收尾训练"]
Scale --> Output["冻结表示与下游任务"]
图中的损失边表示训练监督,不是部署时必须经过的处理步骤。 深度估计与语义分割用冻结编码器的最后层特征训练线性投影;动作识别使用注意力探针。 动作预判还利用冻结的编码器与预测器,机器人应用则另外训练带动作条件的预测器或潜空间世界模型。 因此,通用表示学习、下游头训练和闭环规划不能混为一套“零训练”系统。
关键设计¶
1. 原生图像视频分词:不把静态图像伪装成视频
旧方案使用单一 3D 卷积完成 patch embedding,并把图像在时间上重复成 16 帧静态视频。 这样既增加计算,又让静态外观样本带上不自然的零运动假设。 V-JEPA 2.1 对视频采用空间为 \(16\times16\)、时间跨度为 \(2\) 的 3D 卷积,对图像采用 \(16\times16\) 的 2D 卷积。 两路得到 token 后进入共享编码器,图像不再需要复制出冗余帧。 空间与时间的位置关系由 3D RoPE 表达,输入类型则通过可学习的模态 token 提示。
模态提示同时出现在编码器和预测器输入中,使共享网络知道当前应解释静态外观还是时间变化。 这不是图文多模态模型,本文的两种模态仅指图像和视频。 也不是为每种模态分别训练一个完整骨干,主要区别集中在输入嵌入及模态条件。 图像分支更适合利用大量外观数据,视频分支则继续保留动态学习路径。 表 1 中该步骤将 ADE20K 从 40.8 提升至 41.4 mIoU,同时保持分类结果不变。
2. 深层自监督:让局部细节与全局语义共同进入预测器
x-encoder 不再只输出最后层特征,而是取三个中间块和最后一层的输出。 这些表示归一化后沿通道维拼接,通过轻量 MLP 融合并降维。 随后沿序列维加入携带遮挡位置时空信息的可学习 mask token,形成预测器输入。 预测器为四个编码器层生成相应的预测输出,目标来自 y-encoder 的同层表示。 多层不是四套独立编码器,也不是把四层输出直接平均成一个监督目标。
这样做保留了中间层更局部的信息,同时让高层语义继续参与任务。 两个损失都会在这四个层级上计算,使学习信号不只压在网络末端。 作者认为这还促使局部信息传到最终层,因此密集下游任务不必依赖额外的中间层拼接。 最关键的证据是,在上下文损失已经加入后,多层预测使 SSv2 从 62.5% 恢复到 72.1%,ADE20K 仍从 33.8 升至 38.6。 它解决的是局部监督引入的语义能力损失,而不是单独追求网络更深。
3. 密集预测损失:可见 token 也必须保留自己的位置含义
遮挡位置仍采用原有潜空间预测目标,比较预测器输出和目标编码器对应表示的 L1 距离。 新增上下文损失则在可见位置进行同样的逐位置对齐。 这里的目标仍是学习到的特征,不是 RGB 像素、深度真值或人工分割标签。 完整输入的目标分支为可见分支提供参照,停止梯度和指数移动平均更新沿用 JEPA 的自监督训练框架。 可见 token 现在不能只充当服务其他位置的全局聚合器,还要使自己的预测接近自身位置的目标。
作者没有对所有可见位置简单地赋予相同重要性,而是强调靠近遮挡区域的上下文。 权重取该可见 patch 到最近遮挡 token 的时空块距离的平方根倒数。 用正文定义重述这一权重关系为:
这里的 \(d_{\min}\) 以 block 为距离单位,而非像素距离;越靠近遮挡边界,对上下文预测错误的惩罚越强。 这使可见与遮挡区域附近的局部表示保持连续,同时避免对远处上下文施加同等强度的约束。 需要注意,原文公式 (1)、(2) 在文本抽取中损坏,上式只重述可读正文明确说明的权重,不声称恢复了完整原公式。 本文也未据此补造损失系数、精确距离范数或未列明的实现细节。
4. 数据与模型扩展:在修正目标后增加外观覆盖和容量
作者以 LVD-142M 替换原先约 1M 张 ImageNet 图像,并结合已有视频来源形成 VisionMix163M。 可读正文说明视频来源包含约 19M 个样本,但没有在此完整列出组成总数的逐项清单,不能据此自行补齐剩余来源。 更多静态图像拓宽外观分布,视频数据继续承担运动信息学习。 这一扩展不是新的人工像素监督,而是改变无标签预训练输入的覆盖面。 在逐步消融中,图像数据扩展改善深度和分割,并略微提高分类表现。
模型进一步从 300M 参数的 ViT-L 扩展到 2B 参数的 ViT-G。 高分辨率收尾训练在降低学习率的同时,把图像从 \(256\times256\) 提升至 \(512\times512\)。 视频则从 16 帧、\(256\times256\) 增加到 64 帧、\(384\times384\)。 该步骤同时改变空间细节与时间上下文,因此不能把其全部收益只归因于更高图像分辨率。 它把 NYUv2 RMSE 从 0.365 降至 0.307,说明最终训练日程对密集能力同样重要。
一个完整示例¶
考虑一段手接近杯子的短视频,这是解释流程的示意,而不是论文新增的测试案例。 视频分词器把邻近帧的局部区域变成时空 token,遮挡操作移除其中部分位置。 x-encoder 只能看到剩余的手、杯子及背景区域;y-encoder 则看到完整片段。 四层表示融合后,预测器既补全被遮挡位置,也预测仍可见位置在完整视图中的表示。 对于紧挨遮挡边界的杯沿,可见上下文损失具有较高权重,鼓励它仍代表杯沿,而非仅承载整个动作的摘要。 深层自监督同时保留“手正在接近杯子”这类较全局的动态信息。 部署为动作预判系统时,下游探针读取这些冻结表示;部署为机器人控制系统时,还需要动作条件预测与规划组件。
损失函数 / 训练策略¶
预训练的监督同时覆盖遮挡 token 与可见 context token,并在四个编码器层级上实施。 目标编码器使用学生编码器参数的 EMA 更新,而不是随学生损失直接反向传播。 原文给出算法机制,但当前缓存未包含其指向的补充材料,故不补写学习率、掩码比例和层索引。 蒸馏时,以冻结的 ViT-G 教师替换 EMA 目标编码器,并保留学生的 EMA 副本作为最终模型。 蒸馏仅拟合教师最后层,不使用深层自监督;预测器缩减至 12 个块并带最终投影层。 该分支得到 300M 的 ViT-L 与 80M 的 ViT-B,不应与大模型从头预训练的机制完全等同。
实验关键数据¶
主实验¶
下表节选原文表 6,第 11 页;深度和语义分割使用冻结最后层特征上的线性探针,视频对象分割使用非参数标签传播。 RMSE 越低越好,mIoU 与 J&F 越高越好;不同参数量不是等计算量对照。
| 模型 | 参数量 | NYUv2 RMSE | KITTI RMSE | ADE20K mIoU | VOC12 mIoU | YouTube-VOS J&F |
|---|---|---|---|---|---|---|
| DINOv3 ViT-7B | 7B | 0.309 | 2.346 | 55.9 | 86.6 | 74.1 |
| DINOv2 | 1B | 0.372 | 2.624 | 49.5 | 83.1 | 65.6 |
| V-JEPA 2 ViT-g | 1B | 0.642 | 4.650 | 24.4 | 63.9 | 53.7 |
| V-JEPA 2.1 ViT-g | 1B | 0.350 | 2.601 | 47.8 | 84.7 | 72.3 |
| V-JEPA 2.1 ViT-G | 2B | 0.307 | 2.461 | 47.9 | 85.0 | 72.7 |
1B 对 1B 的比较已显示明显密集能力改善,因而收益并非全部来自 ViT-G 扩容。 但 ViT-G 没有在所有密集任务上超过 DINOv3,尤其 ADE20K 仍为 47.9 对 55.9。
下表节选原文表 2、3,第 9 页,及表 7,第 12 页,保留同协议的 V-JEPA 系列比较。 Ego4D 的 All mAP 同时考核交互目标、动作和接触时间;EK100 为验证集按类别平均的 Action Recall@5。 EK100 使用 32 帧、8 fps、\(384\times384\) 上下文;SSv2 是冻结特征上的注意力探针 Top-1 准确率。
| 模型 | 参数量 | Ego4D All mAP | EK100 Action Recall@5 | SSv2 Top-1 (%) |
|---|---|---|---|---|
| V-JEPA 2 ViT-g | 1B | 6.02 | 39.7 | 77.3 |
| V-JEPA 2.1 ViT-g | 1B | 6.75 | 38.4 | 76.9 |
| V-JEPA 2.1 ViT-G | 2B | 7.71 | 40.8 | 77.7 |
同为 1B 时,交互定位预判提升,但 EK100 和 SSv2 略有下降;“全部任务都更好”不成立。 2B 的 EK100 从 39.7 提升到 40.8 是 1.1 个百分点,约 2.8% 相对提升,而非 2.8 个百分点。
消融实验¶
原文表 1,第 6 页,按行累积加入组件;密集任务为线性探针,分类任务为注意力探针。 这是逐步添加实验,不是控制所有其他因素不变的独立删除实验。
| 累积配置 | IN1K Acc. (%) | SSv2 Acc. (%) | NYUv2 RMSE | ADE20K mIoU |
|---|---|---|---|---|
| V-JEPA 2 基线 | 82.2 | 72.8 | 0.682 | 22.2 |
| + Context Loss | 72.6 | 62.5 | 0.474 | 33.8 |
| + Multi-level Pred. | 80.8 | 72.1 | 0.463 | 38.6 |
| + Vision Mix | 81.6 | 72.6 | 0.418 | 40.8 |
| + Multi-modal Tok. | 81.6 | 72.6 | 0.415 | 41.4 |
| + Model Scaling | 84.8 | 76.1 | 0.365 | 47.1 |
| + Cool-down | 85.5 | 77.7 | 0.307 | 47.9 |
第 7 页首次讨论上下文损失时写作 33.9 mIoU 和 0.473 RMSE,与表 1 的 33.8、0.474 略有不同;此处采用表格值并保留差异说明。 表 1 的基线属于消融设置,不能与表 6 的 1B 主实验基线 0.642 RMSE、24.4 mIoU 混用。
关键发现¶
- 上下文监督和深层自监督形成互补:前者提供局部约束,后者显著恢复分类能力。单独加入前者的效果不能代表完整方案。
- 原文表 4,第 10 页,导航规划时间从 NWM 的 103.2 秒变为 10.6 秒;ViT-G 的 Tartan Drive ATE 为 5.687,对照为 5.831。这是开环轨迹评测,不是实时闭环避障成功率。
- 原文表 5,第 11 页,相同 800 samples、10 iterations、horizon 1、3 秒预算下,抓取成功率从 60% 到 70%。改为 300 samples、15 iterations、horizon 8、14 秒后才达到 80%,总体为 20 个百分点提升,每项技能仅有 10 次任务。
- 原文表 8,第 14 页,ViT-L 蒸馏使 SSv2 从 74.2% 到 76.5%、ADE20K 从 42.0 到 46.7。该页正文的深度变化 2.490 到 2.461 不是 ViT-L 从头训练到蒸馏的对应行;表中 KITTI 实为 2.914 到 2.490。
亮点与洞察¶
- 对“可见位置不需要预测”的默认假设提出了直接实验反例。监督覆盖哪些 token,会影响 token 究竟成为局部描述符还是全局信息载体。
- 多层监督的价值不只在提高分割精度,还在缓解局部目标对动作语义的损害。它比只看最终密集指标更清楚地揭示了设计之间的依赖。
- 冻结表示被用于几何、分割、预判和规划,展示了共同表征的应用宽度。但不同任务采用不同下游组件,不能把通用表示误读为统一任务头。
局限与展望¶
- 作者将复杂场景分割的差距部分归因于 VisionMix 中拥挤场景不足,这是解释性假设,并非经独立数据消融确认的唯一原因。
- 最佳全局成绩依赖 2B 模型和高分辨率收尾训练;同尺寸视频语义任务并非一致提升。后续应在固定算力和固定数据量下评估收益来源。
- 机器人结果样本很小,且长时域配置的运行时间增加;原文没有给出足以支持稳定部署结论的置信区间。需要更多场景、物体和控制预算匹配的对照。
- 当前缓存没有补充材料,公式抽取也有损坏;精确复现仍需核对完整公式、训练超参数和下游实现。笔记不将定性 PCA 图当作机制的独立因果证明。
相关工作与启发¶
- 对比 V-JEPA 2:保留潜空间遮挡预测路线,新增可见位置约束和多层目标。关键改变是表示的学习责任,而不是改为像素重建。
- 对比 DINOv2 / DINOv3:共享对高质量局部特征的追求,但本文通过视频训练学习动态。DINOv3 在若干分割指标上仍领先,二者不能被概括成全面替代关系。
- 对比 NWM:导航实验在新表示上另训潜空间模型,并使用干净表示预测与 DDIM 采样处理高维特征。规划加速属于这套下游系统的结果,不是单独编码器吞吐量测试。
- 可延伸方向:在固定模型规模下比较不同遮挡边界权重,并把收益分解为边界定位、时间一致性和动作语义三部分。这是阅读后的研究建议,不是论文已完成的实验。
评分¶
- 新颖性: 4/5。上下文约束与多层预测的组合有明确机制和对应消融,但仍是 JEPA 训练方案的改进。
- 实验充分度: 4/5。任务覆盖广且有累积消融,机器人样本量及规模混杂限制了部分结论。
- 写作质量: 4/5。方法主线清晰,但正文与表格存在若干数字差异,需逐项核对。
- 价值: 5/5。为兼顾局部结构与视频语义的自监督表示提供了可复用的训练思路。