DSeq-JEPA: Discriminative Sequential Joint-Embedding Predictive Architecture¶
会议: ECCV 2026
论文: ECCV 2026 官方页 / 项目页
领域: 自监督/表示学习
关键词: 自监督学习 / 联合嵌入预测架构 / 判别性区域选择 / 顺序潜在预测 / 注意力显著性
一句话总结¶
DSeq-JEPA 在 I-JEPA 的潜在空间预测目标上加了两个归纳偏置——先用目标编码器的 CLS–patch 相似度显著图挑出并按判别性给区域排序(决定「预测哪里」),再让预测器沿这个顺序逐区域预测下一个区域的嵌入(决定「按什么顺序预测」)——在 ImageNet 线性探针上比 I-JEPA 提升 1.1/0.8/1.3 个点(ViT-B/L/H),并在细粒度识别、COCO/ADE20K 与 CLEVR 上一致获益,而推理端零额外开销。
研究背景与动机¶
自监督学习已经从「实例判别」和「像素重建」两条路走了很远:对比学习一路(SimCLR、MoCo、SwAV)靠大 batch 或动量队列做实例级区分,非对比一路(BYOL、SimSiam)用不对称预测加动量目标证明不用负样本也能避免坍缩;掩码图像建模一路(MAE、BEiT、SimMIM)则让模型把被遮住的 patch 补回来。近期联合嵌入预测架构(JEPA)把目标从「重建像素」或「对比实例」挪到了潜在空间预测——I-JEPA 用可见的上下文区域去预测被掩码目标区域的嵌入,既躲开了像素级重建把容量浪费在低层外观恢复上的问题,也躲开了对比学习对配对/负样本的依赖。后续工作基本都在改「预测什么」:DMT-JEPA 把目标嵌入换成语义相近邻居 patch 的聚合特征,C-JEPA 加对比正则以稳定训练,LeJEPA 想给出更少启发式的形式化。
但这些 JEPA 变体都保留了 I-JEPA 的一个默认设定:目标区域是被一视同仁、并行、独立地预测的。这个默认和视觉信息本身的分布并不匹配——一张图里总有少数区域承载着定义物体的主要语义线索(鸟的喙和额头、车的进气格栅),其余大片区域只是背景或次要语境;而人的视觉感知本身也是选择性的、有先后的,先抓住显著线索,再用额外上下文去修正解释。I-JEPA 从随机分布里采矩形目标块,等价于把学习容量均匀摊到所有内容上,并且让 N 个目标之间没有任何依赖。iGPT、RandSAC 这类自回归式的顺序预测是一个相关方向,但它们仍在像素/token 空间做重建,也没有显式区分「哪些区域更有信息量」。
于是本文问了一个很直接的问题:如果让预测式自监督显式知道在哪里预测、按什么顺序预测,能不能学得更好?DSeq-JEPA 的答案是肯定,做法是在 I-JEPA 上引入判别性顺序的归纳偏置:用注意力导出的显著图定位主判别区域并给出排序(where),再沿着「判别性从高到低」的轨迹做下一区域嵌入预测(in what order),使得预训练天然形成一条从主线索到次线索的课程式语义递进。从表示学习的角度看,它打破了独立区域预测隐含的目标区域置换对称性,换成一个有语义依据的预测顺序。核心 idea:把"预测哪里"和"按什么顺序预测"从隐式的采样细节提升为显式归纳偏置——显著性排序提供顺序先验,顺序预测器把这个先验转化成结构化的潜在预测监督。
方法详解¶
整体框架¶
输入是一张无标注图像,输出是一个能迁移到分类、细粒度识别、检测分割和低层推理的骨干编码器。整条链路是双塔 + 预测器的 JEPA 结构,但比 I-JEPA 多了两个环节:① 判别性区域优先——目标编码器在选定 transformer block 上给出 CLS–patch 相似度显著图,经归一化、Otsu 自适应二值化、8 邻域连通域标记与碎片过滤后,得到若干不规则区域并按「区域内平均显著度」排序,取前 N−1 个作主判别区域、第 N 个取整图补集以保证全覆盖;② 概率课程——用一个随 epoch 从 0 线性升到 1 的概率 λ,逐样本在「判别性选择」与「随机矩形采样」之间切换,让训练早期不稳定的显著图不污染优化。拿到排好序的区域序列后,上下文编码器逐区域编码,预测器按顺序做下一区域嵌入预测:第 k 步只用前 k 个区域的上下文表示和一个位置 token,去预测第 k+1 个区域在目标编码器下的嵌入,用 Huber 损失对齐。顺序预测只在预训练期存在,推理时只保留编码器。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["无标注图像 + 目标编码器<br/>CLS–patch 相似度显著图"] --> B["判别性区域优先<br/>归一化 → Otsu → 连通域 → 排序取 Top-N"]
B --> C["概率课程<br/>λ 由 0 线性升到 1,逐样本切换"]
C --> D["上下文编码器<br/>逐区域编码已选区域"]
D --> E["顺序下一区域嵌入预测<br/>按判别性从高到低逐步预测"]
E --> F["Huber 损失对齐<br/>预测嵌入 ↔ 目标编码器嵌入"]
关键设计¶
1. 判别性区域优先:把「预测哪里」从均匀随机采样换成按语义重要性排序的区域
I-JEPA 的目标区域是从图像里随机采的矩形块——它对所有内容平等,因此相当一部分预测监督落在背景或纹理上,而且矩形块之间还会重叠、覆盖多个语义单元。DSeq-JEPA 换掉的正是这一步:给定输入图像,先用目标编码器在某个选定的 transformer block 上算 CLS 与所有 patch 嵌入的相似度,得到一张 \(h\times w\) 的显著图 \(A\),把它归一化到 \([0,1]\) 后用 Otsu 方法逐图自适应地选阈值二值化(固定阈值会因不同图像的显著性动态范围差异而出现「全选」或「全丢」),再在 8 邻域下做连通域标记,丢掉小于 \(0.15hw\) 的碎片,剩下的每个区域以区域内归一化显著度的平均值作为判别性分数 \(\rho_k\)。按 \(\rho_k\) 降序取前 \(N-1\) 个作为主判别区域,第 \(N\) 个区域定义为整图减去前 \(N-1\) 个区域的补集:
这一项不是可有可无的收尾:与 I-JEPA 的(半)随机掩码不同,这里选出的区域是不规则、互不重叠的,补集区域保证整图无缝隙覆盖,让基于区域的表示学习更稳定;同时它把「剩下的次要内容」也保留成预测目标而不是直接丢弃。整个选择过程不引入任何新参数、也不需要梯度,代价只是数据侧的一次阈值化加连通域分析。它之所以有效,是因为注意力相似度本身已经是一个免费的语义先验——哪个 patch 对全局语义贡献大,模型自己就能说出来;Otsu 让这个先验在逐图尺度上自适应;而排序结果则成为下一个关键设计所需的顺序先验。
2. 概率课程:让早期不可靠的显著图先别参与区域选择
上面那套选择机制有一个明确的风险窗口:预训练早期编码器本身还没学到有意义的结构,CLS–patch 相似度接近噪声,此时强行按噪声显著图挑「主判别区域」,等于把一个错误的语义先验灌进预训练目标。DSeq-JEPA 的应对是把区域选择做成一条概率课程:定义 \(\lambda=\min(1,\max(0,t/T))\),随 epoch 从 0 线性升到 1;对每个样本独立采一个 Bernoulli(\(\lambda\)) 位,为 1 时使用判别性区域,为 0 时退回 I-JEPA 式的随机区域采样(随机中心与随机尺寸的矩形)。于是训练从「几乎全是随机区域」平滑地过渡到「全部是判别性区域」,而不是在某个 epoch 上硬切换。
用逐样本伯努利而不是按 epoch 硬切换是有实际收益的:硬切换会在切换点造成目标分布突变,而逐样本采样让同一个 batch 里两种模式共存,过渡连续,中期还自然形成「一部分随机区域 + 一部分判别区域」的混合难度。这条设计也解释了为什么一个粗糙的显著性代理就够用:把 CLS 相似度换成无标签的 Grad-CAM 式代理后,ImageNet 线性探针只从 73.5 掉到 73.4,两者选出的 Top-20 patch 的 IoU 是 0.41;而反过来,仅仅给 I-JEPA 加一个同样结构的辅助 CLS token(不改变任何区域选择逻辑)一点也没涨点(72.4 → 72.4)。也就是说收益来自「用代理去构造顺序」这件事,而不是多了一个 token。
3. 顺序下一区域嵌入预测:把并行的平坦预测换成有语义方向的因果链
I-JEPA 对 N 个目标块并行、独立地预测,损失是 N 项之和,目标之间不存在任何依赖——这等价于对目标区域置换不变,模型没有动机去理解「哪些区域先出现、后面的预测该依赖前面的哪些」。DSeq-JEPA 把排好序的区域序列 \(R_1,\dots,R_N\) 变成一条自回归链:在第 \(k\) 步,预测器只拿到前面已经编码的区域表示、下一个目标区域的位置 token,去估计第 \(k+1\) 个区域在目标编码器下的嵌入,即 \(\hat{\mathbf{s}}_{R_{k+1}}=g_\theta(\mathbf{p}_{R_{k+1}},\mathbf{h}_{R_1},\dots,\mathbf{h}_{R_k})\),其中 \(\mathbf{h}\) 来自上下文编码器、\(\mathbf{p}\) 是该区域的位置 token。目标嵌入仍由目标编码器给出,所以对齐发生在潜在空间,不涉及像素重建。
这个改动把「顺序」本身变成了监督信号的一部分:越靠后的预测可以条件在越靠前、越具判别性的区域上,预训练因此形成从主线索到次线索的课程。顺序消融给出了很硬的证据——在固定同一组判别性区域的前提下,随机顺序(71.7)甚至比完全不要顺序(72.0)更差,说明没有语义依据的自回归只是让模型在混合难度的目标之间挣扎;反向顺序(判别性从低到高,71.3)掉得更多,说明轨迹方向比「有没有自回归」更关键;只有判别性顺序把收益做到 73.5。代价方面,顺序预测需要在预训练时引入顺序区域 token 与因果掩码,训练显存从 31.5 GB 升到 38.2 GB、墙钟时间从 24.2 h 升到 26.5 h、总计算从 96.4 升到 111.6 GFLOPs;但推理端参数量(86.6 M)与单图计算量(17.7 → 17.8 GFLOPs)几乎不变,因为这套机制只在预训练期启用。
一个完整示例¶
以一张 CUB 的鸟类图像为例走一遍(ViT-B/16,224×224 输入切成 \(14\times14=196\) 个 patch,N 取 I-JEPA 默认的 5):在选定 block 上算 CLS 与 196 个 patch 的相似度,得到 14×14 的显著图;归一化后 Otsu 二值化,8 邻域连通域给出几个候选块,其中小于 \(0.15\times196\approx29\) 个 patch 的碎片被丢掉,剩下的可能正好对应喙、额头、翅羽等部位;区域内平均显著度把它们排成 \(\rho\) 递减的顺序,取前 4 个作主判别区域,第 5 个区域取这 4 个之外的整图补集(覆盖天空与树枝)。训练早期 \(\lambda\) 还很小,这张图大概率走的是随机矩形采样;到 epoch 450 时 \(\lambda=1\),全部走判别性顺序——预测器先看到喙的编码,再依次预测额头、翅羽、最后是整个背景补集的嵌入,每一步都用目标编码器给出的真值嵌入做 Huber 对齐。可视化上这与 I-JEPA 的对比很直观:I-JEPA 的目标掩码弥散、常覆盖多个语义单元,而这里的区域紧凑、判别性从高到低编号(Fig. 6 中 ①–⑤)。
损失函数 / 训练策略¶
预训练目标是预测嵌入与目标嵌入之间的平滑 \(\ell_1\)(Huber)损失,在 \(N-1\) 个预测步与 \(D\) 个特征维上取平均:
作者给的理由是它能让预测与目标嵌入之间的对齐既稳定又判别,且对离群维度比 \(\ell_2\) 更鲁棒——这对一个逐步累积误差的顺序预测过程尤其重要。训练沿用 I-JEPA / C-JEPA 的标准协议:ImageNet-1K 上预训练 ViT-B/16 与 ViT-L/16 共 600 epoch,ViT-H/16 用 448 分辨率训 300 epoch(原文表格里这一格印成 ViT-H/16448 300,按 448 分辨率 + 300 epoch 理解,⚠️ 以原文为准);单视角、不使用视角类数据增强,区域数 \(N=5\) 沿用 I-JEPA 的设定;模块内额外只有一个仅用于生成显著图的辅助 CLS token,不增加层也不增加参数。评测统一按 I-JEPA/C-JEPA 的下游协议做:ImageNet 用线性探针与全量微调,细粒度数据集用线性探针,CLEVR 用冻结 ViT-L/16 特征上的线性探针,COCO/ADE20K 沿用同一套检测/分割微调配置。DSeq-C-JEPA 是在此基础上再叠加 C-JEPA 的对比正则,用于检验两条改进是否互补。
实验关键数据¶
主实验¶
分类与细粒度识别(线性探针 / 全量微调 Top-1,FGVC 为线性探针,最后一列是四数据集平均):
| 骨干 | 方法 | ImageNet 线性探针 | ImageNet 微调 | iNat21 | CUB | Cars | Overall Avg. |
|---|---|---|---|---|---|---|---|
| ViT-B/16 (600ep) | I-JEPA | 72.4 | 83.5 | 35.9 | 65.3 | 65.9 | 64.6 |
| ViT-B/16 (600ep) | DSeq-JEPA | 73.5 (+1.1) | 84.0 (+0.5) | 36.4 (+0.5) | 66.2 (+0.9) | 67.3 (+1.4) | 65.5 (+0.9) |
| ViT-B/16 (600ep) | C-JEPA | 73.5 | 84.2 | 36.2 | 64.9 | 66.1 | 65.0 |
| ViT-B/16 (600ep) | DSeq-C-JEPA | 73.8 (+0.3) | 84.3 (+0.1) | 36.6 (+0.4) | 66.5 (+1.6) | 67.4 (+1.3) | 65.7 (+0.7) |
| ViT-L/16 (600ep) | I-JEPA | 77.1 | 86.6 | 38.8 | 66.9 | 68.1 | 67.5 |
| ViT-L/16 (600ep) | DSeq-JEPA | 77.9 (+0.8) | 86.8 (+0.2) | 39.5 (+0.7) | 68.1 (+1.2) | 68.9 (+0.8) | 68.2 (+0.8) |
| ViT-L/16 (600ep) | DSeq-C-JEPA | 78.4 (+0.4) | 87.2 (+0.3) | 39.7 (+0.7) | 68.3 (+2.5) | 68.8 (+1.1) | 68.5 (+1.0) |
| ViT-H/16 (300ep) | I-JEPA | 81.1 | 87.1 | 38.9 | 67.2 | 67.7 | 68.4 |
| ViT-H/16 (300ep) | DSeq-JEPA | 82.4 (+1.3) | 87.8 (+0.7) | 39.3 (+0.4) | 68.9 (+1.7) | 70.1 (+2.4) | 69.7 (+1.5) |
稠密预测与低层推理(COCO/ADE20K 均为 ViT-B/16,600 epoch;CLEVR 为冻结 ViT-L/16 特征上的线性探针):
| 任务 / 数据集 | 指标 | I-JEPA | DSeq-JEPA | C-JEPA | DSeq-C-JEPA |
|---|---|---|---|---|---|
| MS-COCO | AP^box | 49.9 | 50.5 (+0.6) | 50.7 | 50.9 (+0.2) |
| MS-COCO | AP^mask | 44.5 | 45.0 (+0.5) | 45.3 | 45.7 (+0.4) |
| ADE20K | mIoU | 47.6 | 48.1 (+0.5) | 48.7 | 48.9 (+0.2) |
| CLEVR(Count) | Top-1 | 85.6 | 86.4 (+0.8) | 86.8 | 87.1 (+0.3) |
| CLEVR(Dist) | Top-1 | 71.2 | 71.5 (+0.3) | 71.6 | 71.9 (+0.3) |
补充口径:ViT-B/16 的设置下作者用三个随机种子重跑,得到 73.8±0.4 的线性探针精度,说明增益不是单次运行的噪声;NEPA 的训练配置与本文并不严格对齐(其 ViT-B/14、ViT-L/14 分别训 1600/800 epoch),只能作参考——在 ImageNet 微调上 DSeq-JEPA / DSeq-C-JEPA 为 84.0/84.3(ViT-B)与 86.8/87.2(ViT-L),高于 NEPA 的 83.8 与 85.3。
消融实验¶
两个关键组件是否协同(ViT-B/16,ImageNet 与 iNat21 线性探针):
| 区域生成 | 预测策略 | ImageNet | iNat21 | 说明 |
|---|---|---|---|---|
| 均匀采样 | 平坦并行 | 72.4 | 35.9 | 即 I-JEPA 基线 |
| 均匀采样 | 顺序 | 72.3 | 34.9 | 有顺序但顺序无意义,掉到基线以下 |
| 判别性选择 | 平坦并行 | 72.0 | 35.7 | 有好区域但无依赖建模,同样掉点 |
| 判别性选择 | 顺序 | 73.5 | 36.4 | 两者齐备才拿到最大增益 |
预测顺序与其它设计选择(ImageNet 线性探针,ViT-B/16;顺序类消融固定同一组判别性区域):
| 配置 | ImageNet | 说明 |
|---|---|---|
| Flat(I-JEPA 式,不要自回归) | 72.0 | 顺序消融的参照点 |
| Random 顺序 | 71.7 | 随机顺序反而低于无顺序 |
| Spatial 顺序(按区域中心行优先) | 72.7 | 纯几何结构有收益但有限 |
| Inverse 顺序(判别性从低到高) | 71.3 | 轨迹方向搞反,掉得最多 |
| Truncating(只预测 Top-3 就停) | 73.0 | 丢掉后段区域损失 0.5 |
| DSeq 顺序(完整 Top-5) | 73.5 | 本文顺序 |
| \(N=3\) / \(N=5\) / \(N=7\) | 72.9 / 73.5 / 73.4 | 对区域数不敏感 |
| I-JEPA + 辅助 CLS token | 72.4(I-JEPA 亦 72.4) | token 本身不带来任何表示增益 |
| Grad-CAM 式代理替换 CLS 相似度 | 73.4 | 换成无标签代理只掉 0.1,对代理鲁棒 |
预训练开销与推理效率(ViT-B/16):DSeq-JEPA 预训练 26.5 h / 峰值显存 38.2 GB / 总计算 111.6 GFLOPs,对应 I-JEPA 的 24.2 h / 31.5 GB / 96.4 GFLOPs;推理端两者都是 86.6 M 参数、17.7 与 17.8 GFLOPs/图。
关键发现¶
- 两个组件必须同时用,单独开任何一个都会掉到基线以下。这是本文最有说服力的一组结果:均匀采样 + 顺序(72.3/34.9)和判别性选择 + 平坦(72.0/35.7)都差于 I-JEPA 的 72.4/35.9,只有两者齐备才到 73.5/36.4。作者的解释是「无意义顺序 = 用混合难度信号当监督」,「有区域无依赖 = 把区域间依赖坍缩成独立目标」,即判别性选择提供语义轨迹、顺序预测负责消费这条轨迹,二者是互补而非各自有效。
- 顺序的「方向」比「有没有顺序」更重要。Inverse(71.3)比不要顺序(72.0)还低 0.7,Random(71.7)也低 0.3;Spatial 顺序只涨 0.7,说明单纯的几何顺序能提供一点结构但远不如语义顺序(+1.5)。顺序长度也有讲究:只预测 Top-3 得 73.0,比完整 Top-5 低 0.5,说明低显著度的后段区域仍提供互补监督。
- 判别性顺序隐式形成从易到难的课程。作者用 epoch 450 的 ViT-B 检查点在 10,000 张 ImageNet 图上统计每步预测损失,Top-2/Top-3 的误差明显低于 Top-4/Top-5——模型先学会预测稳定、高信息量的区域,再逐步整合更依赖上下文的弱线索。
- 收益来自「用代理构造顺序」而不是代理本身。加一个辅助 CLS token 对 I-JEPA 毫无帮助(72.4 → 72.4),而把 CLS 相似度换成 Grad-CAM 式代理仍能拿到 73.4;加上两者的 Top-20 patch IoU 只有 0.41,说明性能并非绑定在某个特定的显著性估计器上。
- 表征在预训练中自组织出语义结构。patch 级 4 聚类的可视化显示:早期聚类碎片化、噪声大,随训练推进逐渐对齐到物体部件(Fig. 7),与「顺序预测带来结构化的语义递进」这一说法一致。
- 效率边界清楚:所有额外开销都在预训练(+2.0 h、+15.5 GFLOPs 总计算、+6.7 GB 显存),推理完全不变;同时整套方法只在单视角、600(ViT-H 为 300)epoch 的 JEPA 配方下运行,就能与 1600 epoch、多视角增强的 iBOT 在稠密预测上打平或更好(如 ADE20K mIoU 48.1 vs iBOT 50.0 仍略低,但 COCO AP^mask 45.0 vs 44.2 反超),ViT-H 尺度上 ImageNet 线性探针与微调都是同口径最高。
亮点与洞察¶
- 把「采样细节」升级成「归纳偏置」。I-JEPA 的目标区域怎么采样,一直被当作实现细节;本文指出「预测哪里 + 按什么顺序预测」本身就是一组可以设计的结构化先验,而且顺手给出了「打破目标置换对称性」的理论视角——这个视角比具体的显著性实现更可迁移。
- 显著性代理的选取非常克制:CLS–patch 相似度不引入参数、不要梯度、不额外前向,且用 Otsu 自适应阈值解决了逐图动态范围差异,再配一条 λ 概率课程兜住早期噪声。整套机制的可复现性很高,这也是它能被换代理(Grad-CAM)验证的原因。
- 消融设计相当诚实:作者专门做了「只加 CLS token」和「换显著性代理」两个对照,把「是不是多了一个 token 或者换了一个代理才涨点」这条质疑提前堵死;单独开一个组件的负结果也照实报告,而不是只展示最优组合。
- 推理零成本这个性质值得借鉴:顺序预测只在预训练期引入「目标间的因果依赖」,训练完丢掉预测器只留编码器,因此任何「用额外结构塑造预训练信号、推理时归零」的想法都可以用同样的落地方式。迁移到视频自监督很自然——把区域顺序换成时间顺序、或把显著性排序换成运动幅度排序。
局限与展望¶
- 绝对增益不大,且和 C-JEPA 互有胜负。ViT-B/16 线性探针 73.5 与 C-JEPA 的 73.5 持平,ViT-L/16 的 77.9 略低于 C-JEPA 的 78.0;优势主要体现在细粒度(CUB/Cars)与稠密预测上。作者的解释是判别性顺序让表示更「部件感知」,但这只是一个合理的推断,缺少部件级定位的定量证据。
- 跨方法比较的口径不够对齐。与 NEPA 的比较作者自己声明训练配置不严格匹配(骨干、分辨率、epoch 都不同);与 DINO/iBOT 的比较也存在多视角增强 vs 单视角的差异,两类方法各有代价,不宜直接下结论。
- 显著性先验的可依赖性未深究:所有结论都建立在「注意力相似度能反映语义重要性」之上。当目标很小、被遮挡、或图像语义高度分散(多目标杂乱场景)时,Otsu + 连通域 + Top-N 这条流水线会不会把不同物体切成一个区域、或把同一个物体切碎成若干碎片,文中没有分析;<0.15hw 的碎片阈值与 N=5 也是固定的,没有跨数据集敏感性实验。
- 只在图像上验证。作者把视觉-语言预训练列为未来工作,目前没有多模态或视频实验;顺序预测在语言侧是否对应「先描述主客体再补细节」这类结构,还完全是开放问题。
- 可改进方向:把显著性代理换成可学习的打分器(例如用多 block 注意力融合,或让排序本身接受下游任务的监督);把 λ 从线性换成按区域置信度自适应的调度;在区域内构造更细粒度的子顺序(部分到整体)以检验「顺序」这一自由度的上限。
相关工作与启发¶
- vs I-JEPA: I-JEPA 从随机分布采矩形目标、并行独立预测,靠均值化的 N 项损失学习;DSeq-JEPA 保留同一套双塔 + 预测器骨架与同一个 Huber 目标,只在「选哪些区域」和「按什么顺序预测」两处加结构。区别在于是否对目标区域施加语义排序,本文优势是细粒度与稠密任务上的一致增益(+0.5~+1.5)且推理零开销,劣势是预训练多了约 15% 的墙钟时间与 6.7 GB 显存。
- vs C-JEPA: C-JEPA 在 I-JEPA 上加对比正则,改的是「损失项」;本文改的是「预测的组织方式」,两者正交,因此 DSeq-C-JEPA 能同时叠加以达到 JEPA 系列中的最好结果——这也从侧面说明顺序结构不是对比正则的替代品。
- vs DMT-JEPA / LeJEPA: DMT-JEPA 改的是「预测的潜在目标是什么」(聚合语义近邻的特征),LeJEPA 关注的是「去掉启发式、给出可证明的形式化」;两者都没有触碰目标区域之间的顺序与依赖,本文的切入点与它们互不冲突。
- vs iGPT / RandSAC: 它们同样用自回归式的顺序预测作为自监督的归纳偏置,但顺序来自固定的 token 顺序(或随机分段)且在像素/token 空间重建;DSeq-JEPA 把「顺序」变成由判别性导出的、有语义依据的轨迹,并在潜在空间对齐,避免把容量花在低层外观上。
- vs MAE / DINO / iBOT: 前两者需要 1600 epoch(DINO/iBOT 还要多视角增强),本文用单视角 600(ViT-H 300)epoch 的 JEPA 配方就能在 ViT-H 尺度上取得同口径最高,在稠密预测上也有竞争力;代价是 ImageNet 线性探针在 ViT-B 尺度仍低于 DINO/iBOT,说明单视角 JEPA 在纯语义区分度上并非全面占优。
评分¶
- 新颖性: ⭐⭐⭐⭐ 把 JEPA 的目标区域从「随机采样、并行预测」推向「语义排序、顺序预测」,并用置换对称性给出统一视角,但两个组件(显著性选区域、自回归预测)本身都不新。
- 实验充分度: ⭐⭐⭐⭐ 覆盖分类/细粒度/检测分割/低层推理四类任务、三个骨干尺度,消融覆盖组件协同、顺序方案、区域数、CLS token、显著性代理与开销;扣分在跨方法比较口径不完全对齐、显著性失效场景与阈值敏感性未分析。
- 写作质量: ⭐⭐⭐⭐ 动机链条(where + in what order)清晰、图表和公式克制,消融的对照设计诚实;部分关键设置的细节(区域 token 的构造、目标编码器更新方式)在正文中没有展开。
- 价值: ⭐⭐⭐⭐ 增益幅度属稳进而非跃升,但「顺序化潜在预测」这一模块化设计移植成本低、推理零代价,对后续 JEPA 类预训练(尤其视频/多模态方向)有直接的参考价值。