Neutralizing Token Aggregation via Information Augmentation for Efficient Test-Time Adaptation¶
会议: ECCV 2026
论文: ECCV 2026
代码: https://github.com/Bostoncake/NAVIA
领域: 模型压缩
关键词: 测试时自适应、token 聚合、互信息、视觉 Transformer、推理加速
一句话总结¶
本文把"在测试时自适应(TTA)里插拔式地加 token 聚合来省算力"这件事形式化为 Efficient Test-Time Adaptation(ETTA),用互信息分析指出聚合是 many-to-one 映射、其信息损失无法被 TTA 常用的 LayerNorm 微调补回,于是提出 NAVIA:在聚合发生之前给 [CLS] 挂上"输入级嵌入增强 + 浅层特征级偏置增强"两个可学习信息载体,只多训极少参数(ViT-B/16 上比纯 LayerNorm 多 5.3K),在 4 个 OOD 基准上比 TTA SOTA(FOA)最高 +3.1%,同时获得 14%–26% 的墙钟加速。
研究背景与动机¶
TTA 让一个预训练好的 ViT 在没有源数据、没有标签的情况下,用测试流里的无标签样本在线调整自己,代表方法是 Tent 的熵最小化、EATA 的样本筛选、SAR 的锐度感知最小化、DeYO 的解耦因子视角,以及 FOA 系列只用前向传播(或少量反向)的轻量方案。这些方法在分布偏移下确实有效,但它们几乎全部把注意力放在"精度"上,而把推理成本当成了免费项:骨干网络的一次前向本身就主导了延迟,SAR 还要跨多个推理周期算二阶梯度,DeYO 要把同一批样本按不同 patch 顺序反复前向,CoTTA 一次迭代就烧掉 111 GFLOPs。当 TTA 要落到边缘设备或实时场景时,这些多趟前向的开销直接决定了方法能不能用——这就是本文要处理的 ETTA 问题。
最自然的省算力手段是 token 聚合:ToMe 用轻量二部图匹配把相似的图像 token 逐步合并,EViT 用注意力分数保留关键 token,ToFu 把剪枝与融合结合起来。它们不改 ViT 参数、不干扰 TTA 内部的优化过程,因此理论上与 TTA 完全正交,可以即插即用。但作者把 ToMe 接到 Tent / FOA / SAR / DeYO / CoTTA 上直接测,结果是哪怕在很温和的 12.5% 稀疏度(每层合并 r=2 个 token)下,所有 TTA 方法的精度平均掉了 3% 以上;把压缩率加到 r=4,掉点更加严重。也就是说,两个各自有效的组件拼在一起反而互相拆台,ETTA 的"效率—精度"权衡无法靠简单叠加解决。
本文把失败原因归到信息论上:聚合矩阵把 token 序列做成了 many-to-one 映射,视作马尔可夫链后由数据处理不等式可得 \(I(\mathbf{T}^{Out}_l; Y) \le I(\mathbf{T}^{In}_l; Y)\),且当聚合非单射时不等式严格成立(Corollary 1),因此聚合后的 [CLS] 关于标签 Y 的互信息严格少于聚合之前;而 TTA 主流的 norm-tuning 只调 LayerNorm,LayerNorm 是确定性映射、无法凭空重建被丢掉的信息,于是 \(I(\mathrm{LN}(\mathbf{T}^{Out}_l); Y) \le I(\mathbf{T}^{Out}_l; Y)\)(Corollary 2)。这两条把设计约束钉死了:补偿必须发生在聚之前、发生在输入 token 上,聚合之后再怎么调归一化层都是徒劳。核心 idea:在每层做 token 聚合之前,用一个从预训练 [CLS] 出发的可学习信息载体(输入级嵌入偏置 δ 承担领域级补偿,浅层特征级偏置 δ_l 承担逐层累积的细粒度补偿)去承载本该被聚合压掉的信息,并用熵最小化作为抬高可学习信息上界的实用替代目标。
方法详解¶
整体框架¶
NAVIA 建立在标准 TTA 循环之上,改动只挂在两处,前向网络结构与 ToMe 的聚合逻辑都不动。一个测试 batch 的图像先做 patch embedding 并前置 [CLS],在第一次聚合之前给 [CLS] 嵌入加一个可学习的增强向量 δ(输入级);随后进入 ViT 的逐层编码,每层先用 ToMe 按 [CLS] 相关的相似度合并 r 个 token,而编码器最前面 \(L_{\mathrm{bgt}}\) 个 block 还会在被聚合前的 [CLS] 上各加一个层级偏置 δ_l(特征级)。前向结束时用聚合后的 token 序列算出 [CLS] 预测(预测在反向传播之前取出,保证每个 batch 只前向一次),再用"熵最小化 + 与源域缓存的层特征统计对齐"的损失做一次反向传播,梯度只回传给 δ、δ_l 和 LayerNorm 参数。换言之,NAVIA 省算力的部分交给前向的 token 聚合,补信息的部分交给反向的可学习载体,两者互不侵占。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["测试图像 batch(无标签)"] --> B["输入级 [CLS] 嵌入增强<br/>聚合前加可学习 δ"]
B --> C["浅层 [CLS] 偏置增强<br/>前 L_bgt 层各加 δ_l"]
C --> D["ViT 逐层编码<br/>每层按 ToMe 聚合 r 个 token"]
D --> E["锚定预训练 [CLS] 的轻量更新<br/>熵最小化 + 特征统计对齐"]
E -->|单次反向传播,只回传 δ、δ_l 与 LayerNorm| B
关键设计¶
1. 输入级 [CLS] 嵌入增强:在聚合之前给 [CLS] 挂一个可学习的信息载体
这条设计要对付的是 Corollary 2 揭示的死角:聚合矩阵是非单射的,被合并掉的 token 信息在聚合之后永久消失,而 LayerNorm 微调是确定性的、不能把互信息变多。因此补偿的落点只能在聚合之前、在输入 token 上。作者不去新加可学习 prompt——在自注意力复杂度与序列长度平方成正比的 ViT 里,额外插入 token 会直接抬高前向成本,与 ETTA 的初衷相悖——而是复用已有的 [CLS]:先前工作已表明 [CLS] 能编码对跨域学习有用的领域级信息,作者让它在预训练嵌入的基础上再学一个偏置 δ(即"信息增强",information augmentation),作为 norm-tuning 的互补机制。
这个选择有定理支撑:设 δ 为在熵最小化下学到的 [CLS] 嵌入偏置、\(P_0\) 为聚合矩阵,则
即把 δ 放在聚合之前,等于让信息载体先进入序列、再一起被压缩,从而抬高了可学习信息的上界;原文把熵最小化当作逼近这一上界的实用替代目标(Theorem 1,证明在附录)。实现上,每个测试 batch 直接用 TTA 损失的梯度更新 δ:\(\widetilde{\delta} = \delta - \eta_\delta \nabla_\delta \mathcal{L}(\theta; \mathbf{x})\),学习率与 LayerNorm 同用 SGD,δ 是随 batch 在线更新的轻量向量而非大规模持久参数,因此参数与迭代开销都可忽略。
2. 浅层特征级 [CLS] 偏置增强:按层递进地补回被逐层压缩掉的信息
只用输入级的 δ 不够。token 聚合是逐层发生的,信息损失沿深度不断累积,而 δ 是单个作用于整条前向的向量,越到深层越无力。最直接的做法是每层各学一个 δ_l,但那会把可训练参数推到 \(L \times d\)(ViT-L/16 是 24 层 × 1024 维),在 TTA 只有几百步迭代的预算下参数一多就收敛不动、反而不稳。作者据此只在前 \(L_{\mathrm{bgt}}\) 个 block 上加偏置,即 \(\mathbf{L}_{\mathrm{aug}} = \{0, 1, \dots, L_{\mathrm{bgt}}-1\}\),每个 \(\delta_l\)(\(l \in \mathbf{L}_{\mathrm{aug}}\))用与输入级相同的梯度式更新。
选浅层有三条具体理由:从 token 特征看,第 l 层的聚合矩阵 \(P_l = g(\mathbf{T}^{In}_l, t_{\mathrm{CLS}})\) 本身依赖 [CLS],浅层改 [CLS] 会连带改变后续各层的聚合选择,等于同时干预了"压哪些 token";从信息视角看,逐层聚合是一个有损压缩过程,在浅层加偏置相当于对"即将被压掉的信息"做预加重(pre-emphasis),把可判别信号提前保护下来;从结构看,ViT 的残差连接让浅层对 [CLS] 的更新被后续所有 block 复用,而深层更新生效的机会更少。\(L_{\mathrm{bgt}}\) 从 \(\{4,5,6\}\) 中按目标图像小集上损失式(Eq. 5)的误差挑选,实验显示 4–6 层是稳定区间,超过 6 层会因参数过多、迭代不足而饱和甚至轻微下降。
3. 锚定预训练 [CLS] 的轻量更新:用极少参数换最大的信息补偿
确定了"补什么、补在哪"之后,还要回答"用什么载体补"。作者把方案与两类同样能增加可训练容量的做法放在一起比:一是新增可学习 token(每层 +1/+2/+3 个,共 43.0K–52.2K 参数),二是直接把 [CLS] 重新初始化再训(对应 Tab. 4 的 "Init. [CLS] Embed.")。前者在 TTA 极少的迭代步数下从零学 token 很吃力,精度不如本文;后者掉得最狠(ImageNet-C 平均 65.9%,vs NAVIA 69.8%),说明预训练 [CLS] 里已经编码的类别相关信息不能丢,增强必须是"在已有语义上加偏置"的增量操作。与 LoRA(r=1/2/3,66.0K–121.3K 参数,最高 68.8%)对照也得到同一结论。
这构成了 NAVIA 的效率边界:ViT-B/16 下总可训练参数 43.7K,相比标准 LayerNorm 调优的 38.4K 只多 5.3K,比任何 prompt tuning / LoRA 配置都小,却在 ImageNet-C 上高出 0.8–1.9 个点。同时,所有改动都只发生在输入嵌入与浅层 [CLS] 上,前向图、序列长度与 FLOPs 完全不变(ViT-L/16、r=4 时仍是 42.98 GFLOPs),这也正是它能和 ToMe 这类插拔式聚合共存、不引入额外前向趟数的前提。⚠️ 原文未明确说明 δ 与 δ_l 在 batch 之间是否保留,按正文"for each image batch x ... we directly update"的表述,此处按 batch 级在线更新理解,以原文为准。
一个完整示例¶
以 ViT-L/16 在 ImageNet-C 高斯噪声上跑一个 batch(32 张图,r=2)为例:224×224 图像被切成 14×14=196 个 patch token,前置 [CLS] 后序列长 197。输入级增强把学到的 δ 加到 [CLS] 上,随后进入 block 0:ToMe 以 [CLS] 为参照做相似度匹配,合并掉 2 个最相似的图像 token,序列缩短到 195;因为 block 0 属于浅层集合 \(\mathbf{L}_{\mathrm{aug}}\),它的 [CLS] 在被聚合前还会先叠加上 δ_0。block 1 到 block 5 重复同样的"加偏置 → 聚合"动作,之后各层只做聚合。整条前向在 24 层里共减少约 48 个 token 的等量计算,末层的 [CLS] 经分类头得到预测;这一预测在使用时先取出,再用熵最小化 + 层统计对齐算损失,一次反向把梯度分别灌回 δ、δ_0…δ_5 与各层 LayerNorm。下一个 batch 到来时重复整套流程——聚合负责"每次少算一点",信息增强负责"每次少丢一点"。
损失函数 / 训练策略¶
总体目标沿用近期 TTA 的成熟配方:熵最小化降低预测不确定性,特征统计差异项缓解特征漂移。源域统计量 \(\{\mu_l^S\}\)、\(\{\sigma_l^S\}\) 在部署前用 64 张源域无标签图像一次性算好缓存(属于预部署的离线步骤,部署时不需要源数据),测试时把目标域 batch 各层的均值与方差对齐过去:
⚠️ 该式在缓存中 LaTeX 已损坏,上式按原文文字描述(类别集 C、预测概率 \(\hat{y}_c\)、权衡系数 λ、逐层对齐均值与方差)重构,细节以原文 Eq. (5) 为准。超参:学习率 5e-3(LayerNorm 与信息增强同用 SGD),λ=30,batch size 为 ViT-L/16 取 32、ViT-B/16 取 64;token 聚合统一采用 ToMe。每个测试 batch 只前向一次并在反向之前取出预测,反向只更新 δ、δ_l 与 LayerNorm,不触碰预训练权重。
实验关键数据¶
主实验¶
评测在 4 个 OOD 基准(ImageNet-C severity 5、ImageNet-R、ImageNet-V2、ImageNet-Sketch)与 ViT-B/16、ViT-L/16 两个骨干上进行,压缩率沿用 PYRA 的设定:中等压缩(ViT-L 用 r=2、ViT-B 用 r=4)与高压缩(ViT-L 用 r=4、ViT-B 用 r=8)。token 聚合方法统一接在表现最好的 FOABP 之上。
ViT-L/16 在 ImageNet-C 上的平均精度与开销(节选,完整 15 类见原文 Tab. 1):
| 方法 | ImageNet-C 平均 | GFLOPs | 单 batch 墙钟 (s) | 说明 |
|---|---|---|---|---|
| NoAdapt | 61.1 | 55.60 | 0.50 | 不适配的基线 |
| FOABP | 69.9 | 55.60 | 0.59 | TTA SOTA,无聚合 |
| FOACMA† | 68.2 | 1588.64 | 7.73 | 免反向传播但前向代价极高 |
| Tent | 68.5 | 55.60 | 0.51 | 熵最小化 |
| SAR | 60.8 | 111.20 | 1.08 | 部分损坏类型塌陷(Frost 22.3、Fog 13.5) |
| DeYO | 44.9 | 111.20 | 0.76 | 同类塌陷更严重(Noise 4.5、Weather 4.3) |
| ToMe2 | 68.9 | 50.15 | 0.51 | 直接组合:比 FOABP 掉 1.0 |
| ToMe4 | 65.8 | 42.98 | 0.44 | 高压缩掉 4.1 |
| EViT4 | 54.4 | 46.55 | 0.49 | 高压缩崩掉 15.5 |
| NAVIA2 | 71.9 | 50.15 | 0.51 | 比 ToMe2 +3.0,比 FOABP +2.0 |
| NAVIA4 | 70.7 | 42.98 | 0.44 | 比 ToMe4 +4.9,比 FOABP +0.8 |
ViT-B/16 上同类对比同样成立:NAVIA4 在 ImageNet-C 取得 70.7(ToMe4 69.9、EViT4 69.1、Tofu4 69.7、TCA4 69.7),已略高于无聚合的 FOABP(70.6),而 GFLOPs 从 15.71 降到 14.29、墙钟从 0.39s 降到 0.32s;压到 r=8 时 NAVIA8 仍有 69.8(12.22 GFLOPs、0.30s),高于同压缩率的 ToMe8(68.9)与 EViT8(67.2)。
在 ImageNet-R/V2/Sketch 三个基准上(Tab. 2),ViT-L/16 的平均为:FOABP 67.1、ToMe2 65.8、Tofu2 65.7、TCA2 66.3、EViT2 60.2,NAVIA2 达到 68.7;单看 ImageNet-Sketch,NAVIA2 的 57.7 相比 FOABP 的 54.6 高出 3.1 个点,也正是摘要中"最高 +3.1%"的来源。ViT-B/16 上 NAVIA4/Navia8 分别取得 66.0/65.6,同样居首。
消融实验¶
两个增强的贡献(ViT-B/16,Tab. 3;[CLS]-E 为输入级嵌入增强,[CLS]-S 为特征级偏置增强):
| 配置 | ImageNet-C | R | V2 | Sketch | 平均 |
|---|---|---|---|---|---|
| r=4,无增强 | 69.9 | 67.6 | 75.3 | 52.2 | 66.3 |
| r=4,仅 [CLS]-E | 70.3 | 68.2 | 75.2 | 52.6 | 66.6 |
| r=4,仅 [CLS]-S | 70.4 | 68.0 | 75.5 | 53.4 | 66.8 |
| r=4,两者都用 | 70.7 | 68.8 | 75.5 | 53.6 | 67.2 |
| r=8,无增强 | 68.9 | 66.8 | 74.6 | 52.0 | 65.6 |
| r=8,仅 [CLS]-E | 69.3 | 67.5 | 75.0 | 52.9 | 66.2 |
| r=8,仅 [CLS]-S | 69.5 | 67.3 | 74.7 | 53.0 | 66.1 |
| r=8,两者都用 | 69.8 | 68.4 | 75.2 | 53.4 | 66.7 |
设计选择与参数预算的对照(ViT-B/16,ImageNet-C 按噪声/模糊/天气/数字四组给分):
| 方案 | 总可训练参数 | 噪声 | 模糊 | 天气 | 数字 | 平均 |
|---|---|---|---|---|---|---|
| 浅层 {0..5} 加偏置 | — | 63.7 | 65.0 | 75.5 | 73.4 | 69.8 |
| 深层 {6..11} 加偏置 | — | 63.5 | 64.6 | 74.4 | 72.8 | 69.2 |
| 均匀 | — | 63.4 | 64.5 | 74.6 | 72.8 | 69.2 |
| 重新初始化 [CLS] 再训 | — | 60.2 | 60.8 | 72.0 | 69.3 | 65.9 |
| 新增可学习 token | — | 63.6 | 64.7 | 74.7 | 73.0 | 69.4 |
| 调优预训练 [CLS](本文) | 43.7K | 63.7 | 65.0 | 75.5 | 73.4 | 69.8 |
| Prompt tuning +1 token/层 | 43.0K | 62.9 | 64.0 | 74.4 | 72.2 | 68.7 |
| Prompt tuning +3 token/层 | 52.2K | 63.1 | 64.0 | 74.9 | 72.4 | 69.0 |
| LoRA r=1 | 66.0K | 63.0 | 64.0 | 71.1 | 72.2 | 67.9 |
| LoRA r=3 | 121.3K | 62.9 | 63.9 | 74.4 | 72.3 | 68.8 |
(纯 LayerNorm 调优的基线为 38.4K 参数。⚠️ 上表的分组数值与主表 Tab. 1 的分组均值有细微出入,按原文表格照录。)
关键发现¶
- 两个增强互补且都必要:r=4 时单用输入级增强 +0.3、单用特征级增强 +0.5,合用 +0.9(66.3 → 67.2);r=8 同理(65.6 → 66.7)。这印证了"输入级只能补领域级、逐层累积的损失必须靠层级偏置补"的分工。
- 浅层加偏置是明确更优的选择:浅层 {0..5} 平均 69.8,深层 {6..11} 与均匀取样都只有 69.2;层数本身也有稳定区间,4–6 层最优、超过 6 层饱和或略降,原因是 TTA 迭代步数有限、参数一多就收敛不动。
- 增益来自机制而非参数容量:增加可训练容量(prompt tuning 到 52.2K、LoRA 到 121.3K)只带来 68.7–69.0,均不及只多 5.3K 参数的 NAVIA(69.8);把 [CLS] 重新初始化再训则暴跌到 65.9,说明预训练 [CLS] 的语义是必须保留的锚。
- 压缩率越高,补信息的价值越大:ViT-L/16 上 r=2 → r=4 时,ToMe 从 68.9 掉到 65.8,而 NAVIA 仅从 71.9 掉到 70.7,说明聚合越激进、信息损失越重,本文的补偿就越关键;EViT 在大骨干 + 高压缩下崩到 54.4(Sketch 仅 46.8),从实证上支持了 Corollary 2。
- 收敛更快:在 ImageNet-R 留出的 10,000 张图上做固定迭代次数的适配,NAVIA 在最初的适配迭代里精度上升最快、最终精度也最高,说明信息增强确实缓解了聚合在早期造成的损失。
- 平均值会骗人:Tab. 1 里 SAR 与 DeYO 的平均分看起来尚可(60.8 / 44.9),但逐类看它们的 Frost 22.3、Fog 13.5、Noise 4.5、Weather 4.3 是整列塌陷,说明这些方法在部分损坏类型上完全失稳——这也是 ETTA 场景下更值得警惕的失败模式。
- 内存不背锅:峰值显存对比(Fig. 3)显示 NAVIA 与最高效的聚合基线持平(ViT-L/16 约 8.6 GB、ViT-B/16 约 5.6 GB 量级),信息增强没有额外显存负担。
亮点与洞察¶
- "补偿必须发生在压缩之前"是一个可证明的设计约束,而不是经验调参:作者用数据处理不等式证明聚合后 [CLS] 关于标签的互信息严格减少(Corollary 1),又用 LayerNorm 的确定性证明 norm-tuning 无法补回(Corollary 2),于是把设计空间一刀切到"聚合前的输入 token 上"。这种"先用信息论排掉一整类无效方案、再动手做设计"的写法,比直接堆模块有说服力得多,也很适合迁移到任何"先压缩再适配"的流水线(比如量化 + TTA、token 剪枝 + 持续学习)。
- 把信息载体挂在 [CLS] 而不是新增 prompt,是一箭三雕:新增 token 会让自注意力的开销随序列长度平方增长、且 TTA 步数太少学不好;而 [CLS] 既已经编码了类别语义(重新初始化就掉到 65.9 正好反证这一点),又参与决定每层的聚合矩阵 \(P_l\),改它相当于同时干预"压什么"和"补什么"。
- 残差结构决定了"浅层优于深层":浅层对 [CLS] 的更新会被后续所有 block 通过残差连接复用,深层更新生效机会少;这条论证可以直接搬到任何在 ViT 上做轻量微调的工作里,作为层选择的默认先验。
- 用参数扩容做对照实验来"证伪"自己的增益来源:对照 prompt tuning 与 LoRA 在不同参数预算下的表现,说明提升不是参数多带来的。这个消融设计值得学习——很多轻量适配论文只报"参数量小但效果好",而这篇把"参数本身就是解释"这个替代假说直接测掉了。
局限与展望¶
- 评测集中在 ImageNet 派生的分类基准与 ViT-B/16、ViT-L/16 两个骨干上,没有覆盖检测、分割等密集预测任务,也没有验证在 CLIP 类视觉语言骨干或更大模型上是否成立。
- 损失里的特征统计对齐依赖预部署阶段缓存的源域统计量(64 张源域图像)。这在严格 source-free 的 TTA 设定下不可用;虽然作者强调那是一次性离线步骤,但它仍然是比"完全无源数据"更强的前提。
- 层数 \(L_{\mathrm{bgt}}\) 需要在目标图像小集上按损失挑(原文给的选择集是 {4,5,6}),等于引入了一次目标域探测;文中只在 Fig. 5a 给出了稳定区间,没有讨论挑错层数时的退化幅度。
- ⚠️ δ 与 δ_l 是否跨 batch 保留原文未明确;TTA 中 batch 级在线量对数据顺序、batch size 的敏感性是常见失败点(Tab. 1 里 SAR/DeYO 的塌陷列就是例证),本文没有做这方面的鲁棒性分析。
- NAVIA 固定绑定 ToMe 作为聚合器,虽然与 EViT/ToFu/TCA 在同一表格里做过对比,但没有把信息增强装到这些聚合器上验证其通用性;而 EViT 那种基于注意力分数的选择式压缩,信息损失的形式与 ToMe 的合并式压缩并不相同,值得单独验证。
- 显存只是"与最高效基线持平",没有减少峰值显存;真正的边缘部署收益主要来自墙钟与 GFLOPs。
- 可改进方向:把 δ 的更新从逐 batch 的朴素 SGD 换成带可靠样本筛选的更新(例如借鉴 EATA 的样本选择)以减少噪声梯度对信息载体的污染;或者把层选择从离线网格搜索改成按层的信息量在线估计。
相关工作与启发¶
- vs 纯 TTA 方法(Tent / SAR / DeYO / CoTTA / FOA):它们只优化分布偏移下的精度,几乎不控制前向成本——SAR 需要二阶梯度、DeYO 要用不同 patch 序列多次前向、CoTTA 一次迭代 111 GFLOPs、FOACMA 更是高达 1588 GFLOPs。NAVIA 在 ViT-L/16 上比 FOACMA 快 17 倍以上还高 2.5 个点,比 FOABP 少 23% GFLOPs 且精度更高,把"效率"提到了与精度同等的一等公民位置。
- vs token 聚合方法(ToMe / EViT / ToFu / TCA):它们默认下游模型参数固定、训练与推理一致,所以可以把相似 token 直接合并;但在 TTA 里权重每个 batch 都在变,聚合造成的信息损失会被自适应过程进一步放大,直接组合就掉点(ViT-L/16 上 ToMe4 掉 4.1、EViT4 掉 15.5)。本文补的正是这块它们不负责的信息损失。
- vs 结构压缩 / 剪枝 / 量化 / 蒸馏:那些方法要靠大量重训来恢复压缩损失,而 TTA 根本没有可用的训练数据与算力预算;token 聚合之所以被选中,正是因为它是免训练、插拔式、不改变 ViT 参数的,这也是本文把增强做成"只加可学习偏置"而非"改动骨干"的原因。
- vs prompt tuning(VPT / TPT)与 LoRA:它们在迁移学习里是主流轻量方案,但在 ETTA 的极少迭代预算下,从零学新 token 或低秩增量都收敛不足(65.9–69.0),且参数量更大;本文用"预训练 [CLS] + 偏置"的增量式增强换到了更好的性价比。
- 启发:一个可以延伸的想法是把这个框架反过来用——既然浅层 [CLS] 偏置能保护即将被压缩的信息,那么能否用"信息增强向量的范数/梯度大小"作为每一层聚合多少 token 的自适应压缩率指标,让聚合强度随域偏移程度动态变化?这比固定 r 更符合 ETTA 的初衷,也与本文"聚合矩阵依赖 [CLS]"的观察自然衔接。
评分¶
- 新颖性: ⭐⭐⭐⭐ 首次把"TTA + token 聚合"形式化为 ETTA 问题,并用互信息/数据处理不等式给出"必须在聚合前补偿"的可证明设计约束,问题定义与理论动机都有实质贡献
- 实验充分度: ⭐⭐⭐⭐ 4 个 OOD 基准 × 2 个骨干 × 2 个压缩率,配套层选择、token 载体、参数预算、收敛速度、显存与 t-SNE 多维分析,但只覆盖分类任务、且未讨论 batch 级自适应的稳定性
- 写作质量: ⭐⭐⭐⭐ 分析—定理—设计的链条清晰,表格信息密度高;缺点是部分 LaTeX 公式在排版中损坏、Tab. 4/5 的分组数值与主表存在细微不一致
- 价值: ⭐⭐⭐⭐ 给"在受限算力下做 TTA"提供了一条几乎零成本、即插即用的路径(只多 5.3K 参数、不改前向 FLOPs),对边缘部署场景有直接实用价值