跳转至

Aggregating Cross-Domain Knowledge via Learnable Tokens for Multi-Teacher Distillation

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5104
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/8866.pdf
代码: https://github.com/VISION-SJTU/ACTok
领域: 模型压缩 / 视觉表征学习
关键词: 多教师蒸馏、可学习令牌、跨架构迁移、交替交互、视觉基础模型

一句话总结

ACTok在学生骨干之后加入通道拼接的可学习令牌和跨空间/域内交替交互,用ImageNet-1K汇聚CLIP、MAE、DINO等教师的互补表征,使ViT-B在Caltech101上达到94.4%,但并未在所有任务上超过最强教师或蒸馏基线。

研究背景与动机

视觉基础模型的知识并不只是同一语义空间里精度不同的版本。CLIP的图文对齐偏向全局语义,MAE的重建目标关注局部细节,DINO系列擅长对象级语义结构。把这些教师都压进一个学生,理论上能得到更通用的视觉编码器,但各教师的监督方向可能互相干扰:学生迎合一个教师时,可能损害另一个教师需要保留的细节。

RADIO等方法通过全局和局部特征对齐聚合多个教师,DUNE进一步增加Transformer投影层,但学生仍需直接匹配多种目标。ACTok认为问题不只是特征维度不一样,而是教师之间存在表征冲突。使用更多代理图像可能缓解冲突,却提高了蒸馏成本;若交互结构深入绑定ViT内部,还难以迁移到CNN。作者希望只用ImageNet-1K,通过骨干之后的交互模块,把“如何协调教师”从直接对齐中显式提出来。

这里的“跨域”主要指不同教师预训练目标及表征空间,不是依赖目标域标签的传统域适应。核心 idea:用可学习令牌作为知识聚合的中介,先让多个教师对应的学生特征空间交换并整理信息,再施加全局与局部监督,避免把全部异质约束直接压到裸骨干输出上。

方法详解

整体框架

输入同一张代理图像,学生和多个预训练教师分别提取特征。学生特征被投影到多个教师对应空间,加入可学习令牌通道后,依次通过跨空间交互与域内交互;最终分离令牌分支和视觉特征分支,分别接受全局监督和教师特定的特征监督。

关键区别是:交互模块处理的是学生的多路投影特征,不是把教师特征直接送进学生的前向计算。教师在蒸馏时提供监督目标;下游使用学生及其聚合后的投影特征,不需要运行教师。交互模块也不是训练后必然丢弃的附件,论文明确研究了其下游学习率及输出特征选择。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Input["代理图像"] --> Student["学生骨干"]
    Input --> Teachers["多个预训练教师"]
    Student --> Tokens["通道令牌代理<br/>多空间投影"]
    Tokens --> Interaction["交替空间交互<br/>跨空间后域内"]
    Interaction --> Alignment["双层教师对齐<br/>全局与局部监督"]
    Teachers -->|监督目标| Alignment
    Interaction --> Output["学生投影特征<br/>下游任务"]

关键设计

1. 通道令牌代理:保留空间布局,把知识中介放进特征通道

CNN输出的特征图可以看成每个空间位置一个令牌,ViT本来就输出类别令牌和图像块令牌,因此两类骨干能够共用“空间位置加特征通道”的视角。学生通过每个教师对应的投影器生成多路表征;投影器可采用MLP或Transformer块,各路视觉特征通道统一到教师最大特征维度,再与维度为\(d_m\)的可学习令牌作通道拼接。这不同于提示学习中在序列前面添加几个额外位置。

保留空间布局很重要:沿序列堆叠多个教师空间,会让注意力同时在相互冲突的令牌之间寻找关系,并破坏CNN需要的规则二维网格。论文指出,按序列拼接的注意力复杂度包含\(O(M^2L^2)\)项,其中\(M\)是教师数、\(L\)是空间令牌数。通道拼接没有免费消除计算,而是把增长转移到通道侧,给分组卷积、增加注意力头数等控制成本的实现留出空间。缓存没有完整展示令牌初始化及广播细节,不能据此臆造逐张量实现。

2. 交替空间交互:先交换互补信息,再恢复各教师空间的表达

一个交互阶段先沿通道合并所有学生投影空间及其令牌分量,通过跨空间模块混合信息,再按通道拆回各路。随后,每一路独立经过域内模块,整理刚刚吸收的知识,使其仍能匹配自己的教师。多个阶段重复这一过程,使信息不止在教师损失汇合时发生联系,而是在进入对齐目标之前就有可训练的交互路径。

CNN的跨空间模块使用带残差的Conv-GELU-Conv结构,第一层是深度卷积,第二层是分组逐点卷积,分组数随教师数线性扩展。ViT使用注意力块,注意力头数随教师数增加。域内模块使用相应的卷积或注意力结构,但同一阶段的各教师空间共享参数,并把教师维度并入批维以并行计算。“教师特定空间”因此不意味着每个域内模块都有一套独立权重;投影与监督区分教师,域内整理算子共享。

这一设计也不是保证所有梯度都一致的数学约束。更谨慎的理解是,它为消化不兼容目标增加了可学习的中间容量;消融能验证这些模块帮助优化,但不能单凭结构宣称彻底消除了负迁移。

3. 双层教师对齐:令牌学全局语义,视觉分支保留教师差异

交替交互结束后,每一路按通道拆成聚合令牌分量和视觉特征分量。令牌分量在ViT上取类别令牌,在CNN上做全局平均池化,再经论文描述的共享线性变换,与对应教师的全局表示做平方误差对齐。多个教师共同约束令牌的聚合能力,但不是要求所有教师原始向量不经变换就彼此相等。

视觉分支通过教师特定的线性投影匹配输出维度,并采用不同目标:CLIP分支先池化,再使用余弦相似度约束;DINO分支采用余弦目标,原表6验证其优于MSE;其余教师使用平方误差。虽然论文把这一部分统称为patch-level alignment,CLIP分支实际上包含全局池化,不能写成三个教师都逐图像块使用同一个损失。

CNN与ViT空间分辨率不一致时,将双方特征整理成二维特征图,用双线性插值把较高分辨率下采样到较低分辨率,再计算对应损失。这一步处理的是几何尺寸匹配,前面的交替交互才处理表征关系,两者不可混为一谈。

一个完整示例

以论文的ViT-B/16配置为例:一张\(224\times224\)图像产生\(14\times14=196\)个图像块位置和一个类别令牌。学生输出投影到CLIP、MAE、DINOv3三个空间,分别加入512维令牌通道,再执行一组跨空间与域内交互。这里增加的是通道容量,不是把196个空间位置变成三倍。

训练时,聚合令牌从三个教师的全局目标获得监督,视觉特征则保留各教师的目标差异。完成蒸馏后,论文通常选择DINO空间的投影特征服务下游任务;这不代表重新运行DINO教师,也不代表DINO头在每个数据集都最优。原表5的ResNet-50实验中,分类头在CUB上反而更好。

损失函数 / 训练策略

\(\mathcal L_i^m\)表示第\(i\)个教师的全局令牌对齐损失,\(\mathcal L_i^f\)表示其视觉特征对齐损失,论文整体目标可整理为:

\[ \mathcal L=\sum_{i=1}^{M}\mathcal L_i^m+\sum_{i=1}^{M}\mathcal L_i^f. \]

各教师等权,没有额外的教师选择器或按样本置信度加权机制。缓存中的公式1至4存在排版抽取损坏;这里依据正文解释整理总目标,不补造原文未能确认的归一化、广播和求和细节。图4的PCD、GIR、SCR定义指向补充材料,当前缓存未包含这些定义,因此只将该图视为作者的梯度冲突趋势分析,不自行定义指标或填入数值。

学生随机初始化,在ImageNet-1K约120万张图像上蒸馏300个epoch,分辨率为224。使用AdamW,学习率\(10^{-4}\)、权重衰减0.01、混合精度,在4张A800 80GB上训练。CNN与ViT-B批量为1024,ViT-L为512。CNN采用两组交替交互,ViT采用一组;令牌维度分别是ResNet-50的1024、ConvNeXt-B和ViT-B的512、ViT-L的768。

下游适配保留这些知识聚合模块,并对它们使用较小学习率,例如骨干学习率的0.1倍,以减轻有限任务数据造成的知识遗忘。ImageNet分类再微调10个epoch,细粒度分类微调100个epoch、批量32;ADE20K冻结骨干做512分辨率线性探测;NYUv2采用DPT解码器,批量16、训练25k次迭代。

实验关键数据

主实验

下表摘自原表1的基础规模模型。分类列为准确率百分数,ADE20K为mIoU百分数,NYUv2为RMSE,越低越好。数据量按原表口径列出:教师行是预训练数据,蒸馏方法行是蒸馏数据,不能混同为整套系统总数据成本。

方法 数据量 ImageNet Aircraft Caltech101 CUB ADE20K NYUv2 RMSE
MAE ViT-B/16 1.2M 83.6 85.9 91.6 81.2 22.2 0.347
DINOv3 ViT-B/16 1689M 86.2 92.6 93.5 90.3 50.9 0.293
Proteus ViT-B/14 1.2M 84.9 91.0 91.9 90.5 未报告 0.304
RADIOv2.5-B 约1400M 84.8 83.5 91.2 85.9 48.9 未报告
ACTok ViT-B/16 1.2M 85.6 91.1 94.4 90.8 46.5 0.300

ACTok-B相对RADIOv2.5-B的Aircraft提升为7.6个百分点,但ADE20K低2.4个百分点;相对DINOv3-B,Caltech101高0.9个百分点、CUB高0.5个百分点,ImageNet、Aircraft、分割和深度则仍落后。Proteus和RADIO数字引用各自官方结果,且教师规模、学生结构、训练流程不同,因此这不是严格受控的同预算比较。

消融实验

下表来自原表4,学生为ConvNeXt-B。两列都是蒸馏训练损失,不是下游准确率,原表未报告该消融的误差条。

配置 全局令牌损失 \(\mathcal L^m\) 特征对齐损失 \(\mathcal L^f\) 解释
去掉可学习令牌 不适用 0.29 比完整模型高0.06
去掉跨空间模块 0.18 0.35 全局损失略低,特征损失反而更高
去掉域内模块 3.56 2.60 两种损失都显著升高
完整ACTok 0.20 0.23 提供比较基准

域内模块的移除影响最大,支持“交换以后仍需各空间整理”的设计。跨空间模块并没有让所有损失都更低,所以不应把0.18到0.20解释为性能退化;需要结合特征对齐与最终任务评估。

原表6进一步比较ViT-L/16的DINO分支对齐目标,表中数值均为分类准确率百分数,平均值按原表保留。

DINO对齐目标 Aircraft Caltech101 CUB2011 平均
MSE 89.4 92.8 90.6 90.9
余弦目标 92.1 93.8 91.4 92.4

关键发现

  • 教师架构越像学生并不一定越好。原表2中ConvNeXt-B学生从全CNN教师换为全ViT教师后,ImageNet由83.0升到84.1,NYUv2 RMSE由0.361降到0.349;CUB仍为88.7,并非每项都提升。
  • 骨干之后的模块确实承载知识。原表5中ResNet-50裸骨干在CUB为73.8,DINO、MAE、分类投影头分别为77.9、77.0、79.7,不能假定丢弃投影头仍保留全部收益。
  • 下游小学习率有实际贡献。原表7中对交互模块做学习率缩放,CUB由89.2升至90.8,Caltech101由94.3升至94.4,Aircraft由90.3升至91.1。
  • 分辨率512到4096的稳定性主要由余弦相似度图和PCA可视化支持;VQA与数据规模实验在缓存中只有图及定性描述,没有可可靠读取的逐项数值,这里不补填精度。

亮点与洞察

  • 把“多教师冲突”从损失加权问题变成表征交互问题。教师等权仍能得到收益,说明设计能消化冲突的中间表示也是一条可行路线,而不只依赖复杂的教师权重策略。
  • 通道拼接将同一个思路迁移到CNN和ViT。它保留空间网格,并把多空间交流与域内整理分开,使架构适配落在骨干之后,不要求重写骨干内部。
  • 聚合特征不是裸骨干的同义词。投影头选择和适配学习率都影响最终效果,评估或复现时必须明确实际使用了哪一路输出。

局限与展望

  • 作者明确承认代理数据偏差。ImageNet-1K偏向单个对象,无法充分覆盖DINOv3大规模预训练中的复杂多对象概念,密集预测落后最强教师与这一限制一致。
  • 架构无关不等于架构间表现一致。CNN教师组合存在优化困难,ResNet-50学生的ImageNet为78.0,低于分类教师的80.9;全ViT教师只能部分缓解这些问题。
  • 从实验审视,数据效率不能等同于端到端计算效率。教师已经使用大型数据训练,学生训练又需要多个教师和交互模块;正文没有完整的参数量、FLOPs、延迟与总GPU时对照,不能声称推理开销不变或总成本降低千倍。
  • 从证据审视,模块消融主要报告训练损失,未给出对应完整下游指标或重复实验方差。更扎实的下一步是固定教师、学生和预算,比较直接对齐与ACTok的多任务结果,并测试多对象代理数据能否缩小分割差距。

相关工作与启发

  • 对比Proteus:同样能用ImageNet-1K获取基础模型知识,说明小代理集本身并不是ACTok独有的创新。ACTok的重点是多教师之间的协调及跨架构交互,而非仅仅减少图像数。
  • 对比RADIO / RADIOv2.5:两者聚合多个视觉教师,后者还强调多分辨率蒸馏。ACTok改变对齐前的知识交互方式,并在部分分类任务用更少代理数据取得较好结果,但分割未全面胜出。
  • 对比DUNE:DUNE使用更强投影以融合异质2D/3D教师;ACTok强调可学习令牌、跨空间和域内交替整理。两者都提示投影空间可以是重要的学习对象,而不仅是补齐维度的线性层。
  • 借鉴VGGT的令牌聚合思路:多视角图像存在潜在几何对应,异质教师却可能有语义冲突,因此ACTok选择通道拼接而不是照搬序列拼接。可迁移的启发是先判断不同信息源是否共享对应关系,再决定令牌在哪个维度交互。

评分

  • 新颖性: 4/5。把通道令牌中介和交替空间交互结合到多教师蒸馏,机制具体,但仍建立在已有投影与令牌聚合思路上。
  • 实验充分度: 4/5。覆盖CNN、ViT、多种下游任务与关键消融,但缺少严格同预算对照和完整计算成本报告。
  • 写作质量: 3/5。主线清楚,但patch-level命名与CLIP池化处理需要细读区分,部分图表引用也不够严谨;缓存公式抽取损坏不计作论文自身缺陷。
  • 价值: 4/5。为有限代理数据下的多基础模型知识整合提供可复用结构,不过部署时需保留实际使用的聚合模块并核算成本。