跳转至

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

会议: NeurIPS 2026
arXiv: 2608.04084
代码: https://github.com/Beryex/SpecDrop
领域: 混合专家(MoE)
关键词: 类别条件路由、模块专门化、固定软门控、共享专家、训练信号粒度

一句话总结

SpecDrop 用固定类别到分支映射、非零跨类别软权重和定分母融合塑造模块专门化,在可信类别标签可用于推理的视觉任务上优于不使用标签的匹配基线,但标签感知的稠密输出掩码准确率更高,且模糊文本划分上的路由增益接近零。

研究背景与动机

混合专家模型(MoE)和多分支网络把容量分散到多个模块,却不一定产生真正不同的专长:多个专家可能长期扮演处理各种输入的通才。常见解决办法是学习路由器、加入负载均衡或互信息损失,或者用随机掩码迫使模块分工。然而,如果所有模块接收的训练信号本身混合了多个类别,再精细的门控算法也未必能把这种信号变成清晰的专长。本文因此不把问题简单归因于路由器不稳定,而是追问路由信号的粒度是否匹配要学的类别结构。

这里必须区分两种“对齐”。数据侧的划分对齐,是一个训练单元能否带有一个干净的类别标签;模型侧的分支—类别对齐,则是训练后某个类别是否主要依赖被分配的分支。图像可由细分类别归入一个 superclass,标签与整张图像相对应;文档来源域或指令任务域却不一定对应每个 token 的内容与技能。即使域路由成功让文本分支分工,也可能不改善整体语言建模。作者用视觉和语言四种设置,把“形成结构”与“获得性能收益”分开考察。

SpecDrop 将类别标签视为外部可用信息,而不是让一个额外网络去猜路由。因此视觉比较中的收益包含标签本身的价值:测试时的 CIFAR superclass 和 BREEDS supercategory 都由目标细标签构造,不能当作标准无标签分类结果。核心 idea:用固定的类别非对称软门控改变各分支接收训练梯度的比例,再以匹配架构、标签感知掩码和模糊划分对照,检验类别粒度何时能把专门化转化为性能收益。

方法详解

整体框架

模型输入不只是图像或文本,还包括类别标签。共享部分产生特征,各层的并行分支处理相同输入;“类别分配与软门控”确定一个偏好分支,“定分母融合与共享专家”将全部分支结果组合,训练中的“恒总量路由调度”逐步增强类别差异。同一输入的分支权重在各个路由层复用,最后由共享分类头或语言模型输出预测。

CIFAR 在 ResNet-110 的三个层组路由,ImageNet 在 ViT 的全部 12 个 MLP 路由,语言模型在每层 FFN 路由,SuperNI 在 Llama-3.2-1B 每个块的七个适配线性层路由。主实验采用 Soft SpecDrop:训练和推理都确定性使用软权重,所有分支权重非零,并非随机 dropout,也没有通过只执行少数专家节省计算。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    X["输入与共享特征"] --> A["类别分配与软门控"]
    C["类别标签<br/>训练与推理均需"] --> A
    A --> B["定分母融合与<br/>共享专家"]
    B --> O["预测输出"]
    B -.->|训练调度| D["恒总量路由调度"]
    D -.->|更新软权重| A
    O -.->|仅训练| L["任务损失与反向传播"]
    Y["目标标签<br/>仅作训练监督"] -.-> L

图中的类别标签不是仅供训练的监督项:推理仍沿实线输入门控。虚线表示训练调度与损失监督,不表示推理时额外执行一轮学习;视觉类别标签虽然由目标标签粗化得到,部署时仍必须另行可靠获得。

关键设计

1. 类别分配与软门控:固定偏好,但不隔离其他分支

作者先规定每个类别偏好一个分支,采用 round-robin 映射;类别数多于分支数时,一个分支可接收多个类别。这个分配不经过梯度下降,也不依赖输入特征,所以“parameter-free”只描述路由规则,绝不是整个网络没有可训练参数。四个部署设置分别使用 20、46、7、20 个分支,均与各自类别数相等。

偏好分支得到较大权重,其余分支得到较小但非零的泄漏权重。普通等权融合让所有分支以同样强度处理每个类别;硬类别路由又会把其他类别的知识通路切断。Soft SpecDrop 则让一个分支多学自己负责的类别,同时保留跨类别梯度流。用分配矩阵和两个权重表示这一机制:

\[ p_k(c)=A_{ck}p_{\mathrm{a}}+(1-A_{ck})p_{\mathrm{i}},\qquad p_{\mathrm{a}}>p_{\mathrm{i}}>0. \]

这里 \(A_{ck}\) 表示类别是否分配给该分支,\(p_{\mathrm{a}}\) 和 \(p_{\mathrm{i}}\) 是 Soft 版本直接使用的权重。它们沿用了随机版本“激活概率”的符号,但主模型不采样 Bernoulli 掩码;不能由权重较小推断该分支不执行。

门控为何可能诱导专门化,可以从反向传播理解:每个分支的基础梯度会乘上自身的融合系数。但定理中的分配类别与非分配类别梯度比等于 \(p_{\mathrm{a}}/p_{\mathrm{i}}\),还要求基础梯度与掩码条件独立、不同类别基础梯度期望幅度相同。Soft 消除了掩码随机性,却没有消除类别梯度不同的问题;因此这不是无条件保证专家最终具有独占专长的定理。

2. 定分母融合与共享专家:让路由混合保持单分支尺度

类别偏好改变时,如果融合输出的幅度也随之改变,后续网络可能把门控差异当作整体尺度差异。SpecDrop 将分支加权和除以一个固定总权重;由于每个类别恰好偏好一个分支,这个总量与类别无关。可选的共享专家在归一化后以单位系数加入,而不是跟着各类别权重变化。

\[ z=\frac{\sum_{k=1}^{K}p_k(c)h_k}{S}+h_{\mathrm{SE}},\qquad S=p_{\mathrm{a}}+(K-1)p_{\mathrm{i}}. \]

这里 \(h_k\) 是分支输出,\(h_{\mathrm{SE}}\) 是始终开启的共享专家输出。路由部分的系数和为一,因而保持凸组合的尺度;共享专家负责跨类别共用能力。CIFAR 的最终配置不使用共享专家,ImageNet、SlimPajama 和 SuperNI 则保留它。加入共享专家时需要重新分配容量,不能把额外容量的收益统算为路由收益。

在附录的 Bernoulli 版本中,固定分母还能使单次融合的期望匹配确定性测试融合,前提是分支输出不依赖当前掩码。由于同一个掩码跨多个非线性层组复用,不能把这一结果延伸为整个随机网络训练输出与推理输出严格相同。对于主用的 Soft 版本,没有随机分母偏差要消除,固定分母最关键的作用是尺度校准和共享专家组合。

3. 恒总量路由调度:逐渐强化类别差异,不改变融合总量

训练开头不立即给窄分支强烈类别偏好,而从等权融合出发,按余弦调度提高偏好权重;其他分支权重反向耦合,使总量保持不变。这不是逐渐减少被计算专家数量,而是逐渐改变每个类别对各分支的训练贡献。视觉按 epoch 调度,语言与 LoRA 按 step 调度,最终配置的调度比例为整个训练过程。

类别频率不均衡时,作者还为稀有类别放大偏好与泄漏之间的差值,再围绕统一的平均权重重新分配两者。下式合并了原文的差值定义和保持总量的变换:

\[ \mathrm{gap}_c=(p_{\mathrm{a}}-p_{\mathrm{i}})\left(\frac{1-\pi_c}{1-1/M}\right)^\beta,\quad p_{\mathrm{a}}^c=\frac{S}{K}+\frac{K-1}{K}\mathrm{gap}_c,\quad p_{\mathrm{i}}^c=\frac{S}{K}-\frac{\mathrm{gap}_c}{K}. \]

这里 \(\pi_c\) 是类别频率,\(M\) 是类别数,\(\beta\) 控制放大强度。两类权重的加权总量仍为 \(S\);均衡数据或 \(\beta=0\) 时退化为标量配置。这一扩展要满足权重在合法范围内,不能任意增大指数;附录给出范围约束,并说明运行时检查总量是否被截断破坏。实验中该指数的收益很弱,不能把它描述为已证实解决类别不均衡的关键模块。

一个完整示例

以 CIFAR 的一个 superclass 输入为例,固定分配选定其偏好分支;最终配置为 \(K=20\)、\(p_{\mathrm{a}}=0.7\)、\(p_{\mathrm{i}}=0.3\),所以 \(S=6.4\)。偏好分支的实际融合系数约为 0.109,其余每个分支约为 0.047:不是“70% 只走一个专家”,更不是只计算一个分支。

这组系数在三个 ResNet 层组复用,各层组先运行全部窄分支,再加权融合并进入下一层组。CIFAR 不加共享专家,最后的共享分类头仍输出 100 个细类别,而非只输出这个 superclass 的五个细类;输出限制是训练中形成的效果,不是推理代码显式屏蔽其他细类。

同一个输入训练时还用细类别计算交叉熵。推理时不计算损失,但仍要提供 superclass;若只能先用另一个分类器预测它,标签预测错误会传给路由,且多出一次近似稠密模型的前向开销。

损失函数 / 训练策略

训练仅使用原任务目标:视觉分类交叉熵、语言模型下一 token 交叉熵以及指令微调的监督目标,没有路由辅助损失或可学习路由参数。CIFAR 用 SGD、学习率 0.1、batch 128、200 epochs;ImageNet 用 AdamW、学习率 \(2.5\times10^{-4}\)、batch 256、100 epochs,采用不含 EMA 与 RepeatedAugmentation 的短 DeiT 配方。

SlimPajama 用六层、hidden 384 的约 30M Transformer,在 500M 唯一 token 上训练 10 epochs,batch 为 32 个 512-token 序列。SuperNI 冻结约 1.24B 的 Llama-3.2-1B 基座,训练约 222M 的多分支 LoRA 参数,有效 batch 128、3 epochs;这不是常见不到 1% 参数的低预算 LoRA 场景。

最终偏好权重依次为 0.7、0.6、0.6、0.8,选择实验中泄漏权重与之互补。注意:改变偏好权重的不同候选配置可有不同固定总量,而一个配置内部的 warmup 要保持其总量不变。ImageNet、SlimPajama、SuperNI 的不均衡指数分别为 1、4、1,共享专家相对单分支容量分别为 2、0.5、1;CIFAR 不用共享专家。

实验关键数据

主实验

以下数值来自正文 Tables 1–4,均为三个种子的均值与标准差。Top-1 单位为百分比,PPL 越低越好,ROUGE-L 为 F1;PPL 的标准差用总体形式,其余主表用样本形式。No-Routing 表示相同分支架构的等权融合,视觉主表中的这些对照不使用推理类别标签。

设置 / 方法 参数量 实现计算量 主指标 Align(%)
CIFAR / dense ResNet-110 1.737M 255.3M MACs/图 74.48 ± 0.13 —
CIFAR / No-Routing 1.721M 287.6M MACs/图 63.08 ± 0.04 3.3 ± 2.9
CIFAR / HardCategory 1.721M 287.6M MACs/图 57.67 ± 3.48 100.0 ± 0.0
CIFAR / Soft SpecDrop 1.721M 287.6M MACs/图 79.23 ± 0.17 68.3 ± 5.8
ImageNet / dense ViT-S/16 22.051M 4.25G MACs/图 76.38 ± 0.15 —
ImageNet / tuned Soft MoE 22.196M 2.91G MACs/图 76.69 ± 0.70 —
ImageNet / compute-matched Soft MoE 481.2M 4.26G MACs/图 66.72 ± 0.63 —
ImageNet / No-Routing+SE 22.263M 4.25G MACs/图 73.36 ± 0.29 2.9 ± 2.5
ImageNet / Soft SpecDrop 22.263M 4.25G MACs/图 79.89 ± 0.18 100.0 ± 0.0
SlimPajama / dense Transformer 30.143M 15.93–15.97G MACs/序列范围内 44.80 ± 0.05 —
SlimPajama / No-Routing+SE 30.168M 同上范围 45.28 ± 0.10 5.6 ± 9.6
SlimPajama / Soft SpecDrop 30.168M 同上范围 45.38 ± 0.02 94.4 ± 9.6
SuperNI / HydraLoRA 226.56M 基座外适配器 +18.1% 0.5153 ± 0.003 0.0 ± 0.0
SuperNI / No-Routing+SE 221.92M 基座外适配器 +18.0% 0.5094 ± 0.007 0.0 ± 0.0
SuperNI / Soft SpecDrop 221.92M 基座外适配器 +18.0% 0.5106 ± 0.003 22.2 ± 15.4

计算列来自 Appendix F.3,不是全表 FLOPs 严格匹配:CIFAR 多分支比 dense 多 12.7% MACs,Soft MoE 的两个配置分别匹配参数或近似匹配计算,不能混称为同时匹配。ImageNet 计数遗漏各方法约 0.36G 的融合注意力乘积,SlimPajama 遗漏约 0.60G 的 query–key 乘积;SuperNI 参数只计可训练适配器,计算列是相对冻结基座的额外比例,不是完整模型 MACs。

Align 定义为:逐个置零某分支,找出每个类别性能损失最大的分支,再统计它是否等于分配分支的类别比例。并列时取最低分支编号;LoRA 使用有向性能下降,因此不等同于热图中的最大绝对变化。SlimPajama 仅六个域有验证数据,SuperNI 仅 15 个 cluster 有测试任务;100% Align 也不代表高准确率,HardCategory 就是反例。

消融实验

信息匹配的输出掩码对照是理解视觉结论的必要分析:给所有模型同一个类别标签,只保留该类别下细类的 logits。以下为 Appendix E.3 Table 9 的三种子均值,单位均为 Top-1 百分比。

数据集 / 方法 不加输出掩码 加输出掩码 变化
CIFAR / dense ResNet-110 74.33 85.23 +10.90
CIFAR / No-Routing 63.07 78.47 +15.40
CIFAR / Soft SpecDrop 79.23 79.23 +0.00
ImageNet / dense ViT-S/16 76.37 83.65 +7.28
ImageNet / No-Routing+SE 73.36 81.44 +8.08
ImageNet / Soft SpecDrop 79.89 80.95 +1.06

该表的不加掩码数字与主表最多相差 0.15;作者说明两个 seed-42 dense checkpoint 缺失后按原配置重训,存在版本漂移。应保留两张表各自的数值,而不是把 74.33 改成 74.48 来制造一致性。

另一组 CIFAR 分析来自 Appendix A.3 Table 7,比较掩码与分母。它不是全部条件严格相同的单变量消融:Soft 用 0.7/0.3,Bernoulli 用 0.9/0.1,随机 dropout 用统一 0.5 且没有 warmup。

配置 分母 Top-1(%) 实验边界
类别条件 Soft 固定总量 79.23 ± 0.17 最终部署配置
类别条件 Bernoulli 固定总量 64.55 同时改变软权重与采样
类别条件 Bernoulli 采样后开启数 67.54 随机分母偏差仍存在
无类别 random dropout 固定总量 58.97 概率与 warmup 也不同
无类别 random dropout 采样后开启数 59.53 不能单独归因于去掉类别映射

关键发现

  • 匹配架构上的视觉增益分别为 +16.15 和 +6.53 个百分点;ImageNet 的共享专家本身先贡献 +2.06。匹配架构固定了容量与实现计算,但没有固定视觉标签信息。
  • 标签信息匹配后,dense+mask 在两个视觉数据集都更准。SpecDrop 的 CIFAR 输出掩码增益为零,说明类别限制大部分已内化;它的额外价值是可做分支消融的训练内结构,而不是最佳分类部署。
  • SlimPajama 的 Align 达 94.4%,仍比匹配控制高 0.10 PPL;SuperNI 路由仅增加 0.0012 ROUGE-L。两者在作者的种子噪声判断下无明确收益,不能把结构对齐当作性能提升证据。
  • 125M 文本模型复核仍比匹配控制高 0.17 PPL;一 epoch 检查为 61.91 对 61.93,且 batch 同时从 32 改为 64,不是只改变 epoch 的严格消融。56.1% 验证文本块跨至少两个 BGE cluster,但纯度与逐块损失差相关接近零,支持的是分布层面的解释,而非逐样本因果证明。

亮点与洞察

  • 固定门控是一种机制探针:去掉学习路由器后,仍能观察到类别非对称训练信号形成分工。它把“路由器好不好”与“提供给路由器的分类是否有意义”拆成可检验的问题。
  • 非零泄漏和共享专家都是跨类别知识通路。CIFAR 硬路由无共享专家时只有 57.67%,但加入共享专家的另一配置可达 76.95%;因此不能把所有硬路由失败都归因于单一概率选择。
  • 专门化指标、性能指标和标签信息价值需要分别报告。可迁移的是这种实验设计:等权同架构控制查机制增量,信息匹配控制查标签红利,分支消融查真正依赖结构。

局限与展望

  • 推理必须有可信类别标签。CIFAR 使用 dense 预测再粗化的 83.8% 准确标签时,最终 Top-1 为 69.33;ImageNet 的 88.5% 标签准确率对应 74.25,均不超过各自 dense 参考,而且标签预测约使部署计算翻倍。
  • 模糊划分解释得到四种设置和嵌入诊断支持,但不是普遍因果定律。视觉的 DINOv2 silhouette 0.069 也低于明显聚类阈值;不同模态、模型、标签定义和训练流程同时变化,仍需受控改变标签粒度的实验。
  • 实验规模有限,文本主实验反复遍历 500M token 十次,LoRA 预算约占基座 18%,部分基线偏离原始配置。SMoE-Dropout 的逐步增大专家数调度未实际生效,Mod-Squad 为 FFN-only 适配,不能把排名外推到原始论文全部配置。
  • CIFAR 按测试集最佳 epoch 选 checkpoint,SuperNI 按 119 个 held-out task 的 ROUGE-L 选 epoch,并仅为生成指标抽取每任务 10 个实例。更稳健的验证集划分、更大生成样本和标签预测成本核算能提高外部有效性。
  • 后续可先用固定标签训练出结构,再交接给无标签学习路由器;密集预测则需测试 region/token 级标签是否恢复增益。论文提出这一方向,但尚未完成检测、分割或大规模 MoE 验证。

相关工作与启发

  • vs Soft MoE / Switch: 学习输入相关的专家分配,SpecDrop 则从训练开始固定类别偏好。它省去路由器和辅助损失,却把类别获得问题留给部署环境,且 Soft 主版本仍计算全部分支。
  • vs DEMix / Branch-Train: 都利用域标签组织专家;SpecDrop 的小权重泄漏保持跨域学习,硬域隔离没有这条通路。是否改善性能仍取决于域标签与训练单元的粒度关系。
  • vs Stochastic Depth / dropout: 这些方法主要用随机失活正则化;SpecDrop 的强结果来自确定性类别条件软权重。不能因为名字含 Drop 就解释为更好的随机正则器。
  • vs StableMoE / auxiliary-loss-free balancing: 前者先学习再冻结,后者用在线偏置调负载;本文从第零步固定分配并按类别频率静态改权重。结合类别先验与学习路由是研究线索,而非本文已实现的结果。

评分

  • 新颖性: 3/5 — 固定类别路由并非全新,但对粒度、结构与性能的拆解有明确研究价值。
  • 实验充分度: 4/5 — 四种设置、信息匹配控制和规模复核较完整,标签特权、基线适配与 checkpoint 选择限制外推。
  • 写作质量: 4/5 — v2 清楚限定 Soft、标签红利和理论假设,主表与控制表存在已说明的 checkpoint 数值差异。
  • 价值: 4/5 — 更适合作为模块专门化的诊断工具与类别信号参考,而非无标签部署的压缩或稀疏计算方案。