跳转至

CaRe: Critical Parameter Rectification for Efficient Visual Modeling

会议: ECCV2026
Paper: https://eccv.ecva.net/virtual/2026/poster/5148
PDF: https://media.eventhosts.cc/Conferences/ECCV2026/pdfs/9092.pdf
代码: https://github.com/lime-j/care
领域: 模型压缩 / 高效视觉骨干
关键词: 结构重参数化、参数空间门控、稀疏修正、线性注意力、多阶段融合

一句话总结

CaRe把普通权重改写为稠密基础项加上可学习的Softplus门控修正,在训练中集中修正少量重要位置、部署前合并回普通层,使CaReNet-M1以33,203张/秒的A100吞吐量达到73.6% ImageNet-1K Top-1,比EfficientViM-M1高0.7个百分点。

研究背景与动机

轻量视觉网络的困难不只是减少FLOPs,还要让真实硬件执行得快。结构重参数化提供了一条不同路线:训练时用更丰富的参数表示改善优化,部署时再折叠成简单算子。以RepVGG为例,额外的1×1卷积和恒等分支可以嵌入3×3主卷积核,但这些分支带来的修正只能落在核中心,其空间支持由结构预先决定。

CaRe追问的是:为什么重要的修正位置必须是中心?如果给每个权重都配一个可学习残差,位置固然自由了,基础项和辅助项却可能任意分摊任务,变成两份冗余的稠密权重。作者因此希望修正项既能自由选择位置,又受到偏向稀疏的优化约束;这种约束针对的是额外修正,不是要求最终网络变成稀疏网络,也不是冻结基础权重。

论文将乘积分解的正则化性质与参数空间门控结合,再通过CaReNet验证其部署价值。核心idea:把训练权重表示成“稠密基础项 + 平滑门控修正”,让修正容量集中于少量参数,同时因门控不依赖输入而能够在部署前完全合并。

方法详解

整体框架

CaRe是一种权重参数化,CaReNet则是搭载它的视觉骨干,两者不能混为一谈。训练时,CaRe在卷积或线性层内部构造有效权重;输入图像仍经过常规特征计算。CaReNet以卷积stem进行16倍下采样,随后经过3个金字塔阶段,以Simple Attention混合局部与全局信息,并用渐进阶段融合组合分类预测。

部署前只需计算一次有效权重并移除辅助参数,不需要逐图像计算参数门控。下面的图将训练参数支路与图像特征支路分开;Simple Attention中的特征门控仍然存在,不能与可折叠的参数门控混淆。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    Parameters["训练参数"] --> CaRe["关键参数修正<br/>训练分解与部署合并"]
    Image["图像与卷积stem"] --> Attention["简化注意力<br/>金字塔阶段内重复"]
    CaRe -->|提供层权重| Attention
    Attention --> Fusion["渐进阶段融合"]
    Fusion --> Prediction["分类预测"]

关键设计

1. 关键参数修正:把额外容量分配给可学习的位置

普通的加法分解只增加自由度,没有机制阻止两个分量学成相似的稠密表示。作者先研究标量修正量的乘积分解:在乘积固定时,对两个因子施加平方惩罚,其最小值与修正量绝对值成正比。这里的\(a\)\(g\)代表两个因子,\(\Delta\)代表有效修正;这一等式是线性乘积分解的结论,不是对完整Softplus模型的等价性证明。

\[ \min_{a,g:\,ag=\Delta}(a^2+g^2)=2|\Delta|. \]

将其逐元素应用,因子的\(L_2\)惩罚便具有针对有效修正的\(L_1\)型偏置,从而提供“不要到处都加修正”的动机。不过,直接使用两个有符号因子的乘积,会让正正、负负两条路径都表示同一正修正,符号与幅值的职责纠缠在一起。CaRe将其中一个因子变成严格为正、单调光滑的Softplus门控:

\[ W=W_{\mathrm{base}}+\Delta W, \qquad \Delta W=W_{\mathrm{aux}}\odot\operatorname{Softplus}(W_{\mathrm{gate}}), \qquad \operatorname{Softplus}(g)=\log(1+e^g). \]

三个张量形状一致,逐元素相乘的辅助项决定修正的符号,正值门控调节强度,稠密基础项维持完整表达路径。门控为负时Softplus输出可以很小,但有限输入下不会严格等于零,因此这里的“稀疏”主要指有效修正集中,而非二值掩码或精确零权重。对非关键位置的抑制来自任务优化与正则化共同作用,不能简化成“权重衰减直接把门控推向负无穷”。

参数门控在不同样本间相同,但会随训练更新;这种“静态”与冻结参数不是一回事。推理时把上式直接求值,存成单个标准权重张量即可。它既没有输入相关的条件分支,也不要求稀疏硬件支持。论文在CaReBlock内的深度卷积和FFN层应用这一机制,并讨论向其他骨干的卷积和线性层扩展;零额外开销指同一层合并前后的部署表示,并不意味着CaReNet与EfficientViM的整网FLOPs完全相同。

2. 简化注意力:用紧凑全局状态替代空间两两交互

CaReNet从EfficientViM出发,将HSM-SSD混合器简化为全局线性聚合与输出门控。输入特征按批量、通道、空间位置组织;一条投影支路产生键和查询,经3×3深度卷积与SiLU注入局部空间偏置。另一条投影支路产生值特征和门控信号,使跨位置的信息聚合与输出调制各有职责。

聚合先把值与键沿空间维汇总,形成大小为“扩展通道数 × 状态维度”的全局状态,再用查询将状态分发回各位置。因而不需要构造空间位置数的平方大小的注意力矩阵;在通道与状态维度固定时,计算随序列长度线性增长。分发后的特征再与经过SiLU的输出门控逐元素相乘,最后线性投影。此处门控依赖输入,属于保留在部署网络中的GLU式特征调制。

缓存中式(4)的转置与归一化系数抽取不完整,式(5)也有符号缺失,因此这里只说明正文和张量形状能够支持的计算顺序,不补写精确缩放公式。论文称替换EfficientViM-M1的混合器可以获得相当性能,但没有在所选结果表中单独量化全部宏观改动,不能据此把主表增益全部归于CaRe。

3. 渐进阶段融合:持续保留浅层空间信息

EfficientViM使用可学习权重与softmax融合多阶段输出,作者观察到权重容易过早偏向最后阶段。PSF改为固定递增系数,使较浅的空间线索始终参与,同时给深层语义更大的权重。原文明确给出的系数为\([0.2,0.4,0.6,0.8]\);消融比较了仅末阶段、均匀平均和不同递增方案。

需要保留一个复现边界:正文描述的是3个骨干阶段,但融合向量有4项,当前文本缓存没有清楚交代全部预测头与这4个系数的对应关系,也没有给出完整融合方程。因此不能自行断言第一个系数对应stem,或把这组数当作已经归一化的概率。可靠结论是固定渐进配置在报告的比较中优于仅末阶段与均匀配置。

一个完整示例

以论文的M1为例,224×224图像经过16倍下采样stem后形成14×14的初始网格;3个阶段的通道数为\([128,192,320]\),块数为\([2,2,2]\),状态维度为\([64,32,16]\)。每个相关层训练时用基础、辅助、门控三份参数生成有效权重,特征随后完成局部卷积、全局状态聚合与输出调制,分类端使用PSF。

部署时输入图像的处理顺序不变,变化发生在模型准备环节:三份参数预先合并成普通层权重。不能把门控修正直接删掉来近似合并,因为“合并”保留了修正的数值,“删除”丢失了模型已经学到的表示;后面的消融恰好检验了这个区别。

损失函数 / 训练策略

CaRe不是新增监督任务,重点是改变权重参数化与优化偏置。论文未在缓存中列出完整分类损失及各类增强的全部配置,只说明遵循EfficientViM训练方案,不应据此补造蒸馏或额外稀疏损失。主要模型从头训练300个epoch,另报告M4-256的450个epoch版本。

优化器为AdamW,峰值学习率\(2.5\times10^{-3}\),余弦衰减至\(2.0\times10^{-5}\);预热20个epoch、冷却10个epoch,梯度裁剪最大范数0.02,EMA衰减0.9995。作者报告TPU v4-8训练、每设备批量512、总批量2048;这里保留报告值,不推断未交代的设备映射。COCO使用300个epoch预训练检查点,以AdamW、学习率\(1.0\times10^{-4}\)微调12个epoch。

实验关键数据

主实验

下表摘自原文表1。Top-1单位为%,吞吐量单位为张/秒,测试硬件为NVIDIA A100-PCIE-40GB;参数量和FLOPs均以百万计,不能将这一吞吐结果直接等同于手机延迟。

模型 输入 Top-1 吞吐量 参数量 FLOPs
EfficientViM-M1 224×224 72.9 33,033 6.7 239
CaReNet-M1 224×224 73.6 33,203 6.7 264
EfficientViM-M2 224×224 75.4 28,249 13.9 355
CaReNet-M2 224×224 76.0 27,180 13.9 391
EfficientViM-M3 224×224 77.6 19,038 16.6 656
CaReNet-M3 224×224 78.3 19,249 16.9 727
EfficientViM-M4 256×256 79.4 13,625 19.6 1111
CaReNet-M4 224×224 79.8 14,576 19.6 964
CaReNet-M4-256 256×256 80.4 13,404 19.6 1223
CaReNet-M4-256-450ep 256×256 80.6 13,404 19.6 1223

M1与M3分别提高0.7个百分点;M2提高0.6个百分点但吞吐量下降,并非全系列都同时更快。相同256×256输入下,M4的Top-1提高1.0个百分点,但吞吐量略低;450个epoch版本达到80.6%,不可把更长训练带来的结果作为相同训练预算比较。

COCO-2017结果来自原文表2:RetinaNet下CaReNet-M4为39.2 AP,EfficientViM-M4为38.8;小目标AP却为21.9对22.1。Mask R-CNN下两者框AP均为39.3,掩码AP为36.0对35.8。因此下游证据支持有限增益,而不是各指标全面领先。

消融实验

下表摘自原文表3,比较权重组合方式。各\(P\)代表独立可学习参数;这里的标准层基线是72.7%,不同于主表EfficientViM-M1的72.9%。

权重组合 Top-1 (%) 相对标准层变化(百分点)
\(W=P_1\) 72.7 0.0
\(W=P_1\odot\phi(P_2)\) 69.5 -3.2
\(W=P_1+P_3\) 73.1 +0.4
\(W=P_{3\times3}+P_{1\times1}+P_{\mathrm{id}}\) 73.2 +0.5
\(W=P_1\odot\phi(P_2)+P_3\odot\phi(P_4)\) 70.1 -2.6
CaRe训练后删除门控修正 60.1 -12.6
\(W=P_1\odot\phi(P_2)+P_3\),完整CaRe 73.6 +0.9

原文表5与表6提供了以下补充消融;两组改变的变量不同,应各自在组内比较。

消融组 配置 Top-1 (%)
门控激活 Identity 72.9
门控激活 ReLU 73.1
门控激活 GELU 73.5
门控激活 Softplus 73.6
阶段融合 仅末阶段 \([0,0,0,1.0]\) 73.1
阶段融合 均匀 \([0.25,0.25,0.25,0.25]\) 72.9
阶段融合 简单递增 \([0.1,0.2,0.4,0.8]\) 73.2
阶段融合 PSF \([0.2,0.4,0.6,0.8]\) 73.6

关键发现

  • 稠密基础项不可轻易替代:只用乘积门控为69.5%,两个门控分支为70.1%,均低于完整CaRe的73.6%。
  • 删除修正后从73.6%降至60.1%,即下降13.5个百分点;表中的-12.6是相对72.7%标准层,而不是相对完整CaRe。这证明修正有用,但不是定位“最关键子集”的充分因果实验。
  • 图5以\(|\Delta W|\geq0.05\max(|W|)\)统计大幅修正比例,该比例在约40个epoch内快速下降;最大的10%修正项所占总修正质量比例上升。缓存没有可靠的曲线终值,故不报告具体稀疏率。
  • 原文表4在DeiT训练方案下报告:ResNet-18为69.1%→69.3%,ViT-Tiny为72.2%→72.4%,PoolFormerV2-S12为77.7%→78.1%,各自推理参数量保持11.7M、5.7M、11.9M。可迁移性存在,但增益幅度较小。

亮点与洞察

  • 将“更多训练容量”放到参数表达而非输入相关分支中,是零额外部署算子的关键。可复用的原则是先检查新增计算能否在输入到来前求值,而不是只数训练时的分支。
  • 修正稀疏与模型稀疏是两回事。CaRe保留稠密骨干,以修正集中度解释优化收益,不依赖稀疏算子获得速度。
  • 保留无门控基础路径比增加更多门控分支更重要。组合消融表明,表达形式的归纳偏置比单纯增加参数分支更能解释性能。

局限与展望

  • 理论边界:线性乘积分解的\(L_2\)\(L_1\)等价不直接覆盖Softplus,也不直接证明实际AdamW训练会找到同样的极小值。需要针对非线性门控与实际优化器补充分析。
  • 证据边界:未报告多随机种子方差,通用骨干的0.2至0.4个百分点增益需要稳定性复验;删除整个辅助项不能证明大幅修正排名具有最优性,可增加等数量随机删除对照。
  • 成本边界:零额外推理开销不是零额外训练成本。训练显存、优化器状态、墙钟时间以及移动端实际延迟未在当前缓存中充分量化。
  • 复现边界:注意力公式抽取缺损,3个阶段与4项融合系数的映射未明确;需要对照原始PDF或代码,不能从经验补齐。本次仅依据缓存,未验证代码链接的可访问性。
  • 任务边界:实验主要是ImageNet与COCO,没有自动驾驶专门评测;小目标检测也未改善。未来可在更高分辨率、不同硬件与领域迁移中测试其适用范围。

相关工作与启发

  • RepVGG / ACNet / DBB:通过训练多分支、推理合并改善优化。CaRe以RepVGG的中心支持修正为切入点学习可变位置,但不能把所有结构重参数化方法都简化成只修改中心。
  • EfficientViM / MambaOut:前者提供骨干起点,后者启发对状态空间结构必要性的重新审视。CaReNet同时改变混合器、融合策略与权重参数化,评价单独CaRe时应优先看组合消融与跨骨干结果。
  • LoRA / DoRA:主要面向预训练模型适配,CaRe强调从头联合训练且不是低秩更新。共同点是可将辅助表示合并,但训练假设与约束不同。
  • SE / GLU / CondConv:依据输入进行特征或权重调制,通常不能折叠成一个对所有输入固定的权重。CaRe与它们可以共存,CaReNet的输出特征门控正说明两类门控并不互斥。

评分

  • 新颖性: 4/5。将稀疏偏置的乘积分解、Softplus参数门控与可合并权重结合,思路明确,但各组成思想已有基础。
  • 实验充分度: 4/5。分类、检测、分割、组合与激活消融较完整,但缺少方差、训练成本和移动端验证。
  • 写作质量: 3/5。主线易于理解,非线性稀疏性的理论边界和融合细节解释不足,缓存公式缺损也限制复现。
  • 价值: 4/5。对保持普通部署算子的高效视觉模型有实用价值,通用骨干上的收益较小,仍需任务级评估。