When W4A4 Breaks Camouflaged Object Detection: Token-Group Dual-Constraint Activation Quantization¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/MCG-NKU/nku-model-compre
领域: 语义分割 / 模型压缩
关键词: 伪装目标检测, 后训练量化, W4A4量化, Token分组缩放, 双重约束投影
一句话总结¶
针对 Transformer 伪装目标检测在 W4A4 极限低比特量化下背景重尾激活主导范围导致微弱边界坍缩的现象,COD-TDQ 提出了直和 Token 分组(DSTG)与双重约束范围投影(DCRP),无需重训练即可大幅恢复检测精度并实现 1.5 倍推理加速。
研究背景与动机¶
伪装目标检测(COD)致力于从视觉上高度契合的复杂背景中分割出目标,其模型严重依赖场景中幅度微弱但具有连续空间结构的纹理与边界线索。近年来,随着视觉 Transformer(如 Swin、PVT 等)在多阶段 COD 网络中的普及,模型性能大幅提升,但激增的参数量和计算延迟也阻碍了其在移动端与边缘设备上的实时部署。后训练量化(PTQ)无需高成本的微调与重训练即可实现网络轻量化,然而传统 INT8 量化的压缩收益逐渐饱和,进一步推进到 4 比特权重和 4 比特激活(W4A4)的极限场景成为必然选择。令人意外的是,常规 PTQ 方法在分类网络或显著目标分割上尚能平滑退化,在 Transformer COD 模型上却会直接引发灾难性的性能坍塌。
这种失效的核心矛盾在于:伪装场景天然呈现低对比度,有用信号本身就属于微弱激活;与此同时,海量的背景 Token 展现出显著的非高斯重尾分布与离群极大值。传统的张量级(tensor-wise)或层级(layer-wise)量化器强行让所有 Token 共享单一截断范围,导致极少数背景离群点主导了全局截断半径的选取。这种跨 Token 范围主导直接撑大了量化步长,在四舍五入取整机制下,原本幅值较小但承载轮廓结构的关键边界特征被大量挤入零仓(zero-bin),即落入 \([-\Delta/2, \Delta/2]\) 范围而被彻底置零。在特征一旦置零后,后续的自注意力加权与多层感知机映射根本无法凭空恢复带符号的边界响应,导致最终分割掩码大面积失效。
这一失效本质上是激活量化主导的局部 Token 级病态,诊断显示 W4A8 仍能保持接近 FP32 的性能,而 W4A4 则急剧崩溃。本文的切入角度是打破全局量化对 Token 异质性的抹杀,同时在细粒度激活截断中显式施加防置零与防过粗步长的双向物理约束。核心 idea:提出 COD-TDQ 框架,先利用直和 Token 分组(DSTG)切断背景离群点对前景色激活范围的跨 Token 干扰,再通过双重约束范围投影(DCRP)同时锚定步长离散比和零仓质量上限,直接保全弱对比度边缘信号。
方法详解¶
整体框架¶
COD-TDQ 采用硬件友好的纯后训练量化范式,不改变模型的原始计算拓扑与权重拓扑,重点重构 Linear 与 Conv 算子的输入激活动态量化逻辑。权重方面采用常规的逐输出通道对称均匀量化并预先固化;激活方面则由直和 Token 分组(DSTG)与双重约束范围投影(DCRP)两级协同处理:输入特征首先被拆分为独立的 Token-Group 并计算局部基准半径,随后基准半径被严格投影进预设的离散度与零仓双约束可行域内,最后执行带符号的均匀整数量化与反量化。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入激活张量 X"] --> B["直和 Token 分组 (DSTG)<br/>解耦跨 Token 范围干扰"]
B --> C["双重约束范围投影 (DCRP)<br/>步长与零仓双界联合投影"]
C --> D["4-bit 均匀量化与反量化<br/>保留微弱边界激活"]
D --> E["INT4 矩阵乘法与下游算子"]
关键设计¶
1. 直和 Token 分组:消除跨 Token 激活尺度的恶性干扰
针对背景区域重尾 Token 强行拉大全局量化截断半径、稀释前景弱特征分辨率的痛点,DSTG 将传统的张量级范围解耦到局部 Token 块级别。对于每个 Token 向量 \(x \in \mathbb{R}^C\),将其通道维度划分为长度为 \(g\)(默认取 32)的互不重叠分组(若 \(C\) 不能被 \(g\) 整除则右端补零),将 Token 表示为各子向量的直和:
对于每个 Token-Group \(x_k\),DSTG 依据其自身的无穷范数或分位数独立计算基准截断半径 \(c_k^{\text{base}} = \|x_k\|_\infty\)。这样一来,携带极大值尖峰的背景 Token 仅在其自身组内放大步长,而包含微弱边界纹理的多数 Token 则享有极小且紧凑的专属步长,彻底根除了 \(c^{\text{global}} \gg c_k^{\text{base}}\) 造成的跨 Token 分辨率贬损。
2. 双重约束范围投影:联立步长离散比与零仓质量上界
尽管 DSTG 隔离了不同 Token 之间的相互影响,但在单个 Token-Group 内部,局部激活的非高斯重尾依然可能诱发局部的步长虚高与零仓质量塌陷。DCRP 针对性地构建了两个显式物理约束。约束 C1 限制步长与组内标准差之比 \(\eta_k = \Delta_k / \sigma_k \le \tau\),从而推导出截断半径的上限约束 \(c_k^{(\tau)} = q_{\max} \tau \sigma_k\);约束 C2 限制落入零仓的元素比例 \(\rho_{0,k} \le \mathrm{zr}\),由于四舍五入下置零条件为 \(|x_{k,i}| \le \Delta_k / 2\),该条件等价于要求半步长不超过组内绝对值的 \(\mathrm{zr}\) 分位数,导出截断半径上限 \(c_k^{(\mathrm{zr})} = 2 q_{\max} Q_{\mathrm{zr}}(|x_k|)\)。
最终的有效截断半径通过将基准半径投影到双约束交集区间获得:
经过投影后,\(c_k\) 确保了步长既不会相对于特征自身的离散尺度过大(避免粗粒度量化噪声覆盖细微纹理),又强行将四舍五入置零的元素比例钳制在阈值 \(\mathrm{zr}\) 之内,从根本上杜绝了边界弱特征被整体抹杀。
3. 硬件友好与极低开销实现
虽然 DSTG 与 DCRP 引入了细粒度统计,但由于量化分组 \(g=32\) 沿通道连续存储,且分位数计算与最小值投影均在本地片上寄存器高效完成,无需对特征排序或多轮前向统计。配合优化的 Triton INT4 算子实现,不仅避免了动态位宽切换带来的硬件分支发散,还将额外的缩放系数与索引存储开销控制在仅 0.341%,保持了与常规 W4A4 齐平的高吞吐与低显存占用。
损失函数 / 训练策略¶
COD-TDQ 属于严格的 PTQ 范式,不涉及任何梯度的反向传播与网络重训练。对于需要离线校准统计算子的 baseline 对比方法,统一采用 128 张校准图像。COD-TDQ 全程采用统一固定的超参数配置:分组大小 \(g=32\)、步长离散比阈值 \(\tau=1.0\)、零仓质量容忍上限 \(\mathrm{zr}=0.2\),并在所有基准模型(CFRN 和 ESCNet)与全部四个测试数据集上零样本通用,未做针对特定数据集的超参数过拟合。
实验关键数据¶
主实验¶
在四项具有挑战性的 COD 标准测试集(CAMO、CHAMELEON、COD10K、NC4K)上,以代表性的 Swin 架构 CFRN 为骨干网络,对比全精度、基线量化和既有 SOTA 量化方法。下表完整展示了各方案在 NC4K 与 CAMO 上的综合表现(节选自原论文 Table 2):
| 数据集 | 方法 | \(S_\alpha \uparrow\) | \(F_\beta^\omega \uparrow\) | \(E_m \uparrow\) | \(F_\beta^m \uparrow\) | \(\text{MAE} \downarrow\) |
|---|---|---|---|---|---|---|
| NC4K | FP32 (原始全精度) | .888 | .850 | .941 | .880 | .030 |
| NC4K | Naive W8A8 | .887 | .850 | .940 | .879 | .030 |
| NC4K | Naive W4A8 | .882 | .841 | .936 | .872 | .032 |
| NC4K | Naive W4A4 | .443 | .089 | .344 | .348 | .151 |
| NC4K | PTQ4ViT | .456 | .081 | .340 | .355 | .153 |
| NC4K | SmoothQuant | .452 | .108 | .543 | .342 | .157 |
| NC4K | PTQ4SAM | .702 | .632 | .761 | .660 | .082 |
| NC4K | IGQ-ViT | .710 | .651 | .776 | .688 | .080 |
| NC4K | RepQ-ViT | .718 | .651 | .783 | .691 | .072 |
| NC4K | Ours (COD-TDQ) | .837 | .747 | .884 | .817 | .052 |
| CAMO | FP32 (原始全精度) | .876 | .844 | .934 | .877 | .042 |
| CAMO | Naive W4A4 | .418 | .061 | .314 | .332 | .182 |
| CAMO | RepQ-ViT | .676 | .608 | .750 | .656 | .099 |
| CAMO | Ours (COD-TDQ) | .813 | .724 | .864 | .795 | .070 |
在以 PVT 为骨干的 ESCNet 模型上(原论文 Table 3),全精度 \(S_\alpha\) 为 0.893,Naive W4A4 跌至 0.576,现有最强方法 RepQ-ViT 达到 0.818,而 COD-TDQ 一举恢复至 0.881(\(F_\beta^\omega=0.849\),\(E_m=0.936\),\(\text{MAE}=0.031\)),几乎无损逼近全精度水准。
消融实验¶
在 NC4K 数据集上分别针对 CFRN 与 ESCNet 评估各核心组件的独立贡献(原论文 Table 4):
| 模型骨干 | 配置 | \(S_\alpha \uparrow\) | \(F_\beta^\omega \uparrow\) | \(E_m \uparrow\) | \(F_\beta^m \uparrow\) | \(\text{MAE} \downarrow\) | 说明 |
|---|---|---|---|---|---|---|---|
| CFRN | Naive W4A4 | .443 | .089 | .344 | .348 | .151 | 未作任何优化的朴素量化 |
| CFRN | Per-tensor | .407 | .093 | .513 | .185 | .209 | 张量级动态范围估计 |
| CFRN | DSTG only | .451 | .180 | .532 | .241 | .270 | 仅使用分组尺度,未加 DCRP 约束 |
| CFRN | DCRP only | .435 | .174 | .504 | .228 | .307 | 仅施加双约束,未做 Token 分组 |
| CFRN | Full (COD-TDQ) | .837 | .747 | .884 | .817 | .052 | DSTG + DCRP 联合生效,大幅超越各单项 |
| ESCNet | Naive W4A4 | .576 | .368 | .562 | .459 | .120 | 朴素基线 |
| ESCNet | DSTG only | .617 | .416 | .579 | .488 | .106 | 仅分组缩放 |
| ESCNet | DCRP only | .771 | .684 | .805 | .744 | .062 | 仅双重约束投影 |
| ESCNet | Full (COD-TDQ) | .881 | .849 | .936 | .876 | .031 | 联合优化达到近无损效果 |
关键发现¶
- 两模块紧密耦合缺一不可:在 CFRN 上,单独使用 DSTG 仅能获得 0.451 的 \(S_\alpha\),单独使用 DCRP 也仅有 0.435,只有两者联用时才能激增到 0.837。这是因为仅分组仍会被组内局部重尾恶化,而仅约束若建立在全局被污染的均值方差之上同样失效。
- 边界零置激活率骤降:统计分析证实,Naive W4A4 会使边界区域 41.6% 的激活落入零仓导致信息彻底灭失,而 COD-TDQ 将该比例压制到了 14.2%,使非边界组超出步长离散阈值的比例由 72.60% 归零。
- 真实硬件加速切实有效:在 RTX 4090 的 Triton INT4 部署实测中(Table 5),模型吞吐量从 FP32 的 29.40 FPS 提升至 44.21 FPS(推理延迟从 34.02 ms 降至 22.61 ms),显存峰值从 1421.31 MB 骤降至 834.92 MB,而 DSTG 的额外开销仅为 0.27 FPS(约 0.6%)。
亮点与洞察¶
- 问题诊断见微知著:将伪装目标检测在极限低比特下的失效精确归因到“背景重尾激活跨 Token 扩张截断步长,导致弱对比度边界特征落入零仓”,以 \(\Delta\)、\(\eta\)、\(\rho_0\) 三维诊断指标清晰揭示了任务特异性的崩溃机理。
- 机制与约束严格闭环:DCRP 模块没有引入复杂的黑盒启发式调优,而是直接将诊断指标 \(\eta \le \tau\) 与 \(\rho_0 \le \mathrm{zr}\) 逆变换为截断半径的解析封闭上界,数学形式干净自洽。
- 对通用稠密预测量化的启发:该方法表明,低对比度图像任务(如息肉分割、暗光检测、微小缺陷探伤)在极低比特激活量化下的核心瓶颈往往不是全局特征相似度,而是少数决定语义边界的弱激活是否被零仓抹杀,Token-Group 级别的离散-零仓双重约束具有广泛的迁移潜力。
局限与展望¶
- 算子覆盖范围:当前实验中 LayerNorm 与 Softmax 仍保留在 FP16 精度,全网络全整数计算(Fully INT4)在含有大量自注意力缩放时仍需进一步的数值稳定方案。
- 超参数全局固定:当前在所有网络层均统一采用 \(g=32\)、\(\tau=1.0\)、\(\mathrm{zr}=0.2\)。虽然展现了超强的通用性,但 Transformer 深层语义块与浅层细粒度纹理块对零仓质量的容忍度可能存在差异,自适应层级分位数调节有望进一步挖潜。
- 更大规模骨干网验证:目前主要在专门面向 COD 的 Swin-CFRN 与 PVT-ESCNet 上进行了验证,尚未扩展至通用十亿级参数视觉大模型(如 SAM-2 或通用大尺度视觉多模态骨干)。
相关工作与启发¶
- vs PTQ4ViT / RepQ-ViT: 传统 ViT 量化方法依赖层级/块级输出匹配与 Hessian 矩阵导向的尺度缩放,优化的是全局平均保真度;而 COD-TDQ 聚焦于 Token 异质性与局部极小激活保全,在 NC4K 上相比 RepQ-ViT 取得超过 0.11 的 \(S_\alpha\) 巨大提升。
- vs SmoothQuant: SmoothQuant 通过激活与权重之间的数学等价迁移来削弱激活离群点,但主要作用于 8 比特激活场景;在 4 比特激活的极端离散空间下,等价缩放无法解决弱边界特征直接沉沦入零仓的问题。
- vs post-GELU: post-GELU 依靠动态调整不同 Token 的量化比特数来救赎异常,但破坏了硬件规则并行性;COD-TDQ 保持了统一固定的 W4A4 计算网格,依靠边界几何约束与通道分组在统一精度下实现了性能修复。
评分¶
- 新颖性: ⭐⭐⭐⭐☆ 深入剖析了伪装目标检测在超低比特激活量化下的崩溃机理,提出的 DSTG 与 DCRP 设计针对性极强且数学严谨。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 4 大公开基准数据集、2 类典型 Transformer 骨干网络、详尽的机制诊断、完备的消融实验以及实打实的 Triton INT4 硬件实测。
- 写作质量: ⭐⭐⭐⭐⭐ 逻辑严密,从现象发现、机理诊断到算法设计与硬件实测层层递进,动机非常清晰。
- 价值: ⭐⭐⭐⭐☆ 为轻量化边缘端部署高精度伪装检测与细粒度微弱目标分割提供了即插即用且无须重训练的高效解决方案。