ORFC: Orthogonal Reparameterization for Low-Bitrate ViT Feature Coding¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://github.com/zhangletian2/ORFC
领域: 模型压缩 / LLM效率
关键词: 特征编码, 乘积量化, 正交重参数化, 分割推理, 视觉Transformer
一句话总结¶
针对端云协同分割推理中视觉 Transformer 中间特征低码率编码时因特征空间均方误差失配与通道子空间任务敏感度极不均匀导致的性能崩溃问题,ORFC 提出在固定分组乘积量化前引入基于 Cayley 变换的可微正交重参数化旋转,并以冻结后置网络的输出偏差作为任务代理失真进行端到端率失真优化,在小于 0.1 BPFP 的极低码率下显著消除了任务精度崩塌。
研究背景与动机¶
视觉 Transformer(ViT)在各类视觉表征学习和下游理解任务中展现出卓越的泛化能力,但其庞大的参数量与高昂的自注意力计算开销严重阻碍了在边缘资源受限设备上的实时部署。端云协同分割推理(Split Inference)通过将模型切分为边缘前置端(执行浅层特征提取以充分利用片上计算)与云端后置端(承接深层繁重推理),有效缓解了边缘端的计算压力。然而,这一架构将系统瓶颈由端侧算力直接转移至带宽受限的端云通信信道上,如何对中间层高维特征张量进行超低码率的有损压缩,成为了分割推理落地实用的核心生命线。
传统特征编码方案大多沿袭图像/视频编解码(如 VVC/VTM)或神经特征压缩模型,直接在特征空间中最小化均方误差(MSE)等欧氏重建损失。这种设计隐含了一个基本假设:只要在特征空间保留了足够的数值相似度,后置网络的下游任务性能便能得以维持。然而在 ViT 中间特征的超低码率(如低于 0.1 BPFP)编码场景下,该假设遭遇了双重结构性矛盾。首先,中间特征重建的微小扰动会在后置 Transformer 多层全局自注意力的非线性传播中被急剧放大,特征空间 MSE 极小的压缩方案在最终任务输出上仍可能出现剧烈偏移。其次,ViT 通道各子空间的任务敏感度呈现出高度各向异性:某些通道方向的变化对下游损失具有决定性影响,而另一些方向则近乎无关。
当采用在工程落地中极具吞吐与显存优势的固定分组乘积量化(Grouped PQ)时,上述敏感度不均带来了致命的比特分配失衡。根据经典变换编码的率失真理论,最优比特分配必须满足“等斜率准则”(Equal-Slope Criterion),即各组对总失真的边际下降收益与消耗码率之比保持一致。固定码本大小的分组 PQ 隐式地赋予了各通道子空间均等的比特预算,导致大量珍贵比特被浪费在任务不敏感的平凡方向上,而关键敏感方向却因缺乏表征能力而产生不可逆失真,最终在极低码率区间诱发陡峭的精度崩塌。为此,本文并不盲目引入复杂度高昂的动态可变码本或非均匀量化硬件,而是从特征表征几何切入:核心 idea:通过 Cayley 变换学习可微正交旋转矩阵对中间特征进行重参数化,将各子空间迥异的任务敏感度均匀重分配到各个 PQ 分组中以对齐等斜率准则,并结合冻结后置网络输出偏差构建任务对齐的端到端熵约束率失真优化。
方法详解¶
整体框架¶
ORFC 专为端云分割推理设计,整体由边缘编码端、可微率失真优化管线与云端解码端三部分构成。输入图像经过边缘前置 Transformer 模块提取出中间特征 \(F \in \mathbb{R}^{T \times D}\)(其中 \(T\) 为 token 数,\(D\) 为通道维度)。在边缘端,特征首先进行特征模长归一化解耦全局激活尺度,随后通过一个可学习的正交旋转矩阵 \(R \in \mathbb{R}^{D \times D}\) 变换到旋转表征空间 \(Z = F R\);接着沿通道维度将 \(Z\) 均匀切分为 \(G\) 个子空间,每个子空间利用独立码本进行熵约束乘积量化并输出离散索引;索引经组自适应先验概率进行算术熵编码后生成紧凑比特流传输至云端。在云端,熵解码器还原离散索引,查表重构旋转特征 \(\hat{Z}\),随后通过转置逆变换 \(\hat{F} = \hat{Z} R^\top\) 及模长重标定恢复原始空间特征,最后送入云端冻结的后置 Transformer 模块与任务预测头完成下游推理。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
In["输入中间特征 F<br/>模长归一化处理"] --> R1["Cayley 参数化正交旋转变换<br/>正交矩阵 R 旋转通道子空间 Z=FR"]
R1 --> R2["熵约束分组乘积量化<br/>固定分组与组自适应先验选码"]
R2 --> Comm["算术熵编码比特流<br/>端云无线信道传输"]
Comm --> Dec["云端反量化查表重构<br/>逆变换恢复特征 F_hat=Z_hat R^T"]
Dec --> R3["冻结后置网络输出偏差代理失真<br/>计算后置层输出与原始输出欧氏偏差"]
R3 --> R4["直通估计端到端率失真优化<br/>退火软分配联合优化旋转与码本"]
关键设计¶
1. Cayley 参数化正交旋转变换:拉平跨组任务敏感度 针对通道各子空间任务敏感度极不均匀导致的固定分组量化位分配浪费问题,ORFC 在特征分组前引入正交变换矩阵 \(R \in \mathbb{R}^{D \times D}\)。正交变换的内在保范性(\(R^\top R = I\))确保了特征全局能量与几何流形的无损保持,且其逆变换等于其转置变换,无需计算高复杂度的矩阵逆。然而,如果在黎曼流形上直接对正交约束进行显式参数投影或施加惩罚项正则,会导致梯度优化极不稳定。为此,ORFC 采用经典的 Cayley 变换对正交矩阵进行无约束重参数化构造:优化一个严格反对称的参数矩阵 \(A \in \mathbb{R}^{D \times D}\)(满足 \(A^\top = -A\)),并通过下式在正向传播中解析生成严格正交矩阵: $\(R(A) = (I - A)^{-1}(I + A)\)$ 这种构造使得矩阵 \(R\) 在数学上严格正交,消除了尺度漂移;在端到端任务梯度的驱动下,正交旋转矩阵主动在通道空间内“旋转”坐标系,将原本集中在少数几个特征通道上的关键任务几何分量分散旋转并均衡投射至所有 \(G\) 个固定维度分组中,从表征层面重塑了通道协方差结构,从而在无需改造硬件端齐次并行分组量化管线的前提下使各分组的边际任务增益趋于一致。
2. 熵约束分组乘积量化:实现率失真联合分配 在完成通道旋转后,旋转特征 \(Z\) 沿通道轴被均匀切分成 \(G\) 个维度为 \(d = D/G\) 的子向量 \(z_{t,g}\)。每个组配备独立的离散码本 \(C_g = \{c_{g,1}, \dots, c_{g,N}\}\)。传统最近邻量化仅依据纯几何欧氏距离 \(\text{dist}_{t,g}(j) = \|z_{t,g} - c_{g,j}\|_2\) 分配码字,忽略了码字出现概率对最终熵编码比特流长度的直接制约。ORFC 为每个分组引入可学习的类别先验分布参数 \(\mathbf{p}_g \in \mathbb{R}^N\),通过 Softmax 归一化得到码字先验概率向量 \(\boldsymbol{\pi}_g = \text{softmax}(\mathbf{p}_g)\)。在决定离散码字索引时,将失真度量与码长代价融合为统一的率失真代价函数: $\(\mathrm{cost}_{t,g}(j) = \mathrm{dist}_{t,g}(j) + \frac{1}{\lambda}\left(-\log_2 \pi_{g,j}\right)\)$ 并通过硬分配选出最优码字索引 \(k_{t,g} = \arg\min_j \mathrm{cost}_{t,g}(j)\)。该设计将全局率失真折中因子 \(\lambda\) 直接下沉到边缘端的局部码字决策中,使码字选择天然倾向于高频且低失真的中心点,同时直接输出可微的理论码率评估项 \(-\log_2 \pi_{g,k_{t,g}}\),避免了引入昂贵且复杂的自回归上下文模型。
3. 冻结后置网络输出偏差:构建任务对齐的代理失真 传统特征编码采用特征自身空间内的 MSE 作为重构损失,但实验表明浅层/中间层的微小特征 MSE 与深层分类精度、密集检测定位甚至多模态对齐的性能衰退缺乏单调一致性。若直接采用各具体下游任务损失(如分类交叉熵、检测回归损失)进行反向传播,不仅会导致特征编码器深度过拟合到单一任务、丧失通用表征能力,还会引入额外的任务标注数据与复杂的训练管线。ORFC 采取了“折中且精准”的代理策略:将云端后置 Transformer 网络 \(M_{l+1\to L}(\cdot)\) 彻底冻结,作为固定、免标注的无偏特征几何评估器。将未压缩特征通过后置网络的前传输出记为 \(o = M_{l+1\to L}(F)\),重构特征通过后置网络的输出记为 \(\hat{o} = M_{l+1\to L}(\hat{F})\),并将两者在深层表征空间的欧氏偏差定义为任务代理失真: $\(\mathcal{L}_{\text{ref}} = \|o - \hat{o}\|_2\)$ 由于深层表征 \(o\) 已经充分聚合了全局自注意力相关性,其偏差直接反映了后置网络对特征损伤的容忍度。以 \(\mathcal{L}_{\text{ref}}\) 驱动正交变换与量化码本的学习,既无需下游任务标注,又能极其敏锐地约束那些对深层推理最为关键的特征子空间。
4. 直通估计端到端率失真优化:稳定离散码本与旋转联合优化 在整体优化过程中,总损失函数被形式化为由比特率项与输出偏差项构成的拉格朗日目标:\(\mathcal{L} = R_{\text{bits}} + \lambda \mathcal{L}_{\text{ref}}\),其中 \(R_{\text{bits}} = \sum_{t=1}^T \sum_{g=1}^G (-\log_2 \pi_{g, k_{t,g}})\)。然而硬量化选择算子 \(\arg\min\) 的不可微性会阻断梯度回传,若直接采用标准直通估计(Straight-Through Estimator, STE),由于熵惩罚项会剧烈迫使码字向少数高频点聚集,在训练初期极易导致码本表征坍缩。为此,ORFC 引入了基于温度退火的软概率加权直通机制:定义结合了率失真代价的软分配权重向量 \(\tilde{\mathbf{w}}_{t,g} = \text{softmax}(-\mathrm{cost}_{t,g} / \tau)\),并将前向传播的硬 One-hot 向量 \(\mathbf{h}_{t,g} = \mathbf{e}_{k_{t,g}}\) 构造为: $\(\mathbf{w}_{t,g} = \mathbf{h}_{t,g} - \text{sg}[\tilde{\mathbf{w}}_{t,g}] + \tilde{\mathbf{w}}_{t,g}\)$ 在前向传播中,特征严格由单一最优码字重构;在反向传播中,梯度沿着连续平滑的软分布 \(\tilde{\mathbf{w}}_{t,g}\) 流向所有候选码字、先验分布 \(\boldsymbol{\pi}_g\) 以及上游正交矩阵 \(R\)。伴随温度 \(\tau\) 由 0.5 指数退火至 0.005,优化平稳过渡至离散硬决策,彻底解决了离散码本优化与连续正交矩阵联合求解时的震荡与局部极小问题。
损失函数 / 训练策略¶
训练过程采用未标注的通用图像集(如从 ImageNet 中采样 5,000 张图像),抽取指定切分点处的中间特征。优化器选用 Adam,学习率固定为 \(3 \times 10^{-4}\),拉格朗日乘子设定为 \(\lambda = 0.5\)。码本大小 \(N\) 在 \(\{4, 8, 16, 64, 256\}\) 间扫描,子向量维度 \(d \in \{16, 32\}\),组数配置为 \(G \in \{32, 64\}\)。退火温度 \(\tau\) 随迭代步数按指数衰减 \(\tau_t = \tau_0 \cdot \gamma^t\) 逐渐降至极值 0.005,确保码本充分利用与平稳收敛。
实验关键数据¶
主实验¶
在 DINOv2 ViT-L/14(第 20 层切分点)、VitDet ViT-B/16(目标检测第 3 层)及 SigLIP2(多模态检索第 8 层)上,对比 ORFC 与代表性基线模型(标准视频编解码扩展 VTM、学习型超先验 LaMoFC 以及优化乘积量化 OPQ)在极低码率下的核心任务性能。同时以 VTM 为基准计算 BD-rate(负值表示节省码率)。
| 模型与骨干网络 | 下游任务 / 数据集 | 码率指标 (BPFP) | 本文 (ORFC) | OPQ | VTM | LaMoFC |
|---|---|---|---|---|---|---|
| DINOv2 ViT-L/14 (blk10) | ImageNet 图像分类 (Acc@1) | 0.06 BPFP | 96.0% | 34.2% | 19.8% (0.11 BPFP) | <1.0% |
| DINOv2 ViT-L/14 (blk20) | ImageNet 图像分类 (BD-rate) | 全码率区间 | -77.5% | 基线对照 | 0.0% (基准) | +120.5% |
| DINOv2 ViT-G/14 (blk20) | VOC2012 语义分割 (mIoU) | 0.06 BPFP | 83.1% | 52.4% | 65.5% (0.09 BPFP) | 31.2% |
| VitDet ViT-B/16 (blk03) | COCO2017 目标检测 (mAP) | 0.05 BPFP | 91.6% | 36.7% | 49.5% | <5.0% |
| SigLIP2 So400m/14 (blk08) | COCO2017 跨模态检索 (Recall@1) | 0.08 BPFP | 79.4% | 58.1% | 62.3% | 2.8% (崩塌) |
消融实验¶
在 DINOv2 ViT-L/14 第 20 块特征上进行严格消融实验,验证代理失真 \(\mathcal{L}_{\text{ref}}\)、正交旋转矩阵 \(R\) 以及软分配直通估计(Soft assign)对分类(BD-rateCls)与密集预测分割(BD-rateSeg)的相对增益(以 VTM 为 0% 基准):
| 实验配置编号 | 后置代理失真 \(\mathcal{L}_{\text{ref}}\) | 正交旋转 \(R\) | 软分配退火 (Soft assign) | BD-rateCls (相对 VTM) | BD-rateSeg (相对 VTM) | 说明 |
|---|---|---|---|---|---|---|
| (a) 基础基线 | ❌ (使用特征 MSE) | ❌ (单位阵) | ❌ (纯硬分配) | -6.7% | +190.7% | 传统 MSE 驱动的分组 PQ,分割性能剧烈劣化 |
| (b) 引入旋转 | ❌ (使用特征 MSE) | ✔️ | ❌ | -5.2% | +153.2% | 纯 MSE 驱动的旋转(类似 OPQ),未能对齐任务敏感度 |
| (c) 引入代理失真 | ✔️ | ❌ (单位阵) | ✔️ | -57.0% | +14.4% | 无旋转重分布,子空间敏感度失衡仍制约密集预测 |
| (d) 缺少软退火 | ✔️ | ✔️ | ❌ (纯硬分配) | -24.8% | +181.2% | 硬分配导致码本模式坍缩,率失真权衡失效 |
| (e) 完整模型 (ORFC) | ✔️ | ✔️ | ✔️ | -77.5% | -41.4% | 全模块协同,在两类任务上均取得大幅码率节省 |
关键发现¶
- 正交旋转是密集预测任务的核心解药:对比配置 (c) 与 (e),在同样具备后置代理失真的情况下,引入正交重参数化 \(R\) 使得分割任务的 BD-rate 从 +14.4% 暴降至 -41.4%(节省超过 55% 码率)。这是因为语义分割对特征空间局部相干性极其敏感,正交旋转成功瓦解了局部坏子空间对整图预测的破坏。
- 特征 MSE 优化具有极大的误导性:配置 (b) 相比配置 (a),即便通过 MSE 学习到了数据自适应旋转,分类 BD-rate 仅从 -6.7% 变为 -5.2%,分割性能依旧极差(+153.2%),证明传统基于图像保真度的特征 MSE 指标无法反映机器视觉后置端的信息流需求。
- 跨层与跨任务泛化性稳健:在跨任务泛化评估中(ImageNet 上训练的编解码器直接迁移至 NYU Depth v2 深度估计),在第 5、10、15、20 块切分点分别取得了 -73.3%、-90.0%、-64.1% 和 -50.6% 的惊人 BD-rate 增益,证明学到的正交几何表征重构具有高度的任务不可知性与表征鲁棒性。
- 系统开销极其轻微:在 RTX 4090 上,针对 ViT-L/14(\(D=1024\)),正交变换 \(R\) 的编码前向仅耗时 0.36 ms、显存 25.5 MB,完整端侧编码总耗时仅 1.23 ms,完全满足边缘端实时超低时延传输的要求。
亮点与洞察¶
- 变换编码与大模型特征几何的优美融合:巧妙地将经典通信变换编码中的“等斜率率失真准则”引入视觉大模型的中间特征压缩中,用一个极其轻量、参数完全正交的旋转矩阵就解决了复杂的通道敏感度失衡问题。
- 完全免标注的后置网络一致性代理:通过冻结后置 Transformer 作为特征评估器,利用未压缩与压缩特征在深层的输出偏差构建代理损失,既避开了对多任务标签的繁琐依赖与过拟合风险,又从机理上逼近了机器视觉下游损失。
- 硬件友好的均等分组与数学可微的优雅妥协:不破坏硬件高效执行的固定码本与规整分组结构,而是利用 Cayley 变换将约束转移至连续特征空间的坐标旋转,实现了工程落地实用性与算法理论最优的统一。
局限与展望¶
- 单切分点适配专属性:正交旋转矩阵 \(R\) 和后置网络评估器是针对特定的切分层 \(l\) 进行绑定的;若推理系统根据动态网络信道状况动态切换切分点(如从第 10 层切换到第 15 层),当前方案需要加载不同切分点的编解码参数,缺少跨任意切分点的连续无级自适应机制。
- 静态独立码本的时空相关性忽略:当前分组乘积量化将每个 token 视为独立样本进行逐 token 查表量化,未显式利用相邻视觉 patch token 之间的空间上下文与语义平滑性,低码率下的比特开销仍有压缩空间。
- 未来方向:探索与动态 Token 剪枝/合并(Token Pruning)机制联合协同,在旋转后的正交子空间中自适应识别空间冗余 token,进一步将特征传输码率压低至极限。
相关工作与启发¶
- vs OPQ (Optimized Product Quantization): OPQ 同样学习特征空间的旋转矩阵,但其优化目标是最小化特征空间的欧氏重建误差(MSE),在 ViT 极低码率下无法改善跨组任务敏感度失衡,导致严重的下游任务精度雪崩;ORFC 以深层输出偏差为驱动学习正交旋转,真正实现了任务级别的等斜率比特分配。
- vs VTM (Versatile Video Coding Reference Software): VTM 作为传统视频编码扩展,在常规特征码率下具备竞争力,但其在小于 0.1 BPFP 时表现出陡峭的悬崖效应(Cliff Effect),且需要将特征打包为伪图像块,编解码延迟高达数百毫秒;ORFC 则在保持 1.2 ms 极致低延迟的同时完全抚平了低码率性能崩溃。
- vs LaMoFC: LaMoFC 采用神经网络超先验模型优化特征空间重建,在大模型复杂特征分布下训练易发生模式发散,低码率下表现乏力;ORFC 坚持轻量分组乘积量化底座,结合正交旋转取得了显著更优的率失真权衡。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次从变换编码等斜率准则揭示 ViT 特征量化的敏感度失衡本质,提出 Cayley 正交重参数化方案。
- 实验充分度: ⭐⭐⭐⭐⭐ 涵盖 5 种 ViT 骨干网络、4 大核心任务、多个切分点及详尽的消融、泛化与时延开销测定。
- 写作质量: ⭐⭐⭐⭐⭐ 问题剖析深刻直观,从理论动机到框架落地逻辑严丝合缝,图表论证扎实有力。
- 价值: ⭐⭐⭐⭐⭐ 为边缘-云协同视觉大模型部署提供了即插即用、开销微弱且性能卓越的高效通信压缩范式。