Towards Reconfigurable Visual Feature Compression¶
会议: ECCV 2026
论文: ECCV 原文
代码: https://jhang2020.github.io/Projects/RFC/RFC.html
领域: 模型压缩
关键词: 多任务特征压缩、特征因子化、跨任务超先验、端云协同、特征重组
一句话总结¶
针对端云协同中视觉大模型处理任意多任务组合时的特征传输冗余与推理低效问题,提出基于“因子化-整合-重组”的可重构多任务特征压缩框架(RFC),在前端按需剥离任务无关信息,通过跨任务自回归条件编码消除跨任务共享冗余,并在云端实现单次前向多任务推理。
研究背景与动机¶
随着 Vision Transformer 等视觉大模型(VFMs)在多任务视觉感知中展现出强大的泛化能力,将其实际部署于计算受限的边缘终端变得愈发紧迫。主流的端云协同范式通常将大模型切分为前端浅层特征提取网络和云端深层任务推理网络。为了缓解端云之间频繁的数据交换压力并保护数据隐私,中间特征压缩(Feature Compression)成为关键瓶颈。传统特征压缩技术主要沿用直接压缩并重构中间特征的范式,但在多任务场景下面临严峻的冗余与灵活性挑战。
现有多任务特征传输方案往往陷入两难困境。一方面,传统多任务特征压缩假设用户总是需要运行全部下游任务,将包含所有任务信息的庞大统一特征编码发送,这在实际中极罕见,导致传输码流中充斥着海量的“任务无关信息”;另一方面,若采用为每个任务单独部署独立前端模型的离散方案,前端不仅需要针对不同任务执行多次计算成本高昂的 Transformer 前向传播,而且不同任务特征之间高度共存的共享语义知识被反复压缩编码,造成严重的码流冗余与计算浪费,云端也丧失了一次前向处理多个任务的架构优势。
本文的切入角度是打破“固定整体特征压缩”与“独立离散单任务压缩”的割裂设计,将多任务特征压缩重构为一个可动态配置的因式分解与组装系统。核心 idea:提出可重构多任务特征压缩框架(RFC),在前端利用共享主干与轻量适配器将通用特征原子化因子化为目标任务专有特征以剔除任务无关冗余,在编码端利用已传输任务特征作为自回归超先验条件以消除跨任务共享语义冗余,并在云端通过任务注意力自适应重组单特征以保留单次前向推理能力。
方法详解¶
整体框架¶
RFC 包含三个核心阶段构成的统一流水线:前端特征因子化(Factorization)、码流整合编码(Consolidation)与云端特征重组(Recomposition)。给定用户请求的任意任务子集 \(T_Q \subseteq \mathcal{T}\),前端浅层网络 \(F_{front}(\cdot)\) 提取中间特征,经对应任务的轻量适配器输出原子化的任务专有特征;随后,多个任务特征以自回归顺序编码,后发任务复用先行任务的解码特征作为超先验条件以极低比特率生成码流;最终在云端解码后,通过轻量注意力重组模块融合成统一特征,输入云端骨干 \(F_{cloud}(\cdot)\) 完成一次前向的多任务输出。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["输入图像 x_i 与目标任务请求 T_Q"] --> B["前端共享骨干 F_front"]
B --> C["适配器特征因子化<br/>参数隔离的信息瓶颈分解"]
C --> D["跨任务自回归条件编码<br/>已传输任务特征作为超先验"]
D --> E["按需紧凑比特流传输至云端"]
E --> F["云端熵解码与特征恢复"]
F --> G["任务注意力特征重组<br/>可学习任务嵌入与自注意力融合"]
G --> H["云端骨干 F_cloud 单次前向<br/>多任务预测头输出最终结果"]
关键设计¶
1. 适配器特征因子化:参数隔离的信息瓶颈分解 针对 \(2^N - 1\) 种指数级任务组合直接建模难以收敛、以及多模型复制导致前端注意力重复计算的痛点,RFC 采用分而治之的原子因子化策略。在保持前端共享骨干参数冻结的前提下,仅在特征末端引入参数隔离的轻量任务适配器(Adapter)。该过程在理论上对齐信息瓶颈(Information Bottleneck, IB)原理,通过最小化特征与输入的互信息 \(I(x_i; f_i)\) 同时最大化特征与特定任务标签的互信息 \(I(f_i; Y_i^{t_k})\),有效过滤掉与当前请求任务无关的背景及干扰语义。实际优化目标形式化为率失真损失与压缩正则项的结合: $\(\mathcal{L}_{factor} = \mathcal{R}(f_i^{t_k}) + \lambda \mathcal{L}_{t_k}(\tilde{f}_i^{t_k}, Y_i^{t_k}) + \lambda' \|f_i^{t_k} - \tilde{f}_i^{t_k}\|_2\)$ 其中 \(\tilde{f}_i^{t_k} = \mathcal{D}_{t_k}(\mathcal{C}_{t_k}(f_i^{t_k}))\) 代表经任务专有压缩编解码网络重构的特征,\(\lambda'\) 约束特征空间平滑性。该设计使得前端仅需单次运行昂贵的全局注意力,即可按需提取纯净的任务专属表征。
2. 跨任务自回归条件编码:超先验信息复用消除跨任务冗余 虽然因子化剔除了任务无关信息,但不同视觉任务在浅层网络中仍然高度共享底层几何与纹理先验,逐个独立压缩会导致大量跨任务冗余编码。RFC 将冗余消除从特征空间转移到熵编码层面,提出跨任务超先验条件机制。在经典高斯超先验模型中,当前特征必须额外编码下采样的超先验潜变量 \(z\) 来估计均值 \(\mu\) 与方差 \(\sigma\);而 RFC 采用任务自回归方式,先行任务 \(t_j\) 传输并重构后,其特征 \(\tilde{f}_i^{t_j}\) 在云端已完全可见。后续任务 \(t_k\) 直接以已解压的 \(\tilde{f}_i^{t_j}\) 作为无下采样失真的超先验条件 \(z_i^{t_j \to t_k}\),输入预测网络 \(\mu'_{t_k}(\cdot)\) 和 \(\sigma'_{t_k}(\cdot)\) 直接生成高精度概率分布: $\(z_i^{t_j \to t_k} \longrightarrow \mu'(z_i^{t_j \to t_k}), \sigma'(z_i^{t_j \to t_k}) \stackrel{f_i^{t_k}}{\longrightarrow} \mathcal{B}(f_i^{t_k})\)$ 此机制无需额外发送自身超先验比特流即可使熵估计更加精准,直接节省约 30% 的超先验开销。为避免样本级动态搜索带来的额外通信与计算开销,系统在训练阶段离线确定并固化一张全局最优传输序列查表,推理时直接查表确定任务发送顺序与条件依赖。
3. 任务注意力特征重组:单次前向前馈吞吐优化 多任务特征分别解压缩后,若直接送入云端深层骨干,需要执行 \(|T_Q|\) 次昂贵的前向传播,彻底抵消了视觉大模型的统一多任务吞吐优势。RFC 在云端引入参数量仅占主干 0.4% 的超轻量任务注意力重组模块。首先利用任务专有投影将各解压特征变换至统一维度并沿任务维度拼接为 \(\tilde{f}_i^{all} \in \mathbb{R}^{(B \cdot N_p) \times |T_Q| \times C}\),随后注入可学习的任务嵌入向量 \(TE[T_Q]\),在仅含 \(|T_Q|\) 个 token 的紧凑空间内进行多头自注意力(MHSA)交互,动态评估各任务特征间的语义亲和度并输出归一化权重: $\(w = \text{sigmoid}\left(\text{FFN}\left(\text{MHSA}\left(\tilde{f}_i^{all} + TE[T_Q]\right)\right)\right)\)$ 最后利用 \(w\) 对 \(|T_Q|\) 个特征进行加权求和融合成单一张特征图 \(\tilde{f}_i^{fuse} \in \mathbb{R}^{B \times N_p \times C}\),送入云端骨干网执行单次前向推理。这一设计在几乎不损失任务精度的前提下,使云端计算吞吐量维持在 \(O(1)\) 复杂度。
损失函数 / 训练策略¶
RFC 采用三阶段递进式训练流程: 1. 因子化与基础压缩训练:冻结预训练骨干网络,仅微调各任务的前端适配器与基础编解码网络 \(\mathcal{C}_{t_k}, \mathcal{D}_{t_k}\),采用公式 (4) 的率失真与重构正则化联合优化 60k 迭代; 2. 跨任务条件超先验训练:固定适配器与主编解码器参数,仅训练各任务条件分布估计模块 \(\mu'_{t_k}(\cdot)\) 与 \(\sigma'_{t_k}(\cdot)\),仅以码率优化项 \(\mathcal{R}(\cdot)\) 为目标优化 20k 迭代; 3. 特征重组训练:冻结前后端与压缩参数,枚举所有可能的任务组合 \(T_Q\),仅以多任务综合任务损失 \(\sum_{t_k \in T_Q} \mathcal{L}_{t_k}\) 优化轻量重组模块 20k 迭代。
实验关键数据¶
主实验¶
在多任务通用评测协议下,模拟用户请求流的两种典型场景:少数任务占主导的 F-request 流(单任务至三任务请求占比高达 85%)以及多任务占主导的 M-request 流。在 PASCAL-Context 数据集上与传统图像编解码(HEVC、VVC)、经典特征压缩(Hyperprior FC、VCM、OmniICM、LaMoFC)及离散多模型方案(Multiple ST FC)的综合对比如下(摘自原论文 Table 1):
| 方法 | F-request 码率 (bpp) ↓ | F-request 分割 mIoU ↑ | F-request 解析 mIoU ↑ | F-request 边缘 odsF ↑ | M-request 码率 (bpp) ↓ | 云端前向次数 |
|---|---|---|---|---|---|---|
| 未压缩上限 | - | 78.95 | 66.83 | 72.4 | - | 1 |
| HEVC | 0.2648 | 17.12 | 19.16 | 24.1 | 0.2648 | 1 |
| VVC | 0.2907 | 45.98 | 37.38 | 44.3 | 0.2907 | 1 |
| Hyperprior FC | 0.1554 | 77.43 | 65.70 | 70.4 | 0.1554 | 1 |
| VCM | 0.2531 | 76.25 | 64.06 | 69.3 | 0.2531 | 1 |
| OmniICM | 0.1713 | 76.63 | 65.14 | 69.8 | 0.1713 | 1 |
| LaMoFC | 0.1894 | 77.21 | 65.02 | 70.4 | 0.1894 | 1 |
| Multiple ST FC | 0.0976 | 76.75 | 64.63 | 70.6 | 0.1557 | $ |
| RFC (本文) | 0.0725 | 77.61 | 66.31 | 72.0 | 0.0977 | 1 |
消融实验¶
为验证三大核心模块(因子化、自回归整合、特征重组)在全部 5 个任务请求(\(|T_Q| = 5\))极限条件下的实际效能,原论文在 PASCAL-Context 上的逐步消融数据如下(摘自原论文 Table 2):
| 实验配置 | 分割 mIoU ↑ | 人体解析 mIoU ↑ | 显著性 maxF ↑ | 法线 mErr ↓ | 边缘 odsF ↑ | 传输码率 (bpp) ↓ | 云端前向次数 |
|---|---|---|---|---|---|---|---|
| 仅因子化 (微调完整主干) | 76.98 | 65.79 | 84.49 | 13.63 | 71.9 | 0.2700 | 5 |
| 仅因子化 (轻量适配器) | 77.85 | 66.56 | 85.00 | 13.54 | 72.5 | 0.2675 | 5 |
| 因子化 + 云端重组融合 | 77.43 | 65.90 | 84.60 | 13.75 | 71.1 | 0.2675 | 1 |
| 因子化 + 整合编码 + 云端重组 (完整模型) | 77.43 | 65.90 | 84.60 | 13.75 | 71.1 | 0.1253 | 1 |
关键发现¶
- 整合编码大幅削减共享冗余:对比 Table 2 的第 3 行与第 4 行,引入跨任务自回归超先验整合编码后,传输码率从 0.2675 bpp 骤降至 0.1253 bpp,压缩率提升达 53.16%,而所有任务精度指标完全没有下降(因为条件先验仅作用于无损熵编码分布预测,不影响重构特征数值)。
- 适配器策略超越全参数微调:在特征因子化阶段,共享前端全局注意力并仅微调末端适配器不仅大幅节省内存和算力,其下游分割 mIoU(77.85 vs 76.98)与人体解析(66.56 vs 65.79)反而显著超越直接微调全主干,证明轻量适配器有效抑制了多任务在小样本下的过拟合。
- 面对少任务请求码率优势显著:在 F-request 实用流场景中,RFC 码率仅为 0.0725 bpp,相较于非可重构基线 Hyperprior FC(0.1554 bpp)节省了超过 53% 流量,相较传统视频编解码标准 VVC 码率节省近 75%,同时精度保持最优。
亮点与洞察¶
- 将语义解耦转移到信息熵复用:传统特征压缩常试图在特征提取层彻底解耦不同语义,但受限于边缘前端的浅层算力难以彻底分离;RFC 巧妙地将冗余剔除转移到熵编码阶段,利用已传输特征作为条件超先验,既规避了深层特征解耦的计算开销,又实现了超 50% 的跨任务码率节省。
- 任务注意力重组打破离散计算壁垒:通过轻量级自注意力动态衡量当前请求子集的语义相关度并执行特征自适应加权叠加,成功将多路并行特征收敛为单路特征,使得云端仅需单次前向传播即可驱动多个预测头,兼顾了端侧按需传输的灵活性与云端批处理的高吞吐。
- 离线序列查表规避线上调度开销:在训练阶段离线统计并预先构建各任务组合的最优依赖与传输次序查找表,推理时端云直接通过低开销头信息查表对齐,避免了运行时在线贪心搜索带来的额外延迟。
局限与展望¶
- 作者承认的局限:当前工作主要针对高层机器视觉分析任务的特征压缩,重构特征不具备还原高质量人类可读图像的能力;此外,在特定冲突任务组合下,云端简单特征重组会导致个别任务指标出现微弱波动(如 Table 2 中分割指标略降约 0.42%)。
- 潜在改进空间:特征重组目前采用全局 \(|T_Q| \to 1\) 的粗粒度融合,未来可探索动态任务聚类策略(如将强正相关任务融合成一组,冲突任务保留双路分支),在计算开销与精度干扰之间达成更优 Pareto 均衡。
相关工作与启发¶
- vs OmniICM / LaMoFC:以往端云协同特征压缩方法均基于“整体特征压缩-云端重建”模式,将包含所有任务信息的庞大特征整体传输,缺乏对动态用户请求子集的适应能力;RFC 首创可重构特征压缩框架,按需提取与传输,小任务请求下码率断崖式降低。
- vs Multiple ST FC:简单的单任务多模型部署方案虽然支持按需选择,但在前端和云端均需执行 \(|T_Q|\) 次模型前向计算,且忽略了多任务共存的底层视觉特征冗余;RFC 凭借前端适配器共享机制、跨任务超先验编码以及云端自注意力重组,在前向计算开销与码率效率上全面占优。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ 首次系统提出并形式化可重构多任务特征压缩问题,因式分解与条件超先验复用构思巧妙。
- 实验充分度: ⭐⭐⭐⭐⭐ 覆盖 PASCAL-Context 与 NYUD v2 双基准、5+ 类稠密视觉任务、两种模拟流分布及 ViT-Large 大尺度骨干消融。
- 写作质量: ⭐⭐⭐⭐⭐ 概念清晰,理论框架、图表展现与各阶段设计逻辑层层递进。
- 价值: ⭐⭐⭐⭐⭐ 为大模型时代端云协同视觉系统在多用户、异构请求下的高吞吐部署提供了切实可行的范式。