COVERT: Privacy-Preserving Covariant Obfuscation for VLMaaS via Exact Reparameterization and Tailored Tuning¶
会议: ECCV 2026
论文: ECCV 原文
PDF: ECCV PDF
领域: LLM 安全
关键词: 视觉语言模型, 协变混淆, 隐私推理, 隐状态反演, 模型即服务
一句话总结¶
针对视觉语言模型云端推理(VLMaaS)中的用户视觉提示隐私泄露风险,提出首个专为多模态架构定制的协变混淆框架 COVERT,通过卷积分块的零空间扰动、加性偏置的增维重参数化与浅层 ViT 注意力的定制微调,在保持端到端精度损失低于 3%、吞吐开销低于 6% 的同时彻底抵御特征与隐状态反演攻击。
研究背景与动机¶
随着视觉语言模型(VLM)在医疗辅助、智能金融和私域助理等高价值敏感场景中的广泛落地,受限于本地算力,用户将多模态提示上传至云端服务的“模型即服务”(VLMaaS)模式已成为主流范式。然而,多模态输入中蕴含着高度敏感的生物特征、私密身份与地理坐标等细节,不可信或半诚实(honest-but-curious)的云端服务器既能通过特征反演直接重构原始高分辨率图像,也能利用浅层中间激活恢复敏感语义。传统的密码学隐私推理方案(如基于三方 MPC 的 PrivMLLM)在处理高维连续图像张量时通信与延迟开销巨大,单次请求耗时数分钟且传输数据量达数吉字节,完全无法满足实时交互;而基于差分隐私(DP)的加噪扰动机制则会粗暴破坏图像补丁与文本之间的微妙语义对齐,导致多模态推理能力发生灾难性崩溃。
在纯文本语言模型中,基于联合变换数据与权重的“协变混淆”(Covariant Obfuscation,如 AloePri)范式展现出了零误差代数抵消与严苛隐私保护的优异权衡,但将其直接移植到 VLM 面临着严峻的跨模态结构与表征异质性壁垒。一方面,视觉编码器包含卷积分块(Patchification)、非线性激活及广泛存在的加性偏置,在旋转位置编码(RoPE)等严苛代数约束下,乘性混淆矩阵的自由度被大幅压缩至极其容易被代数逆向求解;另一方面,连续视觉信号具有密集的局部平滑性与强烈的空间几何先验,攻击者能够绕过全局置换,直接从浅层 Vision Transformer(ViT)的注意力图和中间隐藏状态中反演还原出高保真车牌、人脸等视觉细节。
面对跨模态结构异质性与连续空间反演的双重挑战,本文的切入角度是:将文本侧成熟的置换混淆与视觉编码器专用的精确代数重参数化深度解耦,在卷积分块与映射层实现确定性代数消除,同时针对浅层空间漏洞实施定向参数微调。核心 idea:构建模态自适应的协变混淆框架 COVERT,通过卷积补丁的零空间噪声注入与精确重参数化消除特征反演,结合维度扩展吸收加性偏置,并对第一层 ViT 注意力参数实施基于私钥种子的保效用微调以切断隐藏状态空间逆向通路。
方法详解¶
整体框架¶
COVERT 专为当前主流的“视觉编码器 + 投影器 + 大语言模型解码器”的 VLM 架构量身定制。在离线初始化阶段,客户端利用私钥采样随机变换矩阵和噪声种子,完成对 VLM 视觉模块与语言骨干的协同参数混淆并部署至云端;在线推理阶段,客户端仅需对输入图像进行轻量级展开并注入零空间随机噪声,云端服务器在密态表征下执行前向推理,最终由客户端对输出文本进行解密还原。
整体处理流程涵盖四个紧密协同的视觉混淆阶段:首先通过卷积参数的扩维与零空间投影抵消补丁级特征观测;随后借助维度扩展与动态缩放将 ViT 线性层及 FFN 中的加性偏置完美吸收进权重矩阵;接着利用带私有随机种子的注意力参数微调打乱第一层 ViT 的注意力拓扑,消除浅层空间几何泄露;最后通过块对角逆掩码对齐多补丁聚合投影层,无缝衔接至后端语言模型。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["原始视觉输入 X_v"] --> B["协变卷积分块与零空间扰动<br/>X_v 扩维并注入正交零空间噪声"]
B --> C["增维重参数化与偏置吸收<br/>追加单位维度吸收 ViT 线性层偏置"]
C --> D["定制参数微调防御浅层反演<br/>私钥种子加噪微调第 1 层注意力权重"]
D --> E["块对角逆掩码与跨模态投影对齐<br/>Kronecker 积抵消空间聚合特征掩码"]
E --> F["混淆跨模态表征输入后端 LLM"]
关键设计¶
1. 协变卷积分块与零空间扰动:消除输入连续图像的补丁级可观测性
直接将未经处理的连续图像分块送入云端将导致输入层直接暴露。COVERT 将 3D/2D 卷积运算等价展开为向量化矩阵乘法 \(f_{\text{Conv}}(X_v) = X_v W_{\text{conv}}\),其中展平的卷积核维度为 \(D = C_{in} \cdot T_c \cdot H_c \cdot W_c\),补丁数为 \(N\)。客户端构造一对非方阵的扩张随机变换矩阵 \((\hat{P}_v, \hat{Q}_v)\),满足 \(\hat{P}_v \hat{Q}_v = I_D\),其中 \(\hat{P}_v \in \mathbb{R}^{D \times (D + d_{extra})}\) 将特征空间人为充气放大。在离线阶段,卷积核权重被混淆为 \(\tilde{W}_{\text{conv}} = \hat{Q}_v W_{\text{conv}} \hat{P}_{\text{Pat}}\);在线推理时,客户端在输入向量每一行注入服从零空间约束的随机扰动向量 \(v_i\)(满足 \(v_i \hat{Q}_v = \mathbf{0}\)),使得发送给服务端的混淆输入为 \(\tilde{r}_i = r_i + v_i\)。当云端执行矩阵乘法 \(\tilde{X}_v \tilde{W}_{\text{conv}}\) 时,\(v_i \hat{Q}_v\) 严格归零,从而以数学上的零代数误差(\(e_C = 0\))完全抵消扰动,使攻击者无法从单次通信张量中进行确定性特征逆向。
2. 增维重参数化与偏置吸收:化解 ViT 模块中加性偏置与 RoPE 约束的代数冲突
标准的协变混淆依赖于乘性可逆矩阵,但 ViT 中普遍存在的加性偏置 \(W X + b\) 破坏了乘性结合律。若直接使用传统的偏置掩码 \(b \hat{P}\),在 QKV 投影中受到旋转位置编码(RoPE)的块对角结构约束,未知变换的自由度被大幅压缩至 \(O(n)\),使得敌手能够轻易求解线性方程组反解私钥。COVERT 提出维度扩展重参数化机制:通过在输入特征末尾追加常数单位通道 \(X^+ = (X, 1)\),并将偏置拼接到权重张量下方构造增维权重矩阵 \(W_{QKV}^+ = [W_{QKV}^\top; b_{QKV}^\top]^\top\),将加性偏置转化为齐次线性变换,以 \(\tilde{W} = \hat{Q} W^+\) 形式完全吸收偏置项。针对输出投影 \(W_O\),由于 Softmax 算子的全局非线性无法保留增维常数,COVERT 在 Softmax 之前丢弃附加维度,并利用不受 RoPE 限制的稠密掩码 \(\hat{P}_O\) 对输出偏置执行安全掩蔽(具有 \(O(n^2)\) 个未知数,系统在数学上不可求解);对于前馈网络(FFN)中由 SiLU 等激活函数引发的非线性放缩失真,通过在下采样权重上施加 \(\text{SiLU}(1)^{-1}\) 精确缩放因子,保证了全局网络前向传播的代数等价性。
3. 定制参数微调防御浅层反演:切断 ViT 第一层注意力拓扑的空间几何泄露
尽管代数重参数化保证了功能等价,但由于自然图像在浅层特征中的空间局部连续性极强,即使对 ViT 注意力头进行随机置换,攻击者仍可利用注意力分数的结构先验发起自适应隐状态反演攻击,逆向重构出车牌等敏感高频信息。COVERT 发现隐状态泄露具有强烈的浅层聚集性(仅第 1 层极度脆弱,深层因语义抽象而天然免疫)。为此,COVERT 设计了基于私钥种子的效用感知定制微调策略:首先向第 1 层 ViT 注意力权重 \(\{W_Q, W_K, W_V, W_O\}\) 注入与私钥绑定的高斯噪声 \(\mathcal{N}(0, \alpha \cdot \text{std}(W))\);随后在本地借助 5,000 张公开无害图像,冻结 FFN 和后续归一化层,仅微调该层的注意力投影及前置 LayerNorm,以最大化调优后隐状态与原模型隐状态的余弦相似度为目标:
$\(L = 1 - \cos\left(B_{\text{tuned}}^{(1)}(x_i), B_{\text{orig}}^{(1)}(x_i)\right)\)$
这一设计使最终输出表征与原始语义严密对齐以保全多模态下游性能,同时彻底破坏内部注意力拓扑的原始空间几何;由于加噪轨迹依赖不可推测的私钥种子,攻击者无法通过梯度重现内部特征演化,使高保真隐状态反演彻底失效。
4. 块对角逆掩码与跨模态投影对齐:统一视觉语义与语言解码空间的特征契合
经过 ViT 提取的视觉特征需要经由多层感知机(MLP)投影器映射至大语言模型的嵌入空间。主流先进 VLM(如 Qwen2.5-VL)普遍在投影前对空间相邻的 \(2 \times 2\) 视觉补丁执行展平拼接,使得进入 MLP 的输入通道数骤增至 \(D_{in} = 4 D_{\text{Feat}}\)。为了抵消视觉特征所携带的随机掩码 \(\hat{P}_{\text{Feat}}\),客户端在离线状态下构造一个块对角逆掩码矩阵 \(\hat{M} = I_4 \otimes \hat{Q}_{\text{Feat}}^{-1}\)(利用 Kronecker 积),并在两层投影权重之间插入隐层置换矩阵 \(Z\),同时在第二层权重末端注入与文本嵌入完全对齐的通用掩码 \(\hat{P}_{\text{Emb}}\):
$\(\tilde{W}_1 = \hat{M} W_1 Z, \quad \tilde{W}_2 = Z^{-1} W_2 \hat{P}_{\text{Emb}}\)$
云端在处理拼接特征 \(\tilde{F}_{\text{concat}}\) 时,两层投影的矩阵相乘精确相消中间置换并自然卸载视觉掩码,输出携带 \(\hat{P}_{\text{Emb}}\) 的跨模态 token 序列,从而无需额外转换步骤即可直接输入后接的混淆语言解码器中。
实验关键数据¶
主实验¶
在 VLMEvalKit 评测体系下,涵盖通用视觉问答、多学科长程推理、纯视觉依赖 VQA、科学图表理解以及数学视觉推理等 5 个经典评测集,评估 COVERT 及 8-bit 量化(Quant)版本在 Qwen2.5-VL(7B/32B/72B)、MiMO-7B 以及 Fara-7B 上的端到端多模态效用保持能力。
| 模型与配置 | 通用VQA (D1) | 多学科推理 (D2) | 纯视觉VQA (D3) | 科学图表 (D4) | 数学推理 (D5) | 平均准确率 | 平均性能降幅 |
|---|---|---|---|---|---|---|---|
| Qwen2.5-VL-7B (明文基线) | 82.97% | 55.11% | 64.87% | 85.01% | 68.10% | 71.21% | - |
| COVERT | 79.79% | 51.89% | 61.80% | 83.87% | 65.80% | 68.63% | ↓2.58% |
| COVERT (Quant-8bit) | 78.41% | 51.56% | 61.67% | 83.94% | 66.40% | 68.40% | ↓2.81% |
| Qwen2.5-VL-32B (明文基线) | 86.38% | 68.67% | 69.07% | 84.84% | 73.70% | 76.53% | - |
| COVERT | 83.59% | 65.33% | 66.93% | 83.65% | 74.00% | 74.70% | ↓1.83% |
| COVERT (Quant-8bit) | 83.90% | 65.44% | 67.23% | 84.49% | 73.20% | 74.85% | ↓1.68% |
| Qwen2.5-VL-72B (明文基线) | 88.08% | 67.55% | 70.80% | 89.11% | 75.20% | 78.15% | - |
| COVERT | 87.00% | 64.56% | 67.33% | 87.18% | 73.30% | 75.87% | ↓2.28% |
| COVERT (Quant-8bit) | 86.53% | 64.22% | 67.47% | 87.05% | 73.40% | 75.73% | ↓2.42% |
| MiMO-7B (明文基线) | 84.13% | 65.55% | 69.80% | 86.85% | 70.30% | 75.32% | - |
| COVERT | 82.66% | 63.44% | 68.20% | 85.36% | 69.30% | 73.79% | ↓1.53% |
| Fara-7B (明文基线) | 65.09% | 52.78% | 55.93% | 80.47% | 58.30% | 62.51% | - |
| COVERT | 61.07% | 47.22% | 53.20% | 79.83% | 57.20% | 59.70% | ↓2.81% |
消融实验与安全性分析¶
通过衡量自适应隐状态反演攻击下重构图像与真实输入之间的结构相似性(SSIM,越低越安全)与均方误差(MSE,越高越安全),评估定制微调(Tailored Tuning)对 ViT 各层抗反演能力的影响;同时展示基于 vLLM 引擎的高并发在线推理开销。
| 评估对象 / 层级配置 | SSIM (↓) | MSE (↑) | 防御效果说明 |
|---|---|---|---|
| 未调优基线 (Layer 1 - 最浅层) | 0.3404 | 3275.28 | 严重空间泄露,车牌与文字细节可被清晰辨识 |
| 未调优基线 (Layer 2) | 0.2205 | 5737.62 | 语义抽象增强,呈现自然高安全性 |
| 未调优基线 (Layer 3) | 0.1575 | 5541.46 | 深层表征高度散焦,难以还原轮廓 |
| 未调优基线 (Layer 4) | 0.1078 | 5855.34 | 空间特征基本泯灭 |
| COVERT 保护配置 (Layer 1) | 0.1550 | 4577.28 | SSIM 骤降 54.46%,MSE 增加 39.75%,细节彻底不可识 |
在通信与在线服务效率方面,Qwen2.5-VL-32B 在 vLLM 框架(30 并发,单请求 1064 视觉 token)下的性能表现如下:
| 推理模式配置 | 首字生成延迟 TTFT (ms) | 每 Token 解码时间 TPOT (ms) | 服务吞吐量 (tokens/s) | 传输体积膨胀比 |
|---|---|---|---|---|
| 明文服务 (Plaintext) | 3864.89 | 26.73 | 25.17 | 1.00× (基准) |
| COVERT 完整混淆 (PNG 无损) | 3898.38 (+0.86%) | 29.26 (+8.65%) | 23.76 (-5.93%) | 7.68× (PNG) |
| COVERT 极致压缩 (64-bin 量化) | 3898.38 (+0.86%) | 29.26 (+8.65%) | 23.76 (-5.93%) | 1.30× (仅损失 2.39% 准确率) |
关键发现¶
- 模型规模越大,对混淆扰动的韧性越强:32B 与 72B 模型的平均准确率损失(1.68% - 2.28%)显著低于 7B 模型(2.58% - 2.81%),证明参数冗余度高的模型能够更从容地包容近似归一化与微量量化噪声。
- 隐状态反演的威胁严格局限于 ViT 第一层:实验表明 Layer 2 至 Layer 4 的 MSE 自然跃升至 5500 以上,而仅需针对性调优第一层注意力(仅约 4M 训练参数,单卡 GPU 仅耗时 1.5 小时),即可将首层 SSIM 压制到 0.1550,达到与深层一致的安全水准。
- 与差分隐私方案(DP-Forward)相比具有压倒性效用优势:DP-Forward 即使在极为宽松的隐私预算下(\(\epsilon=128\)),数据集 1 的准确率依然从 82.97% 崩塌至 0.07%;而 COVERT 在彻底封堵图像重构的同时依然维持 79.79% 的可用性。
- 在线吞吐损失不足 6%:通过在离线完成重参数化与代数对齐,在线推理完全复用了 vLLM 顶级的 PagedAttention 和并行解码流水线,避免了 MPC 类方案高达数百秒的网络阻塞。
亮点与洞察¶
- 卷积零空间扰动的代数抵消设计非常巧妙:不仅通过膨胀矩阵放大输入空间,更利用行向量正交于逆变换矩阵的零空间约束构造一次性噪声,使得云端前向计算在密态下自然消解随机量,兼顾了完美的理论无损与防御特征单点反解。
- 齐次增维吸收加性偏置突破了 RoPE 结构约束瓶颈:精巧地通过在输入端增补常数 1 并将偏置吸纳入扩展权重,绕开了 RoPE 施加在注意力矩阵上的分块对角低秩约束,将攻击者的求解方程复杂度拉升至不可计算级别。
- 针对反演脆弱性的“精准外科手术式”微调兼备极高能效与实用价值:无需重新训练整个昂贵的视觉编码器,仅锁定第一层 4M 参数施加私钥绑定的扰动重对齐,以极小算力代价从根源上摧毁了自适应反演工具赖以生存的空间拓扑梯度。
局限与展望¶
- 通信体积的无损膨胀仍具优化空间:由于混淆完全打碎了自然图像的局部相关性,差分熵从 ~2.0 飙升至 ~7.0,导致传统图像压缩算法失效,无损 PNG 传输膨胀达 7.68 倍;未来可探索结构保留型频域混淆算子以兼顾高压缩比。
- 离线初始化依赖客户端具备一定的计算与微调条件:虽然定制微调仅需单卡 1.5 小时或 CPU 6.5 小时,但对于算力极度受限的嵌入式微终端而言,仍需要通过可信预计算或第三方无感代理辅助完成初始化。
- 动态自适应分辨率与任意几何裁剪支持需进一步泛化:当前方案针对固定网格分块(如 \(2 \times 2\) 空间拼合)进行了闭式代数推导,针对极端多尺度连续缩放视觉输入的通用化张量混淆仍值得深入研究。
相关工作与启发¶
- vs AloePri: AloePri 首次将协变混淆引入纯文本大模型领域,但无法直接应对多模态场景中连续图像输入、卷积架构以及由浅层空间局部性带来的隐状态高保真几何反演;COVERT 补充了卷积分块、偏置吸收及定向注意力参数微调机制,完成了向 VLM 的关键跨越。
- vs DP-Forward 等差分隐私扰动方案: DP 类方法在激活层直接添加不可校准的随机高斯或拉普拉斯噪声,不可逆地打碎跨模态语义微细对齐,引发严重的精度断崖;COVERT 采用联合代数消除与语义保真微调,严格保证了计算流的代数一致性,将精度损失控制在 3% 以内。
- vs PrivMLLM 等密码学 MPC / TEE 方案: MPC 协议在面对连续高维图像时产生惊人的通信吞吐爆炸与长达数百秒的 WAN 交互时延;COVERT 将开销绝大部分移至离线单次重参数化,在线推理零密码学交互,吞吐开销不足 6%,奠定了真正实用的多模态云推理工程落地基础。
评分¶
- 新颖性: ⭐⭐⭐⭐⭐ [首次将协变混淆严谨拓展至 VLMaaS,提出了卷积零空间投影与 ViT 增维偏置吸收等优美的代数重参数化机制]
- 实验充分度: ⭐⭐⭐⭐⭐ [横跨 5 大多模态经典榜单、3 个量级与多种异构模型,全面覆盖了效用、自适应隐状态反演与真实 vLLM 并发测试]
- 写作质量: ⭐⭐⭐⭐⭐ [问题剖析切中要害,代数推导逻辑清晰,威胁模型与防御机理阐述得十分透彻]
- 价值: ⭐⭐⭐⭐⭐ [以低于 3% 的精度损失和低于 6% 的吞吐开销破解了多模态云服务隐私困境,工程落地可行性极高]