跳转至

Contrastive Representation Shaping for LLM Unlearning

会议: NeurIPS2026
arXiv: 2601.22028
代码: https://github.com/HaoranTang/CLReg
领域: LLM 安全
关键词: 机器遗忘、对比学习、表示塑形、遗忘保留纠缠、隐私评测

一句话总结

CLReg 用同一遗忘样本的增强视图作正对、保留样本作负对,在基础遗忘目标之外塑形隐藏表示,改善多组实验的综合遗忘分数,但表示分离本身不等于知识删除,也不提供隐私保证。

研究背景与动机

大语言模型的机器遗忘希望撤销部分训练数据的影响,同时保留其余知识。只用保留数据重新训练是理想参照,却通常过于昂贵;直接提高遗忘数据上的损失又容易破坏通用能力。NPO、SimNPO、UnDIAL 等方法因此主要在输出概率或 logits 上约束模型:减少目标内容的生成,避免梯度上升引发整体失稳。然而,回答不出来和内部已经没有相关知识并不是一回事。如果遗忘知识仍与保留知识共享表示,输出抑制可能被后续学习重新解除,而继续加强抑制又可能损伤保留能力。

本文关注的具体瓶颈是遗忘与保留表示的纠缠。既有对比遗忘多面向有类别标签的小型分类器,可以借助类别构造正负对;生成式 LLM 的遗忘请求却经常指向某个样本或某类语义内容,没有可靠的监督类别。作者不要求把所有隐藏表示拉回重新训练模型,也不直接把遗忘激活推向随机方向,而是用遗忘输入自己的增强视图确定“应该相近”的表示,再以保留样本确定“应该远离”的方向。这让表示空间可以改变,而保留行为仍由基础训练目标保护。

这种改变的作用是给基础遗忘算法创造更容易选择性修改的表示条件,而不是独立完成删除。核心 idea:把同一遗忘样本的多个视图拉近、把它们与保留表示拉开,将这种定向表示塑形作为现有遗忘损失的正则项。

方法详解

整体框架

输入是已经微调的模型、遗忘集和保留集;输出是经过遗忘更新的同一模型。训练先进行“同例双视图”,再进行“定向对比分离”,最后通过“联合遗忘更新”让表示正则与基础遗忘、保留目标共同作用。CLReg 不增加可训练模块,推理时也没有额外对比检索或负样本分支。

选定 Transformer 层的 token 隐状态先按注意力掩码做均值池化,再作单位长度归一化,得到用于余弦相似度比较的句段表示。论文把遗忘输入的这些表示张成的子空间称为遗忘概念;这是表示层面的操作性定义,并不意味着已经识别出全部知识对应的参数或找到可直接删除的独立子网络。

%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
    F["遗忘输入"] --> V["同例双视图"]
    V --> C["定向对比分离"]
    R["保留输入"] -->|负样本表示| C
    C -.->|训练正则| J["联合遗忘更新"]
    F -->|基础遗忘损失| J
    R -->|基础保留损失| J
    J --> M["更新后的模型"]
    M -->|推理时仅使用模型| O["常规文本输出"]

图中双视图和负样本仅提供训练信号。实际删除目标仍由基础遗忘损失承担,不能把训练中的表示排斥分支理解成推理时的知识过滤器。

关键设计

1. 同例双视图:没有类别标签时,用输入自身定义正对

每个遗忘样本是一个锚点,其正样本来自同一个输入的改写或独立 dropout。TOFU 在训练前用 Llama-3.1-8B-Instruct 为每个遗忘问题生成五种改写,只改问题、不改答案,每次均匀抽取一种;锚点和正样本的隐藏状态分别施加独立 dropout。改写要求保留名字、数字及事实,目的是改变表面措辞而不是改变遗忘目标。MUSE 不提供改写,因而直接让同一段落通过不同 dropout 掩码形成两个视图。

dropout 概率从均值 0.1、标准差 0.05 的正态分布采样,再截断到 0 至 0.2。对比损失最终比较池化、归一化后的表示,而非原始 token 概率;保留负样本不使用这一额外 dropout。这样正对关系不依赖人工标签,也不需要把不同遗忘样本强行视为语义完全相同。

这个细节很重要:CLReg 拉近的是每个样本与自己的增强视图,不是把所有遗忘输入显式压成一个点。论文用“遗忘概念子空间”描述总体对象,但训练直接约束的是局部正对关系及跨遗忘—保留关系。增强质量因此影响正对是否真的保留了目标语义;极小遗忘集或语义失真的改写都会削弱这种信号。

2. 定向对比分离:排斥保留表示,而不是随机扰乱遗忘激活

每个遗忘锚点与保留输入的表示组成负对。默认每个锚点使用 32 个负样本,它们来自八个数据并行工作进程、每个进程四个样本的跨进程汇集。TOFU 的有效批量是 128,MUSE 是 256,但梯度累积不会扩大一次对比计算的负样本池,因此不能把有效批量当作负样本数。

以论文的 DPO 风格版本为例,目标是让正对相似度高于每一个负对相似度:

\[ \mathcal{L}_{\mathrm{CL}}^{\mathrm{dpo}} =-\frac{2\tau}{B_fB_r}\sum_{i=1}^{B_f}\sum_{j=1}^{B_r} \log\sigma\left(\frac{s(z_{f_i},z_{f_i}^{+})-s(z_{f_i},z_{r_j}^{-})}{\tau}\right). \]

这里 \(B_f\)、\(B_r\) 分别是遗忘锚点和保留负样本数,\(s\) 是归一化表示之间的余弦相似度,\(\sigma\) 是 sigmoid,\(\tau\) 是温度。若锚点与保留负样本过于相似,正负相似度差较小,该项就会产生较强更新;已经充分分开的负样本贡献较弱。因此,损失会自动提高困难负样本的权重,不一定需要额外挖掘策略。

“DPO 风格”指成对相似度差上的 logistic 排序形式,不是对偏好回答和策略概率执行标准 DPO。这里没有借该正则项引入奖励模型或参考策略。作者也试验 InfoNCE:把一个正对和全部负对的相似度作为分类 logits,以正对为正确项;两种形式都可以交换遗忘与保留的锚点角色,构造对称版本。不同基础方法和模型适合的变体不同,并不存在一个总是最好的组合。

单锚点分析解释了排斥方向,但需要保持结论边界。在正、负向量固定的嵌入空间里,对锚点的一次直接梯度更新同时朝向正向量、远离负向量;多负样本时,排斥对象变成按难度加权的负样本质心。其相似度降低还需要额外几何条件,训练记录中该条件成立于 94% 的锚点更新,而不是自动成立。

真实训练更新的是共享网络参数,锚点、正样本和保留表示都会改变,且更新后还涉及归一化。上述单步推导不能直接升级为完整网络持续分离、保留表示不失真或知识被认证删除的保证。本文对实际分离的主要证据是表示距离、纠缠指标和干预实验,而不是这一局部推导。

3. 联合遗忘更新:表示塑形必须服务于基础遗忘目标

CLReg 接入 GradDiff、NPO、SimNPO、UnDIAL 或 PDU 的方式是增加一项损失,不替换这些算法各自的遗忘机制:

\[ \mathcal{L}=\alpha\mathcal{L}_{\mathrm{retain}} +\gamma\mathcal{L}_{\mathrm{forget}} +\lambda\mathcal{L}_{\mathrm{CL}}. \]

基础遗忘损失负责改变遗忘数据上的行为,保留损失负责保护保留任务,CLReg 负责改变两侧表示的相对几何关系。单独把遗忘表示移到另一个区域仍可能保留知识,只是使其更易被区分;因此,不能以表示分离替代行为、隐私和恢复测试。作者在结论中也明确把 CLReg 定位为增强基础删除过程的正则项,而非独立删除机制。

这种分工还有一个比较直接的验证:先用保留目标和 CLReg 训练五轮,不使用基础遗忘损失;随后移除 CLReg,用原基础方法训练十轮。如果随后遗忘更容易,收益就不能完全归因于两个损失同时优化的额外信号。作者与训练十五轮的基础方法进行总轮数匹配,预塑形仍改善后续分数。不过,这个控制匹配的是轮数,不是严格相同的墙钟时间或 FLOPs,因为 CLReg 本身可能增加前向计算。

当前实验主要针对较高层的语义知识,默认在最后一个特征层施加 CLReg。更早层的表示通常承载更多共用信息,排斥这些表示更容易影响保留能力。这里的“最后一层”是正则项读取隐藏表示的位置,不应误读成只更新这一层参数,也不是对所有遗忘概念都适用的固定定位规则。

损失函数 / 训练策略

主实验训练十轮,学习率 \(10^{-5}\),使用 H100。作者先调整基础算法参数,再搜索对比温度、是否对称、DPO 风格或 InfoNCE 形式,温度候选为 0.1、0.3、0.5、0.7、0.9。主表默认 \(\lambda=1\);保留权重并非所有方法都完全相同,例如 UnDIAL 基线不使用保留损失,接入 CLReg 后采用较小保留权重,WMDP 的 NPO 也重新平衡该权重。

离线改写不在推理时运行,也不随每轮重新生成。TOFU 多一次改写输入的前向计算;MUSE 仅靠 dropout 构造视图,可避免额外改写前向。多数 TOFU 方法的实测墙钟开销增加 34% 至 49%,但 UnDIAL 因实现中的隐藏状态未缓存,开销更高,不能把这个区间说成所有方法的上限。

实验关键数据

主实验

TOFU 使用虚构作者问答,正文说明模型是 Llama-3.1-8B 和 Llama-3.2-3B,表中简写为 Llama-3-8B/3B;MUSE-Books/News 使用 Llama-2-7B。以下只摘取最能说明增益与代价的配对结果,不把“综合分数提高”等同于所有原始指标都改善。

ForgetScore 先把每个遗忘指标转换成相对原微调模型到重新训练模型的进度,再取调和平均;ForgetQuality 因数量级跨度大,先取对数参与计算。其核心定义为:

\[ \mathrm{Prog}(m,\mathcal{F})= \frac{|m(f_{\mathrm{UL}},\mathcal{F})-m(f_{\mathrm{FT}},\mathcal{F})|} {|m(f_{\mathrm{RT}},\mathcal{F})-m(f_{\mathrm{FT}},\mathcal{F})|},\qquad \mathrm{ForgetScore}=K\left(\sum_{k=1}^{K}\frac{1}{\min(1,\mathrm{Prog}(m_k,\mathcal{F}))}\right)^{-1}. \]

上式将正文描述的进度截断显式写入调和平均。绝对值只计算离开原模型的幅度,不编码变化方向,也不能保证接近目标模型;超过目标后的截断还会掩盖过度遗忘。ForgetQuality 本身是遗忘回答 TruthRatio 分布与重新训练参照进行 KS 检验得到的 p 值,而不是 ForgetScore 的同义词。

原文对 UnlearningScore 存在定义与数值不一致:第 4.2 节称它是 ForgetQuality 与 ModelUtility 的调和平均,但 TOFU 表值与 ForgetScore、ModelUtility 的调和平均相符,例如 SimNPO+CL 的 0.97182 和 0.69815 对应 0.81256,而 ForgetQuality 是 0.00229。以下保留原表分数,并明确这项口径冲突,不自行替作者修正定义。

数据集与方法 UnlearningScore:基础 → +CL 保留指标:基础 → +CL PrivLeak:基础 → +CL
TOFU-8B,SimNPO 0.77378 → 0.81256 ModelUtility 0.67261 → 0.69815 -48.65591 → 55.03337
TOFU-3B,SimNPO 0.71348 → 0.78664 ModelUtility 0.61040 → 0.66531 -61.99405 → -3.72569
MUSE-Books,GradDiff 0.41148 → 0.73778 RetainKnowMem ROUGE 0.59876 → 0.58451 -60.46598 → -57.32249
MUSE-Books,SimNPO 0.73961 → 0.74936 RetainKnowMem ROUGE 0.60877 → 0.59918 -30.65828 → -21.11686
MUSE-News,SimNPO 0.46128 → 0.57173 RetainKnowMem ROUGE 0.47777 → 0.42403 -90.55416 → 88.65659

来源为原文表 1–2。PrivLeak 是相对重新训练参照校准的成员推断 AUC 差异,目标是趋近零,不是越高越好;正值表示过度遗忘,负值表示遗忘不足。TOFU-8B 的 SimNPO 加入 CLReg 后,其绝对值反而更大,不能宣称隐私全面改善;MUSE-News 的 SimNPO 虽绝对值略下降,仍远离零且转为过度遗忘。

WMDP-cyber 仅作为高层安全遗忘评测:Zephyr-7B-β 上,SimNPO 的综合分数从 0.633 变为 0.674,RMU 已发表结果为 0.677。该实验用四选一随机准确率 0.25 代替不可获得的重新训练参照,不报告 PrivLeak;不能把这一代理比较解释为真实重新训练等价。

消融实验

第一张分析表摘取原文表 3–4。Entanglement 是类内离散程度相对两类均值分离程度的比值,越低越好;MK-MMD 是多核分布差异,2-Wasserstein 是分布距离,后两项越高表示两侧更分离。这些是表示几何指标,不直接度量删除保证。

数据与模型,均为 SimNPO Entanglement:基础 → +CL MK-MMD:基础 → +CL 2-Wasserstein:基础 → +CL
TOFU-8B 20.24046 → 5.90206 0.01537 → 0.07327 0.10001 → 0.31250
TOFU-3B 17.19105 → 5.62938 0.01833 → 0.06930 0.06768 → 0.23700
MUSE-News 92.17580 → 11.08532 0.00392 → 0.01775 0.04923 → 0.11468

第二张分析表汇总原文表 5、10、14 的机制检验。不同分析使用重新运行的公开检查点,绝对分数不能与主表混搭,也不能把不同实验行视为一个共同搜索空间。

分析设置 配置 原文指标 解释
TOFU-3B,SimNPO 两阶段 基础方法十五轮 UnlearningScore 0.734 总轮数匹配控制
同上 五轮塑形,再十轮基础方法 UnlearningScore 0.771 第二阶段没有 CLReg
TOFU-3B,SimNPO 负样本数 不使用 CLReg UnlearningScore 0.724 该消融的匹配基线
同上 1 / 32 个负样本 UnlearningScore 0.803 / 0.807 该范围内不依赖大量负样本
TOFU-3B,SimNPO 三种子恢复评测 基础 / +CL recovery AUC \(0.329\pm0.021\) / \(0.228\pm0.012\) 均值与标准差,越低恢复越慢
TOFU-3B,输出质量路径 \(\lambda=0\) UnlearningScore 0.688;P(clean) 0.868 未加正则
同上 \(\lambda=0.3\) UnlearningScore 0.766;P(clean) 0.887 分数与连贯性同时改善
同上 \(\lambda=1\) UnlearningScore 0.785;P(clean) 0.585 更高分数伴随明显退化

recovery AUC 把遗忘回答概率相对当前遗忘检查点到原微调模型的恢复幅度归一化,再在评测索引上计算梯形面积;它不同于成员推断 AUC。P(clean) 是乱码检测分类器对“正常文本”类别的预测概率,并非人工质量评价。

关键发现

  • 主表的五种基础方法在五个任务设置上都提高综合分数,但 TOFU 保留效用普遍改善的结论不能外推到 MUSE:表中多个 MUSE 配对的保留 ROUGE 下降。
  • 表示预塑形后移除 CLReg 仍有收益,使“分离有助于后续遗忘”比单纯联合训练相关性更可信;它仍不能证明分离是唯一原因。
  • 对比形式与是否对称的 16 个组合中,作者报告 14 个优于基线;并非每一种配置都有效。层选择实验中最后层优于较早目标层,也不是越多层施加正则越好。
  • 恢复评测支持 SimNPO 和 GradDiff 的恢复减慢,但 NPO 的 recovery AUC 从 0.068 变为 0.077,并未改善;附录说明恢复曲线最终可在 64 步内趋同。
  • 四次连续 MUSE-News 请求中,保留知识衰减从 37.1% 降到 3.0%,代价是 CLReg 的逐请求 ForgetScore 变弱。附录的通用能力差异也主要应解读为保持能力,而不是显著提升能力。

亮点与洞察

  • 表示空间不必逐点模仿重新训练模型。更有用的目标可能是先减少遗忘与保留的干扰,再用行为目标完成选择性修改。
  • 正对来自同一输入的不同视图,使对比塑形能够进入无类别标签的生成模型场景。负对仅来自保留侧,则把通常的均匀分散变成有方向的排斥。
  • 两阶段干预、几何指标、恢复测试共同支撑机制判断。它们检验的是不同问题,任何一项都不能代替其余评测。

局限与展望

  • 一步嵌入分析没有覆盖共享参数、连续更新和多负样本的一般情况,也没有保留失真界、认证删除或隐私保证。
  • 高 ForgetScore 可能来自遗忘问题上的不连贯输出。输出质量路径中的所有配置拒答率均为 0.000,因此退化不应包装成安全拒答。
  • 固定正则强度会引发过度遗忘。主表 GradDiff 在 MUSE-News 的 PrivLeak 从 -87.84635 变为 99.68514,说明综合分数增益可能与隐私校准恶化并存。
  • 主表主要为单次运行,三种子分析仅覆盖代表性 SimNPO 配对;负样本稳健性和层选择结论也受现有任务范围限制。
  • 可探索概念相关的层选择,以及塑形后受保留行为约束的子空间干预,但必须把它们作为尚未验证的方向,并联合检查知识恢复、输出可用性和多轮请求效用。

相关工作与启发

  • vs NPO / SimNPO:基础方法通过输出层面的目标减少遗忘内容,CLReg 增加隐藏表示间的几何约束。两者互补,不是用一个相似度目标直接替代负偏好遗忘。
  • vs RMU:RMU 将遗忘激活引向随机方向,CLReg 用同例正对和保留负对构造结构化排斥。本文没有实验验证 RMU+CL,不能据此宣称二者必然兼容。
  • vs 分类器对比遗忘:分类器可以用类别标注确定正负关系,本文用同例增强代替类别监督,并以生成行为和保留效用检验结果。
  • 研究启发:选择正则强度时同时考虑综合分数、PrivLeak 和输出连贯性,比单一分数选点更可靠;连续遗忘的最佳强度还可能与单次请求不同。

评分

  • 新颖性: 4/5 — 将无标签同例对比塑形作为 LLM 遗忘正则,机制清晰,但对比学习本身并非新工具。
  • 实验充分度: 4/5 — 覆盖多方法、表示分析和干预实验,主表种子与长请求链仍不足。
  • 写作质量: 4/5 — 方法可复述且附录交代失败情形,但综合指标口径及部分概括需要谨慎核对。
  • 价值: 4/5 — 为减少遗忘副损伤提供可复用切入点,不能当作数据删除合规证明。