UnlearningSoup: Is Repeated Tuning Necessary for Large Language Model Unlearning?¶
会议: NeurIPS2026
arXiv: 2609.37076
领域: LLM 安全
关键词: 机器遗忘、权重插值、模型合并、代理指标、模型选择
一句话总结¶
UnlearningSoup 把训练式大语言模型遗忘中的部分重复调参改为评测驱动的权重插值:EfficientSoup 从原模型和两个已训练遗忘模型搜索,PerformanceSoup 合并已有候选,在多个基准上改善经验性遗忘—保留质量并降低选模成本,但并不取消基础遗忘训练或提供认证遗忘保证。
研究背景与动机¶
训练式机器遗忘需要削弱指定数据对大语言模型的影响,同时尽可能保留其他能力。GradDiff 将遗忘样本上的梯度上升与保留样本上的交叉熵结合;NPO、WGA、SatImp 等进一步控制遗忘更新,LUNAR 则修改相关内部表征。问题不只在于有没有更好的损失函数,还在于同一种方法的学习率、遗忘强度和随机种子稍有变化,就可能从遗忘不足跳到严重损害通用能力。一个最终表现不错的模型,往往隐藏着之前多轮训练与评测的成本。
本文观察到,训练损失并不是可靠的选模指南:它可以持续改善,而遗忘—保留评测先改善、后恶化。于是反复调参实际上是在用昂贵的训练轨迹间接寻找评测空间中的好位置。另一方面,从同一个原模型产生的不同遗忘候选,在权重插值的二维切片上经常落在共同的高性能区域,较优解有时不是任何一个训练终点,而是它们之间的某个混合点。这是经验性的共享评测盆地,不意味着任意架构、任意初始化的模型都能直接平均。
作者因此把关注点从“再设计一次遗忘更新”转向“怎样利用已经训练出的方向进行模型选择”。早期只有少量候选,需要减少新增训练;后期已有一批候选,需要避免为微小收益再训练一遍。核心 idea:以真正反映遗忘和保留的评测信号指导权重空间搜索,在少候选时做带原模型锚点的两阶段插值,在多候选时做性能加权的贪心合并。
方法详解¶
整体框架¶
UnlearningSoup 是基础遗忘算法外侧的选模层,而不是独立的遗忘损失。输入是参数兼容、来自共同原始检查点的候选模型及评测数据;输出是一个混合后的单模型检查点。不同模型家族是分别验证方法适用性的实验,不是在 LLaMA 和 Qwen 之间合并参数。
流程先完成基础遗忘训练,再用验证代理给候选及混合模型打分。EfficientSoup 的候选少,沿两条顺序确定的边搜索;PerformanceSoup 的候选多,按分数排序并尝试加入配方。两者是按已有候选数量选择的替代策略,不要求先运行 EfficientSoup 再运行 PerformanceSoup。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
O["共同原模型"] --> B["基础遗忘训练<br/>遗忘与保留数据"]
B --> C["参数兼容候选"]
C --> V["验证代理<br/>候选与混合点评分"]
Q["验证评测数据"] -.-> V
V -->|两个遗忘候选与原模型| E["两阶段边搜索<br/>EfficientSoup"]
V -->|已有多个候选| P["性能加权贪心合并<br/>PerformanceSoup"]
E --> F["最终检查点<br/>全指标评测与部署"]
P --> F
F --> I["用户输入至单模型输出<br/>推理时不运行搜索"]
实线表示训练、选模和最终检查点的处理流程;虚线仅把验证数据接入评分环节。遗忘与保留数据监督的是基础训练,不是部署时的额外输入;代理评测属于离线搜索,不是推理时集成多个模型。
关键设计¶
1. 验证代理:不用训练损失代替遗忘—保留质量
只观察遗忘集合上的分数会偏好破坏性更新,只观察保留能力又可能选回几乎没遗忘的模型。作者采用偏差分数,把理想点设为“遗忘数据的可提取性为零、保留数据的可提取性为一”。以 Extraction Strength(ES,可提取强度)为例,正文定义如下,分数越低越好:
ES 衡量目标内容仍可被模型提取的程度,因此同一指标同时覆盖忘记目标和保留内容。作者在 TOFU 的候选上观察到它与综合统计质量相关,比逐次运行全指标评测便宜;重复调参基线也用相同代理选模,避免把“代理更便宜”全部算成插值独有收益。最终选定模型才做一次完整评测。相关性是特定实验中的证据,不保证代理对任何遗忘请求都有效。
这里必须区分用途:正文称其为 test-time performance,理论附录的单调性则限定在 validation proxy。实验细节给出评测次数,却未清楚交代用于反复选择的代理样本与最终报告样本是否独立。笔记不把它写成已经核实的独立验证集—测试集协议;部署前应额外留出未参与选模的评测数据。
2. 两阶段边搜索:用原模型锚点修正过强更新,再吸收第二个遗忘方向
EfficientSoup 首先从原模型出发,用同一种基础方法训练两个遗忘候选。主实验中两者使用原论文推荐设置,仅改变随机种子,先按代理选出较好的候选。第一阶段在它与原模型之间做二分搜索式插值,保留目前观察到的最佳混合点;第二阶段在该中间点与另一个遗忘候选之间重复搜索。参数平均不是平均文本答案,也不需要重新做梯度更新。
原模型能充当保留能力的锚点,是因为基础训练可能走得过远,损伤本来不应改变的行为;向锚点回退可以减轻这种损伤。第二个候选则提供不同的更新残差,使混合点有机会比单一训练终点更好。可是锚点本身也包含待忘信息,回退同样可能重新引入目标知识,所以必须同时检查遗忘与保留,而不能把“更接近原模型”当成安全性提升。
这是一种两阶段、有限深度的启发式边搜索,不是全局搜索整个三角形的优化器。第二阶段可访问的线段取决于第一阶段选出的点;即便输出位于三个模型的凸包内,也不意味着找到了凸包上的全局最优。附录的局部凸二次分析只在相应假设下解释边上插值和互补误差的收益,不能证明真实大模型评测曲面处处凸。
3. 性能加权贪心合并:让已有候选贡献互补性,而不按数量均分权重
PerformanceSoup 面向已经完成多轮训练与评测的阶段。先按候选的代理性能排序,从最佳候选初始化配方;随后逐个尝试加入较弱候选,以所有入选候选的性能重新计算权重,评测新配方。只有新混合模型不劣于当前配方时才接受该候选,因此并非“把七个模型无条件全部平均”。主文及算法 1 给出的规则为:
直觉是好候选更靠近优质区域,应占较大比例;较弱候选仍可能提供互补误差,但不该像均匀平均那样立即拿到相同份额。贪心接受避免某次加入直接降低已测代理性能,不过这不保证其他指标或独立测试性能也单调提高,更不是永久删除数据影响的证明。
该公式存在重要尺度疑点:正文 DS 带乘数 100,表 3 报 42.58,而附录表 12 对应报 0.4258;若将 42.58 直接代入,性能就是负数。在全为负分且总和为负的情况下,归一化后的权重虽可能为正,但“好候选权重更大”的关系可能反转;混合正负分时还可能出现负权重或零分母。附录命题 D.8 明确要求各候选的 \(P>0\)。附录确实出现未乘 100 的 DS,但不能据此确认实现究竟怎样归一化、裁剪或保证正分;本笔记保留作者写法并标注待核实,不替作者添加修正算法。
一个完整示例¶
考虑 TOFU-10% 上 LLaMA-3.2-3B 的 GradDiff 遗忘任务:目标是移除指定虚构作者的信息,同时保留其他作者与通用知识。这里只描述防御性选模,不呈现私有问答内容。
起点不是零训练,而是从同一原模型训练两个种子不同的候选。验证代理决定哪个候选先与原模型插值;第一阶段留下较好的中间检查点,第二阶段再与另一个候选混合。作者没有在主表中给出最终混合系数,不能根据结果数字倒推出系数或杜撰逐次搜索轨迹。
表 6 提供了状态变化的实际证据:搜索深度从 2 增至 3、4 时,DS 依次为 46.34、29.03、25.19,SBQ 为 7.144、7.654、7.776;深度 5 不再改善。这里的 SBQ 是最终全指标统计量,不是基础训练损失,说明更细的权重选择能改善终点,但并非越多搜索越好。
如果已有七个训练候选,则改用 PerformanceSoup:先保留代理最佳候选,再依次试加其余六个,接受与否由新混合点的评测决定。最后部署的是一套混合参数,正常回答只运行一次模型前向过程,不需要同时加载七个候选生成再投票。
损失函数 / 训练策略¶
本文没有为混合过程增加新的反向传播损失,基础候选仍由 GradDiff、NPO、SimNPO、WGA、SatImp、LUNAR 或 BS-T 的原有训练目标产生。整体可理解为“先产生遗忘方向,再通过评测确定合适的组合”,不是仅凭原模型就能免训练地实现遗忘。
附录 E.4 给出 AdamW、TOFU 批量大小 32、10 个 epoch、线性调度与一个 warm-up epoch;常规学习率探索为 \(\{5\times10^{-6},10^{-5},2\times10^{-5}\}\),LUNAR 有单独设置。所有实验的平台为 8 张 NVIDIA A100,这不是所有任务都同时占满八卡的声明。BS-T 没有公开实现,作者按论文复现;缓存仅说明代码在补充材料中,未提供可核实的公开仓库链接。
TOFU 的成本账本尤其关键:重复调参是 7 次训练、7 次 DS 评测、1 次全指标评测;EfficientSoup 是 2 次训练、8 次 DS 评测、1 次全指标评测;PerformanceSoup 是 7 次训练、13 次 DS 评测、1 次全指标评测。后者的“小额新增成本”是相对于已经训练出候选的账本,不是从零只付合并成本。
WMDP 与 MUSE 没有采用快速单指标代理,搜索期间使用全指标评测。对应三种方案的“训练次数/全评测次数”分别为 6/6、2/6、6/11。MUSE 每个 epoch 保存检查点,并从十个检查点选择结果,因此还存在训练内部的检查点选择;这些选择与独立测试的关系在缓存中没有充分展开。
实验关键数据¶
主实验¶
TOFU 包含 200 位虚构作者的 4,000 个问答;本文重点实验为 Forget 5% 和 10%。SBQ 越高越好:先把四项遗忘统计指标反向后取调和平均并乘 10 得到 EQ,再将 Model Utility 与保留 ES 取调和平均并乘 10 得到 RQ,最后对 EQ、RQ 取均方根。LBQ 由 GPT-4o 分别判断流畅性、相关性、无误导性和避免目标内容的正确性,再取调和平均;作者运行三次并报告平均值。
以下摘取正文表 2、4 的 TOFU-10% 结果,不把七轮选模基线称为所有既有工作的统一 SOTA。GPU-hours 是这些主表的标注单位。
| 模型/基础方法 | 选模方案 | SBQ ↑ | LBQ ↑ | GPU-hours ↓ |
|---|---|---|---|---|
| LLaMA-3.2-3B/GradDiff | 重复调参 | 5.635 | 0.049 | 2.172 |
| LLaMA-3.2-3B/GradDiff | EfficientSoup | 7.776 | 2.150 | 0.675 |
| LLaMA-3.2-3B/GradDiff | PerformanceSoup | 7.454 | 0.516 | 2.185 |
| LLaMA-3.1-8B/LUNAR | 重复调参 | 7.259 | 7.123 | 4.596 |
| LLaMA-3.1-8B/LUNAR | EfficientSoup | 7.565 | 7.354 | 1.407 |
| LLaMA-3.1-8B/LUNAR | PerformanceSoup | 7.358 | 7.102 | 4.640 |
| Qwen2.5-7B/BS-T | 重复调参 | 8.082 | 7.416 | 5.345 |
| Qwen2.5-7B/BS-T | EfficientSoup | 8.249 | 7.744 | 1.624 |
| Qwen2.5-7B/BS-T | PerformanceSoup | 8.159 | 7.525 | 5.394 |
GradDiff 的 EfficientSoup 在这里使 SBQ 增加 38.0%,时间减少 68.9%,但 LBQ 绝对值仍只有 2.150;从近零基线计算出的巨大相对提升,不等于语言质量已经充分恢复。LUNAR 的 PerformanceSoup 则提高 SBQ、略降低 LBQ,直接说明综合统计分数与语言行为并不完全一致。
跨基准结果也不是无条件同时改善所有子指标。正文表 5 中 MUSE-News/SimNPO 的 MemQ 从 30.485 变为 30.725,遗忘指标略变差,但 UtilPres 从 36.630 增至 40.235。WMDP/BS-T 的 EfficientSoup 将 Forget Acc 从 0.266 降至 0.259、MMLU 从 0.526 增至 0.541、成本从 6.728 降至 2.492 GPU-hours;这些是防御能力评估结果,不涉及具体敏感题目。
消融实验¶
下面将正文表 3 与表 6 摘要放在同一分析表中;两组骨干不同,不能跨组直接比较数字。DS 使用正文乘 100 的尺度。
| 实验组 | 配置 | DS_ES ↓ | SBQ ↑ | 依据 |
|---|---|---|---|---|
| Qwen2.5-7B/TOFU-10% | 均匀合并 | 80.05 | 5.982 | 表 3 |
| Qwen2.5-7B/TOFU-10% | 均匀贪心合并 | 46.69 | 6.952 | 表 3 |
| Qwen2.5-7B/TOFU-10% | 加权贪心合并 | 42.58 | 7.108 | 表 3 |
| LLaMA-3.2-3B/TOFU-10% | 深度 2 | 46.34 | 7.144 | 表 6 |
| LLaMA-3.2-3B/TOFU-10% | 深度 3 | 29.03 | 7.654 | 表 6 |
| LLaMA-3.2-3B/TOFU-10% | 深度 4 | 25.19 | 7.776 | 表 6 |
| LLaMA-3.2-3B/TOFU-10% | 深度 5 | 25.19 | 7.776 | 表 6 |
从均匀合并到均匀贪心的收益远大于再加入性能权重的收益,说明“评测后拒绝坏配方”是重要组成部分,不能把全部优势归于重新加权。搜索深度在 3—4 附近进入收益递减区;改变候选种子、学习率或强度的配对也能找到相近 SBQ,但只是在给定实验中成立。
关键发现¶
- 效率来源是少做基础训练,而非消除训练。TOFU 主表约减少七成成本,跨 WMDP/MUSE 约减少六成;全指标搜索的附录实验仍报告超过五成节省,但更昂贵评测会削弱优势。
- 原文单位与汇总范围有冲突:表 1 明确写分钟,附近正文写 GPU hours;表 15 的标题沿用性能表措辞,却只展示时间样式数字。本文不把这些数字强行换算或合并为一个精确时间表。
- 正文概述 EfficientSoup 的提升范围为 0.9%—32.3%,但表 2 已有 38.0%,表 8 还有 44.4%;PerformanceSoup 段落又误写 EfficientSoup,所述范围也不覆盖所有表项。这里只按指定模型、指定 SBQ/LBQ 报原表值,不统一为一个“总体提升”。
- 附录 E.2 的 Forget Acc 定义为 Bio、Cyber 准确率的均方根,正文 §5.1 却说调和平均;本笔记保留表中结果并说明定义冲突。MUSE 的 MemQ 是 VerbMem 与 KnowMem 的均方根,越低越好。
- 附录表 19 的 LLaMA-3.2-3B/5% 与表 9 有明显不同;表 20 的 Qwen2.5-7B/10% 整块重复了 3B 的数字,且与表 4 不符。附录表 18 的 1.5B/5% 部分行还疑似发生 RQ/SBQ 列错位,不将其作为新结论的依据。
亮点与洞察¶
- 将“得到好模型的总成本”纳入遗忘算法比较,而不只比较最终检查点。这个视角能揭示反复调参对实际维护费用的影响,也避免把后处理的低新增成本误当成低端到端成本。
- 原模型锚点把更新强度变成可在训练后选择的量,不必每次调整学习率后重训。它有利于修正适度过遗忘,但需要显式遗忘门槛,否则通用能力的恢复可能遮住目标知识回流。
- 合并的收益取决于候选误差的互补性,而不仅是候选数量。附录局部理论用“成员平均风险减去多样性项”解释这一点;现实中仍要靠验证信号判断互补性是否有益。
局限与展望¶
- 共享盆地依赖参数对齐、共同起点和不崩溃的候选;不同架构或严重训练崩溃没有普遍保证。所有候选都遗忘不足时,凸组合也不能凭空创造不存在的遗忘方向。
- 性能权重的正分假设与正文 DS 尺度尚未自洽,应核实实现后才能复现权重。排序对单调尺度变化不敏感,但归一化权重对尺度和偏移敏感,不能混为一谈。
- ES 代理可能遗漏它测不到的知识残留;SBQ 的均方根也允许一侧高分补偿另一侧不足。因此代理最优或 SBQ 提升不能替代独立泄漏评估,更不能等同认证遗忘。
- 作者进行了跨语言、对抗提示与后续训练压力评估,表现总体接近重复调参模型,却未消除恢复风险。附录表 11 中 BS-T 在压力评估后的 VerbMem 为 23.1191,EfficientSoup 为 24.4796,PerformanceSoup 为 24.8208,说明部分设置反而更弱;这里不提供测试攻击或恢复步骤。
- 验证/测试划分、选择次数、检查点选择与方差报告需要更清晰。可进一步使用固定验证预算、独立终测和单独的遗忘下限,区分选模过拟合、通用能力改善与真正的目标移除。
相关工作与启发¶
- vs ModelSoups:均匀平均或均匀贪心合并利用共同起点的候选;本文加入遗忘专用代理、原模型锚点和性能加权。它不是证明 ModelSoups 在所有遗忘场景失效,而是在给定候选和评测中展示更好的选择策略。
- vs GradDiff/NPO/WGA/LUNAR:这些方法生成基础遗忘更新,UnlearningSoup 在其外侧搜索检查点组合。二者是互补关系,本文并未绕过忘记数据与保留数据的基础训练。
- vs Task Arithmetic/NegMerge:后者从任务向量或更新方向设计知识编辑、删除机制;本文主要优化已有训练流程的选模成本。可迁移的思路是先确认权重兼容与代理可信,再考虑评测驱动的组合,而不是直接把任意检查点混合。
评分¶
- 新颖性: 3/5 — 模型合并已有基础,针对遗忘选模设计早期与后期两条策略具有明确针对性。
- 实验充分度: 4/5 — 多基准、多模型、多基础方法与消融较广,但数据划分、尺度与重复列问题削弱可复核性。
- 写作质量: 3/5 — 动机与流程清楚,汇总范围、单位、指标定义和附录表格存在多处不一致。
- 价值: 4/5 — 对降低实际选模成本有用,前提是保持独立遗忘评估并计入候选训练费用。