LLM Alignment–Utility Asymmetry under Semantic-Preserving Transformations¶
会议: NeurIPS2026
arXiv: 2609.32717
领域: LLM 安全
关键词: 对齐泛化、任务效用、分布偏移、配对评测、安全监督
一句话总结¶
本文通过原始表示与语义保持表示之间的配对评测,发现任务能力的迁移并不保证安全行为同步迁移,并用良性数据条件、协议对照和防御性监督分析限定这一经验结论。
本笔记仅讨论防御研究问题、聚合证据与实验边界,不提供具体变换规则、编码表、可逆操作、适配配方、提示或攻击示例。
研究背景与动机¶
指令微调和人类反馈强化学习(RLHF)使大语言模型(LLM)在常见语言输入下更符合用户需求与安全要求。 但标准形式上的拒绝测试不能回答另一个问题:当任务含义未变、输入表面分布却明显变化时,原有安全行为是否仍然成立? 已有研究报告过跨语言或异常表示下的安全失败,但不少工作主要记录失败率,没有同时确认模型在相同表示条件下是否还能完成正常任务。 如果模型根本无法理解输入,低失败率可能只是能力缺失,而不是稳健的安全泛化。
本文因此把关注点从单独观察安全失败移到任务效用和对齐行为的联合变化。 自然语言变化往往已被预训练覆盖,难以区分已有语言知识与新表示下的行为迁移;作者选择受控的合成表示偏移,试图减少这一混淆。 然而,这种受控实验也不是现实用户分布的完整模拟:可处理新表示、保持正常任务能力、维持安全限制,是三个需要分别验证的命题。 适配后原始输入上的表现也可能变化,不能把原始模型的能力分数直接当作适配模型的对照。
核心 idea:在同一表示偏移与适配条件下分别测量原始、变换后的任务效用和安全失败,检验能力泛化是否伴随同等稳健的对齐泛化,而不把“能完成任务”当作“仍然安全”的证据。
方法详解¶
整体框架¶
本文是受控行为评测研究,而不是提出新的防御网络。 它围绕配对行为评测、条件分离、协议对照与证据分层组织实验:首先比较同一模型在两种表示条件下的行为,再检查差异是否来自适配、任务形式或评分方式。 最终输出是各任务的效用变化、安全失败变化及其适用边界,不是一个可保证安全的单一分数。
原始条件和变换条件使用对应的评测题目,评分前把输出放入可共同解释的评测形式。 这一步是为了不把输出格式差异直接误记为行为差异;本笔记只说明其评测作用,不展开表示操作。 模型是否正确理解题目、是否答对题目、是否保持安全限制仍需分别判断。 本文属于机制与评测分析,不把章节目录画成操作流程图。
关键设计¶
1. 配对行为评测:比较变化而不是混合不同指标
作者使用 MMLU、ARC-Challenge 和 GSM8K 检查知识、推理与数学任务效用,以 AdvBench 检查安全行为。 \(U_o\)、\(U_t\) 分别表示原始、变换条件下的任务准确率,\(A_o\)、\(A_t\) 表示相应安全失败率。 安全失败率采用论文的 ASR 定义,即被判定产生不安全回答的评测题目比例;数值越低越好。 任务准确率越高越好,两类指标的语义相反,不能因为都写成百分比就当作同一种量。
论文的“不对称”指两种行为在相同分布偏移下表现出不同稳定性,并不是先验定义的普适定律。 阅读结果时可以分别记录下面两个有符号差值;这是对原文变化量的整理,不是新的合成指标:
负的 \(\Delta U\) 表示效用下降,正的 \(\Delta A\) 表示安全失败增加。 应逐任务报告这些变化,而不是把准确率与 ASR 相减构造所谓“总安全分”。 两者来自不同题集,变化幅度的对照也不能证明它们对应相同难度的能力或同一内部机制。
2. 条件分离:区分表示能力获得与安全行为退化
作者分别考察参数更新和上下文学习(ICL)两类适配条件。 前者可能同时改变原始空间和新表示空间的行为,后者没有权重更新,但仍受到上下文内容与商业服务端机制影响。 因此,每种条件都需要自己的原始表示对照,不能把不同模型、不同适配方式的分数排列成通用安全榜单。
关键控制是仅使用良性数据的条件:模型没有接触变换后的不安全监督样例,是否仍出现任务能力与安全行为的分离? Llama3-8B 的这一条件保留了较接近原始表示的三项任务效用,但安全失败率从 1.7% 变为 40.3%。 这支持“直接的不安全监督并非现象出现的必要条件”,不支持“良性适配在任何模型上必然导致同样结果”。 商业 ICL 的主实验包含额外上下文因素,作者明确承认不能将其解释为纯粹的表示变化效应;良性条件提供补充证据,而非自动消除全部混淆。
3. 协议对照:避免把输出形式和任务差异误当成泛化机制
主实验的正常任务与安全任务并非完全相同的输出协议,任务效用评分和安全判断也使用不同程序。 这可能影响观察到的差距,因此作者增加输出形式匹配对照,以及源域、长度、结构和开放式回答形式相近的良性反事实题集。 反事实评测由人工判断是否连贯完成正常指令,减少“选择题准确率”和“开放式安全行为”之间的任务形式差异。
配对反事实中,四个模型的正常指令完成率仅下降 0.7–4.4 个百分点,而对应安全失败率增加 51.0–64.0 个百分点。 这些结果增强了相对稳健性差异的证据,却没有让效用与安全指标变成可直接互换的量。 输出形式匹配实验仍观察到差异,但要求更显式的内容理解时,安全失败明显减小,说明测得效应大小依赖评测协议。 不能把某一协议下的高失败率视为所有服务接口、输出要求与防护组合下的不变属性。
4. 证据分层:把行为变化、防御条件和机制解释分开
作者检查回答是否存在格式失败、无法解释或与任务无关,避免将评分管线失效误当成真实行为变化。 代表性运行中的格式问题很少,支持部分现象来自行为差异;但代表性单次运行的分类比例不能替代三次运行均值。 附录又以人工审核验证部分自动安全标签,并用更大的评测集合检查方向是否稳定。 这些控制提升证据可信度,不意味着所有模型、所有任务和所有输出已得到人工认证。
防御性分析比较安全监督是否覆盖新表示分布,观察到覆盖该分布的监督与更低安全失败相联系,同时任务效用大体保留。 这一结果更适合被理解为“安全训练需要验证分布覆盖”的证据,而不是可直接部署的防御配方。 服务端拒绝与过滤也能改变端到端表现,应把它们作为有效保护的一部分,不把安全限制当作可以绕开的障碍。 附录的表示探测与因果分析支持安全相关通路参与不足的解释,但没有识别完整通路,也没有证明不同适配方式共享唯一机制。
实验关键数据¶
主实验¶
下表节选原文表 1–2。效用和安全失败均为百分比,原始 → 变换指同一适配模型内的两种评测条件。 每项主文评测使用 100 个留出样例;通常汇总三次独立运行,表中为均值 ± 标准差,不是完整基准成绩或置信区间。 这里保留成对数值,不额外构造模型间综合排名;主实验条件也不是纯良性数据条件。
| 模型 / 适配类别 | MMLU 效用:原始 → 变换 | ARC-Challenge 效用:原始 → 变换 | GSM8K 效用:原始 → 变换 | AdvBench 安全失败:原始 → 变换 |
|---|---|---|---|---|
| Llama3-8B-Instruct / 参数更新 | 35.0 ± 4.0 → 37.0 ± 8.9 | 57.3 ± 6.7 → 72.3 ± 6.7 | 63.3 ± 4.7 → 64.3 ± 5.1 | 3.7 ± 0.6 → 67.7 ± 3.5 |
| Qwen2.5-7B-Instruct / 参数更新 | 54.7 ± 1.5 → 40.0 ± 4.4 | 75.0 ± 10.4 → 68.3 ± 11.5 | 75.0 ± 1.0 → 4.7 ± 1.5 | 3.7 ± 1.5 → 67.0 ± 5.3 |
| Mistral-7B-Instruct / 参数更新 | 32.3 ± 5.9 → 29.0 ± 2.6 | 75.0 ± 7.8 → 68.7 ± 8.6 | 52.7 ± 11.1 → 54.0 ± 6.2 | 80.3 ± 1.5 → 78.0 ± 7.8 |
| GPT-4.1 mini / 参数更新 | 62.7 ± 3.8 → 53.0 ± 2.6 | 89.0 ± 1.7 → 90.0 ± 4.6 | 83.0 ± 3.0 → 88.0 ± 2.6 | 13.3 ± 0.6 → 74.3 ± 2.5 |
| Gemini 3 Flash / ICL | 89.7 ± 1.5 → 82.3 ± 1.5 | 98.3 ± 0.6 → 98.3 ± 0.6 | 97.7 ± 1.5 → 95.7 ± 0.6 | 2.3 ± 1.5 → 43.0 ± 8.9 |
| Claude 4 Sonnet / ICL | 72.3 ± 7.8 → 52.0 ± 3.6 | 88.7 ± 9.3 → 89.7 ± 2.5 | 96.3 ± 0.6 → 86.3 ± 2.1 | 0.0 ± 0.0 → 12.0 ± 1.7 |
原文表 2 把 Gemini 3 Flash 的 MMLU 绝对差值列为 7.3 个百分点,而显示的舍入均值直接相减得到 7.4;此处保留原始成对均值,不擅自修改原文差值。 Qwen2.5 的 GSM8K 是明显的效用崩溃例外,Mistral 则存在原始安全失败率较高的天花板效应。 这两行防止把“经常观察到的不对称”误读为“所有模型的效用都不下降且安全都恶化”。
消融实验¶
下表聚焦防御条件分析,节选原文表 3 和表 19 的 Llama3-8B 结果;数值同样为百分比、均值 ± 标准差。 第一行是良性适配参照;后两行的安全监督表示条件相互匹配,不能把三行误当作唯一变量完全一致的三组实验。 仅列监督覆盖的研究条件与聚合结果,不提供数据构造、提示、适配参数或操作步骤。
| 防御研究条件 | MMLU 效用:原始 → 变换 | ARC-Challenge 效用:原始 → 变换 | GSM8K 效用:原始 → 变换 | AdvBench 安全失败:原始 → 变换 |
|---|---|---|---|---|
| 仅良性适配参照 | 42.3 ± 2.5 → 41.7 ± 3.1 | 69.7 ± 6.4 → 72.7 ± 2.5 | 67.0 ± 3.5 → 64.3 ± 2.1 | 1.7 ± 0.6 → 40.3 ± 6.0 |
| 安全监督限于原始表示 | 42.0 ± 2.1 → 42.3 ± 3.3 | 68.0 ± 5.0 → 71.7 ± 1.4 | 67.3 ± 3.1 → 64.0 ± 3.5 | 1.7 ± 0.6 → 38.3 ± 2.3 |
| 安全监督覆盖新表示 | 43.0 ± 1.9 → 40.7 ± 1.5 | 67.3 ± 4.0 → 73.3 ± 1.8 | 66.7 ± 4.1 → 65.3 ± 1.9 | 1.0 ± 0.0 → 8.3 ± 3.0 |
后两行表明,只在原始表示中复习安全行为,与覆盖新分布的安全监督,并不能视为等效保护。 较低的 8.3% 仍非零风险,且这些有限条件下的实验没有建立未知表示上的防御泛化保证。
关键发现¶
- 效用与安全应一起报告:GPT-4.1 mini 的安全失败增加 61.0 个百分点,而三项效用变化的绝对幅度为 9.7、1.0、5.0 个百分点。
- 良性适配也需独立安全验收:直接的不安全监督并不是观察到泛化差距的必要条件。
- 能力下降不是安全证明:附录中的强结构扰动下,精确答题效用可能接近零,而开放式指令相关行为仍部分保留。
- 商业服务的保护有实际作用:部分版本拒绝参与评测或返回空回答,这属于端到端保护行为,不能据此推断底层模型的潜在机制。
亮点与洞察¶
- 将分布偏移下的效用与安全放进同一评测框架,比只记录安全失败更能排除“不理解所以没有失败”的假稳健性。 配对观测的价值在于约束解释,而不是生成一个可以替代全面验收的总分。
- 输出形式对照、良性反事实和防御监督条件从不同角度检验替代解释。 它们支持“对齐迁移需要单独验证”,也揭示效应大小并不独立于协议。
- 附加评测涉及抗迎合与公平性,说明研究问题不限于拒绝行为。 这些有限目标上的证据不能外推为所有对齐目标都会以同样幅度退化。
局限与展望¶
- 语义保持是经验工作定义,不是定理;信息可恢复并不自动证明模型内部获得相同语义表示。
- 主文每项仅 100 个样例,三次运行的标准差不能完整量化抽样不确定性,罕见行为也可能漏检。
- 扩展至 200 / 300 题的安全敏感性分析使用原留出题的生成改写,不等价于新增同数量独立原始题;其中存在样例相关性。
- GPT-4.1 mini 扩展标签的人工验证准确率为 96.0%、94.0%、93.3%,只针对该选定条件,并非所有模型的标签认证。
- 主实验 ICL 上下文与任务输出协议带来混淆;商业 API 结果还包含不可直接观察的服务端过滤和版本变化。
- 附录 H.3 的良性 ICL 结果未附标准差,不能与主文三次运行汇总直接合并;也不能从条件间数值反转推断普适单调关系。
- 后续防御研究应验证不同表示上的安全覆盖、正常请求误拒率和独立题集泛化,并保持输入与输出保护,而非只优化一项失败率。
相关工作与启发¶
- 与表面层对齐研究相比:本文提供分布偏移下的配对行为证据,与安全行为未充分泛化的观点相容,但不凭行为差距证明全部安全机制仅依赖表面模式。
- 与多语言安全研究相比:合成表示减少已知自然语言覆盖的影响,但现实性较弱,不能直接代表多语言部署风险。
- 与单独报告安全失败的评测相比:本文增加能力对照和协议分析,使高失败率与真正能力迁移的关系更可解释,不构成新攻击效果榜单。
- 防御启发:发布验收应分别检查正常任务完成、拒绝正确性与异常表示行为;任何一项通过都不能代替另外两项。
评分¶
- 新颖性: 4/5 — 贡献主要是配对评测与泛化问题的识别,而非新的表示操作。
- 实验充分度: 3/5 — 模型与控制条件较广,但固定小题集、协议混淆和商业系统不可观测性限制解释。
- 写作质量: 4/5 — 明确区分经验现象与理论保证,个别舍入差值及附录统计口径需谨慎阅读。
- 价值: 4/5 — 为防御性验收补充重要维度,但尚未给出经广泛验证的通用防御。