Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models¶
会议: NeurIPS2026
arXiv: 2609.36254
领域: LLM 安全 / 对齐与强化学习
关键词: 安全意识、思维链、推理答案一致性、过程奖励、过度拒绝
一句话总结¶
论文用 DSAR 衡量推理轨迹与最终答案的安全判定不一致,并提出 SARA,将早期安全意识、整段推理安全和答案安全联合用于在线强化学习,在两个 DeepSeek 系模型上改善受扰动推理的一致性,但并非所有场景或安全指标都优于答案奖励基线。
研究背景与动机¶
大推理模型在最终答案前生成思维链,但训练奖励往往集中在最终输出。因此,一个安全答案不必对应一个安全的生成过程:模型可能在推理中沿着不安全方向展开,最后才拒绝;也可能已经识别风险,最终答案却没有保持安全。只检查答案,会把前一种情况藏起来;只寻找推理中的安全措辞,也不能排除后一种情况。
SafeChain、SafePath 和 STAR-1 通过监督微调学习预先准备的安全轨迹,但固定训练轨迹与模型自行生成的推理存在分布差异。RECAP 用在线强化学习和受扰动轨迹增强缩小这种差异,却主要奖励最终答案。本文进一步提出:应当让模型在自己的生成轨迹上尽早识别风险,并同时评价整段推理与答案,而不是仅在终点获得安全奖励。
这里的“欺骗式安全对齐”是作者对可观测安全信号不一致的命名,不是对模型实际欺骗意图、隐藏目标或思维链忠实性的证明。核心 idea:把“尽早识别并拒绝风险”变成推理侧奖励,再与整段推理安全和答案安全联合优化,让安全约束更早影响在线生成。
方法详解¶
整体框架¶
SARA 的训练输入是带有有害或良性类别标记的请求,其中一半训练样本采用受扰动轨迹增强。策略模型为同一请求生成多个候选,分别拆出推理轨迹和最终答案;不同判定器提供安全或拒绝程度信号,再由 DAPO 更新策略。推理时只使用更新后的模型生成轨迹与答案,不要求把训练判定器部署为逐句拦截器。
方法可以按三个设计理解:先通过双支安全评估明确要监测什么,再构造早识别联合奖励,最后用良性请求奖励与在线训练避免把“安全”学成普遍拒绝。下面虚线表示训练监督或训练后权重关系,实线表示评估数据流或推理时生成数据流。
%%{init: {'flowchart': {'rankSpacing': 24, 'nodeSpacing': 28, 'padding': 6, 'wrappingWidth': 400}}}%%
flowchart TD
A["训练候选:推理与答案"] --> B["双支安全评估"]
B -.->|有害请求的判定信号| C["早识别联合奖励"]
C -.->|训练奖励| D["良性保护与在线训练"]
E["良性请求拒绝评分"] -.->|训练监督| D
D -.->|训练后权重| F["更新后的策略模型"]
G["推理时请求"] --> F --> H["推理轨迹与最终答案"]
关键设计¶
1. 双支安全评估:分别测量推理安全意识与答案安全
作者没有把“出现拒绝词”直接等同于安全意识。句级判定器 GPT-oss-safeguard-20B 必须同时判断某句是否识别了输入的有害意图,以及是否据此拒绝、停止或转向安全替代。仅承认风险却继续沿不安全方向推理,不算安全意识。只要至少一句满足条件,推理安全意识标记 \(r_{\mathrm{SA}}\) 就为 1;SAR 是该标记为 1 的轨迹比例,而不是逐句安全比例。
另一条推理评估分支用 Qwen3Guard 判断整段轨迹是否安全,得到 \(r_{\mathrm{safe}}\);答案分支使用同一 guard 得到最终答案安全标记 \(s\)。作者将两种推理信号取逻辑 OR,是为了容纳“不显式拒绝,但整段避开了不安全内容”的轨迹。由此定义不一致指标:
期望针对测试请求及模型生成。SS 是最终答案被判安全的比例;主结果中的 \(1-\mathrm{DSAR}\) 是一致率,表格用百分数表示。SAR 不能替代 \(r\),因此不能把 DSAR 当成 SAR 与 SS 的简单差值。
这个定义有重要边界:一条轨迹只要含有某句合格安全表述,即使后续仍不安全,也可能因 OR 被记作推理安全;而推理与答案同时被判不安全时,DSAR 仍为零。因此低 DSAR 只意味着判定一致,必须结合 SS、SAR 以及整段安全性分析,不能单独当作安全保证。
2. 早识别联合奖励:让风险识别发生在轨迹前部
只有整段安全奖励仍可能遗漏某些不安全的推理倾向,因为轨迹未必包含明确的不安全细节。SARA 在有害请求上分别用 IBM Granite-Guardian-3.1-8B 计算推理安全概率 \(R_i^{\mathrm{cot}}\) 和答案安全概率 \(R_i^{\mathrm{ans}}\),再用句级判定器找到首次安全意识出现的位置。若轨迹有 \(N_i\) 句,位置从 0 开始,首次命中为 \(k^\star\);无命中时令 \(k^\star=N_i\)。
这使第一句识别风险获得最高意识奖励,无识别则没有推理侧奖励。乘法要求推理安全概率与早期意识同时较高,避免只优化其中一种代理信号;独立的答案项则保留终点安全监督。与只奖励最终答案相比,它把学习压力放到推理阶段,而不只是提高最后拒绝的概率。
但乘法是软奖励,不是硬约束。推理项为零时仍可能从安全答案获得最高 0.5 的总奖励;判定器概率也不是可靠性证书。相对句位置奖励还可能受句子切分和轨迹长度影响,早期出现合格安全句并不能保证随后每一步都安全。
3. 良性保护与在线训练:避免把安全优化退化为普遍拒绝
对良性请求,模型不使用有害请求的安全一致性奖励,而让 DS-Qwen2-32B 对最终答案给出 0–10 的拒绝程度评分,奖励为 1 减去该评分除以 10。完全拒绝得到零,较少拒绝得到较高奖励。这样一来,策略必须区分真正需要拒绝的请求与应当提供帮助的请求,而不能靠统一拒绝获得好成绩。
在线训练采用 DAPO:每个请求由旧策略采样一组轨迹,将各候选标量奖励在组内标准化为优势,再用带非对称裁剪的 token 级策略目标更新。即使安全意识来自句级判定,优化信号仍是轨迹级标量奖励,并非逐句独立的密集奖励。论文也没有直接把“降低 DSAR”作为损失项,而是通过奖励塑形间接改善一致性。
一半样本采用受扰动轨迹增强,要求模型在偏离目标的推理上下文后恢复正确行为。本文只讨论这种防御训练安排,不复现扰动文本或构造流程。训练与主评估使用同类增强机制,因此额外的未见扰动评估重要,但仍不能代表所有分布外安全情境。
一个完整示例¶
设某条训练轨迹首先识别风险,但后续未保持安全,最终答案又恢复安全。这只是判定逻辑示例,不复现请求或轨迹。DSAR 的 OR 可能把推理侧记为安全,并因答案也安全而得到一致判定;SARA 的奖励仍使用整段安全概率,不能仅凭首次识别获得最大的推理奖励。该例说明一致率必须与整段及答案安全联合解读,判定器也不是推理时硬拦截器。
损失函数 / 训练策略¶
训练集共 2K 请求:SafeChain 的 1K 有害请求和 FalseReject 的 1K 良性请求,与测试集不重叠。训练实验仅覆盖 DeepSeek-R1-0528-Qwen3-8B 和 DeepSeek-R1-Distill-Qwen2-14B;论文更广的五模型调查不意味着 SARA 已在五个模型上训练验证。
附录 B.1 给出 LoRA rank 8、缩放系数 16、覆盖全部线性层;学习率 \(3\times10^{-5}\),权重衰减 0.1,预热 10 步,训练 1 epoch,请求批量 32,每请求 4 条 rollout。生成温度与 top-p 均为 1.0,最大请求长度为 3972 tokens。
DAPO 裁剪下界参数为 0.2,上界参数为 0.28,KL 系数为 0,损失采用 token 级平均。训练设备为两张 H100 80GB,奖励模型另行托管;作者报告两种模型单次训练约 5 与 6 GPU 小时,不将这些数字外推为所有消融的完整总成本。
实验关键数据¶
主实验¶
下表选取原文表 2 的 Original、RECAP 与 SARA。StrongReject 使用 313 个样本的受扰动评估,SafeChain 使用 500 个样本的标准评估;所有数值均为百分数,Avg. 除外但仍按 0–100 标度。每组安全列依次为 SAR / SS / 一致率 \(1-\mathrm{DSAR}\),均越高越好。
| 模型 | 方法 | StrongReject:SAR / SS / 一致率 | SafeChain:SAR / SS / 一致率 | Avg. |
|---|---|---|---|---|
| DS-Qwen3-8B | Original | 53.40 / 87.86 / 66.77 | 56.60 / 79.80 / 85.00 | 72.23 |
| DS-Qwen3-8B | RECAP | 57.80 / 99.40 / 70.93 | 71.00 / 98.80 / 96.30 | 77.61 |
| DS-Qwen3-8B | SARA | 75.10 / 97.44 / 85.30 | 72.80 / 95.40 / 96.40 | 82.76 |
| DS-Qwen2-14B | Original | 32.90 / 53.67 / 74.44 | 33.80 / 64.00 / 79.80 | 68.98 |
| DS-Qwen2-14B | RECAP | 70.90 / 99.04 / 80.51 | 75.80 / 96.60 / 95.80 | 81.67 |
| DS-Qwen2-14B | SARA | 77.00 / 95.85 / 84.66 | 80.40 / 95.00 / 94.60 | 81.97 |
Qwen3 的受扰动评估中,SARA 比 RECAP 的 SAR 高 17.30 个百分点,一致率高 14.37 点,但 SS 低 1.96 点。Qwen2 的对应变化为 +6.10、+4.15 和 −3.19 点。标准评估中,Qwen2 的一致率反而从 RECAP 的 95.80 降到 SARA 的 94.60,不能概括成所有场景均改善。
有用性并非全面增长:SARA 的 GSM8K / MMLU-Pro 准确率为 Qwen3 的 86.28 / 61.74、Qwen2 的 81.27 / 56.58;后者 GSM8K 略低于 Original 的 81.58。Qwen3 的 OR-Bench HS 从 RECAP 的 67.02 提高到 91.21,但 HS 衡量非拒绝率,不等于正确性或帮助质量。
Avg. 先在安全、帮助性、任务能力三个维度分别平均,再计算三者调和平均。安全维度混合 SAR、SS、一致率和未见扰动的 SS,所以综合分提升不能取代单项安全指标检查。SafePath、RECAP、SARA 使用相同 2K 样本;SafeChain 替换良性部分,STAR-1 使用自己的数据,不能宣称全部基线数据完全一致。
消融实验¶
原文表 3 的奖励消融使用 DS-Qwen3-8B,下表保留其一位小数精度。完整奖励在受扰动条件下提升意识与一致性,但不是最终答案安全最高的配置。
| 奖励配置 | StrongReject:SAR / SS / 一致率 | SafeChain:SAR / SS / 一致率 |
|---|---|---|
| Original | 52.4 / 87.9 / 66.8 | 56.6 / 79.8 / 85.0 |
| 仅答案安全(RECAP) | 57.8 / 99.4 / 70.9 | 71.0 / 98.8 / 96.3 |
| 仅整段推理安全 | 64.2 / 99.4 / 84.4 | 65.4 / 97.4 / 96.0 |
| 仅安全意识 | 71.6 / 93.3 / 81.5 | 71.4 / 87.4 / 91.8 |
| 完整 SARA 奖励 | 75.1 / 97.4 / 85.3 | 72.8 / 95.4 / 96.4 |
仅安全意识比仅整段推理安全获得更高 SAR,却损失 SS 与一致率,说明“会说安全话”与“整段安全”不是同一监督目标。完整奖励将二者结合,但仍留下答案安全的权衡。
原文表 6 的增强消融进一步表明,鲁棒性收益具有条件依赖性。
| 模型 | SARA 训练增强 | StrongReject:SAR / SS / 一致率 | SafeChain:SAR / SS / 一致率 |
|---|---|---|---|
| DS-Qwen3-8B | 不使用 | 62.9 / 92.1 / 78.0 | 89.0 / 97.8 / 98.0 |
| DS-Qwen3-8B | 使用 | 75.1 / 97.4 / 85.3 | 72.8 / 95.4 / 96.4 |
| DS-Qwen2-14B | 不使用 | 76.4 / 90.2 / 81.2 | 90.2 / 95.2 / 95.4 |
| DS-Qwen2-14B | 使用 | 77.0 / 95.9 / 84.7 | 80.4 / 95.0 / 94.6 |
两模型的增强均改善受扰动条件下三项指标,却降低标准条件下三项指标。没有增强时,SARA 对 RECAP 的受扰动 SAR 仍分别高 11.1 与 22.7 点,支持奖励设计具有独立于增强的贡献。
关键发现¶
- 未见扰动评估只报告答案 SS:Qwen3 的 ICL / H-CoT 为 RECAP 100.0 / 50.00、SARA 99.25 / 52.00;Qwen2 为 96.60 / 56.00 与 96.75 / 56.00。结果没有证明这些条件下推理与答案的一致性也改善。
- 人工验证仅来自 Qwen2 标准 StrongReject 的 100 条生成。附录 D 报告安全意识、答案安全和 DSAR 类别的一致率为 93%、95%、92%;不一致类别样本较少,不能据此推断跨模型、跨扰动的稳定准确率。
- 留出判定器支持受扰动 SAR 收益:gpt-oss-120B 下 RECAP / SARA 为 67.1 / 82.4,Qwen2.5-32B 下为 54.3 / 72.5。标准条件下 Qwen2.5-32B 的次序反转为 RECAP 74.8、SARA 72.0,优势并非判定器无关。
原文数值与叙述冲突须保留:表 1 中 Qwen2 的 StrongReject DSAR 为 26.20→25.56,是“扰动使全部模型 DSAR 增长”的反例;正文把 SafeChain 的 15.00→34.40 归给 Qwen2,表 1 却归给 Qwen3,Qwen2 对应为 20.20→22.00。
表 3、表 6 的 Qwen3 Original SAR 为 52.4,而表 1、表 2 为 53.40,这不是单纯舍入差异。正文称句级判定器与人工 95% 一致,但附录 D 的安全意识一致率为 93%,95% 对应答案判定。另有正文称 SafeChain 提高 Qwen3 标准 SS,表 2 却给出 79.20,低于 Original 的 79.80。笔记按各表原值呈现,不自行修正。
亮点与洞察¶
- 将“最终安全”与“过程具有安全意识”拆开评估,能识别只在终点恢复安全的模型。DSAR 的价值在于补充诊断,而不是代替安全分数。
- 早识别奖励关注安全判断在推理中的时间位置,而非只统计安全措辞是否出现。乘以整段安全概率,让这种局部信号必须与轨迹级信号共同贡献奖励。
- 良性请求独立使用拒绝程度奖励,直接处理安全微调容易增加过度拒绝的问题。不过奖励的是减少拒绝,后续仍需要正确性与帮助质量监督。
局限与展望¶
- 作者承认训练仅覆盖两个 DeepSeek 系模型,未覆盖更大规模、闭源模型、长期策略性欺骗或工具使用。五模型描述性调查不能补齐这些训练验证缺口。
- DSAR 的 OR 定义容许安全句掩盖后续不安全,且双方不安全也被视为一致。更稳健的后续评估可分开报告四种推理—答案类别,以及安全识别后是否再次偏离,但这些并非本文已有结果。
- 判定器代理奖励可能被语言表面模式影响;同一安全意识判定器参与训练与主评估。留出判定器缓解了部分担忧,却仅检查 SAR,不足以验证完整 DSAR 管线。
- 表征分析显示答案阶段的良性—有害区分更强,但附录 F 通过直接切换阶段标签、跳过实际推理构造答案阶段输入。它揭示阶段条件差异,不是对完整生成轨迹的因果追踪,也不能证明答案奖励导致了该差异。
- 安全意识按相对句位置计分,需进一步检查分句、长度及后续偏离对奖励的影响。奖励组合和有限测试只提供经验性证据,不能支持“监督中间推理是可靠安全的必要条件”这一普遍性结论。
相关工作与启发¶
- vs RECAP:两者都采用在线 DAPO 与受扰动轨迹增强;SARA 增加整段推理安全及早期安全意识奖励。最强证据来自受扰动 SAR 与一致率提升,但答案 SS 有所下降。
- vs SafeChain / SafePath / STAR-1:这些方法以监督微调学习安全轨迹,SARA 直接评价当前策略生成的轨迹。由于部分基线训练数据不同,主表更适合作为方法整体比较,而不是纯奖励机制的因果证据。
- vs Compliance Gap / D-REX:前者关注不同监控条件的行为差异,后者使用多标准评估欺骗推理;DSAR 聚焦同一次生成内两个安全判定是否一致。它的范围更窄,不应与真实意图、策略性欺骗或思维链忠实性混用。
评分¶
- 新颖性: 4/5。早期安全意识与轨迹安全的联合奖励有针对性,但依赖已有在线 RL 和判定器。
- 实验充分度: 3/5。主结果、奖励与增强消融以及判定器验证较丰富,训练模型覆盖和人工验证规模有限。
- 写作质量: 3/5。机制明确,但多处表文冲突和过强结论影响可靠性。
- 价值: 4/5。提供了过程安全诊断与训练思路,实际使用必须同时监测答案安全、过度拒绝和指标失真。