跳转至

🔒 LLM 安全

🧠 NeurIPS2026 · 5 篇论文解读

📌 同领域跨会议浏览: 🎞️ ECCV2026 (20) · 📷 CVPR2026 (12) · 🔬 ICLR2026 (184) · 💬 ACL2026 (115) · 🤖 AAAI2026 (41) · 🧠 NeurIPS2025 (81)

🔥 高频主题: LLM ×3 · 对齐/RLHF ×2

Contrastive Representation Shaping for LLM Unlearning

CLReg 用同一遗忘样本的增强视图作正对、保留样本作负对,在基础遗忘目标之外塑形隐藏表示,改善多组实验的综合遗忘分数,但表示分离本身不等于知识删除,也不提供隐私保证。

LLM Alignment–Utility Asymmetry under Semantic-Preserving Transformations

本文通过原始表示与语义保持表示之间的配对评测,发现任务能力的迁移并不保证安全行为同步迁移,并用良性数据条件、协议对照和防御性监督分析限定这一经验结论。

Stealth Apart, Harm Together: Skill Cascading Attacks on Skill-Based Agent Systems

本文以 SkillCascade-Bench 的 213 个经过筛选的案例说明:逐技能审查通过不等于联合执行安全;在三类智能体系统与八种模型的沙箱压力测试中,作者报告平均成功率 89.4%,而面向行为组合的防御只取得部分改善。

Towards Mitigating Deceptive Safety Alignment in Large Reasoning Models

论文用 DSAR 衡量推理轨迹与最终答案的安全判定不一致,并提出 SARA,将早期安全意识、整段推理安全和答案安全联合用于在线强化学习,在两个 DeepSeek 系模型上改善受扰动推理的一致性,但并非所有场景或安全指标都优于答案奖励基线。

UnlearningSoup: Is Repeated Tuning Necessary for Large Language Model Unlearning?

UnlearningSoup 把训练式大语言模型遗忘中的部分重复调参改为评测驱动的权重插值:EfficientSoup 从原模型和两个已训练遗忘模型搜索,PerformanceSoup 合并已有候选,在多个基准上改善经验性遗忘—保留质量并降低选模成本,但并不取消基础遗忘训练或提供认证遗忘保证。