🛡️ AI 安全¶
🧠 NeurIPS2026 · 10 篇论文解读
📌 同领域跨会议浏览: 🎞️ ECCV2026 (45) · 📷 CVPR2026 (145) · 🔬 ICLR2026 (139) · 💬 ACL2026 (5) · 🧪 ICML2026 (114) · 🤖 AAAI2026 (45)
🔥 高频主题: 对抗鲁棒 ×2
- A Unified Uncertainty Representation for Graph Neural Networks via Doubly-Spectral Stochastic Expansion
-
DSS-GNN 把节点表示展开到图频率与随机混沌阶数两个谱轴,以确定性求积传播不确定性;独立模式在 14 个校准基准上取得比较方法中最低的平均 Brier,混合模式则在多数节点 OOD 场景和全部 7 个 GOOD 概念偏移设置上优于所列基线。
- Anchoring Adversarial Trajectories to Data Manifolds: A Bilevel Transfer Optimization Framework
-
MABT 将经验流形锚定与面向局部代理模型不确定性的双层初始化学习结合,在受控 ImageNet 跨模型评估中提高错误迁移率,但其流形解释、未知模型分布近似和收敛结论均有明确边界。
- ASIRF: An Agentic Framework for Context-Dependent Sensitive Information Redaction
-
ASIRF 把敏感属性的定义从模型固定标签移到推理时知识库,通过“上下文分类→定义检索→值提取”适配新领域;作者报告,在 80 个模型—领域组合中,至少一种架构的召回率在 68 个组合上超过 OPF,但多智能体并不始终优于同样具有检索工具的单智能体。
- GT-HarmBench: Benchmarking AI Safety Risks Through the Lens of Game Theory
-
GT-HarmBench 用六类双人双选项博弈组织 1,535 个战略交互评测样本,报告 15 个模型的平均功利主义准确率为 0.62,并在独立的八模型实验中观察到制度描述干预带来 +0.13 至 +0.18 的聚合改善,但这些结果衡量文本建议而非真实制度执行或部署安全。
- How Much Must a Private Mempool Hide? Exact Leakage Thresholds for Sandwich Attacks
-
本文在无手续费恒定乘积自动做市商的单订单模型中,证明区间泄漏的安全边界主要由交易规模的下端点决定,而非区间宽度,并严格区分全类型保障、后验期望激励与交易后残余风险。
- Less Supervision, Better Generalization: Weakly Supervised Fake Region Localization in Diffusion-Edited Images
-
ReGFLoW 用图像级真假标签训练双编码器与 VAE 重建引导的区域评分网络,在部分编辑与全合成混合评测中取得更高的跨生成器平均 F1,但付出明显的域内定位精度代价,且仅部分编辑时并未超过最强掩码监督基线的 OOD 均值。
- Rank-Constrained Adaptation for Reliable Real-World Performance
-
MARLA 用冻结 ERM 模型在有任务标签的留出适配集上的错误概率构建加权特征子空间,仅在该子空间内学习低秩 logit 修正,在不使用子群标签的条件下改善最差群体准确率,同时明确区分无、部分和完整子群知识的模型选择条件。
- Social Choice Foundations for Simulation-Augmented Generation
-
本文把模拟增强生成中的代表性路由形式化为比例聚类:先预测模拟响应的观点嵌入,再用 SEAR 选择少量模拟器;在明确的奖励分解与误差假设下给出近似代表性保证,并在两个模拟池上优于聚类和随机路由基线,但不研究最终回答的综合生成。
- Temporal Gradient Inversion for Private Trajectory Reconstruction in Embodied Reinforcement Learning
-
TRACE 将具身强化学习中的梯度泄漏视为有时间关联的隐私问题,在严格的有序逐步梯度可见性假设下,以时序学习评估观察与动作泄漏,主实验达到约 18.8 dB PSNR,并表明轻量压缩不能替代序列级隐私保护。
- Watermarking Should Be Treated as a Monitoring Primitive
-
本文通过观察者威胁模型与受控文本、图像实验论证:在实体绑定持久且推断可靠时,水印可能支持重复归因,因此治理应同时约束内部归因访问和设计相关的外部来源识别,而不能只检验单份内容的水印鲁棒性。