跳转至

🔒 LLM 安全

🎞️ ECCV2026 · 5 篇论文解读

📌 同领域跨会议浏览: 📷 CVPR2026 (12) · 🔬 ICLR2026 (184) · 💬 ACL2026 (115) · 🤖 AAAI2026 (41) · 🧠 NeurIPS2025 (81) · 📹 ICCV2025 (10)

🔥 高频主题: 多模态 ×3 · 对抗鲁棒 ×2

Learning to Compose: Revisiting Proxy Task Design for Zero-Shot Composed Image Retrieval

FoCo(Focus-then-Complete)将零样本组合图像检索(ZS-CIR)中的视觉-文本组合建模为可学习的"先聚焦后补全"两阶段过程,通过文本锚定的视觉聚合和上下文条件化的语义补全两个代理任务联合训练,配合跨实例对比损失防止捷径学习,在四个 ZS-CIR 基准上全面超越已有方法,且推理时不依赖 LLM。

Neural Gate: Mitigating Privacy Risks in LVLMs via Neuron-Level Gradient Gating

本文提出 Neural Gate,一种神经元级梯度门控的 LVLM 隐私风险缓解方法。核心思路是先通过可学习向量在隐私主体特征上测量各神经元对隐私目标的贡献一致性,将神经元分为强激活、弱激活、非激活三类,再在模型编辑时仅对强激活隐私神经元的梯度做参数更新,其余神经元梯度被截断。在 MiniGPT 和 LLaVA 上,Neural Gate 在敏感查询拒绝率超过 94% 的同时几乎不损失通用任务性能,且在分布外隐私类别上展现出强泛化能力。

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift提出一种面向视觉语言模型的推理层后门攻击方法,利用强化学习激发的"啊哈时刻"(aha moment)认知行为,在推理轨迹中诱导可控转向,在保持推理逻辑连贯性的同时将预测结果重定向到预设目标答案,比传统输出层后门攻击更难被检测。

SlowBA: An efficiency backdoor attack towards VLM-based GUI agents

SlowBA 首次提出针对 VLM-based GUI agent 的效率后门攻击:通过两阶段奖励级后门注入(RBI),在 SFT 中教会 agent 生成超长回复、再在 RL 中用触发感知的奖励函数区分带触发器/干净输入,使 agent 在遇到弹窗类触发器时产生极高延迟响应,而任务准确率基本不变。

Towards Benign Memory Forgetting for Selective Multimodal Large Language Model Unlearning

提出"良性记忆遗忘"新范式与 S-MLLMUn Bench 评测基准,并设计 SMFA(Sculpted Memory Forgetting Adapter)框架,通过保留锚点引导的参数掩码精确抹除 MLLM 中的隐私敏感知识,同时不损伤模型的基础视觉理解能力。